遇见数据集

ThirdToFirst

收藏
arXiv2018-12-01 更新2024-07-25 收录
官方服务:

资源简介:

ThirdToFirst数据集由中佛罗里达大学计算机视觉研究中心创建,包含531对同时录制的自我中心和非自我中心视频,旨在探索这两种视角之间的关系。数据集分为合成和真实两部分,涵盖了广泛的动作和运动,每对视频都进行了时间上的对齐。该数据集的创建过程涉及使用游戏引擎生成合成数据,以及通过佩戴身体摄像机和静态摄像机录制真实数据。数据集的应用领域包括视频检索、视频合成、动作识别、姿态估计和3D重建等,旨在解决自我中心和非自我中心视频之间的信息转移问题。

The ThirdToFirst Dataset was developed by the Computer Vision Center at the University of Central Florida. It contains 531 pairs of simultaneously recorded egocentric and non-egocentric videos, aiming to explore the relationship between these two perspectives. The dataset is divided into synthetic and real subsets, covering a wide range of actions and motions, with each pair of videos temporally aligned. The creation process of this dataset involves generating synthetic data using game engines, as well as recording real-world data via body-worn cameras and static cameras. Its applicable domains include video retrieval, video synthesis, action recognition, pose estimation, 3D reconstruction, and more, and it is designed to solve the problem of information transfer between egocentric and non-egocentric videos.

创建时间:
2018-12-01
原始信息汇总

ThirdToFirst 数据集概述

数据集类型

  • 真实数据集
  • 合成数据集

数据集链接

其他资源

搜集汇总
数据集介绍
ThirdToFirst 数据集图片
构建方式
在计算机视觉领域,第一人称与第三人称视角的视频在本质上的巨大差异使得跨视角研究充满挑战。为深入探索这两种视角之间的内在关联,研究者构建了ThirdToFirst数据集,该数据集包含合成与真实两种模态,分别经由游戏引擎生成及真实场景录制。合成数据集利用Unity 3D平台,在多个虚拟环境中驱动虚拟角色执行行走、奔跑、跳跃等动作,同时同步记录虚拟第一人称与第三人称视角的视频帧,总计超过13万帧。真实数据集则通过让演员佩戴第一人称相机,在静态第三人称相机前完成多种动作,共收集531组视频对,并确保两组视频在时间上精确对齐。此外,数据集中还提供了帧级别的动作标签与相机位姿标注,为跨视角学习提供了丰富的监督信息。
特点
该数据集的核心特点在于其双重模态与跨视角的同步性。合成数据规模庞大且环境可控,提供了超过13万帧的精准对齐图像,减少了真实场景中的运动模糊与噪声干扰,便于学习鲁棒的视角变换模型。真实数据集则涵盖了行走、慢跑、拳击等8种动作,包含531组视频对,更贴近实际应用场景中的复杂性与多样性。两者结合使得数据集不仅支持图像合成与跨视角检索任务,还可用于动作识别、相机姿态估计等研究方向。特别地,合成数据通过域适应策略可有效提升真实数据上的检索性能,展现了从模拟到现实的迁移学习潜力。
使用方法
使用该数据集时,研究者可针对合成与真实两种模态分别或联合开展实验。在图像合成任务中,以第三人称图像为条件输入,利用条件生成对抗网络生成对应的第一人称图像,并通过L1损失与对抗损失优化生成质量。在跨视角检索任务中,可采用双流网络分别提取第一人称与第三人称帧的RGB或光流特征,通过对比学习获得视角不变的嵌入表示。研究者还可利用合成数据预训练模型,再在真实数据上进行微调,以缓解真实数据量不足的问题。该数据集公开提供,便于复现基准方法并拓展新的研究方向。
背景与挑战
背景概述
第一人称与第三人称视频在视觉感知上存在本质差异,前者以佩戴者视角记录动态场景,后者则从外部静态视角捕捉行为全貌。尽管两者在计算机视觉领域各自积累了丰富的研究成果,但如何建立跨视角的语义关联,仍是尚未充分探索的课题。2018年,中佛罗里达大学计算机视觉研究中心(CRCV)的Mohamed Elfeki、Krishna Regmi等学者,针对这一空白,构建了名为ThirdToFirst的数据集。该数据集包含同步采集的真实与合成两类视频对,覆盖行走、跑步、跳跃等多种动作,旨在支撑从第三人称到第一人称的跨视角图像合成与检索任务。其发布为理解第一人称与第三人称视频间的映射关系提供了标准化基准,推动了视角迁移、域适应等方向的研究进展。
当前挑战
该数据集面临的核心挑战源于两个视角间视觉信息的巨大鸿沟。第一人称视频中,相机随人体运动导致画面剧烈抖动与模糊,而第三人称视频则呈现稳定的全局视角,两者视野重叠度极低,使得基于像素的跨视角变换成为非平凡问题。在图像合成任务中,生成网络需从缺乏对应纹理与结构的第三人称输入中,幻觉出合理的第一人称场景,这对模型对语义与空间关系的理解能力提出严苛要求。于检索任务而言,不同视角下同一动作的表征差异显著,传统方法难以学习视角不变的特征嵌入。此外,真实同步数据采集成本高昂、规模有限,而合成数据虽可大规模生成,却存在域偏移问题,如何有效利用合成数据提升真实场景的检索与合成性能,亦是构建过程中必须克服的障碍。
常用场景
经典使用场景
在计算机视觉领域,第一人称与第三人称视角视频因成像机理迥异而长期被视为两个孤立的研究域。ThirdToFirst数据集通过同步采集真实与合成场景下的自我中心视角与外中心视角视频对,为跨视角视觉理解提供了关键桥梁。该数据集最经典的使用场景集中于跨视角图像合成与检索两大任务:一方面,基于条件生成对抗网络,从外中心视角图像幻觉化生成对应的自我中心视角图像;另一方面,利用双流卷积神经网络学习视角不变表征,实现给定自我中心查询帧在外中心图库中的精确检索。这些场景为探索视角间信息迁移的底层规律奠定了基准。
实际应用
在实际应用中,ThirdToFirst数据集赋能了多项具有社会价值的场景。在智能监控系统中,通过将固定摄像头的第三人称画面实时转换为佩戴式设备的第一人称视角,可辅助执法人员或安保人员获得更直观的现场态势感知。在虚拟现实与游戏产业中,该数据集支持从第三人称游戏画面自动生成第一人称沉浸式体验,降低内容制作成本。此外,在辅助驾驶领域,车载外中心摄像头与驾驶员自我中心视角的关联检索,可用于分析注意力分布与危险预判。这些应用充分展现了跨视角理解技术从实验室走向产业落地的巨大潜力。
衍生相关工作
围绕ThirdToFirst数据集,学术界衍生了多项具有影响力的后续工作。在生成模型方向,研究者借鉴其跨视角合成框架,进一步提出了基于几何引导的条件生成对抗网络,通过注入相机位姿先验提升了合成图像的几何一致性。在表征学习领域,该数据集启发了联合自我中心与外中心视角的动作识别方法,利用双视角特征融合实现了对复杂人体动作的更鲁棒分类。此外,基于该数据集的域适应范式,后续工作探索了从合成到真实场景的无监督迁移学习策略,显著降低了真实数据标注依赖。这些衍生研究共同构建了从数据到算法、从合成到真实的完整研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务