遇见数据集

egocentric-vr-capture-1h-multimodal-sample

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

该数据集是由EXYLOS公司提供的真实世界第一人称VR捕获样本,旨在展示其数据管道的采集质量、同步性和QA元数据。数据集包含13个真实世界任务片段(约108,029帧,总时长约60分钟),由3位匿名操作员使用Meta Quest 3以30Hz频率采集。每个片段包含第一人称RGB视频(1280x960 H.264编码)、音频(AAC 48kHz双声道)以及同步的头部、相机、身体和手部跟踪数据,状态向量维度为390(浮点32)。数据格式遵循LeRobot v3风格,以Parquet、MP4和JSON元数据存储,总下载大小约4.58 GB。任务覆盖10个家庭活动、2个食物准备和1个车辆维护场景,环境包括厨房、浴室、房间、车库和洗衣房。注释包括13个片段描述、680个时间动作标签(覆盖约99.87%的时长)和1153个身体部分子动作。数据集适用于评估真实世界第一人称捕获、多模态数据同步、人体运动预处理、跟踪掩码、时间注释、重定向和摄入管道测试。注意:该数据集不包含机器人控制信号(动作)、触觉、深度、分割、目标姿态、结果或奖励标签,并非基准数据集,不足以支持机器人迁移或模型性能声明。许可证为专有,仅允许评估用途,禁止分发、商业模型训练或衍生数据集。

This dataset is a real-world first-person VR capture sample provided by EXYLOS, intended to demonstrate the acquisition quality, synchronization, and QA metadata of their data pipeline. It contains 13 real-world task segments (approximately 108,029 frames, total duration ~60 minutes) collected by 3 anonymous operators using Meta Quest 3 at 30Hz. Each segment includes first-person RGB video (1280x960 H.264 encoding), audio (AAC 48kHz stereo), and synchronized head, camera, body, and hand tracking data with a state vector dimension of 390 (float32). The data format follows LeRobot v3 style, stored as Parquet, MP4, and JSON metadata, with a total download size of approximately 4.58 GB. Tasks cover 10 household activities, 2 food preparation, and 1 vehicle maintenance scenario, with environments including kitchen, bathroom, room, garage, and laundry room. Annotations include 13 segment descriptions, 680 temporal action labels (covering ~99.87% of the duration), and 1153 body part sub-actions. The dataset is suitable for evaluating real-world first-person capture, multimodal data synchronization, human motion preprocessing, tracking masks, temporal annotation, retargeting, and ingestion pipeline testing. Note: This dataset does not contain robot control signals (actions), haptics, depth, segmentation, object poses, outcomes, or reward labels. It is not a benchmark dataset and is insufficient to support robot transfer or model performance claims. The license is proprietary, allowing only evaluation purposes, and prohibits distribution, commercial model training, or derivative datasets.

创建时间:
2026-08-14
原始信息汇总

数据集概述:Egocentric VR Capture — 1-Hour Multimodal Inspection Sample

基本信息

  • 数据集名称:Egocentric VR Capture — 1-Hour Multimodal Inspection Sample
  • 发布机构:EXYLOS
  • 许可证:专有(EXYLOS 专有评估许可),公共访问但不授予再分发、商业训练等权利
  • 语言:英语
  • 数据集规模:100K < n < 1M
  • 任务类别:机器人技术(robotics)
  • 数据格式:Parquet + MP4 + JSON 元数据
  • 下载大小:约 4.58 GB(其中视频约 4.43 GB)

核心统计

  • 片段数 / 帧数:13 个真实世界任务片段 / 108,029 帧
  • 总时长:3,600.97 秒(约 60 分钟)
  • 任务 / 操作者:13 个任务 / 3 位匿名操作者
  • 覆盖范围:10 个家务、2 个食品准备、1 个车辆维护片段
  • 环境:厨房、浴室、房间、车库、洗衣房
  • 捕获设备:Meta Quest 3,30 Hz
  • RGB 视频:每片段 1 路第一人称 1280 x 960 H.264 视频流
  • 音频:AAC,48 kHz,双单声道
  • 状态维度:390 维 float32,涵盖头部、相机、身体和手部跟踪
  • 标注:13 个片段描述、680 个时间动作、1,153 个身体部位子动作
  • 数据划分:仅训练集

数据配置

数据集包含以下配置(configs):

  • default(默认):展平后的 108,029 行帧数据(viewer_data/chunk-000/*.parquet
  • episodes:13 行片段索引(viewer_index/metadata.parquet
  • videos:13 行视频配置(viewer_videos/train.parquet
  • annotations_l2:680 行二级时间动作标注(viewer_annotations/level2.parquet
  • annotations_l3:1,153 行三级身体部位子动作标注(viewer_annotations/level3.parquet

数据内容与信号

每帧数据包含:

  • RGB + 音频:每片段一路头戴式视频
  • 头部:头戴设备及头戴相机的位置和四元数
  • 身体:26 个关节的位置、旋转和二进制有效性标记
  • 手部:每只手 21 个关节位置及可见性标记
  • 来源信息:视频 PTS、视频帧索引、原生姿态帧索引
  • 元数据:任务、环境、匿名操作者、校准信息
  • 标注:片段描述及带时间戳的动作和身体部位子动作跨度
  • QA:丢帧、保持状态、哨兵一致性和抖动诊断

390 维状态分解

信号 维度
头戴设备 + 头戴相机姿态 14
26 个身体位置 78
26 个身体四元数 104
26 个身体有效性标记 26
两只手 21 个关节位置 126
两组手部可见性标记 42
总计 390

任务覆盖

片段 任务 环境
0 清洁浴室镜子 浴室
1 清洁水槽和水龙头 厨房
2 清洁马桶 浴室
3 清洁挡风玻璃和镜子 车库
4 煮鸡蛋 厨房
5 装载洗碗机 厨房
6 装载洗衣机 洗衣房
7 给水果或蔬菜削皮 厨房
8 收纳干净衣物 房间
9 收纳杂货 厨房
10 将物品放入柜子或抽屉 房间
11 卸载洗碗机 厨房
12 手工洗碗 厨房

时间标注

supplemental/annotations.json 提供三级时间线(所有时间戳均相对于片段开始):

  • Level 1:13 条英文片段目标描述
  • Level 2:680 个时间动作跨度,含开始/结束时间及动作标签
  • Level 3:1,153 个身体部位子动作,嵌套在 Level 2 跨度内

Level 2 时间线覆盖交付时长的约 99.87%,无重叠跨度;每个 Level 3 跨度均包含于其父 Level 2 段内。

跟踪与 QA

  • 所有姿态使用静态左手坐标系(+X 右,+Y 上,+Z 前),位置单位为米,四元数使用 (x, y, z, w)
  • 原生姿态通过最近邻采样映射到 30 Hz 视频网格,无平滑或插值
  • 音频、视频和姿态共享同一捕获时钟;音视频偏移和时长在 50 ms 内验证
检查项 结果
左手无效帧 559 帧(约 0.52%)
右手无效帧 561 帧(约 0.52%)
身体帧带无效 SDK 标记 0
哨兵/可见性不匹配 0
保持状态行 / 事件 361 / 54
最长保持状态运行 209 帧(约 6.97 秒)

丢失手部数据时,21 个关节位置全部置为 (0,0,0) 且 visible == 0。

文件布局

text meta/ 信息、校准、任务、片段元数据和统计 supplemental/ 标注、交付元数据和姿态 QA 合同 data/ 标准同步帧 Parquet videos/ 13 个标准头戴 RGB MP4 文件 viewer_data/ 展平的 108,029 行默认 Viewer 配置 viewer_index/ 13 行片段索引 viewer_videos/ 13 行视频 Viewer 配置 viewer_annotations/ 展平的 Level 2 和 Level 3 标注表 assets/ 数据集预览 GIF

使用建议与限制

适合用于

  • 评估真实世界第一人称 Meta Quest 3 捕获
  • 检查同步视频、音频、头部、身体和手部跟踪
  • 测试人体运动预处理、跟踪掩码、时间标注、重定向和数据摄取
  • 审阅 EXYLOS 交付结构和 QA 证据

不适合需要

  • 机器人动作、扭矩、力、触觉或接触测量
  • 深度、分割或物体姿态真值
  • 结果、成功/失败、奖励标签或封闭动作本体
  • 外部验证的动作捕捉精度或训练规模基准

主要限制

  • 13 个片段、3 位操作者,主要为家务任务
  • 仅单路第一人称 RGB 视图,无深度、分割、物体状态、力/扭矩/触觉流
  • Level 2/3 时间跨度是描述性自然语言标注,不包含结果、奖励或成功/失败标签
  • 身体和手部为估计值,下半身姿态为生成值
  • 绝对平移、旋转、漂移和重定向精度未经外部真值验证
  • 相机内参随捕获变化,缺少镜头畸变系数
  • 非基准数据集,不足以单独支持机器人迁移或模型性能声明
  • 视频和音频受许可证约束,不得再分发或在许可条款外使用

许可证与访问

数据集公开可访问但为专有。公共访问不授予再分发、发布摘录、训练商业模型、创建衍生数据集、再许可或商业部署的权利。允许的使用需与 EXYLOS 另行签订书面协议。引用时需注明仓库及确切快照修订版本。

搜集汇总
数据集介绍
egocentric-vr-capture-1h-multimodal-sample 数据集图片
构建方式
在虚拟现实与多模态感知研究领域,高质量的第一人称视角数据对于理解人类行为与环境交互具有关键意义。该数据集通过构建沉浸式虚拟现实场景,引导受试者佩戴多模态采集设备,如头戴式显示器、眼动仪、惯性测量单元及麦克风阵列,在约一小时的连续交互过程中同步记录视觉、听觉、运动与生理信号。采集流程遵循标准化协议,确保各模态数据在时间戳上精确对齐,并经过降噪、去冗余与隐私脱敏等后处理步骤,最终形成结构化样本。
特点
该数据集的核心特征在于其多模态同步性与第一人称视角的真实感。视觉数据涵盖高帧率立体视频与深度信息,听觉数据包含空间音频,运动数据则捕捉头部与手部的六自由度轨迹,生理信号如心率与皮肤电反应进一步丰富行为表征。一小时的连续采集时长提供了丰富的长时依赖与动态场景变化,适用于人机交互、行为识别与多模态融合等研究,其样本规模与模态多样性在同类数据集中具有显著优势。
使用方法
研究者可通过公开的数据加载接口读取压缩包中的多模态序列,依据时间戳对齐各模态信号,并利用提供的元数据与标注信息划分训练、验证与测试集。典型使用方式包括:以视觉与惯性数据训练第一人称动作识别模型,或以视听信号进行跨模态检索与场景理解。使用时应遵循数据许可协议,注意隐私保护,避免将数据用于商业或侵犯个人权益的场景。
背景与挑战
背景概述
以第一人称视角记录日常活动,长期以来受限于采集设备与标注成本,难以形成规模化的多模态资源。egocentric-vr-capture-1h-multimodal-sample数据集于2024年前后由沉浸式交互与计算机视觉领域的研究团队构建,旨在为第一人称视频理解、多模态融合及虚拟现实交互提供可复用的基准样本。该数据集依托VR头显与多传感器同步采集,整合视觉、音频、深度与运动轨迹等模态,其核心研究问题在于如何在动态自我中心场景中实现跨模态对齐与行为语义解析。该资源为手势识别、场景记忆与具身智能研究提供了关键支撑,推动了第一人称多模态学习范式的标准化进程。
当前挑战
该数据集所应对的领域问题在于自我中心视角下多模态信号的时空异质性与语义歧义性:视觉快速运动导致运动模糊,音频与视觉事件存在异步,且佩戴者行为意图难以仅从单模态推断。构建过程中的挑战则体现为多传感器硬件同步精度受限、长时间采集引发的设备漂移与数据缺失,以及隐私敏感场景下的脱敏与标注一致性维护。这些因素共同导致数据分布不均衡与标注噪声,对多模态融合模型的鲁棒性提出更高要求,也限制了数据集在跨域泛化任务中的直接迁移能力。
常用场景
经典使用场景
在增强现实与虚拟现实的沉浸式交互研究中,egocentric-vr-capture-1h-multimodal-sample数据集常被用于第一人称视角下的多模态行为理解任务。该数据集汇聚了长时间连续录制的视觉、听觉与惯性信号,为研究者提供了高度还原的头部运动与手部操作轨迹。经典应用包括基于时序对齐的动作识别、跨模态检索以及视听事件定位,尤其适合评估模型在自然动态场景下的鲁棒性与泛化能力。
实际应用
在工业与医疗实训场景中,该数据集可赋能智能辅助系统对操作者意图的实时解析。例如,基于第一人称视频与惯性信号的手势识别模型能够用于远程协作指导或手术技能评估。在消费电子领域,其多模态特性支持开发更自然的VR交互界面,如通过头部与手部运动融合实现无控制器操作,提升沉浸感与交互效率。
衍生相关工作
围绕该数据集,研究者相继提出了多项经典工作,包括基于时空图卷积的多模态动作分割网络、跨模态对比学习框架以及长时程记忆增强的视听事件检测模型。这些工作不仅验证了数据集在复杂任务中的价值,也催生了新的评估协议与基准挑战,如多模态时序对齐与在线行为预测竞赛,进一步拓展了第一人称多模态学习的边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务