egocentric-vr-capture-1h-multimodal-sample
收藏资源简介:
该数据集是由EXYLOS公司提供的真实世界第一人称VR捕获样本,旨在展示其数据管道的采集质量、同步性和QA元数据。数据集包含13个真实世界任务片段(约108,029帧,总时长约60分钟),由3位匿名操作员使用Meta Quest 3以30Hz频率采集。每个片段包含第一人称RGB视频(1280x960 H.264编码)、音频(AAC 48kHz双声道)以及同步的头部、相机、身体和手部跟踪数据,状态向量维度为390(浮点32)。数据格式遵循LeRobot v3风格,以Parquet、MP4和JSON元数据存储,总下载大小约4.58 GB。任务覆盖10个家庭活动、2个食物准备和1个车辆维护场景,环境包括厨房、浴室、房间、车库和洗衣房。注释包括13个片段描述、680个时间动作标签(覆盖约99.87%的时长)和1153个身体部分子动作。数据集适用于评估真实世界第一人称捕获、多模态数据同步、人体运动预处理、跟踪掩码、时间注释、重定向和摄入管道测试。注意:该数据集不包含机器人控制信号(动作)、触觉、深度、分割、目标姿态、结果或奖励标签,并非基准数据集,不足以支持机器人迁移或模型性能声明。许可证为专有,仅允许评估用途,禁止分发、商业模型训练或衍生数据集。
This dataset is a real-world first-person VR capture sample provided by EXYLOS, intended to demonstrate the acquisition quality, synchronization, and QA metadata of their data pipeline. It contains 13 real-world task segments (approximately 108,029 frames, total duration ~60 minutes) collected by 3 anonymous operators using Meta Quest 3 at 30Hz. Each segment includes first-person RGB video (1280x960 H.264 encoding), audio (AAC 48kHz stereo), and synchronized head, camera, body, and hand tracking data with a state vector dimension of 390 (float32). The data format follows LeRobot v3 style, stored as Parquet, MP4, and JSON metadata, with a total download size of approximately 4.58 GB. Tasks cover 10 household activities, 2 food preparation, and 1 vehicle maintenance scenario, with environments including kitchen, bathroom, room, garage, and laundry room. Annotations include 13 segment descriptions, 680 temporal action labels (covering ~99.87% of the duration), and 1153 body part sub-actions. The dataset is suitable for evaluating real-world first-person capture, multimodal data synchronization, human motion preprocessing, tracking masks, temporal annotation, retargeting, and ingestion pipeline testing. Note: This dataset does not contain robot control signals (actions), haptics, depth, segmentation, object poses, outcomes, or reward labels. It is not a benchmark dataset and is insufficient to support robot transfer or model performance claims. The license is proprietary, allowing only evaluation purposes, and prohibits distribution, commercial model training, or derivative datasets.
数据集概述:Egocentric VR Capture — 1-Hour Multimodal Inspection Sample
基本信息
- 数据集名称:Egocentric VR Capture — 1-Hour Multimodal Inspection Sample
- 发布机构:EXYLOS
- 许可证:专有(EXYLOS 专有评估许可),公共访问但不授予再分发、商业训练等权利
- 语言:英语
- 数据集规模:100K < n < 1M
- 任务类别:机器人技术(robotics)
- 数据格式:Parquet + MP4 + JSON 元数据
- 下载大小:约 4.58 GB(其中视频约 4.43 GB)
核心统计
- 片段数 / 帧数:13 个真实世界任务片段 / 108,029 帧
- 总时长:3,600.97 秒(约 60 分钟)
- 任务 / 操作者:13 个任务 / 3 位匿名操作者
- 覆盖范围:10 个家务、2 个食品准备、1 个车辆维护片段
- 环境:厨房、浴室、房间、车库、洗衣房
- 捕获设备:Meta Quest 3,30 Hz
- RGB 视频:每片段 1 路第一人称 1280 x 960 H.264 视频流
- 音频:AAC,48 kHz,双单声道
- 状态维度:390 维 float32,涵盖头部、相机、身体和手部跟踪
- 标注:13 个片段描述、680 个时间动作、1,153 个身体部位子动作
- 数据划分:仅训练集
数据配置
数据集包含以下配置(configs):
- default(默认):展平后的 108,029 行帧数据(
viewer_data/chunk-000/*.parquet) - episodes:13 行片段索引(
viewer_index/metadata.parquet) - videos:13 行视频配置(
viewer_videos/train.parquet) - annotations_l2:680 行二级时间动作标注(
viewer_annotations/level2.parquet) - annotations_l3:1,153 行三级身体部位子动作标注(
viewer_annotations/level3.parquet)
数据内容与信号
每帧数据包含:
- RGB + 音频:每片段一路头戴式视频
- 头部:头戴设备及头戴相机的位置和四元数
- 身体:26 个关节的位置、旋转和二进制有效性标记
- 手部:每只手 21 个关节位置及可见性标记
- 来源信息:视频 PTS、视频帧索引、原生姿态帧索引
- 元数据:任务、环境、匿名操作者、校准信息
- 标注:片段描述及带时间戳的动作和身体部位子动作跨度
- QA:丢帧、保持状态、哨兵一致性和抖动诊断
390 维状态分解
| 信号 | 维度 |
|---|---|
| 头戴设备 + 头戴相机姿态 | 14 |
| 26 个身体位置 | 78 |
| 26 个身体四元数 | 104 |
| 26 个身体有效性标记 | 26 |
| 两只手 21 个关节位置 | 126 |
| 两组手部可见性标记 | 42 |
| 总计 | 390 |
任务覆盖
| 片段 | 任务 | 环境 |
|---|---|---|
| 0 | 清洁浴室镜子 | 浴室 |
| 1 | 清洁水槽和水龙头 | 厨房 |
| 2 | 清洁马桶 | 浴室 |
| 3 | 清洁挡风玻璃和镜子 | 车库 |
| 4 | 煮鸡蛋 | 厨房 |
| 5 | 装载洗碗机 | 厨房 |
| 6 | 装载洗衣机 | 洗衣房 |
| 7 | 给水果或蔬菜削皮 | 厨房 |
| 8 | 收纳干净衣物 | 房间 |
| 9 | 收纳杂货 | 厨房 |
| 10 | 将物品放入柜子或抽屉 | 房间 |
| 11 | 卸载洗碗机 | 厨房 |
| 12 | 手工洗碗 | 厨房 |
时间标注
supplemental/annotations.json 提供三级时间线(所有时间戳均相对于片段开始):
- Level 1:13 条英文片段目标描述
- Level 2:680 个时间动作跨度,含开始/结束时间及动作标签
- Level 3:1,153 个身体部位子动作,嵌套在 Level 2 跨度内
Level 2 时间线覆盖交付时长的约 99.87%,无重叠跨度;每个 Level 3 跨度均包含于其父 Level 2 段内。
跟踪与 QA
- 所有姿态使用静态左手坐标系(+X 右,+Y 上,+Z 前),位置单位为米,四元数使用 (x, y, z, w)
- 原生姿态通过最近邻采样映射到 30 Hz 视频网格,无平滑或插值
- 音频、视频和姿态共享同一捕获时钟;音视频偏移和时长在 50 ms 内验证
| 检查项 | 结果 |
|---|---|
| 左手无效帧 | 559 帧(约 0.52%) |
| 右手无效帧 | 561 帧(约 0.52%) |
| 身体帧带无效 SDK 标记 | 0 |
| 哨兵/可见性不匹配 | 0 |
| 保持状态行 / 事件 | 361 / 54 |
| 最长保持状态运行 | 209 帧(约 6.97 秒) |
丢失手部数据时,21 个关节位置全部置为 (0,0,0) 且 visible == 0。
文件布局
text meta/ 信息、校准、任务、片段元数据和统计 supplemental/ 标注、交付元数据和姿态 QA 合同 data/ 标准同步帧 Parquet videos/ 13 个标准头戴 RGB MP4 文件 viewer_data/ 展平的 108,029 行默认 Viewer 配置 viewer_index/ 13 行片段索引 viewer_videos/ 13 行视频 Viewer 配置 viewer_annotations/ 展平的 Level 2 和 Level 3 标注表 assets/ 数据集预览 GIF
使用建议与限制
适合用于:
- 评估真实世界第一人称 Meta Quest 3 捕获
- 检查同步视频、音频、头部、身体和手部跟踪
- 测试人体运动预处理、跟踪掩码、时间标注、重定向和数据摄取
- 审阅 EXYLOS 交付结构和 QA 证据
不适合需要:
- 机器人动作、扭矩、力、触觉或接触测量
- 深度、分割或物体姿态真值
- 结果、成功/失败、奖励标签或封闭动作本体
- 外部验证的动作捕捉精度或训练规模基准
主要限制:
- 13 个片段、3 位操作者,主要为家务任务
- 仅单路第一人称 RGB 视图,无深度、分割、物体状态、力/扭矩/触觉流
- Level 2/3 时间跨度是描述性自然语言标注,不包含结果、奖励或成功/失败标签
- 身体和手部为估计值,下半身姿态为生成值
- 绝对平移、旋转、漂移和重定向精度未经外部真值验证
- 相机内参随捕获变化,缺少镜头畸变系数
- 非基准数据集,不足以单独支持机器人迁移或模型性能声明
- 视频和音频受许可证约束,不得再分发或在许可条款外使用
许可证与访问
数据集公开可访问但为专有。公共访问不授予再分发、发布摘录、训练商业模型、创建衍生数据集、再许可或商业部署的权利。允许的使用需与 EXYLOS 另行签订书面协议。引用时需注明仓库及确切快照修订版本。




