HiFi-UMI-2K
收藏资源简介:
HiFi-UMI-2K 是一个大规模、高保真的双手机器人操作演示数据集,专为机器人操作策略的预训练和后训练提供基于动作的监督而设计。该数据集通过 HiFi-UMI 便携式高保真双手机器人捕捉系统采集,无需目标机器人、遥操作平台或仪器化环境,直接从自然的人类操作中捕获演示。公开版本包含从超过 20,000 小时、432 万次演示的源语料库中精选的 2,000 小时数据,覆盖 480 多个场景。每个演示片段包含同步的六视角视频(立体头戴视图和每只手两个非平行鱼眼视图)、校准的双臂末端执行器轨迹(本地精度约 3 毫米)、夹持器状态、语言注释、任务元数据和质量控制信息。所有传感器通过 GPIO 硬件触发器同步,跨传感器时间偏移小于 40 微秒。数据处理流程实现了约 98% 的轨迹重建成功率和 98% 的全身控制重放验证成功率。数据以 LeRobot v3 风格格式分发,包含帧级 Parquet 表格、MP4 视频、任务文本、片段元数据、有效性掩码和归一化统计信息。该数据集适用于视觉-语言-动作和世界-动作-模型等策略族的训练与评估,旨在探索仅使用高保真免机器人数据学习可部署操作策略的可行性。数据集采用 CC BY 4.0 许可证发布。
HiFi-UMI-2K 数据集概述
基本信息
HiFi-UMI-2K 是由 Simple AI 团队发布的大规模机器人操作数据集,来源于 HiFi-UMI 便携式高保真双手采集系统。该数据集旨在为操作策略的预训练和后训练提供基于动作的监督信号,无需在数据采集阶段使用真实机器人。
- 数据集规模:公开发布 2,000 小时数据
- 源语料库:超过 20,000 小时,432 万以上个片段
- 场景数量:480+ 个不同场景
- 语言:英语
- 许可证:CC BY 4.0
核心特点
- 无机器人采集:直接采集自然人操作演示,无需目标机器人、遥操作设备或仪器化环境
- 高保真轨迹:通过头戴式离线立体惯性 SLAM 和标记物定位,实现约 3 mm 局部末端执行器精度
- 原生双手位姿:双手在同一头戴相机坐标系中定位,无需事后跨相机重建
- 硬件同步:所有相机、IMU、编码器和夹爪信号共享 GPIO 硬件触发,跨传感器偏移低于 40 µs
- 超宽六视角感知:每个片段包含立体头戴视角和每只手的两个非平行鱼眼视角,覆盖约 200° 水平与垂直范围
- 轨迹验证:轨迹重建成功率约 98%,WBC 重放验证成功率约 98%
- 训练就绪导出:数据以 LeRobot v3 风格格式分发,包含帧级 Parquet 表、MP4 视频等
数据内容
每个片段包含:同步多视角视频、校准后的双手末端执行器轨迹、夹爪状态、语言标注、任务元数据和质量控制信息。
状态与动作表示
状态和动作向量均为 20 维,包含左右手各 10 维:
0:3:末端执行器位置 xyz(米)3:9:6D 旋转表示(旋转矩阵前两行)9:10:夹爪开合角度(弧度)
视频流
每个片段包含 6 个同步视频流:
observation.images.head_mainobservation.images.head_main_stereo_rightobservation.images.left_hand_upobservation.images.left_hand_downobservation.images.right_hand_upobservation.images.right_hand_down
坐标系
- 手部坐标系:原点在指尖,+X 沿指尖指向方向,+Y 向左,+Z 向上
- 头戴相机坐标系:原点在立体相机左侧相机光学中心,+Z 沿光轴指向场景
- 共享世界坐标系:+Z 轴与重力方向对齐,XY 平面垂直于重力;原点位置任意,不同录制间的绝对位置不可直接比较
仓库结构
数据按顶层分片组织:
text chunk-XXXX/ └── part-0000/ ├── data/ # 帧级 Parquet 表 ├── videos/ # 6 个视频流的 MP4 文件 └── meta/ # info.json、modality.json、stats.json、tasks.parquet、episodes/
质量指标
| 指标 | 数值 |
|---|---|
| 局部末端执行器误差 | 3 mm |
| 跨传感器时间偏移 | <40 µs |
| 丢帧率 | 每小时 <2 帧 |
| 夹爪状态误差 | <0.1° |
| 轨迹重建成功率 | 98% |
| WBC 重放验证成功率 | 98% |
论文报告结果
- 在无机器人后训练对比中,HiFi-UMI 后训练与真实机器人遥操作后训练表现相当甚至更优(OpenPI-π₀.₅ 提升 +3.1 个百分点)
- 在大规模预训练中,4,000 小时 HiFi-UMI 混合物上,动作预测误差降低 61%,十个未见任务的平均动作误差降低 41%
引用与许可
数据集随技术报告《HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone》(arXiv:2607.25895)发布,采用 CC BY 4.0 许可证,允许共享和适配数据(包括商业用途),需提供适当署名。




