遇见数据集

HiFi-UMI-2K

收藏
Hugging Face2026-07-25 更新2026-07-27 收录
官方服务:

资源简介:

HiFi-UMI-2K 是一个大规模、高保真的双手机器人操作演示数据集,专为机器人操作策略的预训练和后训练提供基于动作的监督而设计。该数据集通过 HiFi-UMI 便携式高保真双手机器人捕捉系统采集,无需目标机器人、遥操作平台或仪器化环境,直接从自然的人类操作中捕获演示。公开版本包含从超过 20,000 小时、432 万次演示的源语料库中精选的 2,000 小时数据,覆盖 480 多个场景。每个演示片段包含同步的六视角视频(立体头戴视图和每只手两个非平行鱼眼视图)、校准的双臂末端执行器轨迹(本地精度约 3 毫米)、夹持器状态、语言注释、任务元数据和质量控制信息。所有传感器通过 GPIO 硬件触发器同步,跨传感器时间偏移小于 40 微秒。数据处理流程实现了约 98% 的轨迹重建成功率和 98% 的全身控制重放验证成功率。数据以 LeRobot v3 风格格式分发,包含帧级 Parquet 表格、MP4 视频、任务文本、片段元数据、有效性掩码和归一化统计信息。该数据集适用于视觉-语言-动作和世界-动作-模型等策略族的训练与评估,旨在探索仅使用高保真免机器人数据学习可部署操作策略的可行性。数据集采用 CC BY 4.0 许可证发布。

创建时间:
2026-07-19
原始信息汇总

HiFi-UMI-2K 数据集概述

基本信息

HiFi-UMI-2K 是由 Simple AI 团队发布的大规模机器人操作数据集,来源于 HiFi-UMI 便携式高保真双手采集系统。该数据集旨在为操作策略的预训练和后训练提供基于动作的监督信号,无需在数据采集阶段使用真实机器人。

  • 数据集规模:公开发布 2,000 小时数据
  • 源语料库:超过 20,000 小时,432 万以上个片段
  • 场景数量:480+ 个不同场景
  • 语言:英语
  • 许可证:CC BY 4.0

核心特点

  • 无机器人采集:直接采集自然人操作演示,无需目标机器人、遥操作设备或仪器化环境
  • 高保真轨迹:通过头戴式离线立体惯性 SLAM 和标记物定位,实现约 3 mm 局部末端执行器精度
  • 原生双手位姿:双手在同一头戴相机坐标系中定位,无需事后跨相机重建
  • 硬件同步:所有相机、IMU、编码器和夹爪信号共享 GPIO 硬件触发,跨传感器偏移低于 40 µs
  • 超宽六视角感知:每个片段包含立体头戴视角和每只手的两个非平行鱼眼视角,覆盖约 200° 水平与垂直范围
  • 轨迹验证:轨迹重建成功率约 98%,WBC 重放验证成功率约 98%
  • 训练就绪导出:数据以 LeRobot v3 风格格式分发,包含帧级 Parquet 表、MP4 视频等

数据内容

每个片段包含:同步多视角视频、校准后的双手末端执行器轨迹、夹爪状态、语言标注、任务元数据和质量控制信息。

状态与动作表示

状态和动作向量均为 20 维,包含左右手各 10 维:

  • 0:3:末端执行器位置 xyz(米)
  • 3:9:6D 旋转表示(旋转矩阵前两行)
  • 9:10:夹爪开合角度(弧度)

视频流

每个片段包含 6 个同步视频流:

  • observation.images.head_main
  • observation.images.head_main_stereo_right
  • observation.images.left_hand_up
  • observation.images.left_hand_down
  • observation.images.right_hand_up
  • observation.images.right_hand_down

坐标系

  • 手部坐标系:原点在指尖,+X 沿指尖指向方向,+Y 向左,+Z 向上
  • 头戴相机坐标系:原点在立体相机左侧相机光学中心,+Z 沿光轴指向场景
  • 共享世界坐标系:+Z 轴与重力方向对齐,XY 平面垂直于重力;原点位置任意,不同录制间的绝对位置不可直接比较

仓库结构

数据按顶层分片组织:

text chunk-XXXX/ └── part-0000/ ├── data/ # 帧级 Parquet 表 ├── videos/ # 6 个视频流的 MP4 文件 └── meta/ # info.json、modality.json、stats.json、tasks.parquet、episodes/

质量指标

指标 数值
局部末端执行器误差 3 mm
跨传感器时间偏移 <40 µs
丢帧率 每小时 <2 帧
夹爪状态误差 <0.1°
轨迹重建成功率 98%
WBC 重放验证成功率 98%

论文报告结果

  • 无机器人后训练对比中,HiFi-UMI 后训练与真实机器人遥操作后训练表现相当甚至更优(OpenPI-π₀.₅ 提升 +3.1 个百分点)
  • 大规模预训练中,4,000 小时 HiFi-UMI 混合物上,动作预测误差降低 61%,十个未见任务的平均动作误差降低 41%

引用与许可

数据集随技术报告《HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone》(arXiv:2607.25895)发布,采用 CC BY 4.0 许可证,允许共享和适配数据(包括商业用途),需提供适当署名。

搜集汇总
数据集介绍
HiFi-UMI-2K 数据集图片
构建方式
HiFi-UMI-2K数据集源自一套名为HiFi-UMI的便携式高保真双手捕捉系统,该系统无需依赖实体机器人即可采集人类自然操作演示。数据采集过程中,操作者佩戴头戴式立体惯性SLAM设备,双手装载全掌式非对称夹爪与视觉标记物,在超过480种真实场景中执行各类操作任务。原始数据经硬件同步(跨传感器时序偏移低于40微秒)与在线质量监控后,进入闭环数据处理管线,依次完成轨迹重建、自动清洗、基于仿真全身重定位的可行性验证、人工与AI协同标注、以及最终分析与导出。该流程促成了超过432万条演示片段与2万小时原始语料的生成,而本次发布的2千小时精选子集即从中提炼而来。
特点
本数据集最显著的特征在于其卓越的采集保真度与组织完备性。每条演示均包含6路同步摄像头视频(双目头部视角加每手两个非平行鱼眼视角,水平垂直覆盖约200°),以及经由立体惯性SLAM与标记定位获得的三毫米级末端执行器局部位姿精度。数据格式遵循LeRobot v3规范,以Parquet帧级表格与MP4视频文件组织,并附带动作有效性掩码、姿态与夹爪状态语义切片、任务自然语言描述、场景元数据及统计信息,为模仿学习、视觉-语言-动作模型及世界模型的训练与评估提供了高质量、即开即用的结构化支撑。
使用方法
数据集以分片形式存储在HuggingFace上,每片包含data、videos与meta三个子目录。使用者首先通过meta/info.json读取数据路径模板、特征元数据及帧率等全局信息,随后利用data目录下的Parquet表格加载每一帧的20维双手状态与动作向量(位置、旋转6D表示、夹爪开度),并通过meta/episodes中的帧偏移与时间戳定位至videos目录下对应的6路MP4视频片段。建议在训练前依据valid.frame字段过滤无效帧,并基于有效帧重新计算归一化统计量。任务文本与多集元数据则分别存放于meta/tasks.parquet与meta/episodes的Parquet文件中,便于索引与加载。
背景与挑战
背景概述
HiFi-UMI-2K是由Simple AI团队于2026年发布的大规模机器人操作数据集,旨在解决模仿学习领域中数据采集对实体机器人依赖的瓶颈问题。该数据集通过创新的HiFi-UMI便携式高保真双机械臂捕捉系统,直接从人类自然操作中采集演示数据,无需目标机器人、遥操作设备或传感器环境。数据集包含2000小时精心挑选的子集,覆盖480余个场景,具备6个同步摄像头视角、毫米级末端执行器精度(约3毫米)以及亚40微秒的跨传感器同步能力。其核心研究问题在于探索提升无机器人数据保真度是否能够消除部署后训练中通常依赖的远程操作数据。实验结果表明,仅基于HiFi-UMI数据训练的模型可直接部署于真实机器人,在视觉-语言-动作与世界-动作-模型策略家族中取得了与遥操作数据相当甚至更优的性能,对机器人学习领域产生了重要影响。
当前挑战
HiFi-UMI-2K所解决的领域核心挑战在于传统模仿学习对远程操作机器人演示的强依赖性,这种依赖限制了数据采集的可扩展性与部署灵活性。具体而言,机器人操作数据收集通常需要昂贵的遥操作设备、专业操作人员,且遥操作数据受限于特定机器人形态,难以跨平台迁移。同时,构建过程中面临重重技术挑战:如何实现无机器人条件下高精度的双机械臂轨迹恢复(需毫米级精度),如何确保多模态传感器(摄像头、惯性测量单元、编码器、夹爪)在复杂操作场景下的硬件同步(目标低于40微秒),以及如何设计包含6个广角摄像头视角的视频覆盖以避免接触密集操作中的遮挡问题。此外,数据引擎需处理轨迹重建、基于全身体态映射在仿真中进行重放验证、人工智能辅助标注等环节,最终实现98%的轨迹重建与重放验证成功率,方能为下游策略训练提供高质量、可依赖的训练信号。
常用场景
经典使用场景
在机器人学习领域,HiFi-UMI-2K数据集为模仿学习与行为克隆提供了高保真的多模态训练资源。该数据集包含2000小时、480余场景下的双臂操控演示,每段演示均同步记录六视角视频、末端执行器轨迹、夹爪状态及语言标注。研究者可利用这些数据训练视觉-语言-动作模型或世界-动作模型,实现从人类自然演示中直接习得复杂操控策略。其高精度轨迹(定位误差约3毫米)与严格同步特性,使其尤为适合训练需要精细动作控制的任务,如零件装配、工具操作等精细操作场景。
解决学术问题
该数据集核心解决了机器人训练中依赖真实机器人遥操作数据这一长期瓶颈。传统方法要求研究者预先搭建遥操作系统、采集大量机器人演示数据,成本高且扩展性差。HiFi-UMI-2K以纯人类自然演示替代机器人数据,通过高保真轨迹重建与全身运动学重放验证(成功率98%),使训练出的策略可直接部署于真实双臂机器人。实验表明,仅依赖该数据集进行后训练的策略,在多种视觉-语言-动作模型族上的部署成功率与使用机器人遥操作数据训练相当,甚至更优,显著降低了机器人技能学习的硬件门槛。
衍生相关工作
围绕HiFi-UMI-2K及其采集系统,已衍生出若干重要研究工作。其技术报告中提出的零机器人后训练范式,系统比较了视觉-语言-动作模型族(如StarVLA-QwenPI、OpenPI-π₀.₅)与纯运动模式模型在该数据上的表现,揭示了高保真人类数据可替代遥操作数据的可行性。数据集的大规模预训练实验揭示了动作预测误差随数据量增长遵循幂律缩放规律(指数α=0.268,R²=0.993),为数据驱动的策略学习提供了理论依据。此外,采集系统设计的四维保真度框架(精确位姿、自然交互、宽视野、在线质量控制)已成为后续机器人自由数据采集系统的重要参考架构。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务