遇见数据集

Ego2Robot

收藏
arXiv2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

Ego2Robot是由中国人民大学、阿里巴巴等机构联合构建的大规模机器人训练数据集,旨在通过将人类第一人称操作视频转化为机器人格式数据,解决机器人数据采集成本高、多样性不足的问题。该数据集基于约1,940小时的四种第一人称视频源(ANT、EgoDex、ViTRA、EgoVerse),经动作重定向、视觉合成及三级质量筛选后,生成涵盖15种机器人形态的18,561小时有效训练数据,成为目前规模最大的跨形态机器人数据集。创建过程包括手部姿态估计、动作重定向与平滑、机器人基座搜索与逆运动学求解、深度感知合成等步骤,并采用多级质量过滤确保数据可靠性。数据集主要应用于机器人视觉-语言-动作模型的大规模预训练,旨在提升模型在视觉外观、场景布局、形态变化及任务语义等维度上的分布外泛化能力。

Ego2Robot is a large-scale robotic training dataset jointly constructed by Renmin University of China, Alibaba Group and other institutions. Its core goal is to convert human first-person operation videos into robot-compatible data, so as to address the issues of high acquisition cost and insufficient diversity in robotic data collection. This dataset is built upon approximately 1,940 hours of four types of first-person video sources, namely ANT, EgoDex, ViTRA and EgoVerse. After undergoing action retargeting, visual synthesis and three-level quality screening, it yields 18,561 hours of valid training data covering 15 distinct robot morphologies, making it the largest cross-morphology robotic dataset currently available. The construction pipeline of Ego2Robot encompasses multiple steps including hand pose estimation, action retargeting and smoothing, robot base search and inverse kinematics solving, depth perception synthesis, among others. Multi-level quality filtering is employed throughout the process to guarantee the reliability of the dataset. This dataset is primarily intended for large-scale pre-training of robotic vision-language-action (VLA) models, with the objective of enhancing the out-of-distribution (OOD) generalization capability of the models across dimensions such as visual appearance, scene layout, morphological variations and task semantics.

创建时间:
2026-08-04
原始信息汇总

Ego2Robot 数据集详情总结

数据集概览

Ego2Robot 是一个可扩展的管道,用于将第一人称视角(以自我为中心)的人类操作视频转换为机器人训练数据。该数据集通过动作重定向、机器人手臂视觉合成和多层级质量筛选,生成大规模、多样化的仿真机器人数据。

核心数据规模

  • 总数据量:18,561 小时的机器人训练数据
  • 机器人形态:支持 15 种机器人形态(morphologies)
  • 数据来源:四种第一人称视频源,共约 1,940 小时原始人类操作视频
    • ANT(7小时,自建)
    • EgoDex(732小时)
    • ViTRA(249小时)
    • EgoVerse(954小时)
  • 真实机器人数据:约 6,565 小时(来自 DROID、AgibotWorld、InternData),用于联合预训练

管道三阶段

  1. 动作对齐(Action Alignment):将手部关键点(拇指、食指/中指指尖、手腕)重定向为夹爪 TCP、宽度和方向;通过 Savitzky–Golay 和 SLERP 进行平滑处理。

  2. 视觉对齐(Visual Alignment):包括 SAM 3 手臂分割 → ProPainter 手部移除 → 机器人基座姿态搜索 → 逆运动学(IK)求解 → 深度感知合成到修复后的场景中。

  3. 质量筛选(Quality Curation):三层筛选机制:

    • L1:管道内部检查(IK 失败、碰撞、异常值)
    • L2:统计分析(极端值、不连续性)
    • L3:VLM 视频-动作一致性检查

评估框架

在 RoboTwin 2.0 基础上扩展了 11 个独立扰动设置,外加外部 EBench(更高安装摄像头,更接近第一人称视角),解耦了四个泛化轴:

泛化轴 扰动类型
视觉外观 背景、光照、机器人颜色
场景布局 桌子高度、干扰物、相机偏移
具身形态 零样本迁移到 UR5、ARX、Franka
任务语义 未见物体(50 个任务)、505 条改述指令

主要实验结果

核心对比(成功率 %)

预训练配置 Clean Randomized Visual Scene Embodiment Task EBench
仅机器人数据 62.2 50.9 61.4 52.9 23.8 46.2 39.6
Ego2R+Robot (1:3) 61.4 51.0 61.2 52.5 21.9 49.5 47.4
Ego2R+Robot (3:1) 64.1 49.2 62.7 54.3 28.2 51.6 51.7
Ego2R+Robot (1:1) 68.1 53.5 67.3 56.9 27.2 54.1 49.8

关键发现

  • 联合预训练改善 OOD 泛化:Ego2R+Robot (1:1) 在七个指标中的五个领先,RoboTwin Randomized 上达 53.5%(+2.6),同时保持 Clean 68.1%(+5.9)。
  • 视觉外观获益最大:背景 +4、光照 +8、机器人颜色 +6。
  • 场景布局中等增益:相机偏移鲁棒性提升 +6。
  • 具身迁移受益于多形态数据:ARX 从 44 提升至 51(1:1);UR5 在 3:1 时达峰值为 31;Franka 保持低于 7%(大运动学差距)。
  • 任务语义持续改善:未见物体从 29% 提至 40%(3:1 时 +11);改述指令鲁棒性在 1:1 时达 69%。
  • EBench 确认高视角增益:3:1 时达 51.7(+12.1)。

消融实验结论

  • 仅使用原始 Ego 数据预训练:RoboTwin Randomized 上仅达 28.1%
  • 经管道处理(单形态):提升至 31.7%(+3.6)
  • 扩展到 15 种形态:提升至 33.5%
  • 原始 Ego 数据 + 15 形态数据:提升至 37.3%(原始 Ego 数据相当于第 16 种"形态")

真实机器人实验

在 ARX ACone 平台上,五种长时程任务、每任务仅 20 条遥操作演示的少样本设置下:

  • 比较了仅机器人数据、混合预训练(Ego2R+Robot 1:1)、以及混合预训练 + Ego2R Play(将管道转换的第一人称"游玩"演示混入微调数据)
  • Mix + Ego2R Play 在所有五个任务上表现最佳
搜集汇总
数据集介绍
Ego2Robot 数据集图片
构建方式
Ego2Robot数据集的构建依托于一个端到端的可扩展流水线,旨在将大规模第一人称视角的人类操作视频转化为机器人训练数据。该流水线兼容两类输入:一类是已标注手部姿态的公开数据集(如EgoDex、ViTRA、EgoVerse及自采的ANT),另一类是未标注的原始视频。对于后者,系统借助WiLoR进行逐帧手部姿态估计,并通过DynHaMR进行时间维度的优化,同时利用Qwen3.5对长视频进行子任务分割。处理流程涵盖动作对齐阶段,将手部关键点重定向为并行夹爪的末端执行器轨迹,并施加速度对齐与平滑处理;视觉对齐阶段则通过SAM 3完成手臂分割、ProPainter进行背景修复,在此基础上搜索机器人基座位姿并求解逆运动学,最终采用深度感知合成将渲染的机器人融合进场景;此外,还设有三级质量筛选(L1流水线内部、L2统计、L3 VLM一致性),确保数据可靠性。整个流程可并行生成15种机器人形态的训练数据,最终汇集为18,561小时的高质量合成数据。
特点
Ego2Robot数据集具备多项显著特性。首先,其规模空前,包含18,561小时的机器人训练数据,覆盖15种不同形态的机械臂,是目前最大的由人类第一视角视频转化而来的机器人数据集。其次,数据来源多样,融合了来自四个不同第一视角数据源的约1,940小时原始视频,这些视频涵盖丰富的场景、物体和任务变化,有效提升了数据的多样性。第三,数据集采用相机坐标系的相对末端执行器动作表示,这一设计天然统一了不同相机设置和机器人形态,避免了复杂的标定过程。此外,数据构建过程中融入了视觉与动作的双重对齐,并经过多层次质量筛选,确保了合成数据与原始人类操作在语义上的高度一致性。最后,数据集中每条样本包含机器人合成视频帧、相机系动作、相机参数及文本指令,直接支持视觉-语言-动作模型的训练需求。
使用方法
Ego2Robot数据集专为视觉-语言-动作模型的预训练设计。使用时,可将该数据集与真实机器人数据(如DROID、AgibotWorld等)按比例混合,构成预训练语料。实验表明,1:1的混合比例能最有效地提升模型在多种分布偏移下的泛化能力,尤其在视觉外观、场景布局、实体形态和任务语义等维度上增益显著。数据集的动作表示采用相机坐标系下的相对末端执行器位移,因此可直接输入模型,无需额外的坐标系转换。在微调阶段,可将Ego2Robot合成数据与少量遥操作演示数据结合,用于真实机器人上的下游任务部署,实验证明这种联合微调可显著提升长时程操作任务的成功率。此外,用户也可仅使用该数据集进行预训练,或将其作为数据增强工具,与原始人类视频数据混合,进一步增加训练多样性。
背景与挑战
背景概述
Ego2Robot数据集由中国人民大学、阿里巴巴集团、上海科技大学及北京通用人工智能研究院等机构的研究人员于2025年联合构建,旨在解决机器人策略学习面临的数据稀缺与泛化瓶颈。随着视觉-语言-动作(VLA)模型的快速发展,大规模多样化机器人演示数据成为提升操作智能的关键,然而传统遥操作数据采集成本高昂、硬件依赖强,严重制约了数据的规模与多样性。该研究创新性地提出从第一视角人类操作视频中合成机器人训练数据的可扩展范式,通过动作重定向、视觉合成及多级质量筛选,构建了涵盖15种机器人形态、总时长达到18,561小时的迄今最大规模Ego2Robot数据集,为机器人策略预训练提供了全新数据来源,显著推动了跨形态泛化研究的发展。
当前挑战
该数据集面临的挑战主要体现在两方面。在领域问题层面,如何弥合人类与机器人执行器之间的巨大形态差异,将无实体约束的人类手部轨迹可靠地映射到多种机器人运动学结构,同时保持任务语义的完整性,是核心难题;此外,因第一视角数据中相机位姿未知且多样,需设计统一的坐标系表示以融合异构数据。在构建过程层面,动作重定向需应对高频率噪声与速度不匹配,视觉合成则要解决人体手臂精准分割、背景修复以及机器人基座位置优化等复杂问题,深度感知合成还需处理遮挡与光照变化。为保障数据质量,研究者需设计多层级筛选策略,并借助视觉语言模型进行语义一致性审核,确保合成数据能有效提升策略的分布外泛化能力。
常用场景
经典使用场景
Ego2Robot数据集作为大规模机器人策略预训练的基石,其经典使用场景在于将海量第一人称人类操作视频转化为形态各异的机器人训练数据。该数据集通过动作重定向、视觉合成与质量筛选三级流程,将约1940小时的自我中心视频扩展为包含15种机器人形态的18561小时合成数据,为视觉-语言-动作模型提供丰富的预训练语料。研究者可基于此数据集训练机器人策略,使其在未见过的视觉外观、场景布局、本体形态及任务语义下展现更强的泛化能力,从而突破传统机器人数据采集成本高、多样性受限的瓶颈。
实际应用
在实际应用中,Ego2Robot数据集展示了从实验室到真实世界的迁移潜力。研究者在ARX ACone机器人平台上验证了其有效性:通过将日常录制的自我中心操作视频(如摆放水果、折叠毛巾、清扫垃圾等)转化为针对特定机器人形态的训练数据,并与少量遥操作示范混合微调,显著提升了机器人在长时程多任务场景下的成功率。这一应用路径大幅降低了机器人示教数据的人工采集成本,使得非专业用户也能通过随手拍摄的视频为机器人提供有效学习信号,加速了机器人技能在家庭、办公等非结构化环境中的落地部署。
衍生相关工作
Ego2Robot数据集的发布催生了多个方向的相关研究。其一,基于其“重定向-渲染”框架,后续工作探索了更精细的手部姿态估计与多指灵巧操作迁移,以期拓展可学习的技能范围;其二,受其解耦评估思想的启发,研究者设计了更严谨的泛化测试协议,如LIBERO-PRO和EBench等基准进一步细分了扰动轴;其三,该数据集的跨形态合成策略被借鉴到数据增强领域,衍生出如RoviAug、Mirage等跨本体视觉迁移方法。这些工作共同推动了从人类视频到机器人策略学习的规模化、系统化研究进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务