HumanGen
收藏资源简介:
HumanGen是一个由Robbyant、香港科技大学(广州)及香港科技大学联合创建的大规模人机配对数据集,旨在通过人类视频指令实现零样本跨任务泛化。该数据集包含74.2K条人机上下文学习对,覆盖8.6K个多样化任务,数据来源包括AgiBot、InternData-A1、Open-X-Embodiment等五个公开机器人数据集以及内部机器人数据。创建过程采用自动化的上下文人类视频生成管道,从任务级采样的机器人轨迹出发,通过视觉语言模型提取任务信息、编辑首帧图像并生成视频,最终得到语义匹配的人类演示视频与机器人轨迹配对。该数据集主要用于训练机器人策略,使其能够通过人类视频指令在未见任务上实现泛化,解决语言指令难以充分描述操作细节的问题,在仿真和真实场景中均展示了跨任务、长时域及精细操作等复杂场景下的泛化能力。
HumanGen is a large-scale human-robot paired dataset co-developed by Robbyant, The Hong Kong University of Science and Technology (Guangzhou) and The Hong Kong University of Science and Technology, designed to enable zero-shot cross-task generalization via human video instructions. This dataset contains 74.2K human-robot in-context learning pairs, covering 8.6K diverse tasks, with data sources including five public robotic datasets such as AgiBot, InternData-A1, Open-X-Embodiment, as well as internal robotic data. The dataset was constructed via an automated in-context human video generation pipeline: starting from task-level sampled robotic trajectories, vision-language models are used to extract task information, edit first-frame images and generate videos, ultimately yielding semantically matched pairs of human demonstration videos and robotic trajectories. This dataset is primarily applied to train robotic policies, enabling them to generalize to unseen tasks via human video instructions, and addressing the limitation that natural language instructions cannot sufficiently describe operational details. It has demonstrated generalization capabilities in complex scenarios including cross-task, long-horizon and fine-grained manipulation across both simulation and real-world environments.
数据集概述
- 数据集名称: Zero-WAM (In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization)
- 核心目标: 利用人类视频作为上下文提示,实现零样本(Zero-shot)的机器人操作任务泛化
- 提出机构: Robbyant、HKUST (广州)、HKUST
数据集规模
- 数据来源: 超过 10 个数据集源
- 机器人任务数: 超过 8,000 个
- 人类-机器人配对(ICL 配对): 超过 70,000 对,具体为 74.2K 对,覆盖 8.6K 个任务
数据集构成
Zero-WAM 预训练数据包含两大互补组成部分:
- Task-diverse VA: 从五个公共数据集(AgiBot、InternData-A1、OXE、RoboCOIN、RoboMIND)中重新划分机器人轨迹,构建超过 6,000 个操作任务,并按任务级别进行采样。
- HumanGen: 通过生成管道将任务采样的机器人轨迹转换为语义对齐的人类视频指令,涵盖公共数据集、自建平台、仿真以及真实世界采集。同时包括外部预训练 ICL 数据(OpenLoong、Franka、Galaxea、RuierMan)、自建 ICL 数据(RoboTwin)、仿真 ICL 数据(Bimanual Franka)以及真实世界 ICL 数据。
关键特性
- 统一任务接口: 将零样本机器人任务泛化建模为上下文世界-动作建模(In-context World-Action Modeling),单个因果视频-动作策略同时支持语言指令和人类视频作为任务指令。
- 可扩展的上下文数据: 引入生成管道,将任务采样的机器人轨迹转换为语义对齐的人类视频指令,生成 74.2K 个人类-机器人 ICL 配对。
- 上下文未来块预测(IFP): 为避免策略从机器人历史和文本中学习捷径,强化其对人类视频的关注,以预测更长期的任务演化。
评估结果
在 RoboTwin 2.0 仿真基准的七个未见任务(任务级留出)上进行零样本评估:
- 平均成功率: 46.95%
- 对比基线: 比视频-动作基线 LingBot-VA 高出 29.50 个百分点,比 WAN 基线高出 35.97 个百分点
各任务成功率如下:
| 任务 | 成功率 (%) |
|---|---|
| Place object on scale | 24.67 |
| Stamp seal | 47.00 |
| Open microwave | 59.00 |
| Move stapler to pad | 69.14 |
| Place bread into basket | 35.00 |
| Place empty cup | 84.87 |
| Stack three blocks | 9.00 |
| 平均 | 46.95 |
测试场景
- 长时程顺序操作: 例如将银色咖啡杯放入木篮、将海绵放入白色托盘、将葫芦放在粉色椭圆盘上等。
- 高精度插入任务: 例如桌腿插入、灯泡插入、红色立柱插入等。
- 未见任务泛化: 包括未见物体或未见容器、双臂操作、关节物体操作以及长时程操作。




