遇见数据集

HumanGen

收藏
arXiv2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

HumanGen是一个由Robbyant、香港科技大学(广州)及香港科技大学联合创建的大规模人机配对数据集,旨在通过人类视频指令实现零样本跨任务泛化。该数据集包含74.2K条人机上下文学习对,覆盖8.6K个多样化任务,数据来源包括AgiBot、InternData-A1、Open-X-Embodiment等五个公开机器人数据集以及内部机器人数据。创建过程采用自动化的上下文人类视频生成管道,从任务级采样的机器人轨迹出发,通过视觉语言模型提取任务信息、编辑首帧图像并生成视频,最终得到语义匹配的人类演示视频与机器人轨迹配对。该数据集主要用于训练机器人策略,使其能够通过人类视频指令在未见任务上实现泛化,解决语言指令难以充分描述操作细节的问题,在仿真和真实场景中均展示了跨任务、长时域及精细操作等复杂场景下的泛化能力。

HumanGen is a large-scale human-robot paired dataset co-developed by Robbyant, The Hong Kong University of Science and Technology (Guangzhou) and The Hong Kong University of Science and Technology, designed to enable zero-shot cross-task generalization via human video instructions. This dataset contains 74.2K human-robot in-context learning pairs, covering 8.6K diverse tasks, with data sources including five public robotic datasets such as AgiBot, InternData-A1, Open-X-Embodiment, as well as internal robotic data. The dataset was constructed via an automated in-context human video generation pipeline: starting from task-level sampled robotic trajectories, vision-language models are used to extract task information, edit first-frame images and generate videos, ultimately yielding semantically matched pairs of human demonstration videos and robotic trajectories. This dataset is primarily applied to train robotic policies, enabling them to generalize to unseen tasks via human video instructions, and addressing the limitation that natural language instructions cannot sufficiently describe operational details. It has demonstrated generalization capabilities in complex scenarios including cross-task, long-horizon and fine-grained manipulation across both simulation and real-world environments.

创建时间:
2026-08-27
原始信息汇总

数据集概述

  • 数据集名称: Zero-WAM (In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization)
  • 核心目标: 利用人类视频作为上下文提示,实现零样本(Zero-shot)的机器人操作任务泛化
  • 提出机构: Robbyant、HKUST (广州)、HKUST

数据集规模

  • 数据来源: 超过 10 个数据集源
  • 机器人任务数: 超过 8,000 个
  • 人类-机器人配对(ICL 配对): 超过 70,000 对,具体为 74.2K 对,覆盖 8.6K 个任务

数据集构成

Zero-WAM 预训练数据包含两大互补组成部分:

  1. Task-diverse VA: 从五个公共数据集(AgiBot、InternData-A1、OXE、RoboCOIN、RoboMIND)中重新划分机器人轨迹,构建超过 6,000 个操作任务,并按任务级别进行采样。
  2. HumanGen: 通过生成管道将任务采样的机器人轨迹转换为语义对齐的人类视频指令,涵盖公共数据集、自建平台、仿真以及真实世界采集。同时包括外部预训练 ICL 数据(OpenLoong、Franka、Galaxea、RuierMan)、自建 ICL 数据(RoboTwin)、仿真 ICL 数据(Bimanual Franka)以及真实世界 ICL 数据。

关键特性

  • 统一任务接口: 将零样本机器人任务泛化建模为上下文世界-动作建模(In-context World-Action Modeling),单个因果视频-动作策略同时支持语言指令和人类视频作为任务指令。
  • 可扩展的上下文数据: 引入生成管道,将任务采样的机器人轨迹转换为语义对齐的人类视频指令,生成 74.2K 个人类-机器人 ICL 配对。
  • 上下文未来块预测(IFP): 为避免策略从机器人历史和文本中学习捷径,强化其对人类视频的关注,以预测更长期的任务演化。

评估结果

在 RoboTwin 2.0 仿真基准的七个未见任务(任务级留出)上进行零样本评估:

  • 平均成功率: 46.95%
  • 对比基线: 比视频-动作基线 LingBot-VA 高出 29.50 个百分点,比 WAN 基线高出 35.97 个百分点

各任务成功率如下:

任务 成功率 (%)
Place object on scale 24.67
Stamp seal 47.00
Open microwave 59.00
Move stapler to pad 69.14
Place bread into basket 35.00
Place empty cup 84.87
Stack three blocks 9.00
平均 46.95

测试场景

  • 长时程顺序操作: 例如将银色咖啡杯放入木篮、将海绵放入白色托盘、将葫芦放在粉色椭圆盘上等。
  • 高精度插入任务: 例如桌腿插入、灯泡插入、红色立柱插入等。
  • 未见任务泛化: 包括未见物体或未见容器、双臂操作、关节物体操作以及长时程操作。
搜集汇总
数据集介绍
HumanGen 数据集图片
构建方式
HumanGen数据集基于自动化管道构建,该管道将任务采样的机器人轨迹转化为语义匹配的人类操作视频。具体而言,首先利用视觉语言模型(VLM)对每个机器人视频进行任务分析,提取任务名称、初始对象状态、状态变化及最终状态等信息,并生成图像编辑提示,将机器人视频的首帧转换为人类操作场景的初始观测。随后,视频生成模型依据提示合成人类操作视频,并通过VLM对这些视频进行语义保留和物理合理性评估,合格者与原始机器人轨迹配对,形成人-机器人上下文学习(ICL)样本。该流程支持从多个数据源(包括公开数据集、自采数据、仿真及真实世界)大规模生成数据,最终得到包含74.2K个ICL对、覆盖8.6K个任务的数据集。
特点
HumanGen数据集具有显著的多源性和任务多样性,整合了来自公开机器人数据集、内部采集、仿真及真实世界的丰富数据,覆盖超过45种机器人形态,并包含第一人称和第三人称视角的人类视频。其关键特点在于人-机对在视觉对齐上具有多样化的变化,包括背景、视角、环境风格、物体实例和放置位置等,但任务语义保持一致,这迫使模型学习不依赖于特定视觉呈现的任务级对应关系。此外,数据集的构建过程完全自动化,相较于依赖人工采集的传统数据集,可扩展性更强,且任务覆盖范围远超现有同类数据集,为跨任务泛化提供了坚实基础。
使用方法
HumanGen数据集主要用于训练和评估零样本跨任务泛化的机器人操控策略。在训练阶段,该数据集与任务多样化的机器人视频-动作数据(Task-diverse VA)结合,用于预训练因果视频-动作模型Zero-WAM。使用方式上,每个ICL样本包含一个人工视频指令和对应的机器人轨迹,模型被训练为根据人类视频推断任务动态并预测未来的机器人视频和可执行动作。数据集按来源分为预训练ICL、仿真ICL和真实世界ICL,分别支持预训练、仿真环境下跨任务评估以及真实机器人部署前的微调。在测试时,模型可直接以人类视频作为任务规范,无需语言指令或参数更新,即可执行未见过的任务配置。
背景与挑战
背景概述
在机器人学习领域,实现零样本跨任务泛化是迈向通用操作智能的核心挑战。长期以来,策略模型多依赖语言指令作为任务接口,但语言难以精确描述空间约束、中间状态与时间结构,导致任务传递存在本质缺陷。为此,香港科技大学(广州)与Robbyant团队于2026年提出HumanGen数据集,旨在通过大规模生成的人机视频对,将人类演示视频作为任务规范,赋予机器人执行未见任务的能力。该数据集由Jiaming Zhou等研究者构建,包含74.2K个跨8.6K任务的机器人-人类上下文学习(ICL)对,覆盖多源公共数据、自采数据、仿真与真实场景,显著拓展了任务覆盖范围,为机器人策略提供了丰富的视觉任务指引,对推动视频动作模型的跨任务泛化研究具有里程碑意义。
当前挑战
HumanGen所应对的核心挑战在于,传统人机配对数据稀缺且昂贵,难以支持大规模任务多样性的学习。现有数据集多依赖人工采集,任务范围狭窄,且人机视频间语义对齐与视觉一致性难以保证。其次,策略模型在训练时易学习捷径,即仅依据机器人历史观测与语言指令即可预测未来帧,从而忽视人类视频中的任务信息,导致在未见任务上泛化失败。构建过程中,需自动将机器人轨迹转换为语义匹配、视觉多样的人类视频,同时确保物理合理性与任务语义保持,这一生成流程涉及多阶段模型协同,对数据质量与规模提出了严苛要求,成为数据集构建的主要技术瓶颈。
常用场景
经典使用场景
HumanGen数据集在机器人学习领域中被广泛用于零样本跨任务泛化的训练与评估。其核心应用场景在于,通过提供大规模、任务多样的人机配对数据,使机器人策略能够依据人类视频指令,在未见过的任务上实现零样本执行。该数据集涵盖了从模拟环境(如RoboTwin 2.0)到真实世界的多类任务,包括多物体场景、长时间序列操作以及精细插入等,为验证视频条件策略的泛化能力提供了标准化的基准。
实际应用
在实际应用中,HumanGen数据集支撑了机器人从语言指令到人类视频指令的泛化能力,使机器人在真实场景中能够根据未见过的视频演示执行新任务。例如,在多物体放置、顺序操作和精细插入等任务中,机器人能准确理解并执行人类视频所展示的目标,从而提升了机器人在复杂环境中的适应性和操作精度。此外,该数据集还支持了人机协作场景,如通过视频指令调整机器人行为以适应协作需求。
衍生相关工作
基于HumanGen数据集,衍生出了一系列重要的相关研究工作。其中,Zero-WAM模型通过引入上下文未来块预测(IFP)目标,显著提升了模型对未见任务的泛化性能,在模拟和真实环境中均取得了突破性成果。此外,该数据集也推动了视频条件策略(如LingBot-VA)的改进,并激发了关于任务平衡数据采样、人类视频指令生成等方向的后续探索,为世界动作模型的发展提供了新的思路和数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务