遇见数据集

H2R-Bench

收藏
arXiv2026-08-13 更新2026-08-15 收录
官方服务:

资源简介:

H2R-Bench是由上海交通大学和上海人工智能实验室联合构建的跨实体人类到机器人操作视频生成基准。该基准基于EgoDex数据集中的120个第一人称人类操作视频片段,通过配对平行夹爪和灵巧手两种目标实体,扩展为240个评估实例,覆盖刚体操作、机构驱动、插入装配、变形物体、散料转移和表面变换六类操作任务。在创建过程中,每个源视频由人工验证标注任务目标、动作事件、功能接触及物体响应等结构化信息,确保评估的准确性。该基准旨在系统评估视频世界模型能否将人类操作演示忠实转化为机器人操作视频,尤其关注任务意图保持、实体一致性、功能接触迁移等核心能力,为弥补机器人演示数据稀缺提供诊断框架。

H2R-Bench is a cross-entity human-to-robot manipulation video generation benchmark jointly developed by Shanghai Jiao Tong University and Shanghai AI Laboratory. This benchmark is built upon 120 first-person human manipulation video clips from the EgoDex dataset, and is expanded into 240 evaluation instances by pairing two target entities: parallel grippers and dexterous hands. It covers six types of manipulation tasks: rigid body manipulation, mechanism-driven operation, insertion and assembly, deformable object manipulation, bulk material transfer, and surface transformation. During its construction, each source video was manually verified and annotated with structured information including task objectives, action events, functional contacts, and object responses, to ensure the accuracy of the evaluation. This benchmark aims to systematically evaluate whether video world models can faithfully translate human manipulation demonstrations into robot manipulation videos, with particular focus on core capabilities such as task intent preservation, entity consistency, and functional contact transfer, providing a diagnostic framework to address the scarcity of robot manipulation demonstration data.

创建时间:
2026-08-13
原始信息汇总

H2R-Bench 数据集详情总结

数据集概述

H2R-Bench 是一个用于跨具身人类到机器人操作视频生成(Human-to-Robot Manipulation Video Generation)的基准测试数据集。其核心任务为:给定一个以自我为中心的人类演示视频和目标任务具身形态,模型需生成对应的机器人操作视频。该数据集共包含 240 个测试用例(120 个源视频 × 2 种目标具身形态),所有用例均带有基于源视频的标注。

数据集构建流程

  1. 筛选(Curate):从 EgoDex 测试集选取 120 个包含可见实体、交互和状态变化的片段,均匀覆盖 6 个操作类别(每类 20 个),每个片段配对两种目标具身形态,形成 240 个迁移用例。
  2. 标注(Annotate):对每个视频片段标注初始/最终状态、物体与工具、所需动作事件、源侧接触证据;对每种具身形态标注功能接触区域、操作模式、预期物体响应、双手角色分工。所有标注均经人工验证。
  3. 生成(Generate):视频条件模型使用完整源片段,帧条件模型使用按序排列的帧(至其接口上限)。主设定中不提供机器人参考图像,具身信息仅通过文本提示给定。

操作类别与具身形态

  • 六个操作类别(F1–F6)
    • F1:刚性物体搬运/重排
    • F2:关节式作动
    • F3:插入/连接
    • F4:可变形物体构型
    • F5:散装物料转移/混合
    • F6:表面或材料变化
  • 两种目标具身形态:平行夹爪(parallel-jaw gripper)、灵巧手(dexterous hand)。

评估指标

数据集采用 五个维度 评估生成视频,综合得分为 H2RCore(0–100 分),计算公式为:

H2RCore = 100 × (0.15 × M1 + 0.15 × M2 + 0.30 × M3 + 0.30 × M4 + 0.10 × M5)

指标 权重 评估内容
M1:目标状态完成度 0.15 最终状态所需谓词(空间/包含关系、机构状态、附着、形变、材料分布、表面变化)
M2:动作事件完成度 0.15 所需操作是否发生(抓取、插入、释放、倾倒、擦拭、折叠等),不要求复现人类姿态或时序
M3:功能接触迁移 0.30 源帧与生成帧的接触区域、接触可见性、操作模式、物体响应、目标具身可行性
M4:具身正确性 0.30 机器人可见、无人类手部、具身类别正确、末端执行器类型正确、结构时间一致性
M5:视频质量 0.10 成像质量(MUSIQ)、美学质量(LAION + CLIP)、时间稳定性、运动平滑度(AMT-S)

M1–M4 由三个多模态大语言模型评判器(Gemini 3.5 Flash、Qwen3.7-Plus、GPT-5.4)独立评分,每位评判器使用 25 帧均匀采样帧,评分范围 0–4,归一化后取平均。接触迁移与具身正确性合计占 60% 权重,凸显有效迁移的关键性。

主要评测结果

基准测试对 11 个最新模型 在 240 个迁移用例上进行了评估,分为两组:

  • 视频条件生成组(前三名):Seedance 2.0(夹爪 H2RCore 77.3,灵巧手 84.6)、Wan2.7(76.5 / 83.1)、Kling-V3(74.5 / 81.7)。
  • 帧条件生成组:Mitty-EPIC14B(61.5 / 56.1)、Veo 3.1(49.6 / 57.0)、Grok Imagine Video(50.1 / 49.2)等。该组多数模型在目标完成和动作得分上尚可,但具身正确性接近零(如 Wan2.2 夹爪具身得分为 0.000)。

关键发现

  • 视频质量最高的模型(HunyuanVideo 1.5-I2V,质量分 0.806/0.808)在 H2RCore 上排名垫底,表明视觉逼真度与迁移有效性几乎无关(22 个模型-具身对的 Spearman ρ = 0.14)。
  • 灵巧手是更容易的目标:9/11 模型在灵巧手设定下得分更高(平均 +3.3 H2RCore),接触迁移在全部模型中提升。
  • 提供机器人参考图像仅对部分模型有帮助(如 Wan2.7 提升明显),对其他模型反而降低分数。

适用范围与局限性

该基准评估人类到机器人迁移的可见证据,不评估物理可执行性或下游策略性能。其 120 个 EgoDex 源视频和两种目标具身仅覆盖真实操作场景的部分变体;原生接口比较混合了模型能力与接口差异,组间模式为描述性而非因果性;在遮挡、细微接触或严重生成伪影下,采样视觉证据和 MLLM 评判可能存在不确定性。

搜集汇总
数据集介绍
H2R-Bench 数据集图片
构建方式
H2R-Bench的构建基于从EgoDex测试集中精心挑选的120段第一人称人类操作视频,确保每个片段包含清晰可见的任务相关实体、交互动作与状态变化。这些源视频均匀覆盖六类操作族系,包括刚体重整、机构驱动、插入装配、柔性体构型、散体物料传输及表面材质转化。每个源片段与两种目标具身(平行夹爪与灵巧手)配对,形成240个迁移任务实例。对于每个实例,借助多模态语言模型Qwen3.7-Plus生成结构化注释,记录初始与最终状态、相关物体与工具、所需操作事件及源侧接触证据,并针对每种目标具身补充功能接触区域、操作模式及预期物体响应。所有注释均经过人工针对源视频的逐条校验,确保注释的准确性与可靠性,从而为评估提供严格的源参照基准。
特点
H2R-Bench的核心特色在于其源导向的评估范式,聚焦于跨具身迁移能力,而非仅关注视频的视觉逼真度或时间连贯性。该基准引入五种互补的评估维度:目标状态完成度、操作事件完成度、功能性接触迁移、具身正确性以及通用视频质量,其中前四项由三个多模态大模型依据共享的0-4评分标准独立评判,并经由人工评分验证高度一致。尤其强调接触与具身维度,其权重合计占比60%,精准识别出现有视频生成模型在语义保留与具身一致性之间的显著落差。此外,基准覆盖多种代表性模型与两种目标具身,揭示了灵巧手目标下模型表现普遍优于平行夹爪的现象,为诊断模型在任务执行、交互保真与形态适配等方面的能力边界提供了系统化框架。
使用方法
H2R-Bench的使用方法遵循标准化协议,以确保不同视频生成模型间的公平可比性。每个迁移实例包含源人类演示视频、目标具身约束及结构化注释。模型根据其原生条件接口接收输入:视频条件模型获得完整源片段,图像或帧条件模型则输入按时序排列的源帧(若接口支持多帧则保留首尾帧)。所有模型共享统一的任务与具身提示词,主设置中不提供目标机器人参考图像以测试纯文本引导的跨具身替换能力。生成的视频以原生分辨率、时长与帧率保存,评估时统一采样固定数量的帧以计算各指标得分。最终H2RCore得分加权聚合五个维度,其中接触与具身各占0.30,目标与动作各占0.15,视频质量占0.10。该协议支持模型间横向对比、目标具身效应分析以及迁移失败模式的诊断,为视频世界模型在人-机器人跨具身操作迁移领域的性能评估提供了严谨的基准工具。
背景与挑战
背景概述
H2R-Bench是由上海交通大学与上海人工智能实验室的研究团队于2026年联合推出的基准测试,旨在系统评估视频世界模型在跨实体人机操作视频生成中的能力。该数据集针对机器人学习中大规模操作数据难以获取的瓶颈,探索利用丰富的第一视角人类操作视频,通过视频生成模型将其转化为指定机器人形态的操作视频。核心研究问题在于,模型能否在保留源视频任务目标、动作事件、功能性接触及物体状态变化的同时,完成从人手到机器人末端执行器的形态替换。H2R-Bench涵盖了六类操作任务与两种机器人形态,并引入了源条件化的评估设定,弥补了现有视频生成基准在跨实体迁移评估上的空白,为推动机器人操作数据的高效生成提供了重要参考。
当前挑战
该数据集面临的核心挑战来源于跨实体操作迁移的复杂性。领域层面,现有视频生成模型普遍难以在替换人类执行者为机器人时维持功能一致性,常常出现接触区域错位、末端执行器类型不匹配或人类手部残留等问题,且视觉质量与有效迁移之间的关联较弱,高保真视频未必满足任务与实体约束。构建层面,需要从海量第一视角视频中筛选具有清晰任务状态变化与可见交互的片段,并针对不同目标实体设计结构化标注,涵盖任务目标、动作事件、功能性接触及物体响应等维度,同时确保标注的可靠性与来源一致性。此外,评估协议需兼顾可复现性与人类判断的一致性,以提供全面而稳健的诊断框架,实现对模型能力的精确判断。
常用场景
经典使用场景
H2R-Bench作为首个专门针对跨具身(cross-embodiment)人机转换视频生成的基准测试,其核心应用场景在于系统性地评估视频世界模型能否将第一人称人类操作演示转化为指定机器人形态下的操作视频。该基准通过精心构建的240个转换实例,覆盖六类操作族(如刚体重排、机构驱动、插入装配、可变形物体构型、散体材料转移及表面材质变化),并配以两种目标机器人末端执行器(平行爪夹持器与灵巧手),为不同生成模型提供了统一的源条件化评估平台。研究者可利用H2R-Bench对模型进行能力剖析,观察其在目标状态达成、动作事件完成、功能接触迁移、具身一致性及视频质量五个维度上的表现,从而深入理解跨具身生成中的关键挑战。
衍生相关工作
H2R-Bench的提出激发了多项后续研究,包括但不限于:基于其评估框架改进的跨具身视频生成模型,如引入参考图像或强化源条件约束,以提升具身一致性;开发更细粒度的功能接触迁移评价方法,用于分析机器人末端执行器与物体交互的物理合理性;以及将该基准扩展到更多机器人形态(如四足机器人或轮式平台)和更复杂的操作任务中。此外,H2R-Bench的诊断特性也促进了可解释性研究,旨在区分生成视频中因任务、接触或形态导致的失败类型,进而为视频世界模型在真实机器人系统中的应用提供指导。
数据集最近研究
最新研究方向
H2R-Bench基准的引入标志着跨具身人类到机器人操作视频生成评估领域迈出了关键一步。当前,视频世界模型在将丰富的第一人称人类演示转化为特定机器人形态的操作视频方面展现出巨大潜力,但评估其跨具身迁移能力仍属空白。H2R-Bench通过构建覆盖六类操作族和两种目标具身(平行爪夹持器与灵巧手)的240个迁移案例,并确立目标状态完成、动作事件完成、功能性接触迁移、具身正确性及视频质量五维评估体系,系统揭示了现有视频生成模型在保持任务意图与交互证据方面的显著不足。该基准的发布为衡量视频世界模型弥合人类与机器人具身鸿沟的能力提供了标准化诊断框架,推动了基于海量人类演示生成可靠机器人训练数据这一前沿方向的实证研究。
相关研究论文
  • 1
    H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models上海交通大学; 上海人工智能实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务