H2R-Bench
收藏资源简介:
H2R-Bench是由上海交通大学和上海人工智能实验室联合构建的跨实体人类到机器人操作视频生成基准。该基准基于EgoDex数据集中的120个第一人称人类操作视频片段,通过配对平行夹爪和灵巧手两种目标实体,扩展为240个评估实例,覆盖刚体操作、机构驱动、插入装配、变形物体、散料转移和表面变换六类操作任务。在创建过程中,每个源视频由人工验证标注任务目标、动作事件、功能接触及物体响应等结构化信息,确保评估的准确性。该基准旨在系统评估视频世界模型能否将人类操作演示忠实转化为机器人操作视频,尤其关注任务意图保持、实体一致性、功能接触迁移等核心能力,为弥补机器人演示数据稀缺提供诊断框架。
H2R-Bench is a cross-entity human-to-robot manipulation video generation benchmark jointly developed by Shanghai Jiao Tong University and Shanghai AI Laboratory. This benchmark is built upon 120 first-person human manipulation video clips from the EgoDex dataset, and is expanded into 240 evaluation instances by pairing two target entities: parallel grippers and dexterous hands. It covers six types of manipulation tasks: rigid body manipulation, mechanism-driven operation, insertion and assembly, deformable object manipulation, bulk material transfer, and surface transformation. During its construction, each source video was manually verified and annotated with structured information including task objectives, action events, functional contacts, and object responses, to ensure the accuracy of the evaluation. This benchmark aims to systematically evaluate whether video world models can faithfully translate human manipulation demonstrations into robot manipulation videos, with particular focus on core capabilities such as task intent preservation, entity consistency, and functional contact transfer, providing a diagnostic framework to address the scarcity of robot manipulation demonstration data.
H2R-Bench 数据集详情总结
数据集概述
H2R-Bench 是一个用于跨具身人类到机器人操作视频生成(Human-to-Robot Manipulation Video Generation)的基准测试数据集。其核心任务为:给定一个以自我为中心的人类演示视频和目标任务具身形态,模型需生成对应的机器人操作视频。该数据集共包含 240 个测试用例(120 个源视频 × 2 种目标具身形态),所有用例均带有基于源视频的标注。
数据集构建流程
- 筛选(Curate):从 EgoDex 测试集选取 120 个包含可见实体、交互和状态变化的片段,均匀覆盖 6 个操作类别(每类 20 个),每个片段配对两种目标具身形态,形成 240 个迁移用例。
- 标注(Annotate):对每个视频片段标注初始/最终状态、物体与工具、所需动作事件、源侧接触证据;对每种具身形态标注功能接触区域、操作模式、预期物体响应、双手角色分工。所有标注均经人工验证。
- 生成(Generate):视频条件模型使用完整源片段,帧条件模型使用按序排列的帧(至其接口上限)。主设定中不提供机器人参考图像,具身信息仅通过文本提示给定。
操作类别与具身形态
- 六个操作类别(F1–F6):
- F1:刚性物体搬运/重排
- F2:关节式作动
- F3:插入/连接
- F4:可变形物体构型
- F5:散装物料转移/混合
- F6:表面或材料变化
- 两种目标具身形态:平行夹爪(parallel-jaw gripper)、灵巧手(dexterous hand)。
评估指标
数据集采用 五个维度 评估生成视频,综合得分为 H2RCore(0–100 分),计算公式为:
H2RCore = 100 × (0.15 × M1 + 0.15 × M2 + 0.30 × M3 + 0.30 × M4 + 0.10 × M5)
| 指标 | 权重 | 评估内容 |
|---|---|---|
| M1:目标状态完成度 | 0.15 | 最终状态所需谓词(空间/包含关系、机构状态、附着、形变、材料分布、表面变化) |
| M2:动作事件完成度 | 0.15 | 所需操作是否发生(抓取、插入、释放、倾倒、擦拭、折叠等),不要求复现人类姿态或时序 |
| M3:功能接触迁移 | 0.30 | 源帧与生成帧的接触区域、接触可见性、操作模式、物体响应、目标具身可行性 |
| M4:具身正确性 | 0.30 | 机器人可见、无人类手部、具身类别正确、末端执行器类型正确、结构时间一致性 |
| M5:视频质量 | 0.10 | 成像质量(MUSIQ)、美学质量(LAION + CLIP)、时间稳定性、运动平滑度(AMT-S) |
M1–M4 由三个多模态大语言模型评判器(Gemini 3.5 Flash、Qwen3.7-Plus、GPT-5.4)独立评分,每位评判器使用 25 帧均匀采样帧,评分范围 0–4,归一化后取平均。接触迁移与具身正确性合计占 60% 权重,凸显有效迁移的关键性。
主要评测结果
基准测试对 11 个最新模型 在 240 个迁移用例上进行了评估,分为两组:
- 视频条件生成组(前三名):Seedance 2.0(夹爪 H2RCore 77.3,灵巧手 84.6)、Wan2.7(76.5 / 83.1)、Kling-V3(74.5 / 81.7)。
- 帧条件生成组:Mitty-EPIC14B(61.5 / 56.1)、Veo 3.1(49.6 / 57.0)、Grok Imagine Video(50.1 / 49.2)等。该组多数模型在目标完成和动作得分上尚可,但具身正确性接近零(如 Wan2.2 夹爪具身得分为 0.000)。
关键发现:
- 视频质量最高的模型(HunyuanVideo 1.5-I2V,质量分 0.806/0.808)在 H2RCore 上排名垫底,表明视觉逼真度与迁移有效性几乎无关(22 个模型-具身对的 Spearman ρ = 0.14)。
- 灵巧手是更容易的目标:9/11 模型在灵巧手设定下得分更高(平均 +3.3 H2RCore),接触迁移在全部模型中提升。
- 提供机器人参考图像仅对部分模型有帮助(如 Wan2.7 提升明显),对其他模型反而降低分数。
适用范围与局限性
该基准评估人类到机器人迁移的可见证据,不评估物理可执行性或下游策略性能。其 120 个 EgoDex 源视频和两种目标具身仅覆盖真实操作场景的部分变体;原生接口比较混合了模型能力与接口差异,组间模式为描述性而非因果性;在遮挡、细微接触或严重生成伪影下,采样视觉证据和 MLLM 评判可能存在不确定性。

- 1H2R-Bench: Benchmarking Human-to-Robot Manipulation Video Generation in World Models上海交通大学; 上海人工智能实验室 · 2026年




