遇见数据集

RoboDojo

收藏
arXiv2026-07-09 更新2026-07-09 收录
数据链接:
官方服务:

资源简介:

RoboDojo是由国际多所顶尖高校与研究机构联合构建的一个统一仿真与现实基准测试集,旨在全面评估通用机器人操作策略的综合性能。该数据集包含42个仿真任务与18个现实世界任务,覆盖了泛化性、记忆性、长时程、精确性和开放词汇指令跟随五大能力维度,其仿真数据通过异构并行模拟在Isaac Sim平台高效采集。该基准集通过标准化的硬件设置、场景重置流程与评估协议,旨在系统性诊断当前机器人策略在复杂物理部署中的瓶颈,推动具身智能在通用操作领域的稳健发展。

RoboDojo is a comprehensive robotic manipulation benchmark dataset jointly created by multiple top-tier academic institutions, aiming to systematically evaluate the comprehensive performance of general-purpose robotic manipulation policies. This dataset includes 42 simulated tasks and 18 real-world tasks, covering five core capability dimensions: generalization, memory ability, long-term execution, precise manipulation, and open-vocabulary instruction following. It enables efficient evaluation via heterogeneous parallel simulation techniques and standardized physical deployment platforms. The dataset construction process deeply integrates physics simulation engines and real robotic hardware, and adopts strict task design procedures and anti-gaming protocols to ensure the fairness and reproducibility of evaluations. Its core applications lie in diagnosing and improving the robustness of general robotic manipulation policies, providing a systematic evaluation framework for addressing the long-standing challenge of simulation-to-real transfer, and promoting the actual deployment of embodied intelligence in complex physical environments.

创建时间:
2026-07-06
原始信息汇总

RoboDojo 数据集概述

RoboDojo 是一个面向通用机器人操作策略的统一仿真与真实世界(Sim-and-Real)基准测试,旨在系统且全面地评估策略能力。

数据集组成

  • 仿真任务(Simulation Tasks):共 42 个任务,覆盖五个能力维度:

    • 泛化(Generalization)
    • 记忆(Memory)
    • 精度(Precision)
    • 长程执行(Long-Horizon)
    • 开放词汇指令跟随(Open-Vocabulary Instruction Following)
  • 真实世界任务(Real-World Tasks):共 18 个任务,涵盖三种机器人本体(embodiments),用于评估策略在真实物理世界中的部署性能。

关键特性

仿真基准

  • 基于 Isaac Sim 实现异构并行仿真,大幅提升评估吞吐量。
  • 具体任务定义与可视化详见:http://robodojo-benchmark.com/doc/sim-tasks

真实世界评估系统(RoboDojo-RealEval)

  • 提供可复现的真实世界评估系统,支持远程云端访问。
  • 标准化硬件设置、场景重置流程、评估协议和部署接口。
  • 支持 24 小时连续远程评估,在受控条件下运行。

统一策略开发与部署基础设施(XPolicyLab)

  • 提供统一的策略开发与部署基础设施,策略只需集成一次,即可在仿真和真实环境中进行评估。
  • 目前已集成 30 种策略,并在 RoboDojo 上进行了评估,建立了公开排行榜。

排行榜与评估

  • 仿真排行榜列出了 Top 10 策略,评估指标包括:
    • 综合得分(Score)
    • 成功率(Success Rate, SR)
    • 泛化(Generalization)
    • 精度(Precision)
    • 长程执行(Long-Horizon)
    • 记忆(Memory)
    • 开放词汇(Open)
  • 排行榜由非营利基金会 AI MMLab Club 独立维护,无商业资助或赞助。

未来扩展

RoboDojo 计划扩展以下基准线:

  • 移动操作(Mobile Manipulation)
  • 灵巧操作(Dexterous Manipulation)
  • 触觉操作(Tactile Manipulation)
  • 人形机器人(Humanoid Robotics)

引用信息

  • 论文:arXiv:2607.04434(http://arxiv.org/abs/2607.04434)
  • 代码仓库:http://robodojo-benchmark.com/(RoboDojo)、http://xpolicylab.github.io/(XPolicyLab)
  • 排行榜:http://robodojo-benchmark.com/leaderboard
搜集汇总
数据集介绍
RoboDojo 数据集图片
构建方式
RoboDojo的构建立足于对通用机器人操作策略评估需求的深度剖析,旨在弥合现有仿真与真实世界基准之间的鸿沟。其构建方式基于一个统一的仿真与真实世界框架,仿真部分依托NVIDIA Isaac Sim与Isaac Lab,采用配置驱动的模块化场景构建管线,通过YAML规范定义42项仿真任务,涵盖泛化、记忆、长时域、精确度与开放词汇五大能力维度。训练数据包含3,500条轨迹,总计20.66小时的双臂操作数据,通过自动化轨迹合成与VR遥操作两种互补模式收集。真实世界基准则构建了RoboDojo-RealEval系统,通过标准化硬件配置、工作空间布局、光照条件与场景重置流程,在三种机器人平台上建立18项可复现的真实世界任务,并收集了1,800条演示轨迹,共计17.91小时的数据。
特点
RoboDojo数据集的核心特点在于其独特的仿真与真实世界统一评估范式,提供了全面的能力诊断与物理部署验证。仿真基准支持异构并行模拟,允许多种不同场景在同一向量化接口下并发执行,显著提升评估通量。其任务设计超越了简单的物体或语言变化,通过五大能力维度系统性地诊断策略局限性:泛化维度引入高达25个杂乱物体与强域随机化,记忆维度测试非马尔可夫决策与关键帧记忆,长时域维度评估多步骤依赖执行,精确度维度要求严格的空间与运动精度,开放维度检验技能重组与语言引导的迁移能力。真实世界基准则通过标准化硬件、远程云端评估与双盲评分协议,确保评估的可重复性与公平性,同时暴露接触动力学、感知噪声与执行漂移等仿真难以捕捉的部署挑战。
使用方法
RoboDojo提供了多层次的使用方法,以支持高效的策略开发与系统评估。通过XPolicyLab这一统一基础设施,研究者可以将策略一次性集成,即可在仿真与真实世界环境中进行无缝部署与评估。仿真评估支持高效的批量并行测试,每个任务进行50次试验,共计2,100次试验,计算成功率与平均分数两大指标,并通过标准与随机两种设置评估域内性能与分布外鲁棒性。真实世界评估则通过RoboDojo-RealEval平台进行,支持本地部署与远程云端评估,每个任务进行10次试验,采用双盲独立评分。系统还建立了公开排行榜,通过隐藏布局验证、多种子重复评估与完整开源物件的发布协议,有效防止过拟合与排行榜操控,确保评估结果的公正性与可复现性。
背景与挑战
背景概述
随着具身智能领域的蓬勃发展,通用机器人操作策略取得了显著进步,然而现有基准测试在系统性与全面性评估上存在局限。为弥补这一空白,2026年7月,来自香港大学、加州大学伯克利分校、清华大学、北京大学、斯坦福大学、麻省理工学院等多所顶尖机构的研究人员联合发布了RoboDojo。该基准测试的核心目标在于构建一个统一的仿真与真实世界评估平台,用于对通用机器人操作策略进行全方位诊断。RoboDojo包含42个仿真任务与18个真实世界任务,覆盖泛化、记忆、精度、长序列执行及开放词汇指令跟随等五大能力维度,并集成了超过30种现有策略,通过标准化协议与持续更新的排行榜,为领域内研究提供了系统性的进展评估工具。
当前挑战
RoboDojo所面临的挑战可分为两个层面。首先,在领域问题层面,现有通用操作策略在多样化的操作场景中表现极不均衡,尤其在精密操控、记忆依赖及开放语义理解等维度存在严重瓶颈。仿真评估揭示,即便最佳策略的平均成功率也低于15%,且场景级随机化会导致大部分策略性能急剧下降,凸显了策略在视觉与空间分布偏移下的脆弱性。其次,在基准构建过程中,团队需要解决仿真与真实世界评估之间的鸿沟:仿真虽高效但无法完全复现物理世界的接触动力学与感知噪声,而真实世界评估则面临成本高昂、可重复性差等挑战。为此,RoboDojo设计了可重复的真实世界评估系统RoboDojo-RealEval,通过标准化硬件布局、场景重置流程与评估协议,在确保评估结果可靠性的同时,支持远程云端评估与高效政策迭代。
常用场景
经典使用场景
在具身智能与机器人操作领域,RoboDojo被广泛用于对通用型机器人操控策略进行系统化的能力诊断与评估。研究者利用其涵盖42个仿真任务与18个真实世界任务的多元化测试套件,针对泛化能力、记忆依赖、高精度操控、长时序执行以及开放词汇指令理解等五大核心维度,对策略进行全面而精细的评估。这一基准弥补了以往评测场景单一、维度狭窄的缺陷,为比较不同架构的视觉-语言-动作模型提供了标准化、可复现的协议。
实际应用
在实际应用层面,RoboDojo通过标准化的RoboDojo-RealEval平台,为机器人操控策略的真实环境部署提供了可复现的评测基础设施。该平台固定了硬件布局、光照条件及场景复位流程,支持远程云端评估,使得不同机构的策略能够在完全一致的物理条件下进行公平比拼。这直接服务于服务机器人、工业协作臂以及家庭自动化等场景,帮助工程师在部署前准确评估策略在接触丰富、感知噪杂的真实环境中的稳定性与安全性,加速从实验室原型到商业产品的落地进程。
衍生相关工作
该数据集催生了一系列具有深远影响力的衍生工作。RoboDojo发布的排行榜和综合评估结果,直接激发了诸如Hy-Embodied-0.5-VLA、Spatial Forcing以及π0.5等主流VLA模型在长时序执行与记忆推理方向上的针对性改进。同时,其揭露的开放语义操作难题,推动了如X-VLA和EventVLA等模型在多模态对齐与事件记忆机制上的创新。此外,基于RoboDojo的评测框架,研究者还发展出一系列用于诊断策略稳定性与控制安全性的方法论,催生了后续关于行动平滑度、接触感知反馈以及错误恢复机制的深入研究,构成了一个活跃的研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务