遇见数据集

robodyna-benchmark-v2

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

RoboDyna Benchmark 是一个专门针对动态场景的双机器人操作基准数据集,基于 RoboTwin 2.0 / DOMINO 平台构建,使用 SAPIEN 3.0.3 模拟器和双 UR5 机械臂(配备 WSG 夹爪,型号 ur5-wsg)。数据集包含 23 个动态任务和 12 个家庭任务,共 81 个任务-条件组合,每个组合有 50 个成功轨迹(共 4,050 个片段),总帧数达 1,374,883 帧(约 22.9 小时,控制频率 16.667 Hz)。数据通过脚本化专家策略收集,仅包含成功滚动的轨迹,失败数据未发布。数据格式包括原始 HDF5 和 LeRobot v2.1 两种,内容完全一致。HDF5 格式独立可读,无需额外依赖;LeRobot 格式包含 parquet 文件、视频和元数据。每个片段包含 3 个 RGB 摄像头(头部、左腕、右腕)的图像(320×240),以及 14 维关节状态、16 维末端执行器位姿、32 维任务特定动态状态(零填充)、14 维动作命令。此外,HDF5 文件中还包含任务相关的动态信息(如目标位置、速度、成功标志等),便于分析时序行为。每个任务的基础条件(base)和两个难度变体(opt1、opt2)分别调整不同的难度轴(如添加障碍物、干扰物、运动目标等),共 23 个动态任务各提供三种条件,12 个家庭任务仅提供 base 条件。数据集经过质量检查:无重复片段、条件覆盖验证通过、每个组合的片段数准确为 50。适用任务包括机器人操作、动态控制、模仿学习、时序决策等研究领域。数据集采用 Apache-2.0 许可证。

RoboDyna Benchmark is a dual-robot manipulation benchmark dataset specifically designed for dynamic scenarios, built on the RoboTwin 2.0 / DOMINO platform, using the SAPIEN 3.0.3 simulator and dual UR5 robotic arms with WSG grippers (model ur5-wsg). The dataset contains 23 dynamic tasks and 12 household tasks, totaling 81 task-condition combinations, each with 50 successful trajectories (4,050 episodes total), amounting to 1,374,883 frames (approximately 22.9 hours at 16.667 Hz control frequency). Data is collected via scripted expert policies, including only successful rollouts; failure data is not released. The data format includes raw HDF5 and LeRobot v2.1, with identical content. HDF5 format is independently readable without additional dependencies; LeRobot format includes parquet files, videos, and metadata. Each episode includes images from 3 RGB cameras (head, left wrist, right wrist) at 320×240 resolution, along with 14-dimensional joint states, 16-dimensional end-effector poses, 32-dimensional task-specific dynamic states (zero-padded), and 14-dimensional action commands. Additionally, HDF5 files contain task-related dynamic information (e.g., target positions, velocities, success flags) for temporal behavior analysis. Each task has a base condition (base) and two difficulty variants (opt1, opt2) with different difficulty axes (e.g., adding obstacles, distractors, moving targets). The 23 dynamic tasks each provide three conditions, while the 12 household tasks only provide the base condition. The dataset has undergone quality checks: no duplicate episodes, condition coverage verified, and exactly 50 episodes per combination. Applicable tasks include robot manipulation, dynamic control, imitation learning, and sequential decision-making. The dataset is licensed under Apache-2.0.

创建时间:
2026-08-18
原始信息汇总

RoboDyna Benchmark v2 数据集概述

RoboDyna 是一个围绕动态场景构建的双臂操作基准数据集,重点关注移动目标、滚动/坠落物体、有限时间窗口、传送带和干扰物等动态条件,而非静态的抓取放置任务。每个片段均为脚本化专家策略的成功 rollout,失败数据未发布。

数据集规模与配置

项目 数值
任务–条件组合数 81
总片段数 4,050(每个组合恰好 50 个)
总帧数 1,374,883(约 22.9 小时 @ 16.67 Hz)
机器人 ur5-wsg — 双 6 自由度 UR5 机械臂,各配一个平行夹爪
相机 3 × RGB @ 320×240(头部、左腕、右腕)
控制频率 16.667 Hz(仿真 250 Hz,每 15 步记录一次)
数据格式 原始 HDF5LeRobot v2.1(同一批片段,两种格式)

任务与条件设计

  • 23 个动态任务每个提供三种条件(baseopt1opt2),opt1opt2 分别在 base 基础上独立切换一个难度维度,用于隔离两个因素而非叠加。示例:
    • hit_targetopt1 添加静态阻挡物,opt2 添加移动阻挡物
    • catch_cuboidopt1 添加第二个待抓取长方体,opt2 使用不透明表面(纯视觉变化)
    • whack_molesopt1 添加兔子干扰物(不可击打),opt2 鼹鼠在弹出之间重新定位
  • 12 个家庭任务仅提供 base 条件:boil_milkcatch_cupclean_tablecook_foodpour_beertrap_bug 等。
  • 总计:23 × 3 + 12 = 81 种组合

数据内容与结构

LeRobot 特征

字段 形状 说明
observation.images.head/left_wrist/right_wrist 240×320×3 固定俯视前方视角 + 双腕部视角
observation.state 14 每臂 6 关节角 + 1 夹爪
observation.endpose 16 每臂 7 维末端位姿 + 1 夹爪
observation.task_state 32 任务特定动态状态,零填充至固定宽度
action 14 目标关节 + 夹爪指令
  • 每个任务在 HDF5 中以任务名命名的分组暴露自描述的动态状态,例如 hit_target/target_center_world (T,3)hit_target/center_hit (T,) boolhit_target/hit_score (T,) 等,用于研究时序而非仅轨迹。
  • 每片段注释 JSON 包含自然语言 instructionprimitive_annotation 片段列表,以及 dynamic_state.schema 列名说明。
  • HDF5 中 RGB 以编码图像字节(变长)存储,需用 cv2.imdecode / PIL 解码。
  • 深度图、点云和分割未采集(HDF5 中空的 pointcloud 数据集仅为 schema 兼容性占位)。

相机设置

三台 Intel D435 相机,分辨率 320×240。头部相机在所有任务和片段中保持同一世界位姿(位置 (0.00, −0.50, 2.00),俯视向前,37° 垂直视场,fx = fy = 358.6cx = 160cy = 120),因此头部视角策略无需逐任务标定即可跨套件迁移。HDF5 中逐帧记录 intrinsic_cvextrinsic_cvcam2world_gl

采集协议与质量控制

  • 每组合由脚本化专家策略在随机种子场景下通过两遍流程采集:第一遍规划并存储轨迹,第二遍渲染重放。采集器持续重试新种子,直到 50 个 rollout 满足任务自身的 check_success 判定,因此每个组合恰好 50 个成功片段,成功率不体现在片段计数中。
  • 已执行的质量检查:
    • 无重复片段:所有 4,050 个片段通过 md5(joint_action) + md5(首帧) + md5(末帧) 签名均唯一。
    • 条件覆盖已验证生效:通过比较各条件平均片段长度确认(如 hit_target 的 base/opt1/opt2 分别为 124/145/279 帧)。
    • 各组合计数双格式核对:50 个 HDF5 文件、50 个 parquet 文件、meta/info.json → total_episodes == 50 均一致。

已知限制

  • 仅包含成功 rollout,无失败数据,不适用于奖励学习或失败检测。
  • 未发布 seed.txt 文件,且种子不可移植(第二遍重放依赖本地缓存的轨迹)。
  • 演示为脚本化而非遥操作,动作高效但非拟人化。
  • observation.task_state 零填充至 32 维,切片前需从注释中读取 dynamic_state.schema

许可

Apache-2.0(基于 RoboDyna 代码库及其 RoboTwin 2.0 上游)。个别 3D 资产在源仓库中带有各自声明。

搜集汇总
数据集介绍
robodyna-benchmark-v2 数据集图片
构建方式
RoboDyna基准数据集由RoboTwin 2.0平台基于SAPIEN 3.0.3仿真环境构建,采用双UR5机械臂与WSG夹爪的实施例,通过脚本化专家策略在随机种子场景下生成演示。每个任务组合经历两阶段采集流程:首阶段规划并存储轨迹,次阶段以渲染方式重放,并依据任务特定的成功谓词反复尝试直至获得50个成功回合。数据以HDF5和LeRobot v2.1两种格式并行存储,确保内容与索引完全一致,覆盖81种任务-条件组合,总计4050个成功回合,包含超过137万帧观测数据。
使用方法
使用者可依据需求选择HDF5或LeRobot格式加载数据。对于LeRobot格式,可通过Hugging Face的snapshot_download按任务组合部分下载,并利用LeRobotDataset直接解码视频与特征;HDF5格式则独立自包含,仅需h5py库即可读取关节动作、编码图像及任务动态状态。数据集设计支持策略学习、动态预测和时序分析等研究,但需注意图像为编码字节,需解码使用,且仅包含成功演示,无失败案例。
背景与挑战
背景概述
RoboDyna Benchmark v2 数据集由 RoboDyna 团队于近期创建,基于 RoboTwin 2.0 平台与 SAPIEN 仿真环境,聚焦于双臂机器人动态操作任务。其核心研究问题在于,突破传统静态抓取操作 benchmarks 的局限,构建包含移动目标、滚动与坠落物体、传送带、时间窗口及干扰物等动态场景的基准。该数据集包含 23 个动态任务和 12 个家庭任务,共计 81 种任务-条件组合,4050 个成功演示,约 137 万帧数据,并提供 HDF5 与 LeRobot v2.1 双格式。其影响力体现在为动态操作中的时序决策、多任务泛化及视觉-动觉融合研究提供了标准化试验场,有望推动机器人学习从实验室静态场景迈向真实动态环境。
当前挑战
该数据集所解决的领域挑战在于动态操作中环境的不确定性与时间约束——如目标移动、遮挡变化、传送带持续运行等,要求策略具备实时感知与预测能力,而现有静态 pick-and-place 基准难以评估此类能力。构建过程中亦面临多重挑战:确保演示多样性需通过随机种子与条件变量(如 opt1/opt2)独立控制难度;采集协议需两阶段(轨迹规划与重放渲染)以保证高质量成功演示;质量校验需规避假重复(如仅用动作流签名的误判),并通过多签名融合与条件效果验证保障数据纯净。此外,场景复现的种籽不可移植性、缺乏失败数据,以及脚本化演示的非拟人性,均为后续研究设定了边界。
常用场景
经典使用场景
RoboDyna Benchmark作为双机械臂动态操作领域的开创性基准,其经典使用场景聚焦于评估与训练具身智能体在高度动态环境中的操作技能。该数据集包含81种任务-条件组合,覆盖从目标追踪、物体拦截到装配操作等多样化动态任务,每个组合提供50条专家示范轨迹,总计4050条成功演示。研究者可借助其标准化的LeRobot v2.1格式或HDF5格式,便捷地开展模仿学习、行为克隆及强化学习的基准测试,尤其适用于研究时序决策与动态场景适应性。
解决学术问题
该数据集有效解决了动态场景下机器人操作学习研究中长期存在的基准缺失问题。传统静态抓取基准无法覆盖移动目标、滚动物体、时间窗口等动态要素,而RoboDyna通过精细的任务条件设计(如遮挡、干扰物、运动速度变化)隔离了不同难度因子,为 ablation study 提供了理想平台。其提供的动态任务状态信息(如任务特定状态的真值)促进了时序感知策略的研究,推动了从轨迹模仿向因果动作预测的学术范式转变。
实际应用
在实际应用中,RoboDyna Benchmark彰显了其在工业自动化与智能服务领域的巨大潜力。数据集中包含的传送带分拣、目标击打、动态装配等任务,直接映射到现代工厂中的物料处理、质量检测与柔性装配环节。研究人员利用该数据集训练的操控策略,可迁移至真实UR5双臂平台,实现快速感知与响应。其多视角视觉输入设计与同步的关节空间控制指令,为部署视觉-运动控制闭环系统提供了标准化的训练与验证范式。
数据集最近研究
最新研究方向
面向动态场景的双臂操作基准数据集RoboDyna Benchmark v2,其最新研究聚焦于突破传统静态抓取任务的局限,通过引入移动目标、滚动与坠落物体、传送带、干扰物及时间窗口等动态因素,为具身智能体提供高保真训练环境。该数据集以81种任务-条件组合、4050个成功示范片段及约137万帧多视角RGB图像,支持多模态学习与跨任务泛化研究。其特色在于细致的条件分化设计(base/opt1/opt2),每对条件独立调控一个难度轴,便于消融实验与因子分析。此外,数据集提供统一头相机位姿及动态状态标注,促进时序决策与动态操作策略的研究,并兼容HDF5与LeRobot v2.1格式,为机器人操作领域的前沿探索,如动态场景下的视觉-动作协同、时序依赖策略学习及多任务迁移,提供了标准化基准与丰富数据资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务