robodyna-benchmark-v2
收藏资源简介:
RoboDyna Benchmark 是一个专门针对动态场景的双机器人操作基准数据集,基于 RoboTwin 2.0 / DOMINO 平台构建,使用 SAPIEN 3.0.3 模拟器和双 UR5 机械臂(配备 WSG 夹爪,型号 ur5-wsg)。数据集包含 23 个动态任务和 12 个家庭任务,共 81 个任务-条件组合,每个组合有 50 个成功轨迹(共 4,050 个片段),总帧数达 1,374,883 帧(约 22.9 小时,控制频率 16.667 Hz)。数据通过脚本化专家策略收集,仅包含成功滚动的轨迹,失败数据未发布。数据格式包括原始 HDF5 和 LeRobot v2.1 两种,内容完全一致。HDF5 格式独立可读,无需额外依赖;LeRobot 格式包含 parquet 文件、视频和元数据。每个片段包含 3 个 RGB 摄像头(头部、左腕、右腕)的图像(320×240),以及 14 维关节状态、16 维末端执行器位姿、32 维任务特定动态状态(零填充)、14 维动作命令。此外,HDF5 文件中还包含任务相关的动态信息(如目标位置、速度、成功标志等),便于分析时序行为。每个任务的基础条件(base)和两个难度变体(opt1、opt2)分别调整不同的难度轴(如添加障碍物、干扰物、运动目标等),共 23 个动态任务各提供三种条件,12 个家庭任务仅提供 base 条件。数据集经过质量检查:无重复片段、条件覆盖验证通过、每个组合的片段数准确为 50。适用任务包括机器人操作、动态控制、模仿学习、时序决策等研究领域。数据集采用 Apache-2.0 许可证。
RoboDyna Benchmark is a dual-robot manipulation benchmark dataset specifically designed for dynamic scenarios, built on the RoboTwin 2.0 / DOMINO platform, using the SAPIEN 3.0.3 simulator and dual UR5 robotic arms with WSG grippers (model ur5-wsg). The dataset contains 23 dynamic tasks and 12 household tasks, totaling 81 task-condition combinations, each with 50 successful trajectories (4,050 episodes total), amounting to 1,374,883 frames (approximately 22.9 hours at 16.667 Hz control frequency). Data is collected via scripted expert policies, including only successful rollouts; failure data is not released. The data format includes raw HDF5 and LeRobot v2.1, with identical content. HDF5 format is independently readable without additional dependencies; LeRobot format includes parquet files, videos, and metadata. Each episode includes images from 3 RGB cameras (head, left wrist, right wrist) at 320×240 resolution, along with 14-dimensional joint states, 16-dimensional end-effector poses, 32-dimensional task-specific dynamic states (zero-padded), and 14-dimensional action commands. Additionally, HDF5 files contain task-related dynamic information (e.g., target positions, velocities, success flags) for temporal behavior analysis. Each task has a base condition (base) and two difficulty variants (opt1, opt2) with different difficulty axes (e.g., adding obstacles, distractors, moving targets). The 23 dynamic tasks each provide three conditions, while the 12 household tasks only provide the base condition. The dataset has undergone quality checks: no duplicate episodes, condition coverage verified, and exactly 50 episodes per combination. Applicable tasks include robot manipulation, dynamic control, imitation learning, and sequential decision-making. The dataset is licensed under Apache-2.0.
RoboDyna Benchmark v2 数据集概述
RoboDyna 是一个围绕动态场景构建的双臂操作基准数据集,重点关注移动目标、滚动/坠落物体、有限时间窗口、传送带和干扰物等动态条件,而非静态的抓取放置任务。每个片段均为脚本化专家策略的成功 rollout,失败数据未发布。
数据集规模与配置
| 项目 | 数值 |
|---|---|
| 任务–条件组合数 | 81 |
| 总片段数 | 4,050(每个组合恰好 50 个) |
| 总帧数 | 1,374,883(约 22.9 小时 @ 16.67 Hz) |
| 机器人 | ur5-wsg — 双 6 自由度 UR5 机械臂,各配一个平行夹爪 |
| 相机 | 3 × RGB @ 320×240(头部、左腕、右腕) |
| 控制频率 | 16.667 Hz(仿真 250 Hz,每 15 步记录一次) |
| 数据格式 | 原始 HDF5 和 LeRobot v2.1(同一批片段,两种格式) |
任务与条件设计
- 23 个动态任务每个提供三种条件(
base、opt1、opt2),opt1和opt2分别在base基础上独立切换一个难度维度,用于隔离两个因素而非叠加。示例:hit_target:opt1添加静态阻挡物,opt2添加移动阻挡物catch_cuboid:opt1添加第二个待抓取长方体,opt2使用不透明表面(纯视觉变化)whack_moles:opt1添加兔子干扰物(不可击打),opt2鼹鼠在弹出之间重新定位
- 12 个家庭任务仅提供
base条件:boil_milk、catch_cup、clean_table、cook_food、pour_beer、trap_bug等。 - 总计:23 × 3 + 12 = 81 种组合。
数据内容与结构
LeRobot 特征
| 字段 | 形状 | 说明 |
|---|---|---|
observation.images.head/left_wrist/right_wrist |
240×320×3 | 固定俯视前方视角 + 双腕部视角 |
observation.state |
14 | 每臂 6 关节角 + 1 夹爪 |
observation.endpose |
16 | 每臂 7 维末端位姿 + 1 夹爪 |
observation.task_state |
32 | 任务特定动态状态,零填充至固定宽度 |
action |
14 | 目标关节 + 夹爪指令 |
- 每个任务在 HDF5 中以任务名命名的分组暴露自描述的动态状态,例如
hit_target/target_center_world (T,3)、hit_target/center_hit (T,) bool、hit_target/hit_score (T,)等,用于研究时序而非仅轨迹。 - 每片段注释 JSON 包含自然语言
instruction和primitive_annotation片段列表,以及dynamic_state.schema列名说明。 - HDF5 中 RGB 以编码图像字节(变长)存储,需用
cv2.imdecode/PIL解码。 - 深度图、点云和分割未采集(HDF5 中空的
pointcloud数据集仅为 schema 兼容性占位)。
相机设置
三台 Intel D435 相机,分辨率 320×240。头部相机在所有任务和片段中保持同一世界位姿(位置 (0.00, −0.50, 2.00),俯视向前,37° 垂直视场,fx = fy = 358.6,cx = 160,cy = 120),因此头部视角策略无需逐任务标定即可跨套件迁移。HDF5 中逐帧记录 intrinsic_cv、extrinsic_cv 和 cam2world_gl。
采集协议与质量控制
- 每组合由脚本化专家策略在随机种子场景下通过两遍流程采集:第一遍规划并存储轨迹,第二遍渲染重放。采集器持续重试新种子,直到 50 个 rollout 满足任务自身的
check_success判定,因此每个组合恰好 50 个成功片段,成功率不体现在片段计数中。 - 已执行的质量检查:
- 无重复片段:所有 4,050 个片段通过
md5(joint_action) + md5(首帧) + md5(末帧)签名均唯一。 - 条件覆盖已验证生效:通过比较各条件平均片段长度确认(如
hit_target的 base/opt1/opt2 分别为 124/145/279 帧)。 - 各组合计数双格式核对:50 个 HDF5 文件、50 个 parquet 文件、
meta/info.json → total_episodes == 50均一致。
- 无重复片段:所有 4,050 个片段通过
已知限制
- 仅包含成功 rollout,无失败数据,不适用于奖励学习或失败检测。
- 未发布
seed.txt文件,且种子不可移植(第二遍重放依赖本地缓存的轨迹)。 - 演示为脚本化而非遥操作,动作高效但非拟人化。
observation.task_state零填充至 32 维,切片前需从注释中读取dynamic_state.schema。
许可
Apache-2.0(基于 RoboDyna 代码库及其 RoboTwin 2.0 上游)。个别 3D 资产在源仓库中带有各自声明。




