mhbench_cocarry_test
收藏资源简介:
MHBbench — CoCarry (G1 × 2) 数据集包含50个成功的双操作员演示,任务为两个Unitree G1人形机器人并肩搬运一块1.2米长的木板越过目标线。每个机器人由一名人类操作员通过Meta Quest 3头显在联邦式双进程Isaac Sim链接中远程操作。数据共23,651帧,采样率50 Hz,模拟演示时长7.9分钟。任务难点在于两个独立机械臂共同持有一个刚体,操作员的错误会通过物体传递给对方。数据收集于2026年8月13日,分三次会话完成,每次成功由系统自动检测而非手动标记。数据集采用LeRobot v2.1格式,包含parquet行、H.264视频和meta/目录。每个演示包含状态(每机器人43个关节角度)、动作(每机器人35维)、图像(5个H.264视频流,240×320分辨率,包括两个第一人称视角、一个固定第三人称视角和两个深度图)以及语言指令(三个任务描述,分别对应双人任务和每个机器人各自的任务)。演示统计显示:帧数范围364-651,中位数471;板子X方向移动范围1.45-1.56米,中位数1.50米;偏离中心线最大Y方向0.02-0.19米,中位数0.07米;最终板子高度0.78米;双机器人同时抓握时间占比73-86%,中位数82%;负载共享比例0.09-0.81,中位数0.38;实时因子0.25-0.28。数据集存在已知限制:两次演示被手动删除导致编号混乱;重建图像比原始约亮8%;负载很少均匀分配;所有会话运行在0.25-0.28倍实时速度;操作员对齐存在约13毫秒的延迟;抓取采用磁吸抽象而非真实接触;仅单场景、单操作员对、平坦地面。
The MHBbench — CoCarry (G1 × 2) dataset contains 50 successful dual-operator demonstrations where two Unitree G1 humanoid robots carry a 1.2-meter-long wooden plank side by side across a target line. Each robot is teleoperated by a human operator using a Meta Quest 3 headset through a federated dual-process Isaac Sim link. The data comprises 23,651 frames at a sampling rate of 50 Hz, with a total simulation duration of 7.9 minutes. The challenge of the task lies in the two independent robotic arms jointly holding a rigid body, where errors by one operator are transmitted to the other through the object. Data was collected on August 13, 2026, over three sessions, with successful episodes automatically detected by the system rather than manually marked. The dataset follows the LeRobot v2.1 format, including parquet rows, H.264 videos, and a meta/ directory. Each demonstration includes states (43 joint angles per robot), actions (35 dimensions per robot), images (5 H.264 video streams at 240×320 resolution, comprising two first-person views, one fixed third-person view, and two depth maps), and language instructions (three task descriptions corresponding to the dual-robot task and each robots individual task). Demonstration statistics show: frame count range 364-651, median 471; board X-direction movement range 1.45-1.56 m, median 1.50 m; maximum deviation from the center line in Y-direction 0.02-0.19 m, median 0.07 m; final board height 0.78 m; dual-robot simultaneous grasping time ratio 73-86%, median 82%; load sharing ratio 0.09-0.81, median 0.38; real-time factor 0.25-0.28. Known limitations: two demonstrations were manually deleted causing numbering confusion; reconstructed images are about 8% brighter than the original; load is rarely evenly distributed; all sessions ran at 0.25-0.28x real-time speed; operator alignment has approximately 13 ms delay; grasping uses magnetic abstraction rather than real contact; only a single scene, single operator pair, and flat ground.
MHBench — CoCarry (G1 × 2) 数据集概述
数据集基本信息
- 许可证: Apache-2.0
- 任务类别: 机器人学 (robotics)
- 规模: 少于 1K 样本 (n<1K)
- 标签: 机器人学、模仿学习、遥操作、人形机器人、多智能体、操作、Isaac Lab、LeRobot、深度、RGBD
数据集内容
该数据集包含 50 次成功的双操作员演示,任务为 Isaac-CoCarry-G1x2-v0:两个 Unitree G1 人形机器人并排搬运一块 1.2 米长的木板越过终点线,每个机器人由一名人类操作员通过 Meta Quest 3 头显在分布式双进程 Isaac Sim 链接中控制。数据包含 23,651 帧(50 Hz 采样),共计 7.9 分钟 的模拟演示。
数据格式与结构
采用 LeRobot v2.1 格式:parquet 行、H.264 视频和 meta/ 目录。
meta/ info.json 特征、数据类型、维度名称、fps、路径模式 modality.json 每个键对应的列切片 episodes.jsonl 每行一个片段:索引、任务、长度 tasks.jsonl 三条指令 mhbench_provenance.json 每个片段的来源记录 data/chunk-000/episode_000000.parquet ... episode_000049.parquet videos/chunk-000/observation.images.ego_a/... 彩色视频 observation.images.ego_b/... observation.images.scene/... observation.depth.ego_a/... 米制、无损 observation.depth.ego_b/... configs/operators.yaml 元数据整数编码的图例
状态与动作空间
状态:每个机器人 43 个测量关节角,分为七组(URDF 顺序):
- 左腿/右腿:6 + 6
- 腰部:3
- 左臂/右臂:7 + 7
- 左手/右手:7 + 7
动作:每个机器人 35 维:
- 左臂/右臂(7+7):关节目标,相对于片段起始时的角度
- 左手/右手(7+7):关节目标,绝对
- 腰部(3):关节目标,绝对
- 基座高度指令(1):髋部高度(米)
- 导航指令(3):
vx, vy, wz
注意:腿部仅在状态中而不在动作中——运动通过速度和高度指令控制,由平衡控制器解析腿部。
语言指令
包含三条指令,因为两个机器人的角色不对称——一个侧步向右,另一个侧步向左:annotation.human.task_description 是两人组合的指令,…_robot_a 和 …_robot_b 分别为每个机器人自己的指令。
演示统计
| 指标 | 范围 | 中位数 |
|---|---|---|
| 帧数 | 364 – 651 | 471 |
| 木板 X 方向行程 | +1.45 – +1.56 m | +1.50 m |
| 最大偏离中心线 | Y | |
| 最终木板高度 | 0.78 m | 0.78 m |
| 双机器人持续抓持 | 73 – 86% 步数 | 82% |
| 负载分担比 | 0.09 – 0.81 | 0.38 |
| 实时因子 | 0.25 – 0.28 | 0.28 |
终点线: X = 1.5 m (±0.15),走廊 ±0.6 m,支架高 0.78 m。
图像数据
每集 5 个 H.264 视频流,分辨率 240×320,每行一帧:
| 视频键 | 描述 |
|---|---|
observation.images.ego_a |
操作员 1 的机器人视角 |
observation.images.ego_b |
操作员 2 的机器人视角 |
observation.images.scene |
固定第三人称视角 |
observation.depth.ego_a |
同一视角的米制深度 |
observation.depth.ego_b |
深度数据
深度以 H.264 MP4 编码但无损,像素值为毫米数,跨两个通道分割,无返回值处为零。可通过 (帧[..., 0] << 8) | 帧[..., 1]) / 1000.0 解码为米。最坏误差为 0.5 mm 舍入。每个深度特征还携带相机内参(camera.fx/fy/cx/cy)和每行的相机位姿(observation.camera_pose)。
已知局限性
- 两次演示被手动删除:第一会话的
demo_13失败,demo_25随之一同删除,新版块被重命名填补空缺,导致文件与组名不一致。 - 重建帧比原始会话亮约 8%:均匀地影响所有三个相机,源于全局差异而非单相机差异。
- 负载分担不均:负载分担比中位数 0.38(均匀搬运应为 0.50),极端情况下单机器人承担九成负载。
- 实时因子 0.25–0.28:操作员以慢动作遥操作,控制率 50 Hz 下实际仅 12.7 Hz。
- 操作员同步存在延迟:两个操作员流中位时间差约 13 ms,最坏 p90 为 37.1 ms。
- 抓取为抽象实现:使用磁性表面闩锁而非指-物接触解算,
states/hand_contact/*恒为零。 - 单一场景、单一操作员对、平坦地面:
terrain_id = 0,partner_id = 0,一块板、一个生成布局——50 次是对单一配置的重复,缺乏泛化所需的变化。
加载方式
数据集支持 LeRobot 和 GR00T 训练框架直读。需读取 meta/modality.json 获取列切片索引,而非硬编码偏移量。GR00T 训练时需使用 launch_train.py(而非 launch_finetune.py),因为动作块为 50 步(50 Hz 下 1.0 秒),而微调入口点默认验证 40 步的块。



