armnetbench_robometer_v01
收藏资源简介:
ArmnetBench v0.1是一个用于机器人操作基准测试的数据集,专注于在低成本SO-101机器人手臂上执行的单臂和双臂任务。该数据集包含12个不同的操作任务(8个单臂任务和4个双臂任务),每个任务提供了50条人类遥操作的高质量参考演示轨迹。此外,数据集还包含了7种不同策略(包括ACT、Diffusion、SmolVLA、π0、π0.5、GR00T N1.7和MolmoAct 2)在这些参考数据上训练或微调后,在真实机器人上执行产生的评估轨迹。数据以RoboMeter统一轨迹格式组织,每个数据行代表一个摄像头视角下的一个完整操作片段(episode),包含唯一标识符、自然语言任务指令、任务指令的句子嵌入向量、数据源标识、视频文件相对路径、机器人标识以及离散质量标签(分为successful、failure或suboptimal)。视频数据由三个摄像头以240p分辨率、20帧/秒的H.264格式录制,单臂任务使用front、top、wrist视角,双臂任务使用left_wrist、right_wrist、top视角。整个数据集包含约3300个操作片段,由于每个片段按摄像头视角存储,共产生约9760个视频片段,总同步时长约23小时,各摄像头单独计算时长约68小时。数据集在HuggingFace上分为两个子集配置:so101(单臂任务,包含6777个样本)和bimanual_so101(双臂任务,包含3297个样本)。
ArmnetBench v0.1 is a dataset for robotic manipulation benchmarking, focusing on single-arm and bimanual tasks performed on a low-cost SO-101 robot arm. The dataset includes 12 different manipulation tasks (8 single-arm tasks and 4 bimanual tasks), each providing 50 high-quality reference demonstration trajectories from human teleoperation. Additionally, the dataset contains evaluation trajectories generated by 7 different policies (including ACT, Diffusion, SmolVLA, π0, π0.5, GR00T N1.7, and MolmoAct 2) trained or fine-tuned on the reference data and executed on a real robot. Data is organized in the RoboMeter unified trajectory format, with each row representing a complete episode from a camera view, including a unique identifier, natural language task instruction, sentence embedding vector for the task instruction, data source identifier, relative path to video frames, robot identifier, and discrete quality label (categorized as successful, failure, or suboptimal). Video data is recorded by three cameras at 240p resolution and 20 fps in H.264 format, with single-arm tasks using front, top, and wrist views, and bimanual tasks using left_wrist, right_wrist, and top views. The entire dataset contains approximately 3300 episodes, and due to storage per camera view, it produces about 9760 video clips, with a total synchronized duration of about 23 hours, and approximately 68 hours when calculated per camera separately. The dataset is divided into two subset configurations on HuggingFace: so101 (single-arm tasks, with 6777 samples) and bimanual_so101 (bimanual tasks, with 3297 samples).
数据集概述:ArmnetBench v0.1
ArmnetBench v0.1 是一个用于机器人操作任务评估的基准数据集,专为训练和评估 RoboMeter 奖励模型而设计。
核心信息
- 数据集名称: ArmnetBench v0.1
- 许可证: Apache-2.0
- 任务类别: 机器人技术
- 标签: 机器人技术、操作、SO-101、奖励建模、模仿学习、评估、遥操作
- 大小: 1K < n < 10K(样本量)
- 数据格式: RoboMeter 格式
数据内容
该数据集包含 50 条人工遥操作参考轨迹 和来自 7 个策略 的评估轨迹,这些策略基于参考数据集训练或微调。数据在低成本的 SO-101 机器人手臂上执行,涵盖 8 个单臂任务 和 4 个双臂任务。
- 机器人: SO-101(单臂)和双臂 SO-101
- 任务数量: 12 个(8 个单臂,4 个双臂)
- 参考演示: 每个任务 50 条人工遥操作轨迹
- 相机: 每个片段 3 个摄像头,240p,20 fps,H.264 编码
- 总片段数: 约 3,300 个
- 总时长: 约 23 小时(同步后),约 68 小时(每个摄像头单独计算)
- 标签: 每个片段标记为
successful、failure或suboptimal
任务详情
每个任务都有 50 个人工遥操作参考演示。
| 任务 | 手臂 | 指令 |
|---|---|---|
block_stack |
单臂 | 将彩色方块堆叠在一起 |
cable_clip |
单臂 | 将 DisplayPort 线缆推入白色块上的线缆夹中 |
cable_unclip |
单臂 | 从线缆夹中取出电源线 |
eye_drops_to_basket |
单臂 | 将眼药水放入篮子中 |
eye_drops_to_shelf |
单臂 | 将眼药水放在架子上 |
ring_insert |
单臂 | 将彩色环插入中央木钉中 |
tool_insert |
单臂 | 将缺失的工具插入工具箱的空槽中 |
tool_removal |
单臂 | 从工具箱中取出中间的小工具 |
fold_tea_towel |
双臂 | 折叠棕色茶巾 |
insert_candle |
双臂 | 将蜡烛插入灯笼内并关上门 |
open_lamp_door |
双臂 | 用左臂固定粉色台灯,用右夹爪打开门 |
transfer_cube |
双臂 | 在双臂之间传递立方体并将其放入白色篮子中 |
策略详情
七个策略针对每个任务在参考演示上训练或微调,然后在机器人上执行以生成评估轨迹。
| 策略 | 家族 |
|---|---|
act |
Action Chunking Transformer (ACT) |
diffusion |
Diffusion Policy |
smolvla |
SmolVLA |
pi0 |
π0 流匹配 VLA |
pi0.5 |
π0.5 VLA |
grootn1.7 |
NVIDIA GR00T N1.7 VLA |
molmoact2 |
MolmoAct 2 VLA |
数据格式
数据集使用 RoboMeter 统一轨迹模式。一行 = 一个摄像头视角下的一个片段(因此一个包含 3 个摄像头的片段会贡献 3 行记录)。
| 字段 | 类型 | 描述 |
|---|---|---|
id |
字符串 | 唯一轨迹 ID,编码了出处信息 |
task |
字符串 | 自然语言的任务指令 |
lang_vector |
float32[384] | 任务指令的句子嵌入 |
data_source |
字符串 | 始终为 armnetbench |
frames |
字符串 | 该摄像头下片段的 MP4 视频的相对路径 |
is_robot |
布尔值 | 始终为 true |
quality_label |
字符串 | successful、failure 或 suboptimal |
partial_success |
float / null | 当前版本为 null |
- 子集(HF 配置):
so101(单臂)和bimanual_so101 - 视频: 位于仓库根目录下的
videos/…目录 - 质量标签: 遥操作始终标记为
successful;策略执行轨迹则根据评估标记为successful、failure或suboptimal。
版本与标签
| 标签 | 内容 |
|---|---|
sample |
一小部分数据样本 |
preview |
早期预览版本(当前发布版本) |
release_1.0 / main |
最终的完整发布版本 |
引用与链接
- 基准测试: ArmnetBench v0.1
- 奖励模型格式与工具: RoboMeter




