遇见数据集

armnetbench_robometer_v01

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

ArmnetBench v0.1是一个用于机器人操作基准测试的数据集,专注于在低成本SO-101机器人手臂上执行的单臂和双臂任务。该数据集包含12个不同的操作任务(8个单臂任务和4个双臂任务),每个任务提供了50条人类遥操作的高质量参考演示轨迹。此外,数据集还包含了7种不同策略(包括ACT、Diffusion、SmolVLA、π0、π0.5、GR00T N1.7和MolmoAct 2)在这些参考数据上训练或微调后,在真实机器人上执行产生的评估轨迹。数据以RoboMeter统一轨迹格式组织,每个数据行代表一个摄像头视角下的一个完整操作片段(episode),包含唯一标识符、自然语言任务指令、任务指令的句子嵌入向量、数据源标识、视频文件相对路径、机器人标识以及离散质量标签(分为successful、failure或suboptimal)。视频数据由三个摄像头以240p分辨率、20帧/秒的H.264格式录制,单臂任务使用front、top、wrist视角,双臂任务使用left_wrist、right_wrist、top视角。整个数据集包含约3300个操作片段,由于每个片段按摄像头视角存储,共产生约9760个视频片段,总同步时长约23小时,各摄像头单独计算时长约68小时。数据集在HuggingFace上分为两个子集配置:so101(单臂任务,包含6777个样本)和bimanual_so101(双臂任务,包含3297个样本)。

ArmnetBench v0.1 is a dataset for robotic manipulation benchmarking, focusing on single-arm and bimanual tasks performed on a low-cost SO-101 robot arm. The dataset includes 12 different manipulation tasks (8 single-arm tasks and 4 bimanual tasks), each providing 50 high-quality reference demonstration trajectories from human teleoperation. Additionally, the dataset contains evaluation trajectories generated by 7 different policies (including ACT, Diffusion, SmolVLA, π0, π0.5, GR00T N1.7, and MolmoAct 2) trained or fine-tuned on the reference data and executed on a real robot. Data is organized in the RoboMeter unified trajectory format, with each row representing a complete episode from a camera view, including a unique identifier, natural language task instruction, sentence embedding vector for the task instruction, data source identifier, relative path to video frames, robot identifier, and discrete quality label (categorized as successful, failure, or suboptimal). Video data is recorded by three cameras at 240p resolution and 20 fps in H.264 format, with single-arm tasks using front, top, and wrist views, and bimanual tasks using left_wrist, right_wrist, and top views. The entire dataset contains approximately 3300 episodes, and due to storage per camera view, it produces about 9760 video clips, with a total synchronized duration of about 23 hours, and approximately 68 hours when calculated per camera separately. The dataset is divided into two subset configurations on HuggingFace: so101 (single-arm tasks, with 6777 samples) and bimanual_so101 (bimanual tasks, with 3297 samples).

创建时间:
2026-06-29
原始信息汇总

数据集概述:ArmnetBench v0.1

ArmnetBench v0.1 是一个用于机器人操作任务评估的基准数据集,专为训练和评估 RoboMeter 奖励模型而设计。

核心信息

  • 数据集名称: ArmnetBench v0.1
  • 许可证: Apache-2.0
  • 任务类别: 机器人技术
  • 标签: 机器人技术、操作、SO-101、奖励建模、模仿学习、评估、遥操作
  • 大小: 1K < n < 10K(样本量)
  • 数据格式: RoboMeter 格式

数据内容

该数据集包含 50 条人工遥操作参考轨迹 和来自 7 个策略 的评估轨迹,这些策略基于参考数据集训练或微调。数据在低成本的 SO-101 机器人手臂上执行,涵盖 8 个单臂任务4 个双臂任务

  • 机器人: SO-101(单臂)和双臂 SO-101
  • 任务数量: 12 个(8 个单臂,4 个双臂)
  • 参考演示: 每个任务 50 条人工遥操作轨迹
  • 相机: 每个片段 3 个摄像头,240p,20 fps,H.264 编码
  • 总片段数: 约 3,300 个
  • 总时长: 约 23 小时(同步后),约 68 小时(每个摄像头单独计算)
  • 标签: 每个片段标记为 successfulfailuresuboptimal

任务详情

每个任务都有 50 个人工遥操作参考演示。

任务 手臂 指令
block_stack 单臂 将彩色方块堆叠在一起
cable_clip 单臂 将 DisplayPort 线缆推入白色块上的线缆夹中
cable_unclip 单臂 从线缆夹中取出电源线
eye_drops_to_basket 单臂 将眼药水放入篮子中
eye_drops_to_shelf 单臂 将眼药水放在架子上
ring_insert 单臂 将彩色环插入中央木钉中
tool_insert 单臂 将缺失的工具插入工具箱的空槽中
tool_removal 单臂 从工具箱中取出中间的小工具
fold_tea_towel 双臂 折叠棕色茶巾
insert_candle 双臂 将蜡烛插入灯笼内并关上门
open_lamp_door 双臂 用左臂固定粉色台灯,用右夹爪打开门
transfer_cube 双臂 在双臂之间传递立方体并将其放入白色篮子中

策略详情

七个策略针对每个任务在参考演示上训练或微调,然后在机器人上执行以生成评估轨迹。

策略 家族
act Action Chunking Transformer (ACT)
diffusion Diffusion Policy
smolvla SmolVLA
pi0 π0 流匹配 VLA
pi0.5 π0.5 VLA
grootn1.7 NVIDIA GR00T N1.7 VLA
molmoact2 MolmoAct 2 VLA

数据格式

数据集使用 RoboMeter 统一轨迹模式。一行 = 一个摄像头视角下的一个片段(因此一个包含 3 个摄像头的片段会贡献 3 行记录)。

字段 类型 描述
id 字符串 唯一轨迹 ID,编码了出处信息
task 字符串 自然语言的任务指令
lang_vector float32[384] 任务指令的句子嵌入
data_source 字符串 始终为 armnetbench
frames 字符串 该摄像头下片段的 MP4 视频的相对路径
is_robot 布尔值 始终为 true
quality_label 字符串 successfulfailuresuboptimal
partial_success float / null 当前版本为 null
  • 子集(HF 配置): so101(单臂)和 bimanual_so101
  • 视频: 位于仓库根目录下的 videos/… 目录
  • 质量标签: 遥操作始终标记为 successful;策略执行轨迹则根据评估标记为 successfulfailuresuboptimal

版本与标签

标签 内容
sample 一小部分数据样本
preview 早期预览版本(当前发布版本)
release_1.0 / main 最终的完整发布版本

引用与链接

  • 基准测试: ArmnetBench v0.1
  • 奖励模型格式与工具: RoboMeter
搜集汇总
数据集介绍
armnetbench_robometer_v01 数据集图片
构建方式
该数据集通过远程操控SO-101机器人手臂,针对8项单臂与4项双臂操作任务,各采集50条人类参考轨迹构成基础库。在此之上,基于ACT、Diffusion Policy、SmolVLA、π0、π0.5、GR00T N1.7及MolmoAct 2共七种策略模型,分别对每项任务进行训练或微调,并在真实机器人上执行获得评估轨迹。所有数据遵循RoboMeter统一格式组织,每条记录对应单一摄像头视角下的一次完整操作片段,共涵盖约3300个操作片段及近9760段视频剪辑。
特点
数据集以人类遥操作与多种策略评估相结合的方式,形成了包含成功、失败与次优三级质量标注的轨迹库。每个操作片段配备了自然语言任务指令及其384维句子嵌入向量,并提供来自前、顶、腕部等多角度摄像头的240p、20帧/秒的H.264编码视频。单臂与双臂操作数据分别存储为独立子集,便于针对性研究,而成功及次优轨迹均截取至任务完成时刻,消除了无效尾帧干扰。
使用方法
数据集可通过HuggingFace Datasets库加载,访问时需指定配置名(so101或bimanual_so101)及版本标签(preview或sample)。加载后的数据以ID、任务描述、语言向量、视频路径及质量标签等字段组织,适用于RoboMeter奖励模型训练与评估。使用时需通过huggingface-cli下载完整仓库以确保视频路径解析正确,随后可依据质量标签进行筛选,或按任务、策略等维度进行下游分析与模型对比。
背景与挑战
背景概述
ArmnetBench v0.1 是一个面向机器人操作领域的基准数据集,由 Armnet 团队于近期发布,依托于低成本 SO-101 机械臂平台。该数据集涵盖 8 项单臂与 4 项双臂操作任务,每项任务包含 50 条人类遥操作参考轨迹,并收录了 ACT、Diffusion Policy、π0 等 7 种主流策略模型在相同任务上的评估轨迹。核心研究问题在于为奖励建模与模仿学习提供一个标准化的评价基准,以促进机器人操作策略的泛化能力与鲁棒性研究。该数据集采用 RoboMeter 格式组织,以多视角视频片段存储轨迹,为机器人学习社区提供了低成本、高复现性的实验平台,有望推动具身智能中奖励函数设计与策略评估的标准化进程。
当前挑战
该数据集致力于解决机器人操作领域中奖励信号获取困难与策略评估不一致的挑战。传统的稀疏奖励或手工设计奖励函数难以捕捉复杂操作任务的全过程,而 RoboMeter 格式通过引入成功/失败/次优的质量标签为奖励感知模型训练提供监督信号。此外,构建过程中面临多策略模型在同一平台公平对比的难题,需确保每种策略均采用相同的参考数据与遥操作质量;同时,多视角视频同步采集、轨迹修剪(剔除完成后的空闲帧)以及双臂协调任务的准确标注也对数据处理流程提出了较高要求。数据集在版本迭代中仍需处理部分策略缺失导致的任务评估不完整问题,以避免评价偏差。
常用场景
经典使用场景
在机器人操作领域,ArmnetBench v0.1数据集为模仿学习与奖励建模研究提供了标准化且富有挑战性的基准平台。其核心使用场景聚焦于评估和比较多种先进的操作策略,涵盖单臂与双臂协作任务。数据集囊括了从动作分块变换器、扩散策略到多种视觉-语言-动作大模型在内的七种代表性策略轨迹,并附有由人类遥操作采集的参考轨迹,为衡量策略在精细操作任务上的表现提供了高质量的对照基础。研究者可通过该数据集系统性地评估模型在堆叠方块、线缆插拔、工具放置及双臂协同等任务上的成功率与动作质量。
实际应用
在工业与家庭服务机器人领域,ArmnetBench的实际应用价值体现在为奖励模型训练与策略选择提供了可直接借鉴的评估流程与数据资源。开发者可借助该数据集中包含的成功、失败与次优轨迹标签,训练能够准确评判操作质量的奖励模型,进而将其融入强化学习或模仿学习框架中以提升策略的学习效率。数据集涉及的线缆管理、工具插入、物体转移等任务,与电子装配、物流分拣、家庭辅助等真实场景高度契合,使得在此基准上验证的策略与奖励模型具备较强的迁移潜力,为低成本机器人平台的实际部署提供了可量化的性能参考。
衍生相关工作
ArmnetBench的出现催生了一系列围绕奖励模型、策略比较与数据格式标准化的衍生工作。基于其提供的RoboMeter格式轨迹与质量标签,研究者可系统性地开展奖励模型架构的对比实验,催生了诸如将时序信息与多视角视觉特征融合的奖励回归模型。同时,数据集涵盖的多种策略轨迹为分析不同规模与架构模型(如动作分块变换器与流匹配视觉-语言-动作模型)在细微操作约束下的表现差异提供了实证基础,激发了关于策略选择与任务复杂度关系的量化探讨。此外,其数据格式规范也推动了机器人数据集标准化的进程,为构建更大规模、多来源的统一操作基准提供了可借鉴的范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务