遇见数据集

ATOM-Bench

收藏
arXiv2026-06-15 更新2026-06-17 收录
官方服务:

资源简介:

ATOM-Bench是由北京通用人工智能研究院与北京大学联合构建的机器人操作基准数据集,旨在评估原子技能获取与组合泛化能力。该数据集包含3,000条专家演示数据,涵盖单臂与双臂机器人平台上的30项原子任务与24项组合任务,数据通过遥操作采集并包含同步观测与动作序列。数据集通过分解桌面操作为运动原子与指令原子,为诊断机器人策略在精细动作执行、语言条件理解及技能组合复用等方面的失败模式提供结构化测试环境,主要应用于机器人操作策略的泛化性能评估与基础模型能力验证。

ATOM-Bench is a robotic manipulation benchmark dataset jointly developed by the Beijing General Artificial Intelligence Research Institute and Peking University, aiming to evaluate atomic skill acquisition and compositional generalization capabilities. This dataset contains 3,000 expert demonstration trajectories, covering 30 atomic tasks and 24 composite tasks on single-arm and dual-arm robotic platforms. The data is collected via teleoperation and includes synchronized observations and action sequences. By decomposing desktop manipulation into motion primitives and instruction primitives, it provides a structured test environment for diagnosing failure modes of robotic policies in fine-grained motion execution, language-conditioned comprehension, skill composition and reuse, etc. It is primarily applied to the generalization performance evaluation of robotic manipulation policies and the capability validation of foundation models.

创建时间:
2026-06-15
原始信息汇总

ATOM-Bench 数据集概述

ATOM-Bench 是一个针对操作策略的原子技能与组合泛化能力的真实世界机器人基准测试。它通过将桌面操作分解为运动原子和指令原子,测试在原子任务上微调的策略是否能在配对单臂和双臂轨道上,对未见过的实机组合任务实现技能重组。

核心规模

  • 30 个原子实机任务
  • 24 个未见过的组合任务
  • 3,000 人类遥操作演示
  • 2,700 物理评估 rollout
  • 2 个配对的机器人轨道
  • 5 种代表性策略

任务分解

每个平台包含运动集、指令集和组合集。配对单臂和双臂套件共享任务意图,双臂轨道增加了角色分配、双臂协调和有序动作序列。

  • 运动原子:pick(抓取)、place(放置)、reorient(重新定向)、push(推)、stack(堆叠)、pour(倾倒)、access(打开)
  • 指令原子:color(颜色)、shape(形状)、size(尺寸)、count(计数)、exclusion(排除)、source(来源)、relation(关系)、goal(目标)、destination(目的地)

平台

Franka Panda:单臂轨道,7自由度 Franka Panda 机械臂,Robotiq 2F-85 夹爪,三个 Intel RealSense 摄像头,8维机器人动作空间。 Agilex Cobot Magic:双臂轨道,基于 Mobile ALOHA 风格系统,协调双手控制,三个 Intel RealSense 摄像头,14维机器人动作空间。

评估协议

  1. 收集原子演示:每个原子任务收集 100 个专家遥操作演示(30 Hz)。
  2. 微调策略:模型在所有 15 个原子任务上联合微调,不使用组合演示。
  3. 评估物理种子:每个任务在 10 个固定的实机种子上进行评估,种子由掩模引导放置重复。
  4. 报告诊断指标:使用 SR(成功率)、PSR(过程成功率)、AS(原子分数)、CFS(组合失败份额)和 TG(转移差距)来分离任务完成、部分进展和组合失败。

主要结果

跨五种代表性策略(Pi0.5, Motus, LingBot-VLA, GROOT N1.6, SmolVLA)的实验表明,简单的指令接地比精细的运动控制更容易。即使在原子任务上表现最强的策略,在未见过的组合任务上也表现出显著的性能下降。

关键指标定义

  • SR: 成功率
  • PSR: 过程成功率
  • AS: 原子分数
  • CFS: 组合失败份额
搜集汇总
数据集介绍
ATOM-Bench 数据集图片
构建方式
ATOM-Bench通过任务因子分解构建,将桌面操作任务拆解为运动原子和指令原子两类。运动原子涵盖抓取放置、重新定向、推、堆叠、倾倒和铰接物体访问等物理操作;指令原子包括颜色、形状、大小、源关系、目标位置、计数与排除等语义或逻辑约束。基于这些原子,研究者在Franka Panda单臂平台和Cobot Magic双臂平台上设计了30项原子任务与24项保留的组合任务,双臂任务作为单臂任务的双手对应版本,额外引入手部角色分配与双臂协调要求。每项原子任务通过人类遥操作收集100条专家演示,共采集约21.5小时、3000条演示数据,并同步记录30Hz的观测与动作序列。
特点
ATOM-Bench的核心特点在于其诊断性设计,能够区分操作策略失败的根本原因。该基准引入了原子得分(Atomic Score, AS)和组合失败份额(Compositional Failure Share, CFS)两项指标:AS衡量策略在孤立任务中执行所需原子的能力,CFS则量化组合任务中不可归因于原子技能不足的失败比例,从而将失败区分为原子缺陷与组合失效。此外,基准设置了迁移差距(Transfer Gap, TG)用于比较联合原子微调与单任务微调的效果。通过2700次物理实验对五种代表性操作策略进行评估,发现当前策略在精确控制类运动原子和集合级推理类指令原子上表现欠佳,且强原子性能无法可靠迁移至未见过的组合任务。
使用方法
使用ATOM-Bench时,研究者首先将策略在全部15项原子任务上进行联合微调(原子迁移微调),或在单项任务上进行独立微调(单任务微调基线)。微调完成后,依次评估策略在原子任务与24项保留的组合任务上的表现,采用成功率(SR)、过程成功率(PSR)、原子得分(AS)、组合失败份额(CFS)和迁移差距(TG)五项指标进行分析。每项任务在10个固定的物理测试种子下进行,通过掩模引导的物体放置确保初始场景可重复。评估过程需要人工进行场景布置、安全监控与得分点标注,目前尚未完全自动化。
背景与挑战
背景概述
ATOM-Bench 是由北京人工智能研究院与北京大学于2026年联合推出的真实世界机器人操作策略评估基准。其核心研究问题在于,当前通用操作策略(如 Pi0.5、Motus 等)在原子技能习得与组合泛化能力上究竟表现如何。该基准通过将桌面操作任务分解为运动原子与指令原子,构建了包含30个原子任务与24个保留组合任务的评估套件,涵盖单臂与双臂机器人平台。ATOM-Bench 的提出,填补了现有仿真基准与真实世界评估之间的诊断性空白,为判断策略失败究竟源于原子技能缺陷还是组合重用限制提供了可复现的实验平台,对推动机器人策略向更可靠的真实世界泛化具有重要影响力。
当前挑战
ATOM-Bench 所应对的领域挑战在于,当前通用操作策略在复杂物理技能(如倾倒、重新定向、推拉)与集合级指令(如计数、排除)上仍表现薄弱,且即便学得了可靠的原子技能,其在未见过的组合任务中成功率急剧下降,揭示了组合重用能力的严重不足。在基准构建过程中,挑战同样严峻:需确保原子任务与组合任务的可分离性与可组合性,同时需在真实机器人平台上以人工遥操作收集3000条高保真演示,并设计精确的可重复物理测试种子(每个任务10个种子)。此外,双平台间的配对任务设计需要同步考虑单臂与双臂协调的差异化评价指标,提出原子得分(AS)与组合失败份额(CFS)以区分失败根源,这些均对实验的可控性与诊断精度提出了极高要求。
常用场景
经典使用场景
ATOM-Bench将桌面操作任务分解为运动原子与指令原子,涵盖30个原子任务和24个保留组合任务,横跨单臂与双臂机器人平台。其经典用法在于提供一个受控的物理环境,用于严格评估操作策略在原子技能习得与组合泛化两个维度的真实表现。研究者可通过该基准对策略进行原子层面的微调,随后分别在原子任务与从未演示过的组合任务上测试,从而精准诊断策略在物理执行、语言理解与技能重组方面的能力边界。
衍生相关工作
ATOM-Bench衍生了多项具有影响力的研究工作。其原子分解与组合泛化评估范式启发了对操作策略故障模式的深入分析,促使后续研究聚焦于精细运动技能(如定向调整、倾倒控制)与集合级语言推理(如计数、排除)的改进。该基准提出的Atomic Score与Compositional Failure Share指标已被用于对比多种策略在该诊断框架下的表现,相关实验揭示了高原子性能并不自动转化为组合任务成功这一关键发现。此外,其双轨任务设计推动了双臂协调操作评估的发展,为未来更具通用性的机器人学习基准奠定了基础。
数据集最近研究
最新研究方向
当前,机器人操作领域的前沿研究方向聚焦于评估通用操作策略的原子技能习得与组合泛化能力。ATOM-Bench作为首个面向真实世界的基准,通过将桌面操作分解为运动原子与指令原子,构建了包含30个原子任务和24个留出组合任务的测试套件,并引入原子得分和组合失败份额等诊断指标,精确区分技能缺陷与组合失败。该基准在单臂与双臂双机器人平台上对五种代表性策略进行了2700次物理部署,揭示了现有策略在精细运动控制、计数与逻辑过滤等指令原子上的显著短板,尤其是强原子性能无法可靠迁移至未见组合任务。这一发现为推动鲁棒且可泛化的机器人学习提供了关键诊断工具与方向指引。
相关研究论文
  • 1
    ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies北京通用人工智能研究院; 北京大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务