ATOM-Bench
收藏资源简介:
ATOM-Bench是由北京通用人工智能研究院与北京大学联合构建的机器人操作基准数据集,旨在评估原子技能获取与组合泛化能力。该数据集包含3,000条专家演示数据,涵盖单臂与双臂机器人平台上的30项原子任务与24项组合任务,数据通过遥操作采集并包含同步观测与动作序列。数据集通过分解桌面操作为运动原子与指令原子,为诊断机器人策略在精细动作执行、语言条件理解及技能组合复用等方面的失败模式提供结构化测试环境,主要应用于机器人操作策略的泛化性能评估与基础模型能力验证。
ATOM-Bench is a robotic manipulation benchmark dataset jointly developed by the Beijing General Artificial Intelligence Research Institute and Peking University, aiming to evaluate atomic skill acquisition and compositional generalization capabilities. This dataset contains 3,000 expert demonstration trajectories, covering 30 atomic tasks and 24 composite tasks on single-arm and dual-arm robotic platforms. The data is collected via teleoperation and includes synchronized observations and action sequences. By decomposing desktop manipulation into motion primitives and instruction primitives, it provides a structured test environment for diagnosing failure modes of robotic policies in fine-grained motion execution, language-conditioned comprehension, skill composition and reuse, etc. It is primarily applied to the generalization performance evaluation of robotic manipulation policies and the capability validation of foundation models.
ATOM-Bench 数据集概述
ATOM-Bench 是一个针对操作策略的原子技能与组合泛化能力的真实世界机器人基准测试。它通过将桌面操作分解为运动原子和指令原子,测试在原子任务上微调的策略是否能在配对单臂和双臂轨道上,对未见过的实机组合任务实现技能重组。
核心规模
- 30 个原子实机任务
- 24 个未见过的组合任务
- 3,000 人类遥操作演示
- 2,700 物理评估 rollout
- 2 个配对的机器人轨道
- 5 种代表性策略
任务分解
每个平台包含运动集、指令集和组合集。配对单臂和双臂套件共享任务意图,双臂轨道增加了角色分配、双臂协调和有序动作序列。
- 运动原子:pick(抓取)、place(放置)、reorient(重新定向)、push(推)、stack(堆叠)、pour(倾倒)、access(打开)
- 指令原子:color(颜色)、shape(形状)、size(尺寸)、count(计数)、exclusion(排除)、source(来源)、relation(关系)、goal(目标)、destination(目的地)
平台
Franka Panda:单臂轨道,7自由度 Franka Panda 机械臂,Robotiq 2F-85 夹爪,三个 Intel RealSense 摄像头,8维机器人动作空间。 Agilex Cobot Magic:双臂轨道,基于 Mobile ALOHA 风格系统,协调双手控制,三个 Intel RealSense 摄像头,14维机器人动作空间。
评估协议
- 收集原子演示:每个原子任务收集 100 个专家遥操作演示(30 Hz)。
- 微调策略:模型在所有 15 个原子任务上联合微调,不使用组合演示。
- 评估物理种子:每个任务在 10 个固定的实机种子上进行评估,种子由掩模引导放置重复。
- 报告诊断指标:使用 SR(成功率)、PSR(过程成功率)、AS(原子分数)、CFS(组合失败份额)和 TG(转移差距)来分离任务完成、部分进展和组合失败。
主要结果
跨五种代表性策略(Pi0.5, Motus, LingBot-VLA, GROOT N1.6, SmolVLA)的实验表明,简单的指令接地比精细的运动控制更容易。即使在原子任务上表现最强的策略,在未见过的组合任务上也表现出显著的性能下降。
关键指标定义:
- SR: 成功率
- PSR: 过程成功率
- AS: 原子分数
- CFS: 组合失败份额

- 1ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies北京通用人工智能研究院; 北京大学 · 2026年



