RoboCOIN/AI2_Alphabot_2_package_fruit_2
收藏官方服务:
资源简介:
该数据集采用基于LeRobot的扩展格式,并完全兼容LeRobot。
This dataset uses an extended format based on LeRobot and is fully compatible with LeRobot.
提供机构:
RoboCOIN搜集汇总
数据集介绍

构建方式
在零售与超市场景的物理环境中,该数据集依托AI2_Alphabot_2双臂机器人平台构建,其末端执行器为双指夹爪,通过VR控制器实现遥操作数据采集。数据采集任务为从桌面抓取草莓与芒果并放入棕色篮子,共记录988个演示片段,包含384,538帧,以30帧/秒的采样频率进行。数据遵循LeRobot扩展格式组织,视频流以H.264编码的640×480分辨率存储,状态与动作数据则以34维浮点向量记录,涵盖关节角度、末端执行器位姿及夹爪开合状态。
使用方法
数据集完全兼容LeRobot框架,研究者可直接通过该框架的API进行加载与回放。数据文件以Parquet格式按片段组织,视频与元数据分置在videos与annotations目录下,便于按需调用。从训练角度,988个片段均可用于监督学习,此外,丰富的预计算标注(如夹爪活动标签)可直接作为算法输入,无需额外处理步骤。使用者需遵守Apache 2.0许可并引用相关论文。
背景与挑战
背景概述
在机器人学习领域,双臂协调操作是迈向通用具身智能的关键瓶颈之一,然而现有数据集多聚焦于单臂任务或仿真环境,难以支撑真实世界复杂操控策略的泛化研究。由北京人工智能研究院(BAAI)旗下RoboCOIN团队于2025年创建的AI2_Alphabot_2_package_fruit_2数据集,旨在弥补这一空白。该数据集基于AI2_Alphabot_2双臂机器人平台,在真实超市场景中采集了988段、共计约38.5万帧的高保真演示数据,任务要求机器人从桌面抓取草莓与芒果并放入篮中。通过配备四台RGB摄像头与34维状态/动作空间,该数据集为模仿学习与离线强化学习提供了丰富的多视角观测与精细的关节级控制信号,其开放许可与LeRobot兼容格式显著降低了研究门槛。自发布以来,该数据集已作为RoboCOIN计划的核心组件,推动双臂操作从固定程序向数据驱动范式的转变,在机器人社区中引发广泛关注。
当前挑战
当前,该数据集面临的主要挑战呈现在三个层面。其一,所解决的领域问题在于真实超市环境中目标物体的柔性特性——草莓与芒果形态、硬度各异,且随意放置于桌面,要求机器人具备可变抓取力与姿态适应能力,这对传统刚性控制策略构成本质性挑战。其二,构建过程中,团队需克服双机械臂协同轨迹冲突的约束,通过VR遥操作采集自然演示时,操作者的意图与机器人运动学限制之间频繁产生矛盾,导致大量数据需经人工筛选与重采样。其三,尽管数据集提供了加速度、速度及夹爪活动等丰富标注,但不同光照条件与遮挡场景下的视觉鲁棒性仍不足以支撑零样本迁移,如何从现有注释中高效蒸馏出跨情景泛化的表征,成为后续研究的核心难点。
常用场景
经典使用场景
AI2_Alphabot_2_package_fruit_2数据集专为零售超市场景下的机器人抓取与放置操作而构建,其核心任务为引导机器人从桌面拾取草莓与芒果并放入篮中。该数据集收录了988条高质量演示轨迹,涵盖多视角视觉观测(四路RGB摄像头)与34维机器人状态-动作序列,适用于模仿学习、行为克隆及强化学习等经典范式的研究与验证。研究者可基于其标准化LeRobot格式,直接开展机器人操纵技能的端到端学习与泛化能力评估。
解决学术问题
该数据集聚焦于解决机器人操作中的多物体分拣与精细放置这一学术难题,尤其针对冗余自由度双臂机器人在非结构化环境中的协同控制问题。通过提供高保真度的真实世界演示数据,它有效支撑了从视觉感知到运动规划的跨模态映射研究,推动了抓取位姿估计、轨迹优化及避障策略等方向的发展。其公开可复现的基准设定,为评估不同算法的鲁棒性与泛化性提供了可靠依据,显著降低了机器人学习研究的入门门槛。
实际应用
在实际应用层面,该数据集可赋能零售仓储与物流行业的自动化升级,例如超市货架的智能补货、快递包裹的分拣与打包等重复性劳动场景。基于数据集中蕴含的抓取-放置技能,开发者可训练机器人适应不同类型水果(如草莓、芒果)的柔性抓取,从而在真实生产环境中提升作业效率与安全性。此外,其多视角视频数据也可用于视觉检测系统的增强训练,助力实现商品识别与缺陷检测的精准联动。
数据集最近研究
最新研究方向
该数据集聚焦于零售超市场景下的双臂机器人精细操作任务,通过采集988组真实环境中机械臂抓取与放置水果(草莓、芒果)的演示数据,为具身智能研究提供了高保真的多视角视觉-动作轨迹资源。当前前沿方向包括:结合多模态大语言模型进行任务语义理解与零样本泛化,利用包含34维关节与末端执行器状态的高维动作空间训练模仿学习算法,以及探索基于VR遥操作数据的高效技能迁移策略。该数据集的开源发布显著推动了真实世界机器人操作从单一抓取向复杂序列任务(如分拣-放置)的跨越,为构建可泛化的工业级机器人智能体奠定了数据基石。
以上内容由遇见数据集搜集并总结生成



