遇见数据集

RoboCOIN/AI2_Alphabot_2_package_fruit_1

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

该数据集是一个名为AI2_Alphabot_2_package_fruit_1的机器人数据集,使用基于LeRobot的扩展格式,并完全兼容LeRobot框架。它专注于一个具体的机器人操作任务:从桌子上拾取草莓和芒果,并将它们放入一个棕色篮子中。数据集包含309个完整的情节(episodes),总计138,843帧视频数据,帧率为30 FPS,总大小为2.15 GB。使用的机器人是AI2_Alphabot_2,配备双指末端执行器,通过VR控制器进行遥操作。场景设置在零售超市环境中。数据集提供了多视角RGB视频观测,包括胸前前置、头部前置、左手腕和右手腕四个摄像头,每个视频分辨率为640x480,使用h264编解码器。此外,数据集还包含机器人的状态数据(如关节位置、末端执行器位姿)和动作数据,维度均为34维,以及丰富的时间戳、帧索引和注释信息。数据以Parquet文件格式组织,并包含训练集分割。该数据集由北京人工智能研究院(BAAI)的RoboCOIN团队贡献,旨在支持机器人操作和模仿学习的研究。

This dataset, named AI2_Alphabot_2_package_fruit_1, uses an extended format based on LeRobot and is fully compatible with LeRobot. It focuses on a specific robotic manipulation task: picking a strawberry and a mango from a table and placing them into a brown basket. The dataset comprises 309 total episodes, with 138,843 total frames at 30 FPS, and has a total size of 2.15 GB. The robot used is the AI2_Alphabot_2, equipped with a two-finger end-effector and teleoperated via a VR controller. The scene is set in a retail supermarket environment. It provides multi-view RGB video observations from four cameras: front chest, front head, left wrist, and right wrist, each with a resolution of 640x480 and using the h264 codec. Additionally, the dataset includes robot state data (e.g., joint positions, end-effector poses) and action data, both with 34 dimensions, along with rich timestamp, frame index, and annotation information. The data is organized in Parquet files and includes a training split. This dataset is contributed by the RoboCOIN Team at the Beijing Academy of Artificial Intelligence (BAAI) and is intended to support research in robotic manipulation and imitation learning.

提供机构:
RoboCOIN
搜集汇总
数据集介绍
RoboCOIN/AI2_Alphabot_2_package_fruit_1 数据集图片
构建方式
该数据集源自RoboCOIN团队在BAAI开展的双臂机器人数据采集项目,采用基于LeRobot扩展的格式进行构建。数据通过VR控制器对AI2_Alphabot_2机器人进行遥操作采集,聚焦于零售场景中的水果抓取与放置任务。系统配备了四台RGB摄像头,分别置于胸部、头部及左右手腕,以30帧/秒的速率捕获多视角视觉信息。数据集包含309个完整episode,共计138843帧,涵盖了机器人34维关节状态与动作序列,并辅以末端执行器位姿、加速度、速度及夹爪模式等多层次标注,为策略学习提供了结构化的训练样本。
使用方法
本数据集与LeRobot框架完全兼容,用户可直接通过LeRobot的API进行加载与预处理。数据以parquet文件存储状态与动作序列,视频文件则按相机视角分目录存放。使用时,可依据提供的data/chunk-{id}/episode_{id}.parquet路径模式批量读取,并结合annotation文件夹中的JSONL文件进行筛选或增强。数据集已划分好训练集(episode 0至308),便于直接用于模仿学习或强化学习的训练流程。对于需要跨任务泛化的研究,还可利用task.json与episodes.jsonl文件进行任务级别的检索与组合。
背景与挑战
背景概述
机器人操作领域的快速发展对大规模、高质量的数据集提出了迫切需求,尤其是面向双臂协同与细粒度操作的场景。在此背景下,RoboCOIN团队于北京智源人工智能研究院(BAAI)于2025年创建了AI2_Alphabot_2_package_fruit_1数据集,该数据集作为RoboCOIN项目的重要组成部分,专注于零售超市场景下的水果拾取与放置任务。数据集包含309个演示片段,总帧数超过13万,记录了AI2_Alphabot_2机器人通过VR控制器遥操作完成抓取草莓和芒果并放入篮子的过程。通过兼容LeRobot格式并提供多视角视觉与状态动作数据,该数据集为双臂机器人模仿学习与操作策略研究提供了标准化基准,对推动真实世界机器人智能操作的发展具有重要影响。
当前挑战
该数据集主要解决机器人领域中的双臂精细操作与复杂环境感知难题,具体挑战包括:如何在超市货架等真实场景中实现草莓和芒果等易损物体的无损抓取与稳定放置,这要求机器人具备多模态感知与自适应抓取力控制能力。在构建过程中,面临同步四路RGB摄像头(前胸、前额、左右手腕)高帧率视频数据与34维状态动作数据的挑战,需确保遥操作轨迹的精确性与可重复性。此外,数据集虽包含丰富的动作与状态注释,但面对光照变化、物体位姿多样性及背景干扰等真实环境因素,模型泛化能力仍受制约。同时,从VR控制器到机器人运动学映射的延迟与标定误差,也为数据质量保障与高效采集提出了额外难题。
常用场景
经典使用场景
在机器人学习与操作领域,AI2_Alphabot_2_package_fruit_1数据集凭借其精细化的任务设计,成为研究双臂机器人协同抓取与放置动作的经典平台。该数据集聚焦于零售业场景中的典型操作——将草莓与芒果从桌面拾取并放入篮筐,包含了309个高质量演示片段,覆盖了从抓取到放置的完整原子动作。借助四路RGB摄像头提供的多视角视觉信息(包括胸部、头部及左右腕部视角),研究者能够深入探索视觉-运动控制的耦合机制,为模仿学习与行为克隆等范式提供了标准化且可复现的训练与评估基准。
解决学术问题
该数据集有效回应了机器人操作领域长期面临的学术挑战,即如何在非结构化环境中实现稳健的抓取与放置。它解决了从高维视觉观测到低维关节动作的映射问题,使研究者得以量化分析双臂协调、力位混合控制及动态环境适应性等核心议题。通过提供34维状态与动作空间以及详尽的末端执行器加速度、方向、速度等注释,数据集推动了动作序列的分层理解与泛化能力研究,其开源特性亦促进了社区内对比实验的规范性,为后续探索小样本学习和跨任务迁移奠定了坚实的数据基础。
实际应用
在实际应用层面,该数据集直接服务于智能仓储与零售自动化场景,其示范的拾取与装箱动作可迁移至电商分拣、生鲜包装等工业流程。结合VR遥操作采集的细腻轨迹,数据集训练出的策略能够赋能机器人完成高精度且重复性的作业任务,减少人工干预成本。此外,多视角视频流与标注信息的结合,使得机器人在真实世界中模拟与部署的鸿沟得以缩小,为商用服务机器人普及提供了技术验证与落地支持。
数据集最近研究
最新研究方向
随着人形机器人与具身智能技术的迅猛发展,双臂协同操作与精细化抓取成为前沿热点。AI2_Alphabot_2_package_fruit_1数据集由北京智源人工智能研究院RoboCOIN团队贡献,聚焦于零售超市场景下的水果拣选与置筐任务,通过VR遥操作采集了309条高质量演示轨迹,覆盖草莓与芒果的抓取与放置原子动作,并配备四视角RGB视觉与34维状态-动作空间。该数据集依托LeRobot标准格式与RoboCOIN开源平台,为模仿学习、视觉运动策略及双臂协调控制提供了基准数据,其精细化的末端执行器加速度、方向及夹爪活动注释,显著推动了对复杂操作技能的解耦分析与泛化研究,在具身智能与真实世界机器人部署中具有重要奠基意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务