遇见数据集

RoboCOIN/AI2_Alphabot_2_unplug_data_cable

收藏
Hugging Face2026-06-08 更新2026-06-14 收录
官方服务:

资源简介:

这是一个名为AI2_Alphabot_2_unplug_data_cable的机器人操作数据集。该数据集基于LeRobot格式进行了扩展,并完全兼容LeRobot。主要任务涉及使用名为AI2_Alphabot_2的双臂机器人,在家庭厨房场景中,用右手拿起白色的多端口USB集线器,同时用左手拔下白色的数据线。数据集包含932个episodes,总计371,680帧,帧率为30 FPS,数据大小为7.08 GB。机器人配置为双指末端执行器,通过VR控制器进行遥操作。传感器包括四个RGB摄像头:前胸摄像头、前头摄像头、左手腕摄像头和右手腕摄像头,每个摄像头的分辨率为640x480,视频编码为av1。数据集结构包括视频文件、状态数据(关节位置、速度等)、动作数据和元数据,组织在parquet文件中。此外,数据集提供了丰富的注释,如末端执行器加速度、方向、速度以及夹爪活动等,以支持多样化的学习方法。数据集由北京智源人工智能研究院(BAAI)的RoboCOIN团队贡献,遵循Apache 2.0许可证。

This is a robotic manipulation dataset named AI2_Alphabot_2_unplug_data_cable. It is extended based on the LeRobot format and fully compatible with it. The primary tasks involve using the dual-arm robot AI2_Alphabot_2 to grasp a white multi-port USB hub with its right arm, while unplugging a white data cable with its left arm in a home kitchen scenario. This dataset contains 932 episodes, totaling 371,680 frames at 30 FPS, with a total data size of 7.08 GB. The robot is equipped with two-fingered end-effectors and is teleoperated via VR controllers. The sensor suite includes four RGB cameras: a front-chest camera, a front-head camera, a left-wrist camera, and a right-wrist camera. Each camera has a resolution of 640×480, and the video is encoded in the AV1 format. The dataset structure consists of video files, state data (including joint positions, velocities, etc.), action data, and metadata, all organized in Parquet files. Additionally, the dataset provides rich annotations such as end-effector acceleration, orientation, velocity, and gripper activity to support diverse learning approaches. This dataset is contributed by the RoboCOIN team from the Beijing Academy of Artificial Intelligence (BAAI), and is released under the Apache 2.0 license.

提供机构:
RoboCOIN
搜集汇总
数据集介绍
RoboCOIN/AI2_Alphabot_2_unplug_data_cable 数据集图片
构建方式
该数据集由北京智源人工智能研究院(BAAI)RoboCOIN团队构建,采用基于LeRobot的扩展格式,完全兼容LeRobot框架。数据采集通过VR控制器远程操作AI2_Alphabot_2机器人完成,机器人配备双指末端执行器。数据集包含932个演示片段,总计371,680帧,以30FPS的帧率记录,总容量达7.08 GB。每个片段记录了机器人执行“用右手拿起多端口USB集线器,用左手拔掉数据线”这一复合任务的过程,操作类型为固定双臂协同。数据以parquet文件和压缩视频形式存储,按chunk组织,并包含annotation、meta和video等子目录。
特点
该数据集的核心特点在于其细致入微的多模态标注体系。除了标准的34维状态向量与动作向量(涵盖双臂关节角度、末端执行器位姿及夹爪开合度等),数据集还提供了丰富的语义化标注文件,包括末端执行器加速度大小、运动方向、速度、夹爪活动状态及夹爪模式等。这些标注为研究精细操作技能的分解与泛化提供了关键支撑。此外,数据集配备了四个同步的RGB摄像头视角(胸部前方、头部前方、左右手腕),以640×480分辨率记录操作场景,确保了视觉信息的全面性与高保真度。
使用方法
数据集以LeRobot标准格式组织,用户可直接通过LeRobot库加载使用。数据文件遵循`data/chunk-{id}/episode_{id}.parquet`的模式路径存储,视频文件则置于对应摄像头的子目录下。开发者可通过Hugging Face Datasets库或LeRobot的API轻松访问框架、状态和动作数据。数据集还提供了丰富的元信息文件,如episodes.jsonl、tasks.jsonl和info.json,便于灵活的数据拆分与任务管理。使用时应引用相关论文,并遵守Apache-2.0许可证条款。
背景与挑战
背景概述
在机器人操作领域,双手机器人协同完成精细化操作任务一直是研究的热点与难点,特别是涉及插拔线缆等日常生活中常见但要求高精度力控与位姿感知的作业。AI2_Alphabot_2_unplug_data_cable数据集由北京智源人工智能研究院(BAAI)的RoboCOIN团队于2025年创建,是RoboCOIN项目的重要组成部分。该数据集的核心研究问题聚焦于如何利用遥操作(VR控制器)与多视角视觉传感(包括胸部、头部及双腕共四个RGB摄像头),使AI2_Alphabot_2双手机器人学会执行“右手拿起多端口USB集线器,左手拔除数据线缆”这一典型家庭厨房场景下的复合操作。数据集包含932个演示回合、逾37万帧的高频(30 FPS)数据,为模仿学习、表示学习及精细操作策略提供了丰富的真实世界基准。该工作通过公开大规模、标准化格式(兼容LeRobot)的数据集,显著推动了家务操作机器人研究从简单抓取向复杂、双臂、薄片物体操作的迈进,对相关领域的模型泛化与迁移学习产生了深远影响。
当前挑战
该数据集所面临的挑战主要体现在两个方面。在领域问题层面,其针对的“拔除数据线缆”任务本质上需要解决高精度力位混合控制与柔性物体交互的难题:线缆的形变特性、接口的微小尺寸以及双手在受限空间内的避碰协调,均使得传统纯位姿控制或单臂操作策略难以胜任。此外,家庭厨房场景下的光照变化、背景杂波以及USB集线器与线缆的随机初始位姿,对视觉感知模型的鲁棒性提出了严苛要求。在构建过程中,挑战同样不容忽视。首先,利用VR控制器进行遥操作时,操作员需克服空间映射延迟与力觉反馈缺失,保证演示轨迹的质量与一致性。其次,数据集的多模态同步十分复杂:四个视频流、34维状态信号及动作指令需在30 FPS下实现精确对齐,任何帧错位都会污染学习效果。最后,对932个演示回合的大规模标注,包括末端执行器速度、方向、加速度及夹爪活动状态等精细信息,在保证准确性的前提下耗费了巨大的人力与计算资源。
常用场景
经典使用场景
在机器人学习与操作领域,精细的双手协同操作一直是研究的前沿与难点。AI2_Alphabot_2_unplug_data_cable数据集专注于仿真家庭厨房场景中拔取数据线这一典型任务,通过采集AI2_Alphabot_2双臂机器人的932个完整操作回合与逾37万帧多视角视觉数据,为模仿学习与行为克隆提供了高质量的示范数据。研究者可利用该数据集训练管线,使机器人学习如何用一只手稳定抓取USB集线器,同时用另一手精准拔除线缆的复合动作序列,从而在受控环境中再现人类的灵巧操作。
解决学术问题
该数据集着力攻克了双臂机器人在非结构化环境中进行协调操作时面临的样本效率低下与泛化能力不足的学术难题。传统单臂数据集忽略了双臂间的力矩耦合与时序配合,而本数据集通过记录34维关节空间状态与末端执行器位姿、速度及加速度的精细标注,为研究双臂的力觉交互与轨迹协同控制提供了基准。其公开的LeRobot兼容格式与巨量示范数据,使得深度模仿学习算法能够在真实世界级噪声条件下接受检验,推动了对接触式插拔动作的鲁棒建模。
衍生相关工作
该数据集作为RoboCOIN项目的重要组成部分,其发布的丰富标注信息——包括末端执行器方向、速度、加速度及夹爪活动模式——催生了一系列后续研究。相关工作围绕双臂操作的因果推理与动作分割展开,例如基于夹爪活动标注的任务阶段检测模型,以及利用末端执行器加速度特征进行接触条件预测的工作。此外,与LeRobot框架的深度整合推动了跨数据集迁移学习的探索,使得研究者能够将家庭厨房场景中习得的拔取策略迁移至相似工业装配任务中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务