遇见数据集

RoboCOIN/AI2_Alphabot_2_shake_test_tube_1

收藏
Hugging Face2026-07-16 更新2026-07-22 收录
官方服务:

资源简介:

该数据集名为AI2_Alphabot_2_shake_test_tube_1,是一个用于机器人操作的现实世界数据集,专注于一个具体的操作任务:从试管架上拿起透明试管,摇晃它,然后将其放回试管架。数据集基于LeRobot格式并完全兼容,包含399个完整操作片段(episodes),总计313,739帧视频数据,大小为24.50 GB。数据采集自名为AI2_Alphabot_2的双臂机器人,配备双指末端执行器,并通过VR控制器进行遥操作。场景设置为零售超市环境,涉及的对象包括透明的试管架和试管。数据集提供了多视角的RGB视频观测,来自四个摄像头:胸前前置摄像头、头部前置摄像头、左腕摄像头和右腕摄像头,分辨率均为640x480,帧率为30 FPS。此外,数据集包含机器人的状态信息(如关节位置、末端执行器位姿)和动作指令(34维),以及丰富的注释信息(如末端执行器速度、加速度、夹爪活动等)。数据集主要用于机器人学习研究,特别是模仿学习、强化学习和操作技能学习。

This dataset, named AI2_Alphabot_2_shake_test_tube_1, is a real-world robotic manipulation dataset focused on a specific task: picking up a transparent test tube from a test tube rack, shaking it, and then placing it back into the rack. It is based on and fully compatible with the LeRobot format, containing 399 complete episodes, totaling 313,739 frames of video data, with a size of 24.50 GB. The data was collected using a dual-arm robot named AI2_Alphabot_2, equipped with a two-finger end-effector and teleoperated via a VR controller. The scene is set in a retail supermarket environment, involving objects such as a transparent test tube rack and a test tube. The dataset provides multi-view RGB video observations from four cameras: front chest RGB, front head RGB, left wrist RGB, and right wrist RGB, all with a resolution of 640x480 and a frame rate of 30 FPS. Additionally, the dataset includes robot state information (e.g., joint positions, end-effector poses) and action commands (34-dimensional), as well as rich annotations (e.g., end-effector velocity, acceleration, gripper activity). The dataset is primarily intended for robotics learning research, particularly imitation learning, reinforcement learning, and manipulation skill learning.

提供机构:
RoboCOIN
搜集汇总
数据集介绍
RoboCOIN/AI2_Alphabot_2_shake_test_tube_1 数据集图片
构建方式
该数据集基于LeRobot扩展格式构建,由北京人工智能研究院(BAAI)的RoboCOIN团队通过虚拟现实控制器(VR controller)遥操作AI2_Alphabot_2双臂机器人采集所得。数据收集场景设定于零售超市环境,机器人需执行从试管架中拾取透明试管、摇晃后放回原位的精细操作任务。数据集共包含399个演示片段,累计313739帧图像,总容量达24.50 GB。每段轨迹记录均以Parquet文件存储状态与动作数据,同时附带四路RGB摄像头(胸前、头部、左右手腕)同步采集的压缩视频流,确保多视角观测信息完备。
特点
该数据集呈现鲜明特性:其一,聚焦于单一精细操作任务,涵盖抓取、旋转与插入三类原子动作,动作与状态空间均为34维,囊括双臂关节角度、末端执行器位姿及夹爪开合度等完整运动学信息。其二,提供四位一体的视觉观测体系,四路640×480分辨率、30帧/秒的AV1编码视频从不同角度记录操作过程。其三,配备丰富的动作语义标注,包括末端执行器速度、加速度方向、夹爪模式与活动状态等多维度元数据,为模仿学习与机器人基础模型训练提供高质量数据支撑。
使用方法
该数据集完全兼容LeRobot框架,可通过其标准API直接加载使用。数据以分块结构组织,单块含1000个片段,实际399个演示片段存放于data/chunk-000/目录下。用户可通过指定数据路径模式data/chunk-{id}/episode_{id}.parquet逐段读取轨迹,而视频文件则按对应摄像头视图分目录存储于videos/chunk-000/中。数据集已预划分为训练集(第0至398片段),并内置任务指令文本描述,便于多任务学习场景下的任务条件生成。此外,丰富的JSONL格式标注文件支持研究者按需进行动作语义分析或构建层级化操作模型。
背景与挑战
背景概述
AI2_Alphabot_2_shake_test_tube_1数据集由北京人工智能研究院(BAAI)的RoboCOIN团队于2025年创建,旨在推动双臂机器人精细操作领域的发展。该数据集聚焦于超市零售场景中的典型任务——从试管架中拾取透明试管并完成摇晃与放回操作,研究了透明物体抓取、动态操作及精准放置等核心问题。依托AI2_Alphabot_2机器人平台,数据集包含399条高质量演示轨迹,配备四视角RGB摄像头及34维状态-动作空间。作为RoboCOIN项目的重要组成部分,该数据集为学习复杂操作策略和机器人通用技能提供了宝贵资源,对模仿学习与行为克隆研究具有重要推动价值。
当前挑战
该数据集所应对的核心挑战包含两个方面。领域层面,透明物体在视觉感知中具有弱纹理、光折射等特征,导致传统抓取算法难以准确估计位姿,同时摇晃试管与重新插入架孔的操作要求机器人具备精确的力位混合控制能力。数据构建过程中,四路高清视频流(每秒30帧)与34维状态数据的同步采集带来了存储与处理的挑战,24.5GB的数据量需要高效的压缩编码方案;此外,透明的试管和架体在多种光照条件下均难以被视觉系统稳定跟踪,要求标注流程中融入细致的质量校验机制以确保数据可靠性。
常用场景
经典使用场景
在机器人操作研究领域,该数据集专为精细抓取与动态操作任务的模仿学习而设计。其核心场景为:机器人需从透明试管架上夹取透明试管,完成摇晃动作后再精准归位。这一流程涵盖了抓取、旋转、插入三种原子动作,且操作对象具有视觉上的高透明度特性,对感知与控制的鲁棒性提出了严苛挑战。基于3.5小时、30帧每秒的高频记录,该数据集为训练端到端策略网络提供了近400个高质量演示轨迹,尤其适用于研究在结构化零售环境中执行多步骤、非刚体任务的深度模仿学习方法。
解决学术问题
该数据集所填补的关键学术空白,在于为双臂机器人处理透明、易碎物品的动态操作提供了标准化的基准。透明物体的视觉检测与跟踪一直是计算机视觉的难点,而将抓取与动态抖动动作耦合,则进一步考验了机器人对力反馈与运动轨迹的实时调整能力。通过提供精确的关节角度、末端执行器位姿及夹爪开度等34维状态与动作数据,该数据集有力推动了关于精细操作中阻抗控制与视觉伺服融合的研究,其影响体现在为后续工作建立了可复现的评估体系,显著提升了在非结构化环境中操作透明物体的成功率。
衍生相关工作
围绕本数据集已衍生出多项基础性工作,主要集成于RoboCOIN与LeRobot两大框架。RoboCOIN项目作为开源双臂机器人数据采集与策略学习平台,以此为范例定义了标准化格式,并配套了从VR遥操作到策略训练的全套管线,使得数据集可直接用于行为克隆、扩散策略等主流算法的训练与评测。LeRobot框架则提供了统一的数据接口与预训练模型,极大降低了研究者的入门门槛,并催生了一批关于跨任务泛化与多视角视觉融合的研究。未来工作可进一步利用其丰富标注(如夹爪活动、末端速度等)来探索可解释的模块化操作策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务