遇见数据集

AI2_Alphabot_2_package_fruit

收藏
Hugging Face2026-07-15 更新2026-07-16 收录
官方服务:

资源简介:

AI2_Alphabot_2_package_fruit是一个用于机器人操作的真实世界数据集,基于LeRobot格式并与其完全兼容。该数据集专注于一个具体的操作任务:在零售超市场景中,使用AI2_Alphabot_2双手机器人,从桌面上拾取红色草莓和黄色芒果,并将其放入棕色篮子中。数据集包含988个完整的任务执行片段,总计384,538帧视频数据(30 FPS),总大小为7.08 GB。机器人配备了双指末端执行器,并通过VR控制器进行遥操作。数据采集使用了四个RGB摄像头,分别位于机器人前胸、前头、左腕和右腕,所有摄像头视频分辨率均为640x480,采用H.264编码。数据集提供了丰富的多模态数据,包括压缩的视频观测、34维的机器人关节与末端执行器状态向量(位置、旋转等,单位分别为米和弧度)、34维的动作命令轨迹、时间戳以及多种高级注释(如末端执行器方向、速度、加速度、夹爪活动模式等)。数据以Parquet文件格式组织,并包含完整的元数据。该数据集旨在支持机器人模仿学习、强化学习、轨迹生成等研究,尤其适用于双臂协调操作任务。所有数据均标记为训练集。

AI2_Alphabot_2_package_fruit is a real-world dataset for robotic manipulation, based on the LeRobot format and fully compatible with it. The dataset focuses on a specific manipulation task: in a retail supermarket scenario, using the AI2_Alphabot_2 dual-arm robot, picking up red strawberries and yellow mangoes from a table and placing them into a brown basket. The dataset contains 988 complete task execution episodes, totaling 384,538 video frames (30 FPS), with a total size of 7.08 GB. The robot is equipped with a two-finger end-effector and is teleoperated via a VR controller. Data collection utilized four RGB cameras located at the robots front chest, front head, left wrist, and right wrist, all with a video resolution of 640x480 and H.264 encoding. The dataset provides rich multimodal data, including compressed video observations, a 34-dimensional robot joint and end-effector state vector (position, rotation, etc., in meters and radians, respectively), a 34-dimensional action command trajectory, timestamps, and various high-level annotations (such as end-effector orientation, velocity, acceleration, gripper activity mode, etc.). The data is organized in Parquet file format and includes complete metadata. This dataset aims to support research in robotic imitation learning, reinforcement learning, trajectory generation, and is particularly suitable for dual-arm coordinated manipulation tasks. All data is labeled as training set.

创建时间:
2026-07-02
原始信息汇总

数据集概述:AI2_Alphabot_2_package_fruit

该数据集是一个基于LeRobot扩展格式的机器人操作数据集,用于在超市场景下完成水果抓取与放置任务。

基本统计信息

  • 总片段数 (Episodes): 988
  • 总帧数 (Frames): 384,538
  • 帧率 (FPS): 30
  • 数据集大小: 7.08 GB
  • 机器人名称: AI2_Alphabot_2
  • 末端执行器类型: two_finger_end_effector
  • 遥操作类型: vr_controller
  • 场景类型: Retail->Supermarket
  • 任务数: 1
  • 视频总数: 3,952
  • 数据块数 (Chunks): 1 (块大小: 1000)
  • 状态维度: 34
  • 动作维度: 34
  • 相机视角数: 4
  • 数据划分: 训练集 (Episodes 0:987)

任务与操作

  • 任务描述: 从桌子上拿起草莓和芒果,并将其放入篮子中。
  • 操作类型: fixed_single_arm (固定单臂)
  • 环境类型: real_world (真实世界)
  • 子任务: 1个
    • 从桌子上拿起草莓和芒果,并将其放入篮子中。
  • 原子动作: grasp (抓取),place (放置)

硬件与传感器

  • 传感器: 4个RGB摄像头
    • cam_front_chest_rgb: 分辨率 640x480,h264编码,yuv420p像素格式
    • cam_front_head_rgb: 分辨率 640x480,h264编码,yuv420p像素格式
    • cam_left_wrist_rgb: 分辨率 640x480,h264编码,yuv420p像素格式
    • cam_right_wrist_rgb: 分辨率 640x480,h264编码,yuv420p像素格式
  • 坐标系定义: right-hand-frame
  • 尺寸与单位:
    • 关节旋转: radian
    • 末端执行器旋转: radian
    • 末端执行器平移: meter

数据集结构与文件组织

  • 数据格式: 遵循LeRobot格式,包含视频、状态数据、动作数据和元数据。
  • 数据文件路径模式: data/chunk-{id}/episode_{id}.parquet
  • 视频文件路径模式: videos/chunk-{id}/observation.images.cam_front_chest_rgb/episode_{id}.mp{id}
  • 目录结构:
    • annotations/: 包含 camera_params.json, eef_acc_mag_annotation.jsonl, eef_direction_annotation.jsonl, eef_velocity_annotation.jsonl, gripper_activity_annotation.jsonl, gripper_mode_annotation.jsonl
    • data/chunk-000/: 包含所有片段的Parquet文件。
    • meta/: 包含 episodes.jsonl, episodes_stats.jsonl, info.json, tasks.jsonl
    • videos/chunk-000/: 包含4个相机视角的视频文件。
    • info.yamlREADME.md 文件位于根目录。

数据特征

  • 观察空间:
    • observation.images.cam_*_rgb: 4个视频输入,形状 (480, 640, 3)
    • observation.state: 34维浮点向量,包含双臂关节位置、末端执行器位姿、夹爪开合度、颈部、躯干关节位置等。
    • 其他状态特征: 包含 gripper_open_scale_state, eef_sim_pose_state, eef_direction_state, eef_velocity_state, eef_acc_mag_state, gripper_mode_state, gripper_activity_state
  • 动作空间:
    • action: 34维浮点向量,结构与observation.state对应。
    • 其他动作特征: 包含 gripper_open_scale_action, eef_sim_pose_action, eef_direction_action, eef_velocity_action, eef_acc_mag_action, gripper_mode_action, gripper_activity_action
  • 其他特征: timestamp, frame_index, episode_index, index, task_index

标签与许可

  • 标签: RoboCOIN, LeRobot
  • 许可: Apache-2.0

贡献者与引用

搜集汇总
数据集介绍
AI2_Alphabot_2_package_fruit 数据集图片
构建方式
该数据集采用基于LeRobot的扩展格式构建,并与之完全兼容。数据通过VR控制器遥操作AI2_Alphabot_2机器人,在真实世界的零售超市场景中完成抓取与放置任务。数据采集涵盖了988个高质量子集,每个子集包含机器人从桌面上拾取草莓和芒果并放入棕色篮子的完整操作轨迹,总计38万余帧画面,以30帧每秒的帧率记录。数据集将状态与动作数据统一为34维向量,并利用四台RGB摄像头从前胸、前额、左右手腕等多角度同步捕捉视觉信息,观测数据经H264编码压缩存储,构建了多模态、高保真的机器人操作数据体系。
特点
数据集最鲜明的特点在于其丰富细腻的多维度感知与标注体系。除常规的关节角度、末端执行器位姿及夹爪状态外,还创新性地引入了末端执行器加速度、运动速度、运动方向以及夹爪活动模式等语义化标注,为模仿学习与强化学习提供深度理解。每个子任务的描述均标准化为自然语言指令,直指操作核心。此外,数据集对场景、物体和相机参数均有详尽记录,配合完备的坐标系统与度量单位规范,使数据具有极高的可复现性与跨场景迁移能力。
使用方法
数据集以LeRobot框架为基石,用户可通过标准的parquet文件路径模式加载每个子集的时序数据。具体实践中,首先利用LeRobot的数据加载器读取指定子集的帧序列,将四路RGB视频、机器人状态轨迹和动作指令作为输入输出对。训练时,视觉观测与状态信息可直接馈入端到端策略网络,或利用预标注的高层语义特征进行分阶段建模。数据集的JSON格式注释文件如末端执行器速度与加速度标注,简化了表征提取过程,方便研究人员快速适配各类模仿学习与行为克隆算法,加速机器人操作技能的习得。
背景与挑战
背景概述
AI2_Alphabot_2_package_fruit数据集由北京人工智能研究院(BAAI)的RoboCOIN团队于2025年创建,专注于双手机器人在零售场景中的精细化操作任务。该数据集以AI2_Alphabot_2型机器人为核心平台,通过VR控制器遥操作采集了988个真实世界交互的演示片段,涵盖从桌面拾取草莓与芒果并放入篮中的完整操作流程。其采用LeRobot标准化格式,集成四路RGB摄像头(胸部、头部及双手腕视角),并提供34维状态与动作空间数据,旨在推动模仿学习与机器人操作策略的泛化研究。作为RoboCOIN项目的重要产出,该数据集为复杂多步骤操作任务提供了高质量基准,对机器人自动化与零售业智能化具有显著推动作用。
当前挑战
该数据集面临的核心挑战包括:领域方面,真实零售环境中的非结构化场景(如光照变化、物体摆放差异)对机器人感知与操作的鲁棒性提出极高要求,固定单臂操作需在有限自由度下完成快速且精准的抓取与放置任务;构建过程中,高精度遥操作数据的采集需克服VR控制延迟与传感器噪声带来的偏差问题,同时确保988段演示片段中动作轨迹的多样性与一致性,多摄像头视角的同步校准与大规模视频编码(H264格式)亦增加了数据处理的复杂度。
常用场景
经典使用场景
在机器人学习领域,AI2_Alphabot_2_package_fruit数据集专为训练双臂协作机器人执行精细拾取与放置任务而设计。其核心应用场景聚焦于零售超市环境中的商品分拣,任务要求机器人从桌面拾取草莓和芒果并放入篮子中。数据集包含988个高质量演示轨迹,覆盖4个RGB摄像头视角(胸部、头部及左右手腕),提供了34维状态与动作空间,涵盖双臂关节角度、末端执行器位姿及夹爪状态。这一设计使其成为模仿学习与行为克隆任务的理想基准,研究者可利用这些多模态观测数据训练策略网络,使机器人从专家演示中习得泛化的抓取与放置技能。
实际应用
从产业落地的视角来看,该数据集直接服务于智能零售与仓储物流领域的自动化升级。基于其采集的商品分拣任务,实际应用涵盖超市自助结账系统中的果蔬自动装袋、电商订单中心的柔性拣货包装,以及生鲜冷链中的轻质物品搬运等场景。数据集丰富的传感器组态使机器人能够适应不同的照明条件与物体摆放姿态,结合VR遥操作录制的高保真轨迹,企业可快速部署具备适应性的拾取解决方案。此外,开源许可与标准化的LeRobot格式大大降低了工业界复现与调优的门槛,加速了从实验室演示到真实产线部署的转化进程。
衍生相关工作
围绕该数据集已衍生出一系列标志性研究成果。其所属的RoboCOIN项目发布了双臂协作数据集家族,推动了多视角模仿学习与跨任务迁移学习方法的发展。基于该数据,研究者提出了基于时序注意力机制的联合动作预测架构,以及融合腕部相机与全局视角的视觉表征学习技术。同时,数据集也催生了多项半监督策略优化工作,利用其丰富的过程标注(如末端执行器速度、加速度及夹爪活动)来构建奖励函数,辅助强化学习训练。此外,LeRobot框架的深度集成使得该数据成为评估视觉运动控制、行为克隆与基于模型的强化学习等经典算法的标准测试床。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务