遇见数据集

jellyho/aloha_handover_box_joint_pos_bc_orig

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人控制数据集,使用LeRobot工具创建。它包含40个训练集,总计9547帧数据,帧率为25fps,并包含120个视频。数据集中每个样本包含机器人状态观测(如左右机械臂的6个关节角度和夹爪状态,共14维浮点数)、动作(同样为14维浮点数,对应关节和夹爪控制)、来自不同视角的图像观测(包括背部摄像头(分辨率480x640)和左右手腕摄像头(分辨率240x320)的视频数据),以及奖励、成功标志、时间戳、帧索引、集索引等元数据。数据集主要用于机器人模仿学习或强化学习任务,支持训练模型以控制双机械臂系统执行特定操作。

This robotic control dataset was constructed using the LeRobot toolkit. It consists of 40 training splits, with a total of 9547 frames at a frame rate of 25 fps, and includes 120 videos. Each sample in the dataset contains robotic state observations (e.g., 6 joint angles and gripper states for both the left and right robotic arms, totaling 14-dimensional floating-point values), actions (also 14-dimensional floating-point values corresponding to joint and gripper control commands), image observations from multiple perspectives (including video data from the rear camera with a resolution of 480x640 and the left/right wrist cameras with a resolution of 240x320), as well as metadata such as rewards, success flags, timestamps, frame indices, and split indices. This dataset is mainly designed for robotic imitation learning or reinforcement learning tasks, enabling the training of models to control dual-arm robotic systems to perform specific operations.

提供机构:
jellyho
搜集汇总
数据集介绍
jellyho/aloha_handover_box_joint_pos_bc_orig 数据集图片
构建方式
aloha_handover_box_joint_pos_bc_orig数据集基于LeRobot框架构建,专注于机器人操作任务。数据收集涉及双臂机器人执行盒子传递动作,通过记录机器人各关节的实时状态与动作指令,形成完整的运动轨迹。数据集包含40个episode,总计9547帧数据,以parquet格式存储于data目录下,同时配套有三视角(背部、左手腕、右手腕)的视频记录,视频以av1编码、25fps的速率保存于videos文件夹。每个episode的关节状态与动作均为14维向量,涵盖左右各6个关节及夹爪位置。
特点
数据集的显著特点在于其多模态与高保真性。特征空间包含14维的关节观测状态与14维的动作指令,二者维度对齐便于行为克隆建模。视觉信息由三个摄像头提供:480×640分辨率的背部视角与两路240×320的手腕视角,构成完整的操作场景感知。数据集提供了奖励信号(next.reward)与成功标志(next.success),配合时间戳、帧索引等元信息,支持离线强化学习与模仿学习研究。每帧数据均经过标准化处理,且所有episode未被分割,直接作为训练集使用。
使用方法
使用该数据集时,可借助LeRobot库的DataLoader接口直接加载parquet文件与关联视频,高效构建训练流程。对于行为克隆任务,可将observation.state作为输入,action作为监督目标进行回归训练。支持强化学习场景时,利用next.reward和next.success构造环境交互的奖励信号。由于视频与状态数据已时间对齐,研究者可联合图像特征与关节角度进行多模态策略学习。数据集单一任务的设计有利于聚焦特定操作技能的泛化性验证,亦可作为基线测试的标准benchmark。
背景与挑战
背景概述
在机器人操作领域,模仿学习作为一种高效的行为获取范式,近年来取得了显著进展,特别是在双机械臂协同任务中展现出巨大潜力。aloha_handover_box_joint_pos_bc_orig数据集由Hugging Face LeRobot社区创建,采用Apache-2.0开源许可,旨在为双机器人臂协作递送盒子任务提供标准化的示范数据。该数据集于2023年至2024年间构建,由多个匿名研究团队贡献,包含40个演示片段、总计9547帧时序信息,以25帧/秒的频率记录。其核心研究问题聚焦于利用14维关节位置状态(包括左右机械臂各6个自由度及夹爪状态)结合多视角视觉输入(背面、左腕、右腕相机),驱动基于行为克隆的神经网络策略,实现对复杂物体交接动作的精确复现。该数据集的出现填补了双机器人精细操作领域缺乏大规模开源基准的空白,为后续研究提供了可复现的评估平台,对推动机器人抓取与协作控制的发展具有重要价值。
当前挑战
该数据集所解决的领域核心挑战在于双机械臂协作中的物体交接任务,这要求算法不仅需要分别控制两只手臂完成独立路径规划,还需精准协调两者在时空上的同步,以避免碰撞和抓取失败。在模型层面,行为克隆方法面临从高维视觉和状态输入中学习长时程依赖动作序列的困难,尤其是在仅40个演示片段的小样本条件下,模型的泛化能力和对干扰的鲁棒性成为瓶颈。构建过程中,数据采集面临硬件同步、传感器标定和动作质量控制的挑战,确保左右臂14个关节位置与夹爪开合的准确记录,同时需注入连续视频流以避免时间漂移。此外,数据清洗与标注需人工检查交接点的有效性,排除失败案例,这在规模化扩展时显著增加了人力成本。这些挑战共同限定了当前算法的性能上界,也为未来研究指明了提升方向。
常用场景
经典使用场景
在机器人操作领域,aloha_handover_box_joint_pos_bc_orig数据集为双臂协作任务的行为克隆学习提供了珍贵的演示轨迹。该数据集记录了40个成功完成盒子交接操作的完整回合,包含双机械臂各7个自由度(六个关节加一个夹爪)的关节位置序列,以及背部、左腕和右腕三个视角的同步视频流。研究者可将此数据用于训练基于联合位置的动作模仿模型,使机器人习得从感知到平稳交接盒子的连续操作策略,尤其适用于研究双臂协调中接触力感知、物体姿态调整与抓取时机预测等关键问题。
衍生相关工作
围绕这一数据集,研究人员已衍生出一系列经典工作,例如基于扩散策略的动作序列生成模型在双臂交接任务上的优化,以及结合时序对比学习的多模态表征预训练方法。数据集中提供的多视角视频与关节同步数据激发了关于观测遮蔽下的鲁棒策略研究,比如利用单视角图像预测未观测关节状态。更前沿的工作还包括将交接演示数据引入到逆强化学习框架中,以推断隐含的奖励函数,从而生成更自然的协作动作风格。这些衍生研究共同推动了从单一任务演示到通用操作技能学习的范式演进。
数据集最近研究
最新研究方向
在机器人操作领域,双臂协同与精细抓取始终是迈向通用机器人技能的核心挑战。aloha_handover_box_joint_pos_bc_orig数据集聚焦于双机械臂交接箱子这一典型任务,通过记录14维关节位置与多视角视觉信号,为模仿学习中的行为克隆(BC)算法提供了高质量训练素材。当前前沿研究正围绕视觉-运动联合表征展开,该数据集的同步关节位置与背部、腕部多路摄像头数据,恰好契合了从像素到动作的端到端映射需求。结合LeRobot生态系统在开放数据集标准化方面的努力,这一资源有力助推了双臂操作中泛化性与鲁棒性的提升,为物流分拣与人机协作等热点场景的应用铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务