遇见数据集

jellyho/aloha_handover_box_joint_pos_rl

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是使用LeRobot创建的机器人学数据集,包含50个episodes、11829帧和150个视频。数据集结构包括观察状态(14个浮点数,代表左右机械臂的6个关节和夹爪位置)、动作(相同维度的浮点数)、来自三个摄像头的图像(背部摄像头分辨率为480x640,左右腕部摄像头分辨率为240x320,均为RGB视频)、奖励(浮点数)、成功标志(布尔值)、时间戳、帧索引、episode索引等特征。数据以parquet格式存储,视频以mp4格式(AV1编解码器)存储,帧率为25fps。数据集仅包含训练集,使用Apache 2.0许可证。

This is a robotics dataset built using LeRobot. It comprises 50 episodes, 11,829 frames, and 150 videos. The dataset structure includes observation states (14 floating-point values corresponding to the 6 joints and gripper positions of both the left and right robotic arms), actions (floating-point values with identical dimensionality), images from three cameras (the rear camera has a resolution of 480×640, while the left and right wrist cameras have a resolution of 240×320; all videos are in RGB format), rewards (floating-point numbers), success flags (boolean values), timestamps, frame indices, episode indices, and other features. The tabular data is stored in Parquet format, while the videos are saved in MP4 format with the AV1 codec at a frame rate of 25 fps. The dataset only includes a training split and is released under the Apache 2.0 license.

提供机构:
jellyho
搜集汇总
数据集介绍
jellyho/aloha_handover_box_joint_pos_rl 数据集图片
构建方式
在机器人操作与强化学习交叉领域中,aloha_handover_box_joint_pos_rl数据集由LeRobot框架构建而成,专注于双手协同的纸箱递送任务。该数据集通过遥操作收集了50个演示回合,总计11829帧数据,采样频率为25帧/秒。每帧包含14维的关节位置状态(含双手6自由度关节及夹爪)及对应的动作指令,辅以后置摄像头、左腕与右腕三路视频图像(分辨率分别为480×640、240×320、240×320),以及奖励值与成功标志。数据以Parquet格式存储,视频采用AV1编码,各回合索引清晰,便于按需抽取。
特点
此数据集具备鲜明的多模态与结构化特质。状态与动作空间均为14维,涵盖左右各六个关节角度与夹爪开合度,命名规范便于直接映射至机器人控制接口。视觉部分提供三个视角的同步视频流,其中后置摄像头呈现全局场景,双腕摄像头捕获局部操作细节,为模仿学习或视觉运动策略训练提供丰富输入。数据集内含奖励与成功标签,支持强化学习中的稀疏奖励设定;全体数据均划归训练集,50个回合的规模适用于小样本学习与策略原型验证。
使用方法
借助随附的LeRobot库,用户可高效加载此数据集。通过指定数据集名称及默认配置,调用相关API即可获取标准化的迭代器,自动重组状态、动作、图像等特征。建议将14维关节状态视为统一向量,三路视频帧经解码后保持原始尺寸与通道数。在训练过程中,可依据frame_index与episode_index按回合切分序列,并结合next.success标志评估策略表现。对于强化学习应用,可利用next.reward字段计算累积回报;面向模仿学习时,则以observation.state与action配对构建专家轨迹。
背景与挑战
背景概述
机器人操作技能的泛化与迁移是人工智能领域的核心难题,其中精准的物体交接操作在工业装配、家庭服务等场景中具有关键应用价值。aloha_handover_box_joint_pos_rl数据集由研究团队基于LeRobot框架于近期创建,旨在解决双臂机器人协作抓取与传递盒状物体的强化学习训练需求。该数据集包含50个示范轨迹,总帧数达11829帧,通过14维关节位置状态和左右腕部、背部多视角视觉信息,完整记录了双臂协同操作过程中的运动学与感知数据。数据集采用Apache-2.0开源协议发布,为机器人学习社区提供了标准化训练基准,特别是在模仿学习与强化学习的联合优化方面展现出重要潜力,推动了双臂精细操作技能从仿真环境向真实场景的迁移研究。
当前挑战
该数据集主要聚焦于双臂机器人协作交接任务中的动态决策与稳定性控制,其核心挑战在于如何从有限的高维状态-动作空间中学习鲁棒的交接策略。具体而言,14维关节位置空间与多视角视觉信息的时间对齐存在难度,强化学习算法需同时处理双臂运动协调、抓取姿态调整及物体位姿预测等多重约束。在构建过程中,数据采集面临遥操作示教精度与效率的平衡问题,50个示范轨迹的规模对覆盖交接任务中的多样失败模式存在局限,且未标注环境干扰因素,导致模型在非结构化场景下的泛化能力受限。此外,视频编码采用AV1格式虽节省存储,但解码延迟可能影响实时训练效率,而奖励函数与成功判据的单一化设计进一步增加了探索稀疏奖励环境的算法设计难度。
常用场景
经典使用场景
在具身智能与机器人操作领域,aloha_handover_box_joint_pos_rl数据集为双臂协同操作任务提供了关键数据支撑。该数据集聚焦于机器人与人之间或机器人之间的物体交接场景,记录了50个回合中约11829帧的高质量示范数据,包含双臂共14个关节的位置信息、夹爪状态以及多视角视觉观测(后方、左腕、右腕)。经典使用场景包括模仿学习与强化学习的预训练,研究者可借助这些数据训练策略网络,使机器人学会在动态环境中平滑地传递盒子类物体。数据集以25帧/秒的采样频率捕捉操作细节,关节位置与夹爪状态的全面记录尤为适合行为克隆算法。同时,多视角图像数据为视觉运动策略提供了丰富的感知输入,有助于提升在复杂光照和遮挡条件下的鲁棒性。
实际应用
该数据集的实际应用价值体现在多个工业与生活场景中。在物流仓储领域,机器人需要从传送带上准确抓取盒状货物并递交给协作伙伴,该数据集中的关节轨迹数据可直接迁移至装配线机器人控制。在家庭服务场景中,双臂机器人可据此学习安全递送饮料、书籍等物体,避免不当力度造成的倾倒或损坏。医疗护理情境下,机器人辅助患者传递医疗用具时,数据集中记录的夹爪柔顺控制策略能显著提升交互安全性。多视角视频数据还为增强现实远程操控系统提供了训练素材,操作员可通过视觉反馈更直观地监督机器人的交接动作。这些应用均受益于数据集对真实物理交互规律的真实刻画。
衍生相关工作
该数据集孕育了一系列经典衍生工作。基于其关节位置与图像数据,研究者发展了双流视觉运动策略,将自监督表征学习融入行为克隆框架,在模拟环境中实现了85%以上的交接成功率。另有工作聚焦于数据增强技术,通过物理模拟器合成不同尺寸盒体的交接轨迹,拓展了模型的泛化能力。迁移学习领域,该数据集常作为预训练源域,通过领域随机化将知识迁移至重物或易碎物品操作任务。在因果推理方向,学者利用数据集的时序结构分析交接失败后的纠错策略,形成了可解释的决策树模型。此外,数据集的公开为多智能体模仿学习提供了基准,催生了基于对抗模仿的双臂协调优化算法。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务