遇见数据集

aloha-static-bimanual-real-v1

收藏
Hugging Face2026-06-06 更新2026-06-07 收录
官方服务:

资源简介:

该数据集是一个用于机器人精细双手操作任务的模仿学习/强化学习数据集,基于低成本硬件平台ALOHA收集,使用LeRobot框架创建。它包含50个完整episodes,总计55,000帧数据(对应200个视频片段),帧率为50 fps,以parquet文件格式组织,仅提供训练集。数据内容涵盖多模态观测和动作指令:观测部分包括来自四路摄像头的视频流(cam_high、cam_left_wrist、cam_low、cam_right_wrist),每路视频分辨率为480x640,RGB三通道,使用AV1编码;同时包含14维的机器人关节状态和关节力矩向量。动作部分为14维的关节目标控制指令,这些维度对应左右机械臂的14个具体关节:腰部、肩部、肘部、前臂滚动、腕部角度、腕部旋转和夹爪。此外,数据集还包含episode索引、帧索引、时间戳、终止标志等元数据字段。该数据集适用于训练机器人执行需要双手协调的精细操作任务模型,相关研究发表于RSS 2023论文《Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware》。

This dataset is designed for imitation learning/reinforcement learning in robot fine-grained bimanual manipulation tasks, collected using the low-cost hardware platform ALOHA and created with the LeRobot framework. It contains 50 complete episodes, totaling 55,000 frames (corresponding to 200 video clips) with a frame rate of 50 fps, organized in parquet file format and only includes a training set. The data encompasses multimodal observations and action commands: observations consist of video streams from four cameras (cam_high, cam_left_wrist, cam_low, cam_right_wrist), each with a resolution of 480x640, RGB three-channel, encoded with AV1; it also includes a 14-dimensional robot joint state and joint effort vector. The action part comprises a 14-dimensional joint target control command, with these dimensions corresponding to 14 specific joints of the left and right robotic arms: waist, shoulder, elbow, forearm roll, wrist angle, wrist rotation, and gripper. Additionally, the dataset includes metadata fields such as episode index, frame index, timestamp, and termination flag. It is suitable for training models to perform fine-grained manipulation tasks requiring bimanual coordination, with related research published in the RSS 2023 paper Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware.

创建时间:
2026-05-26
原始信息汇总

数据集概述

  • 名称:aloha-static-bimanual-real-v1
  • 主页:https://tonyzhaozh.github.io/aloha/
  • 论文:Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware(arXiv:2304.13705)
  • 许可证:MIT

数据集结构与规模

  • 构建工具:LeRobot
  • 机器人类型:aloha
  • 总片段数:50
  • 总帧数:55,000
  • 总任务数:1
  • 总视频数:200
  • 总块数:1
  • 块大小:1,000
  • 帧率:50 FPS
  • 数据路径:data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet
  • 视频路径:videos/chunk-{episode_chunk:03d}/{video_key}/episode_{episode_index:06d}.mp4
  • 数据划分:训练集(片段0-49)

数据特征

所有图像观测均为视频数据,分辨率480×640,3通道,采用AV1编码,yuv420p像素格式,无音频。

特征名称 数据类型 形状 说明
observation.images.cam_high video [480, 640, 3] 顶部摄像头
observation.images.cam_left_wrist video [480, 640, 3] 左腕摄像头
observation.images.cam_low video [480, 640, 3] 底部摄像头
observation.images.cam_right_wrist video [480, 640, 3] 右腕摄像头
observation.state float32 [14] 14维关节状态(左右各7个电机)
observation.effort float32 [14] 14维关节力矩(左右各7个电机)
action float32 [14] 14维动作指令(左右各7个电机)
episode_index int64 [1] 片段索引
frame_index int64 [1] 帧索引
timestamp float32 [1] 时间戳
next.done bool [1] 结束标志
index int64 [1] 全局索引
task_index int64 [1] 任务索引

关节名称(14个电机)

左侧:左腰部(left_waist)、左肩(left_shoulder)、左肘(left_elbow)、左前臂旋转(left_forearm_roll)、左腕角度(left_wrist_angle)、左腕旋转(left_wrist_rotate)、左夹爪(left_gripper)

右侧:右腰部(right_waist)、右肩(right_shoulder)、右肘(right_elbow)、右前臂旋转(right_forearm_roll)、右腕角度(right_wrist_angle)、右腕旋转(right_wrist_rotate)、右夹爪(right_gripper)

引用

bibtex @article{Zhao2023LearningFB, title={Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware}, author={Tony Zhao and Vikash Kumar and Sergey Levine and Chelsea Finn}, journal={RSS}, year={2023}, volume={abs/2304.13705}, url={https://arxiv.org/abs/2304.13705} }

搜集汇总
数据集介绍
aloha-static-bimanual-real-v1 数据集图片
构建方式
该数据集基于ALOHA(低成本双臂远程操作系统)平台采集,专注于静态场景下的双臂精细操作任务。经由专业操作员远程操控机器人完成单一任务,共收录50个演示片段,总计55,000帧时序数据,采样频率为50Hz。数据以Parquet格式存储,并同步记录来自四台高清摄像头(480×640像素)的RGB视频流,包括俯视视角、低位视角及左右腕部视角。此外,数据集完整保留了双臂各7个关节的电机状态(位置与力矩)及对应的动作指令,为模仿学习提供了对齐的多模态观测-动作对。
特点
数据集显著特色在于其高保真度与结构化设计。10维动作空间与状态空间精确映射14个自由度(双臂各含腰、肩、肘、前臂、腕关节及夹爪),且所有时序数据通过帧索引、时间戳及任务标签严格对齐。视频采用AV1编码压缩以平衡画质与存储,配合LeRobot标准化格式,支持跨框架无缝加载。尽管仅含单一任务,但50个演示片段覆盖了操作变异性,为研究双臂协调与行为克隆提供了高质量的基准资源。
使用方法
数据集兼容LeRobot库,可直接通过其API加载并划分为训练集(全部50个片段)。用户可通过指定数据根目录读取Parquet序列文件并自动关联对应视频,按帧或按片段迭代获取观测图像、状态与动作。适用于构建基于视觉的模仿学习模型,尤其适合训练双向LSTM或扩散策略等时序模型。由于已预定义特征名称(如'observation.images.cam_high'及'action'),研究者可便捷地接入现有算法管线或进行多视角融合,无需额外处理原始格式。
背景与挑战
背景概述
aloha-static-bimanual-real-v1数据集由斯坦福大学Tony Zhao、Vikash Kumar、Sergey Levine和Chelsea Finn等研究人员于2023年创建,基于ALOHA(Affordable Low-Cost Hardware for Advanced Manipulation)机器人平台构建。该数据集专注于双臂精细操作任务,通过低成本硬件采集了50个演示片段、共55,000帧的高质量运动数据,涵盖14个自由度的关节状态、力矩及多视角视觉图像。作为LERobot生态系统中的标准数据集,它有效支撑了模仿学习在双臂协同操作领域的研究,推动了机器人从简单抓取向复杂双手机器人技能迁移的范式转变,在低成本机器人学习与精细操作领域具有里程碑意义。
当前挑战
该数据集所解决的核心领域挑战在于如何以极低成本实现精准的双臂协同操作模仿学习。传统机器人数据集依赖昂贵的工业级硬件,而ALOHA采用模块化设计将硬件成本降至数千美元,但仍需应对双臂运动耦合带来的数据稳定性问题。构建过程中,团队面临多视角视觉特征对齐与14维高维连续动作空间的高效采样难题,单任务50万帧数据的采集需保证演示轨迹的一致性与可重复性。此外,原始数据中含有的力矩信息与视觉流之间的时序同步、以及从静态环境到动态干扰的泛化能力,构成了数据采集与建模的双重壁垒。
常用场景
经典使用场景
在精细双臂机器人操作领域,aloha-static-bimanual-real-v1 数据集作为 ALOHA 系统的核心静态数据资源,广泛应用于模仿学习算法的训练与评估。该数据集包含 50 个演示片段、55,000 帧高频率(50 FPS)的视觉与状态动作序列,覆盖了从高分辨率相机(cam_high、cam_low、左右腕部相机)到 14 维关节状态(包括左右臂的腰部、肩部、肘部等)的完整观测空间。研究者常利用这些固定基座下的真实双臂操作演示,训练模型学习如抓取、装配等需要高度协调的精细任务,验证行为克隆、隐式策略等方法的泛化能力。
解决学术问题
该数据集解决了低成本硬件条件下精细双臂操作数据稀缺的学术困境,为验证模仿学习在真实复杂操作任务中的有效性提供了标准化基准。通过提供同步记录的多视角视觉、关节状态、力信息及动作标签,它支持了从状态表示学习到策略泛化能力的系统研究。其发布的意义在于打破了高精度数据采集对昂贵设备的依赖,推动了低成本机器人系统在学术界的普及,并启发了后续关于数据效率、跨任务迁移以及基于视觉的精细控制等核心科学问题的探索。
衍生相关工作
基于该数据集衍生了多项里程碑式的工作,其中最著名的是 ALOHA 系统和其后续的 Mobile ALOHA 框架。原始论文《Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware》发表于 RSS 2023,首次证明了低成本静态双臂平台在精细操作中的可行性。其后,通过扩充动态移动基座数据,相关工作如“Learning to Fold and Unfold Clothes”进一步拓展了操作场景的边界。此外,该数据集的标准化格式(LeRobot 框架)也催生了一系列关于数据增强、离线强化学习及多模态融合的研究,成为机器人学习社区重要的评估基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务