遇见数据集

zeuzei/pick_place_so101_battery_12grid_120eps

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,专注于机器人任务,具体为pick_place_so101_battery_12grid_120eps。数据集包含120个episodes和71803帧,帧率为30fps。数据以parquet文件格式存储,视频以mp4格式存储。特征包括动作(6个浮点数表示关节位置)、观测状态(包括顶部和手腕的图像,分辨率为480x640,3通道,视频编码为av1)、时间戳、帧索引、episode索引等。机器人类型为so_follower,用于拾取和放置任务,涉及电池和12网格环境。

This dataset was created using LeRobot and focuses on robotics tasks, specifically pick_place_so101_battery_12grid_120eps. It contains 120 episodes and 71803 frames with a frame rate of 30fps. Data is stored in parquet files, and videos are stored in mp4 format. Features include actions (6 float values for joint positions), observation states (including top and wrist images with a resolution of 480x640, 3 channels, video codec av1), timestamps, frame indices, episode indices, etc. The robot type is so_follower, used for pick and place tasks involving batteries and a 12-grid environment.

提供机构:
zeuzei
搜集汇总
数据集介绍
zeuzei/pick_place_so101_battery_12grid_120eps 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在捕获机器人执行‘拾取与放置’任务的精细操作序列。数据采集于SO-101电池12格栅板场景,通过so_follower机器人类型,以30Hz频率记录了120个完整轨迹,共计71,803帧。每个轨迹均包含六维关节位置指令(如肩部、肘部、腕部及夹爪),以及顶部和腕部双视角的高清视频流(480×640像素,AV1编码),确保了动作与视觉信息的时空同步。数据以Parquet格式存储,并划分为训练集(全部120个片段),便于直接用于模仿学习模型的训练与评估。
特点
数据集的核心特色在于其精细的任务结构与多模态融合。单一任务‘拾取与放置电池至12格栅板’通过120个演示片段展现了丰富的操作变体,涵盖了不同的抓取姿态与放置精度。双摄像头设置(顶部与腕部)提供了全局环境与局部操作的互补视角,有助于模型理解空间关系与灵巧操作。动作与状态空间均采用6维浮点向量,精确映射到机器人关节空间,支持细粒度的控制学习。此外,数据以高性能Parquet格式存储,并辅以压缩视频文件,兼顾了数据完整性与存储效率,为机器人学习研究提供了高质量的基准资源。
使用方法
研究者可直接从HuggingFace加载该数据集,利用LeRobot库中的API进行数据访问与预处理。数据集支持标准的训练/测试划分,当前已将全部120个轨迹作为训练集,可用于模仿学习或强化学习的策略训练。具体使用时,可基于‘action’和‘observation.state’字段构建控制输入,并配合‘observation.images.top’与‘observation.images.wrist’作为视觉观察,从而在仿真或物理机器人上复现拾放任务。可视化工具(如visualize_dataset)提供了数据探索的便捷入口,便于研究者直观检查数据质量与行为模式。
背景与挑战
背景概述
随着机器人学习领域的蓬勃发展,模仿学习作为赋予机器人复杂操作能力的关键范式,其数据集的构建与质量成为研究热点。在此背景下,由zeuzei团队于近年创建并基于LeRobot框架发布的pick_place_so101_battery_12grid_120eps数据集,聚焦于电池抓取与放置的精细操作任务。该数据集采用SO-101系列六自由度机器人,融合肩部、肘部、腕部等多关节运动数据,并通过顶部及腕部双视角视觉信息捕捉操作细节,包含120个示范回合,约7.18万帧数据。其核心研究问题在于探索高精度、可复现的电池装配操作模式,为机器人学习领域提供标准化的训练与评估基准,对推动工业装配自动化及具身智能研究具有重要参考价值。
当前挑战
该数据集面临的挑战首先体现在抓取与放置任务本身的物理交互复杂性,电池形状规则但表面光滑,要求机器人具备精确的力控与位姿估计能力,而单个任务设定限制了泛化性能的验证。构建过程中,需同步采集高分辨率(480x640)双视角视频与6维关节动作数据,确保时间戳对齐与数据一致性,且数据量庞大(总存储约300MB)对采集与处理流程提出了严苛要求。此外,数据集中未提供深度图像,可能增加对物体空间位置感知的难度,以及缺乏多任务场景,难以全面评估跨任务迁移能力,这些因素都制约了其在实际应用中的鲁棒性与通用性。
常用场景
经典使用场景
在机器人学习与操作领域,模仿学习已成为赋予机械臂灵巧操作能力的关键范式。此数据集专为机器人抓取与放置任务而设计,记录了单臂机器人在12网格电池盘上进行精准插装操作的120个示范轨迹。每个轨迹均包含高帧率(30fps)的顶视与腕部视觉观测、六维关节状态及对应的动作指令,构成了一个完整的视觉-运动控制闭环数据集。其典型使用场景集中于基于视觉的模仿学习模型训练,如行为克隆、扩散策略及隐式策略等,用于学习从像素到关节力矩的端到端映射。研究者可依托此数据集中规整的状态-动作对,开展多视角视觉特征融合、动作序列预测以及轨迹泛化能力等课题的探索。
实际应用
在实际应用层面,该数据集所蕴含的抓取与放置能力可直接迁移至工业精密装配、电子元器件插装、仓储物流分拣等自动化场景。针对锂电池、电路板等小型脆弱的部件,机器人通过模仿学习即可习得稳妥的力控与位控策略,保障生产节拍与良品率。尤其在新能源汽车产业蓬勃发展的背景下,该数据集所演示的动力电池网格插装操作,为电池模组自动化组装线的快速部署提供了免手动编程的解决途径。同时,数据集中多视角视觉数据的设置,有利于构建更鲁棒的视觉伺服系统,以应对真实产线中光照变化、遮挡等干扰,进而提升生产柔性,降低自动化改造成本。
衍生相关工作
此数据集的发布结构紧密衔接LeRobot生态系统,由此催生了多类衍生研究工作。以该数据集为基准,科研人员可开展机器人操作基座模型的预训练与微调研究,探索利用大规模异构数据集构建通用操作先验的可能性。基于其standardized数据格式,推动了动作分块Transformer(ACT)、扩散策略(Diffusion Policy)等先进模仿学习算法在该类精细任务上的改进与验证。此外,数据集中显式提供的有关时间戳、帧索引及多视角视频,为研究长时序动作预测、视频-动作对齐及跨视角知识蒸馏等课题提供了理想的实验土壤。这些衍生工作共同促进了开源机器人学习社区的发展,加速了可复现、可比较的学术研究循环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务