遇见数据集

hukewei/lerobot_peg_optical_4cams_0527_2

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人学数据集,使用LeRobot创建。数据集包含60个总集数、36662个总帧数,涉及1个总任务。数据以30帧每秒的速率采集,存储为parquet和mp4格式。特征包括动作(如肩部、肘部、腕部和夹爪的位置)、观测状态(与动作相同的关节位置)、以及来自四个摄像头(左腕、顶部、近右、近左)的图像观测,每个图像分辨率为480x640像素,3个通道。数据集还包含时间戳、帧索引、集索引、索引和任务索引等元数据。机器人类型为so_follower,许可证为Apache-2.0。

This dataset is a robotics dataset created using LeRobot. It contains a total of 60 episodes, 36662 frames, and involves 1 task. Data is collected at 30 frames per second and stored in parquet and mp4 formats. Features include actions (e.g., positions of shoulder, elbow, wrist, and gripper), observation states (same joint positions as actions), and image observations from four cameras (left wrist, top, close right, close left), each with a resolution of 480x640 pixels and 3 channels. The dataset also includes metadata such as timestamp, frame index, episode index, index, and task index. The robot type is so_follower, and the license is Apache-2.0.

提供机构:
hukewei
搜集汇总
数据集介绍
hukewei/lerobot_peg_optical_4cams_0527_2 数据集图片
构建方式
在机器人学习领域,模仿学习依赖于高质量的多模态数据集。该数据集基于LeRobot框架构建,旨在支持细粒度操作任务的研究。数据采集利用SO系列从属机械臂(so_follower)完成,涵盖60个独立episode,总计36662帧时序数据,帧率为30 FPS。数据集按容量将数据分割为1000帧的chunk文件,并采用Parquet格式存储运动数值(包括6维关节位置与夹爪状态),同时将四路摄像头(左腕、顶部、右近、左近)采集的480×640 RGB视频以AV1编码格式保存。所有样本被统一划归至训练集,未设置验证与测试子集,反映了特定研究场景下的专注性构建策略。
特点
该数据集的核心特点在于其多视角视觉与运动状态的同步捕获能力。四组摄像头从不同空间位置记录环境与机械臂末端信息,为视觉伺服与空间推理提供了丰富的上下文。运动数据以6维float32向量形式存储,精确映射了肩关节、肘关节、腕关节及夹爪的位置变化,与视觉流在时序上严格对齐。此外,数据集中每个样本均包含时间戳、帧序号、episode索引等元数据,便于进行时间序列分析与轨迹重放。30Hz的高采样率进一步确保了细粒度运动细节的完整性,适用于高频控制策略的学习。
使用方法
该数据集主要通过LeRobot库进行加载与应用。研究者可调用LeRobot的API直接读取Parquet数据文件与视频文件,获取已对齐的运动指令、关节状态及多视角图像序列。在预处理阶段,可借助LeRobot内置的转换模块将视频帧解码为ndarray格式,并将动作与状态向量标准化处理。由于数据集已按标准LeRobot格式组织,用户无需手动解析二进制文件或设计视频采样流程,即可高效地构建训练管线。结合Hugging Face提供的可视化工具,还能够快速预览单条episode中的视觉与运动轨迹,辅助验证数据完整性。
背景与挑战
背景概述
该数据集由hukewei等人利用LeRobot框架创建,于2025年5月27日发布,专注于机器人精细化操作任务——光学插件装配(Peg-in-Hole)。研究核心在于通过多视角视觉反馈(左腕、顶部、右侧近距及左侧近距共四路摄像头)驱动机械臂(so_follower型)完成高精度装配动作,记录包含6自由度关节角度与夹爪状态的动作序列及状态观测。数据集收录60个完整轨迹,总计36662帧,以30帧/秒的parquet与AV1编码视频格式存储,为模仿学习与强化学习提供了多模态对齐的低级控制基准。其影响体现在将工业级装配难题转化为可复现的科研基准,推动视觉-运动控制策略的泛化能力研究。
当前挑战
该数据集所应对的核心领域挑战在于光学插件装配任务的亚毫米级精度要求,机械臂需在连续视觉反馈下实现柔性接触与微小误差补偿,这对阻抗控制与视觉伺服融合提出严苛考验。构建过程中,四路摄像头同步采集带来高维异质数据对齐难题,不同视角的动作变换与遮挡鲁棒性需精心校准;此外,仅包含单一任务和60条轨迹的规模限制了策略的泛化性,动作与状态空间的6维连续控制需确保时序一致性,而低帧率(30fps)与硬件抖动可能引入动力学建模的累积偏差,数据的噪声与标签精度直接决定策略的最终性能上限。
常用场景
经典使用场景
在机器人学习领域,高精度插拔任务(peg-in-hole)一直是衡量机械臂精细操作能力的经典基准。lerobot_peg_optical_4cams_0527_2数据集以so_follower机械臂为硬件平台,通过四台光学相机(左腕、顶部、右侧近距、左侧近距)从多视角同步采集高分辨率视觉信息,并记录六维关节动作序列(肩部三个自由度、腕部两个自由度及夹爪开合),构建了包含60个完整回合、总计36662帧的精细化操作轨迹。该数据集最经典的使用场景在于训练基于视觉的模仿学习模型,使机器人能够从人类示教数据中习得插销入孔的柔顺控制策略,尤其适用于研究多视角视觉输入对高精度装配任务成功率的提升作用。
实际应用
在工业智能化和服务机器人领域,该数据集具有显著的应用价值。其记录的插拔操作数据可直接用于训练机械臂在电子元件装配、医疗器械操作等场景中的自主决策能力,尤其适用于精密制造环节中公差极小(亚毫米级)的零件接合任务。借助四相机阵列的观测冗余性和30Hz的高频动作记录,机器人可学习在动态干扰下(如工件抖动、传送带运动)保持夹持稳定性的鲁棒控制策略。此外,该数据集还能为自动化流水线中的快速换产提供知识迁移基础——通过微调预训练模型,使机器人快速适应不同形状、材质的插接件操作,从而显著降低传统编程方式的时间与经济成本。
衍生相关工作
基于该数据集衍生的研究工作主要沿着三个方向展开。其一,由多视角插拔轨迹驱动的视觉模仿学习框架(如基于扩散策略或Transformer架构的变体)被广泛探讨,通过对比单目与多目输入下的成功率,验证了三维空间感知对精细操控的必要性。其二,为加速策略学习的数据效率优化工作应运而生,例如利用该数据集的60个标准回合设计数据增强算法(如视觉域随机化、动作扰动注入),以提升模型在小样本条件下的泛化能力。其三,围绕该数据训练的预训练模型已拓展至其他高精度任务,如电缆插头对接、微电子芯片拾取,展示了跨场景技能迁移的潜力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务