遇见数据集

hukewei/lerobot_peg_optical_4cams_0527_1

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

这是一个使用LeRobot创建的机器人控制数据集,专门用于机器人技术任务。数据集包含29个完整的情节,总计17,543帧,采样率为30帧每秒。数据以Parquet格式存储,总数据文件大小为100MB,视频文件大小为200MB。数据集的特征包括机械臂的6维动作(如肩部平移、肩部提升、肘部弯曲、手腕弯曲、手腕旋转和夹爪位置)和对应的6维观察状态。此外,提供了来自四个摄像头的视觉观察数据:左腕摄像头、顶部摄像头、近右摄像头和近左摄像头,每个摄像头的视频分辨率为480x640像素,3通道彩色,使用AV1编解码器。数据集还包含时间戳、帧索引、情节索引、索引和任务索引等元数据。所有数据仅用于训练集,适用于机器人学习和控制研究。

This dataset was created using LeRobot and is designed for robotics tasks. It contains 29 total episodes with 17,543 total frames at a frame rate of 30 fps. The data is stored in Parquet format, with a total data file size of 100 MB and video file size of 200 MB. The dataset features include 6-dimensional robot actions (e.g., shoulder pan, shoulder lift, elbow flex, wrist flex, wrist roll, gripper position) and corresponding 6-dimensional observation states. Additionally, visual observations from four cameras are provided: left wrist, top, close right, and close left, each with video resolution of 480x640 pixels, 3 color channels, and using AV1 codec. The dataset also includes metadata such as timestamp, frame index, episode index, index, and task index. All data is allocated to the training split, making it suitable for robot learning and control research.

提供机构:
hukewei
搜集汇总
数据集介绍
hukewei/lerobot_peg_optical_4cams_0527_1 数据集图片
构建方式
在机器人模仿学习领域,高质量示范数据的采集直接决定了策略模型的泛化能力。该数据集依托LeRobot框架构建,以so_follower机械臂为执行平台,围绕单一插销任务展开29次完整示范,累计采集17543帧同步数据流。采集过程中,四路摄像头分别从左侧腕部、顶部、右近端与左近端视角记录操作画面,每路视频以30帧每秒的速率录制,采用AV1编码压缩为yuv420p格式的480×640图像序列。机械臂的六维关节位置与夹爪状态以float32精度逐帧记录,与视觉观测严格时间对齐,形成动作-状态-多视角视觉的闭环数据结构。
特点
该数据集在架构设计上呈现出多模态融合与结构化组织的双重优势。四路摄像头的空间布局兼顾全局场景与局部细节,顶部视角提供任务全貌,腕部视角捕捉末端执行器的精细操作,左右近端视角则补充了侧向遮挡区域的视觉信息,为三维空间理解提供冗余约束。数据以Parquet列式存储格式按块组织,每块上限1000个文件、单文件不超过100MB,兼顾了读取效率与存储管理。29个回合的示范被统一划分为训练集,涵盖单任务多回合的重复性演示,fps为30的恒定采样率保证了时序建模的一致性。
使用方法
面向机器人策略学习的研究者可通过HuggingFace平台直接加载该数据集,利用LeRobot提供的可视化空间在线浏览各回合的视觉与状态轨迹。数据加载时,依据meta/info.json中定义的data_path模板按chunk索引读取Parquet文件,同时从video_path指定的路径获取对应回合的四路视频流。动作标签与观测状态可直接用于行为克隆、扩散策略或视觉-语言-动作模型的监督训练,四路视频则支持多视角编码器的对比学习。研究者亦可借助LeRobot工具链将数据转换为标准训练格式,在仿真或真实平台上进行策略评估与迁移实验。
背景与挑战
背景概述
机器人操作策略学习长期以来受制于高质量演示数据的匮乏,尤其是在精细装配任务中,视觉信息与本体感知的融合对策略泛化至关重要。lerobot_peg_optical_4cams_0527_1数据集由HuggingFace LeRobot生态构建,于2024至2025年间发布,面向so_follower机械臂的轴孔装配任务,采集了29个回合、17543帧、30fps的多视角演示数据,涵盖顶视、双腕及双近端共四路视觉流,并同步记录六维关节位置与动作序列。该数据集为视觉-动作联合建模、多视角表征学习及接触丰富型操作研究提供了标准化基准,推动了开源机器人学习社区在精细操作领域的可复现研究。
当前挑战
轴孔装配任务本身要求机器人在毫米级公差下完成对准、插入与力控协调,涉及接触状态突变、视觉遮挡及姿态微调等高难度操作,对策略的鲁棒性与泛化能力构成严峻考验。数据集构建过程中,四路相机需保持时空同步并校准外参,视频编码采用AV1格式以平衡质量与存储,同时需确保动作与观测在30fps下严格对齐,避免时序漂移。单一任务设定与有限回合数亦带来分布偏移风险,模型在光照变化、物体位姿扰动及不同初始条件下的泛化性能仍待验证,跨本体迁移与长时序推理亦是当前亟待突破的瓶颈。
常用场景
经典使用场景
在机器人学习领域,尤其是精细操作任务中,lerobot_peg_optical_4cams_0527_1数据集提供了经典的多视角视觉-动作配对样本,其核心使用场景聚焦于基于视觉的插孔(peg-in-hole)任务。该数据集采集自so_follower机械臂,配备四个摄像头(左腕、顶部、右近、左近),以30帧每秒的频率记录了29个回合、共计17543帧的示范数据。研究者常将其用于训练模仿学习策略,如行为克隆(Behavior Cloning)或扩散策略(Diffusion Policy),通过融合多视角视觉观测与机械臂关节位置、夹爪状态及动作序列,使机器人能够学习从杂乱场景中精准对齐并插入销钉的技能。其多摄像头配置为视觉表征学习提供了丰富的空间信息,是研究视觉引导精细操作的标准数据源之一。
衍生相关工作
基于该数据集,研究者已衍生出若干经典工作,包括采用多视角Transformer架构进行视觉特征融合的模仿学习模型、利用扩散策略生成多模态动作序列的规划方法,以及结合对比学习预训练视觉编码器的迁移学习框架。在LeRobot生态中,该数据集常被用于基准测试新型策略网络,如ACT(Action Chunking with Transformers)和Diffusion Policy的改进版本。此外,一些工作将其扩展至多任务学习场景,通过共享视觉表征提升跨任务泛化能力。这些衍生研究不仅验证了数据集的有效性,也推动了视觉-运动控制算法在精细操作领域的持续演进。
数据集最近研究
最新研究方向
在具身智能与机器人操作学习领域,基于多模态感知的精细操作技能习得正成为前沿热点。lerobot_peg_optical_4cams_0527_1数据集依托LeRobot框架,面向SO follower机械臂的轴孔装配任务,通过四路摄像头(左腕、顶部、左右近景)同步采集视觉观测与六维关节动作,以30Hz频率构建了29条演示轨迹、逾1.7万帧的时空对齐数据。该数据集的最新研究方向聚焦于利用多视角视觉融合提升接触密集型任务的策略泛化能力,探索视觉-动作联合表征学习在精密装配中的迁移机制。其意义在于为模仿学习与视觉伺服控制提供标准化基准,推动机器人从结构化环境向非结构化场景的灵巧操作演进,对智能制造与自动化装配具有潜在影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务