遇见数据集

hukewei/lerobot_peg_optical_4cams_0527_50

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集使用LeRobot创建,专为机器人学任务设计。数据集包含54个总集数,48304个总帧数,帧率为30fps,所有数据均用于训练。机器人类型为so_follower。数据集特征包括动作数据(如肩部、肘部、腕部和抓取器的位置)、观察状态(与动作数据相同)、来自四个摄像头的图像观察(左腕、顶部、近右和近左摄像头,每个图像分辨率为480x640,3通道,视频编码为av1),以及时间戳、帧索引、集索引、索引和任务索引等元数据。数据以Parquet格式存储,视频以MP4格式存储,总数据文件大小为100MB,视频文件大小为200MB。

This dataset was created using LeRobot and is designed for robotics tasks. It contains a total of 54 episodes, 48304 frames, with a frame rate of 30fps, and all data is used for training. The robot type is so_follower. Dataset features include action data (e.g., positions of shoulder, elbow, wrist, and gripper), observation state (same as action data), image observations from four cameras (left_wrist, top, close_right, and close_left, each with a resolution of 480x640, 3 channels, video codec av1), and metadata such as timestamp, frame index, episode index, index, and task index. Data is stored in Parquet format, videos in MP4 format, with a total data file size of 100MB and video file size of 200MB.

提供机构:
hukewei
搜集汇总
数据集介绍
hukewei/lerobot_peg_optical_4cams_0527_50 数据集图片
构建方式
该数据集基于LeRobot框架构建,专为机器人操控任务设计。数据通过控制'SO Follower'机器人执行插销插入任务采集而成。系统以30帧/秒的采样频率,同步记录来自四台摄像机(左腕、顶部、右近端、左近端)的多视角视觉信息,每帧图像尺寸为480x640像素,并采用AV1编码压缩存储。同时采集了机器人6维关节空间(包含肩部、肘部、腕部及夹爪)的动作指令与本体状态数据。整个数据集包含54个完整演示轨迹,共计48304帧时序数据,以Parquet格式存储结构化数据,MP4格式存储视频流,并划分为训练集使用。
特点
该数据集的核心特点在于其多模态、多视角的丰富表征能力。四台高分辨率摄像机提供了机器人工作空间的完整视觉覆盖,包括腕部近景与全局俯视视角,为模仿学习算法提供了充分的场景理解基础。数据包含6自由度关节动作与状态信息,精度为32位浮点数,确保了控制信号的平滑与精确。此外,数据集具备明确的结构化特征,每个轨迹均包含时间戳、帧索引与情节索引,便于时间序列分析与序列建模。整体数据规模适中(视频约200MB,结构化数据约100MB),兼顾了训练效率与信息完备性。
使用方法
用户可利用LeRobot生态工具链便捷地加载此数据集。通过Hugging Face的`lerobot`库,可直接按配置名称'default'访问数据,其中训练集涵盖全部54个轨迹。建议采用LeRobot提供的可视化工具(如`visualize_dataset`空间)进行数据预览与质量校验。使用时,可将'observation.state'与'observation.images.*'作为模型输入,'action'作为监督信号,构建端到端的视觉运动策略。数据集遵循Apache-2.0开源协议,支持学术研究与商业应用场景。
背景与挑战
背景概述
该数据集由研究者基于LeRobot框架创建,聚焦于机器人精密插拔(peg insertion)这一经典操作任务。工业装配中,高精度对孔作业要求机器人同时依赖视觉与力觉反馈,传统方法常因环境变化或几何偏差而失败。数据集通过四台光学相机(左腕、顶部、近左、近右)同步采集多视角视觉信息,记录6自由度动作与状态序列,共包含54条演示轨迹、超过4.8万帧数据,为模仿学习与强化学习提供了丰富的多模态训练素材。其构建依托开源机器人平台so_follower,旨在推动具身智能研究在复杂接触任务中的泛化能力与鲁棒性。
当前挑战
该数据集的核心挑战在于解决精密装配中视觉感知与动作控制的耦合难题。多视角图像需融合为一致的场景表征,以应对遮挡、光照变化及零件微小间隙(亚毫米级)带来的定位模糊。动作空间的高维度与接触动力学中的非线性摩擦、弹性变形,使模型难以从有限演示中泛化至未见过工况。此外,构建过程中需确保相机标定精度、动作同步误差控制在毫秒级,并人工校验54条轨迹的质量以排除失败案例,这些工程细节直接影响数据集的可用性与下游算法的复现成功率。
常用场景
经典使用场景
在机器人学习与操控领域,该数据集专为精细装配任务设计,聚焦于高精度“插轴入孔”作业。它通过多视角视觉感知——包括顶部俯瞰、左右近距以及左手腕相机——构建了丰富的观测空间,为模仿学习与强化学习算法提供了四路同步视频流与六维度关节动作轨迹。研究者常利用这些数据训练视觉运动策略,使机械臂能从像素级信息中习得柔顺、稳定的插接行为,是验证端到端机器人操作能力的经典基准。
解决学术问题
该数据集直面机器人操作中接触状态建模与视觉反馈控制的核心难题。传统方法依赖精确力学模型或标记物追踪,而本数据通过提供大量真实演示数据,支撑了无模型模仿学习范式的探索。它帮助学术界研究多模态观测融合对关节极限精度任务的影响,揭示了视觉注意力机制在微小间隙补偿中的关键作用,推动了从示教到泛化的迁移学习理论在非结构化场景下的发展。
衍生相关工作
该数据集催生了多项代表性研究,例如基于扩散模型的机器人动作生成工作,利用其中丰富的视觉-动作配对样本学习插接过程中的连续柔顺轨迹;又如针对多视角特征对齐的对比学习框架,通过挖掘四摄像机视野中的共享表征提升策略泛化能力。还有工作将其与力觉数据集成,构建了视觉-触觉联合表征模型,重新定义了基于示教的精密装配范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务