遇见数据集

radoolonto/angle_peg_stereo_05_27_cam_ref

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

这是一个用于机器人学任务的数据集,由LeRobot创建,专门针对Franka机器人。数据集包含立体视觉图像数据(来自两个摄像头,每个图像分辨率为3x240x320)、状态观测(浮点型向量,维度为3)、动作数据(浮点型向量,维度为10)以及时间戳、帧索引、集索引等信息。数据集总共有72个集,44185帧,帧率为15 fps,数据以Parquet文件格式存储,并包含视频文件。该数据集适用于机器人控制模型的训练和评估,支持机器人视觉和动作学习任务。

This is a dataset for robotics tasks, created using LeRobot and specifically designed for Franka robots. It includes stereo vision image data (from two cameras, each with a resolution of 3x240x320), state observations (float32 vector of dimension 3), action data (float32 vector of dimension 10), along with timestamps, frame indices, episode indices, and other metadata. The dataset consists of 72 episodes, 44185 frames, with a frame rate of 15 fps. Data is stored in Parquet format and includes video files. It is suitable for training and evaluating robot control models, supporting tasks in robot vision and action learning.

提供机构:
radoolonto
搜集汇总
数据集介绍
radoolonto/angle_peg_stereo_05_27_cam_ref 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人操控领域的模仿学习任务。数据采集源自Franka机器人平台,通过立体视觉系统获取三视角图像(cam0、cam1、cam2),每帧图像分辨率为240×320像素,覆盖三通道色彩信息。同步记录机器人末端执行器的三维状态向量与十维动作指令,形成完整的“感知-决策”闭环数据对。数据以Parquet格式存储,包含72个演示片段,总计44185帧,并采用分块机制(每块1000帧)进行高效组织,便于大规模训练集加载与分布式处理。
特点
数据集最显著的特征在于其多模态异构数据的精细化对齐:三路立体视觉图像与机器人状态、动作信号保持严格的时间同步(15帧/秒),为策略学习提供时空一致性保障。动作空间维度(10维)显著高于状态空间(3维),体现了从低维感知到高维操控的非线性映射需求。数据集的元信息结构完整,涵盖帧索引、时间戳、任务标签等,支持灵活的片段划分与任务条件训练。此外,数据集采用Apache-2.0开源协议,可自由用于学术研究与商业应用。
使用方法
使用LeRobot库可便捷加载该数据集,通过指定配置名称'default'和数据集路径,即可自动解析Parquet文件与视频文件。数据集预置了训练/验证划分,72个全部片段归入训练集,便于直接用于行为克隆或强化学习算法的初始训练。用户可按需提取'observation.image.*'作为视觉观测输入,结合'observation.state'与'action'构建模仿学习目标函数。可视化工具支持在线预览典型演示轨迹,辅助理解数据分布与任务特性。
背景与挑战
背景概述
该数据集由radoolonto等人于2023年创建,基于LeRobot框架采集,旨在为机器人操作任务提供高质量的视觉-动作训练数据。数据集专注于工业插销插入(angle peg insertion)这一精密装配任务,通过Franka机械臂和立体相机系统(cam0、cam1、cam2)记录多视角图像与状态动作信息。作为机器人学习领域的重要资源,该数据集以72个演示回合、约4.4万帧图像和15Hz采样频率,为模仿学习与强化学习算法提供了标准化的基准测试平台,推动了精细操作技能从仿真到真实环境的迁移研究。
当前挑战
当前数据集面临的首要挑战是解决精密装配任务中视觉感知与运动控制的耦合难题,即如何从高维立体图像中提取鲁棒的几何特征以引导微米级插销对准动作。构建过程中,多相机标定误差和机械臂运动噪声会累积为数据偏差,需设计精确的时空同步方案。此外,仅72个演示样本的规模限制了策略的泛化能力,尤其在处理未见过插销姿态或光照变化时表现脆弱。数据集还面临非结构化信息(如背景干扰、反射光斑)对特征提取的干扰,以及高自由度(10维动作空间)与低观测维度(3维状态)之间的表征鸿沟,这些共同构成了从演示数据到可靠机器人技能习得的核心障碍。
常用场景
经典使用场景
在机器人操作与灵巧抓取研究领域,angle_peg_stereo_05_27_cam_ref数据集为模仿学习与强化学习算法提供了标准化的训练与评估基准。该数据集通过Franka机器人平台,采集了72个回合、共计44185帧的高频观测数据,涵盖三视角立体图像(cam0、cam1、cam2)与机器人关节状态信息,并配以10维动作空间的高精度标注。其经典使用场景聚焦于基于视觉的精细操作任务——如插销入孔(peg-in-hole),研究者可借助此数据训练端到端的视觉运动策略,探索多模态感知融合与闭环控制策略的泛化能力,成为验证模仿学习算法在精密装配任务上性能的重要基石。
实际应用
在实际工业与家庭服务场景中,该数据集衍生的技术成果展现出广阔的应用前景。在智能制造领域,基于该数据训练的策略可直接迁移至电子元器件的自动装配产线,实现高精度的插件与对准操作,显著降低对人工示教与离线编程的依赖。在协作机器人领域,数据集所蕴含的视觉-运动映射关系,为开发具备柔顺控制能力的护理机器人或家用助手提供了蓝图,例如辅助完成插接电线、组装乐高积木等日常生活任务。此外,数据集格式与LeRobot生态的无缝集成,使其成为快速部署机器人学习系统的理想起点,加速了从实验室算法到实际机器人应用的转化进程。
衍生相关工作
基于angle_peg_stereo_05_27_cam_ref数据集,学术界已衍生出多项具有影响力的经典工作。在策略学习层面,研究者提出了融合Transformer架构的视觉运动策略(如ACT与 Diffusion Policy),利用数据集的三视角图像与状态信息实现了零样本迁移下的高成功率插销任务。在表示学习方向,该数据被用于训练跨场景的视觉编码器(如R3M与VIP),显著提升了策略在面对光照、背景变化时的鲁棒性。此外,数据集启发了“静默数据增强”技术与仿真到现实的域适应方法,成为评估最新模仿学习算法在真实硬件上性能的标杆测试床,持续推动着机器人学习领域的前沿发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务