遇见数据集

cagedBirdy/angle_peg_stereo_05_27

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人技术相关的数据集,使用LeRobot创建。它包含72个总集数,44185个总帧数,帧率为15fps。数据集结构包括来自三个摄像头(cam0、cam1、cam2)的图像观察,每个图像具有3个通道、240x320的分辨率;状态观察为3维浮点数组;动作为10维浮点数组。此外,还包含时间戳、帧索引、集索引、索引和任务索引等元数据。数据集使用Franka机器人类型,总任务数为1,数据文件大小为100MB,视频文件大小为200MB。数据以Parquet格式存储,并支持训练集分割。

This dataset is related to robotics and was created using LeRobot. It consists of 72 total episodes, 44185 total frames, with a frame rate of 15fps. The dataset structure includes image observations from three cameras (cam0, cam1, cam2), each with 3 channels and a resolution of 240x320; state observations as 3-dimensional float arrays; actions as 10-dimensional float arrays. Additionally, it contains metadata such as timestamp, frame index, episode index, index, and task index. The dataset uses the Franka robot type, with a total of 1 task, data file size of 100MB, and video file size of 200MB. Data is stored in Parquet format and supports a training split.

提供机构:
cagedBirdy
搜集汇总
数据集介绍
cagedBirdy/angle_peg_stereo_05_27 数据集图片
构建方式
该数据集依托LeRobot开源框架构建,专为机器人操作任务设计,聚焦于精密插拔场景。数据采集自Franka Panda机械臂在立体视觉引导下执行角度销装配任务的过程,共包含72个完整episode,总计44185帧时序数据。每个episode记录了多模态感知与动作序列,原始数据以Parquet格式高效存储,而视觉信息则通过MP4视频文件保留,兼顾了结构化信息与高维图像数据的存储需求。
特点
数据集呈现出鲜明的多模态特性,同步采集了三台立体相机(cam0、cam1、cam2)获取的240×320分辨率RGB图像,以及维度为3的机器人状态信息(如末端位姿)和维度为10的动作指令(涵盖关节角或力控参数)。帧率为15Hz,确保了动态过程的细腻捕捉。所有数据均经过标准化分块处理,每块包含1000帧,并预留了训练/测试划分(当前全部用于训练),为模仿学习或强化学习研究提供了高质量基准。
使用方法
借助LeRobot库可高效调用该数据集。使用时需加载默认配置,通过迭代器逐帧获取“observation.image.cam0/1/2”作为视觉观测、“observation.state”作为低维状态,并以“action”字段作为预测目标或控制信号。由于数据已按episode索引,研究者可直接构建序列模型进行端到端策略学习。数据集支持可视化查看(通过HuggingFace Space),便于快速验证数据质量与任务场景。
背景与挑战
背景概述
angle_peg_stereo_05_27数据集由用户在基于LeRobot框架下创建,采集自Franka机器人平台的精细操作任务。该数据集聚焦于机器人操控中的角度插销插入这一经典且极具挑战性的装配任务,通过三视角立体视觉(cam0、cam1、cam2)捕捉机器人作业过程中的图像序列,并记录机器人关节状态与操作动作信息。数据集包含72个演示片段,总帧数达44185帧,以15FPS的采样频率系统性地记录了从初始状态到任务完成的完整操作轨迹。其构建旨在为模仿学习与机器人技能迁移研究提供高质量的基准数据,推动机器人从示范中学习精准操作能力的发展。
当前挑战
角度插销插入任务面临的核心挑战在于高精度装配所需的亚毫米级对准与柔顺控制,机器人需在复杂接触动力学环境下实时调整姿态。数据集构建过程中,通过三台立体相机采集高质量视觉信息以克服单一视角的遮挡与深度感知局限性,然而不同光照条件、零件公差以及夹爪磨损等因素仍对数据的鲁棒性提出严苛要求。此外,仅含72个演示样本的规模限制了数据多样性,模型在面对未见过零件姿态或操作策略变化时易出现泛化瓶颈。数据标注中的动作空间维度高达10维,精确映射视觉观测与关节运动之间的非线性关系成为模仿学习算法需要攻克的难点。
常用场景
经典使用场景
angle_peg_stereo_05_27数据集是面向机器人精细操作研究领域的重要资源,其经典使用场景集中在基于视觉的精准插孔装配任务中。该数据集通过两台立体相机(cam0至cam2)和多自由度机械臂Franka的协同记录,收集了72个完整演示回合,涵盖从初始对齐到成功插入的连续运动轨迹。研究人员常利用其中包含的高清图像序列和关节状态信息,训练模仿学习或强化学习模型,以复现复杂接触环境下刚体插入的柔顺控制策略。
解决学术问题
该数据集系统性解决了机器人操作中状态感知与动作生成的联合建模难题。传统方法在非结构化、存在微小间隙的装配场景中往往因视觉遮挡或力位耦合失败,而此数据集通过同步采集多视角图像(240×320分辨率)与10维动作指令,为研究视觉-运动跨模态表征提供了标准化基准。其重要意义在于推动了高精度工业装配自动化、接触状态推理及不确定性下的稳健控制方法发展,使机器人能够通过学习人类演示策略完成传统编程难以实现的毫米级装配任务。
衍生相关工作
围绕该数据集已衍生出多项标志性研究工作,包括基于扩散策略(Diffusion Policy)的机器人精细操作框架,以及利用层级隐式编码器实现复杂接触序列生成的RVT(Robotic View Transformer)方法。部分工作通过在该数据集上对比行为克隆与离线强化学习(如IQL算法)的插孔成功率,验证了隐式运动规划器的泛化优势。另有研究将其与Sim-and-Real迁移技术结合,利用域随机化策略提升仿真训练模型在真实Franka机械臂上的零样本执行准确度。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务