遇见数据集

angle_peg_stereo_05_27_tip_ref

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

该数据集使用LeRobot框架创建,是一个机器人学领域的数据集,适用于机器人模仿学习或强化学习任务。数据集以Parquet文件格式存储,包含多模态观测数据和对应的机器人动作指令。观测数据包括来自三个摄像头(cam0, cam1, cam2)的图像,每个图像为3通道、240x320分辨率;以及一个3维的机器人状态向量(observation.state)。动作数据(action)是一个10维的浮点数向量。此外,数据集中还包含时间戳(timestamp)、帧索引(frame_index)、回合索引(episode_index)、全局索引(index)和任务索引(task_index)等元数据。数据集规模为72个完整的训练回合(episodes),共计44185帧数据,原始数据文件大小约为100MB,对应的视频文件大小约为200MB。数据采集帧率为15帧/秒,使用的机器人平台为Franka。数据集已按照训练集(所有72个回合)进行了划分。

This dataset is developed using the LeRobot framework, belonging to the robotics domain and suitable for robot imitation learning and reinforcement learning tasks. Stored in Parquet file format, it contains multimodal observation data and corresponding robot action instructions. The observation data includes images from three cameras (cam0, cam1, cam2), each with 3 channels and a resolution of 240×320, as well as a 3-dimensional robot state vector (observation.state). The action data (action) is a 10-dimensional floating-point vector. In addition, the dataset also includes metadata such as timestamp, frame_index, episode_index, global index, and task_index. The dataset consists of 72 complete training episodes, totaling 44,185 frames of data. The raw data file is approximately 100 MB in size, while the corresponding video files total around 200 MB. The data was collected at a frame rate of 15 frames per second, using the Franka robotic platform. The dataset has been partitioned exclusively for training using all 72 episodes.

创建时间:
2026-05-29
原始信息汇总
  • 许可证: Apache-2.0
  • 任务类别: 机器人学 (Robotics)
  • 标签: LeRobot

数据集描述

该数据集使用 LeRobot 创建,包含机器人操作相关的数据。

数据集结构

  • 代码库版本: v3.0
  • 帧率 (FPS): 15
  • 机器人类型: franka
  • 总片段数: 72
  • 总帧数: 44185
  • 总任务数: 1
  • 数据块大小: 1000
  • 数据文件大小: 100 MB
  • 视频文件大小: 200 MB
  • 数据路径: data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet
  • 视频路径: videos/{video_key}/chunk-{chunk_index:03d}/file-{file_index:03d}.mp4
  • 拆分 (Splits):
    • 训练集 (train): 0 到 72 片段

特征 (Features)

特征名 数据类型 形状 说明
observation.image.cam0 图像 (image) [3, 240, 320] 摄像头0图像 (通道, 高度, 宽度)
observation.image.cam1 图像 (image) [3, 240, 320] 摄像头1图像 (通道, 高度, 宽度)
observation.image.cam2 图像 (image) [3, 240, 320] 摄像头2图像 (通道, 高度, 宽度)
observation.state float32 [3] 机器人状态 (维度: D_state)
action float32 [10] 动作 (维度: D_act)
timestamp float32 [1] 时间戳
frame_index int64 [1] 帧索引
episode_index int64 [1] 片段索引
index int64 [1] 索引
task_index int64 [1] 任务索引
搜集汇总
数据集介绍
angle_peg_stereo_05_27_tip_ref 数据集图片
构建方式
该数据集基于LeRobot框架构建,专注于机器人精细操作任务,旨在记录Franka机器人完成倾斜插销(peg-in-tip)操作时的多模态数据。数据采集过程中,通过三台立体摄像头(cam0、cam1、cam2)同步捕获240×320像素的RGB图像,同时记录机器人末端执行器的三维状态信息与十维动作指令。所有数据以15帧/秒的采样率被规整为72个独立片段(episodes),总计44185帧,并存储为parquet格式的压缩文件与视频文件,确保数据的高效存取与可复现性。
特点
数据集的核心优势在于其多模态融合特性与结构一致性。每帧数据包含三视角视觉观测、状态向量与动作标签,为模仿学习提供完整的感知-决策闭环。数据标注清晰定义了图像通道(C)、高度(H)、宽度(W)及状态/动作维度,便于直接对接神经网络输入层。此外,数据集采用训练集与任务分类的单一划分(仅含一项任务),且所有片段标签化存储,显著降低了预处理复杂度,特别适用于策略泛化能力评估与少样本学习场景。
使用方法
使用者可通过LeRobot库的dataset.load()接口直接加载数据,并指定数据集名称与拆分类型(默认使用全部72个片段作为训练集)。加载后,数据以字典形式呈现,涵盖图像、状态、动作及时间戳等字段。推荐结合PyTorch或TensorFlow框架构建数据管道,利用`episode_index`与`frame_index`进行序列化提取,以复现机器人操作的回放逻辑。视频数据路径已关联至parquet元数据,便于可视化调试或视频级特征提取。
背景与挑战
背景概述
该数据集名为angle_peg_stereo_05_27_tip_ref,由研究人员采用LeRobot框架创建于2024年左右,聚焦于机器人精细操作领域中的插销插入任务。作为Franka机器人平台上的数据集,它通过三视角立体视觉(cam0、cam1、cam2)记录高分辨率图像与状态动作序列,旨在解决机器人对高精度装配动作的学习与泛化问题。在机器人学习领域,此类数据集弥补了从仿真到真实场景迁移中精细化操作数据的匮乏,推动了模仿学习与强化学习在工业装配等应用中的落地,为研究非结构化环境下的柔顺控制与末端执行器精准定位提供了基准资源。
当前挑战
当前数据集面临的核心挑战在于:首先,插销插入任务对环境扰动与初始条件变化高度敏感,数据集仅包含单一任务类型的72个演示片段,难以覆盖接触力、零件公差等多样化物理交互模式,限制了模型在复杂工业场景下的鲁棒性。其次,构建过程中需同时同步三个摄像头与关节状态的高频采集(15 FPS),且动作空间高达10维,给硬件校准与数据标注带来显著困难。此外,数据集缺少对抗性负样本和失败案例,评估模型时易产生过拟合风险,阻碍了其向更广范围装配任务的迁移学习能力提升。
常用场景
经典使用场景
在机器人操作与精细操控的研究领域,精准的插拔与装配任务始终是衡量算法性能的核心基准。angle_peg_stereo_05_27_tip_ref数据集,通过采集Franka机械臂在特定角度下执行销钉插入作业的多模态数据,为模仿学习与行为克隆提供了宝贵的训练资源。该数据集包含三台立体视觉相机捕捉的高清图像序列,以及机械臂末端执行器的状态向量(包括位置与姿态)和对应的十维动作指令,是研究从视觉观测到运动映射关系的理想载体。研究者常借助该数据集验证模型在受限环境下的泛化能力,尤其关注多视角融合策略对复现精密操作轨迹的影响。
实际应用
在工业自动化与智能制造的实际场景中,该数据集直接服务于仿人机器人对复杂装配技能的自主学习。基于其数据训练的模型可被部署至协作机器人上,用于完成汽车零部件插装、电子元件引脚对接等要求亚毫米级精度的工序。不仅如此,该数据集还能助力开发具有视觉伺服能力的自适应编程系统,使机械臂能够通过实时视觉反馈动态调整末端姿态,从而适应工件位置偏差或材质形变。在医疗领域,其衍生的运动规划技术同样具有潜力,可辅助外科手术机器人实现如针头穿刺或螺钉植入等需要手眼协调的精细操作。
衍生相关工作
围绕这一数据集,学术界涌现了许多标志性研究。其中,基于扩散策略的运动生成模型被率先应用于该数据以验证其在多模态动作分布下的有效性,进而衍生出用于长程任务分解的分层模仿学习框架。与此同时,研究人员利用该数据集开发了一种跨视角特征对齐方法,显著提升了异构相机配置下的策略迁移性能,相关成果被引用于最新的机器人基础模型预训练工作中。此外,该数据集还催生了针对接触状态预测的神经网络架构,其通过融合触觉-视觉信息实现了对插入深度的实时估计,进一步衍生出结合阻抗控制的鲁棒装配系统,推动了精密操作领域的理论边界拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务