遇见数据集

ankile/real01c-insert-marker-d1-blind-dagger-r2-baseline-uniform-ours-iql-protocol

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个机器人数据集,使用LeRobot工具创建,包含来自Franka机器人的数据。数据集共有116个episodes,36234帧,帧率为15fps。数据特征包括状态观测(如笛卡尔位置、关节位置、速度、夹爪位置)、动作(如笛卡尔速度、位置、关节速度、位置、夹爪动作)、奖励、完成标志、干预标志、成功标志等,并包含两个摄像头的视频数据(分辨率480x640,3通道,H.264编码)。数据集主要用于机器人任务的学习和评估。

This dataset is a robotics dataset created using the LeRobot tool, containing data from a Franka robot. It consists of 116 episodes, 36234 frames, with a frame rate of 15fps. Features include state observations (e.g., Cartesian position, joint position, velocity, gripper position), actions (e.g., Cartesian velocity, position, joint velocity, position, gripper action), reward, done flag, intervention flag, success flag, etc., and video data from two cameras (resolution 480x640, 3 channels, H.264 codec). The dataset is primarily used for robotics task learning and evaluation.

提供机构:
ankile
搜集汇总
数据集介绍
ankile/real01c-insert-marker-d1-blind-dagger-r2-baseline-uniform-ours-iql-protocol 数据集图片
构建方式
该数据集基于LeRobot框架构建,旨在为机器人学习领域提供精细化的操作数据。数据采集环境依托Franka机器人平台,专注于单一操作任务,共计收集116个完整回合(episodes),总帧数达36234帧,以15帧/秒的采样频率进行录制。数据以Parquet格式存储结构化信息,并同步保存高清视频流(H.264编码,480×640分辨率),从而保留视觉与状态信息的同步性。数据集按1000帧为单元进行分块(chunks)管理,便于大规模加载与分布式处理。训练集涵盖全部116个回合,未设置验证集或测试集划分,适用于基于模仿学习或离线强化学习的场景。
特点
该数据集最显著的特点在于其多维度的精细标注体系。除基础的机器人状态与动作信息外,还包含7维笛卡尔位姿与关节状态观测、7维速度与夹爪动作指令,以及关键的操作信号如干预标志(intervention)、任务完成标志(success)和有效性标志(is_valid),支持对数据质量的严格筛选。此外,数据集记录了笔类工具的2D位置与偏航角(pen_x, pen_y, pen_yaw),并细分了多种动作表征(笛卡尔速度/位置、关节速度/位置、夹爪速度/位置),为多模态策略学习提供了丰富的输入空间。两个视角的RGB视频流进一步增强了场景感知能力。
使用方法
该数据集适用于LeRobot生态内的策略训练与评估流程。用户可通过LeRobot库的API直接加载Parquet数据文件与对应视频,兼容模仿学习(如行为克隆)和离线强化学习(如IQL)算法。由于数据特征字段丰富,研究者可灵活选择观测空间(例如仅使用关节状态或融合视觉与状态信息)和动作空间(如笛卡尔速度或关节位置)。建议在训练前利用‘is_valid’与‘success’标志过滤异常片段,并考虑通过‘intervention’字段分析人机交互质量。数据分块结构便于按需流式读取,适用于大规模或持续学习的场景。
背景与挑战
背景概述
在机器人操作领域,模仿学习与强化学习的融合正成为推动技能习得的关键范式。该数据集由LeRobot社区基于Franka机器人平台构建,聚焦于盲眼匕首插入这一精细操作任务。数据集创建于2024年前后,包含116个演示片段、总计36234帧,以15帧每秒的采样率记录,并提供了7维末端执行器状态与动作、多模态视觉输入(双640×480摄像头)以及干预标志、成功标志等关键信息。其核心研究问题在于:如何在有限演示下,利用离线强化学习(如IQL)与行为克隆基线实现高精度、鲁棒的插拔操作泛化。该数据集为机器人技能迁移与样本效率研究提供了标准化的测试基准,尤其针对欠观测场景下的操作瓶颈,推动了面向精密装配任务的算法评估体系发展。
当前挑战
该数据集所解决的领域核心挑战在于,精密操作任务(如匕首插入)常面临高精度位姿控制、接触力感知缺失以及从人类演示中提取鲁棒策略的困难。具体而言,盲眼设定下机器人仅依赖前置与全局视觉输入,缺乏触觉反馈,导致对轴孔对齐误差的容忍度极低。构建过程中,数据采集需解决三个关键问题:首先,人类遥操作演示的一致性与灵巧度差异显著影响数据质量,需借助干预标志(intervention flag)筛选有效片段;其次,多模态数据同步(15Hz视频流与1kHz状态流对齐)与高帧率运动记录存在技术挑战;最后,任务成功评判标准(success flag)的自动化标注需设计可靠阈值,以避免主观偏差对策略学习的干扰。
常用场景
经典使用场景
在机器人学习与模仿学习领域,real01c-insert-marker-d1-blind-dagger-r2-baseline-uniform-ours-iql-protocol 数据集为基于Franka机械臂的精密插装任务提供了标准化训练与评估基准。该数据集包含116个演示片段,共计36234帧多模态数据,融合了7维关节状态、7维动作指令、双目视觉观测(640×480像素)及任务完成标志(success_flag)等丰富特征。研究者常利用其精细的动作空间设计(涵盖笛卡尔速度/位置、关节速度/位置、夹爪控制)来训练策略网络,通过端到端模仿学习实现高精度插针操作,尤其适用于验证隐式Q学习(IQL)等离线强化学习算法在高维连续控制场景下的有效性。
实际应用
在实际工业场景中,该数据集训练的策略可直接部署于装配线上的高精度部件插装环节,例如电子元件引脚对准或微型轴承压入等需亚毫米级精度的任务。利用其双目视觉输入与笛卡尔速度控制输出,实现了对夹具姿态的实时视觉伺服调节,有效应对零件公差与表面反光等干扰因素。此外,数据集中的'pen_x/pen_y/pen_yaw'等专用特征标示了目标零件的精确位姿,使得基于该数据集的模型能够迁移至不同生产线上的相似插装任务,大幅减少传统手工示教所需的时间和专业工程师介入成本,在柔性制造与无人化工厂建设中展现出重要价值。
衍生相关工作
围绕该数据集涌现了一系列标志性研究工作。一方面,以Implicit Q-Learning (IQL) 为代表的离线强化学习方法在此得到深度验证,衍生出结合数据增强的IQL变体(如DrQ-IQL),显著提升了策略在有限演示样本下的抗干扰能力。另一方面,基于Transformer架构的行为克隆模型(如Decision Transformer适配版)被用于捕获长时序任务依赖,推动了机器人操作中序列决策建模的进展。同时,该数据集催生了关于'盲操作'(即不依赖视觉反馈)与'视觉引导'策略的对比分析框架,为理解机器人操作中多模态融合的鲁棒性提供了关键实验平台,并启发了后续针对非结构化环境中精细操作难题的跨具身本体迁移研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务