遇见数据集

RLinf/rlt-maniskill-PegInsertionSide-v1-400-succ

收藏
Hugging Face2026-06-17 更新2026-06-21 收录
官方服务:

资源简介:

rlt_maniskill_joint是一个LeRobot风格的数据集,用于在ManiSkill插孔插入任务上进行关节控制机器人学习令牌(RLT)训练。它专为RLinf + OpenPI的pi05_rlt_joint流水线设计,并用于三个阶段:1. OpenPI监督微调(SFT)基础策略训练;2. RLT第1阶段RL令牌训练;3. RLT第2阶段在线RL初始化和归一化。该数据集对应ManiSkill任务:环境为PegInsertionSideWideClearance-v1,控制模式为pd_joint_delta_pos,默认指令为insert the peg in the hole。此数据集旨在用于关节空间视觉语言动作训练,而非末端执行器动作预测。

`rlt_maniskill_joint` is a LeRobot-style dataset for joint-control Robot Learning Token (RLT) training on the ManiSkill peg insertion task. It is designed for the RLinf + OpenPI `pi05_rlt_joint` pipeline and is used in three stages: 1. OpenPI supervised fine-tuning (SFT) base policy training 2. RLT Stage 1 RL-token training 3. RLT Stage 2 online RL initialization and normalization The dataset corresponds to the ManiSkill task: - Environment: `PegInsertionSideWideClearance-v1` - Control mode: `pd_joint_delta_pos` - Default instruction: `insert the peg in the hole` This dataset is intended for joint-space vision-language-action training rather than end-effector action prediction.

提供机构:
RLinf
搜集汇总
数据集介绍
RLinf/rlt-maniskill-PegInsertionSide-v1-400-succ 数据集图片
构建方式
该数据集基于ManiSkill仿真环境中的PegInsertionSideWideClearance-v1任务构建,采用pd_joint_delta_pos控制模式,旨在为机器人学习令牌(RLT)联合控制训练提供标准化数据。数据集遵循LeRobot格式规范,由RLinf团队的pi05_rlt_joint数据配置管线生成,通过OpenPI监督微调、RLT第一阶段令牌训练及第二阶段在线强化学习初始化三个环节构建,确保了数据在仿真到真实迁移场景中的一致性和可复现性。
使用方法
使用时需将数据集接入RLinf的pi05_rlt_joint数据配置,默认训练动作步数为10步。图像数据在预处理中统一转换为HWC uint8格式,状态向量取前9个Panda机械臂关节位置值,动作指令按8维关节控制命令输入模型。该数据集适用于机器人操作任务的监督学习、预训练及后训练,尤其适合需要联合控制策略的场景,可配合OpenPI框架进行高效模型微调与评估。
背景与挑战
背景概述
在机器人操作领域,视觉-语言-动作联合建模已成为一项前沿研究方向,旨在使机器人能够理解自然语言指令并执行精细操作任务。RLT ManiSkill Joint数据集由RLinf与OpenPI团队于近年创建,专注于ManiSkill仿真环境中的轴孔插入任务(PegInsertionSideWideClearance-v1),采用关节空间增量位置控制模式(pd_joint_delta_pos),为机器人学习令牌(RLT)训练提供标准化数据。该数据集支持从监督微调到在线强化学习的多阶段训练流程,其LeRobot格式的设计促进了仿真与真实数据的对齐,显著推动了关节控制策略在精密装配任务中的泛化能力,对机器人学习社区具有重要影响力。
当前挑战
该数据集所解决的领域挑战主要源于轴孔插入任务的高精度需求,机器人需在关节空间内完成毫米级对齐与插入,对动作时序与状态感知提出严苛要求,传统端到端学习方法常因样本效率低下而难以收敛。数据构建过程中同样面临多重挑战:首先,仿真数据需精确匹配真实物理特性以避免Sim-to-Real差距;其次,动作表示采用10步时序动作块(action chunk),但模型实际仅消耗其中8维控制命令,这种维度不匹配要求数据处理流水线具备高度一致性;此外,双视角图像(主相机与腕部相机)需在不同分辨率与通道顺序格式间完成标准化预处理,增加了数据管线的复杂性。
常用场景
经典使用场景
在机器人学习领域,联合控制策略的训练长期受困于高维动作空间与稀疏奖励信号的矛盾。该数据集专为ManiSkill环境中的PegInsertionSideWideClearance-v1任务设计,采用pd_joint_delta_pos控制模式,提供了标准化的视觉-语言-动作三元组。其经典用途在于支持基于联合空间的监督学习:通过预录的专家演示数据,模型可从第三视角与腕部相机图像中联合感知场景状态,并将9维本体感知状态与8维关节增量动作序列(时间步长T=10)进行端到端的映射学习,从而习得精准的插销动作策略。
解决学术问题
在学术研究中,该数据集核心解决了两个长期存在的挑战:一是弥合仿真训练与真实部署之间的领域鸿沟,通过OpenPI数据管道提供了仿真到真实对齐的数据格式;二是为联合空间下的视觉-语言-动作联合建模提供了标准化基准。研究者得以系统性地探索强化学习中的token化表征方法,验证从监督微调(SFT)到在线强化学习两阶段训练范式的有效性。该数据集的意义在于揭示了联合动作空间与语言指令的语义对齐机制,推动了具身智能体在精密装配任务中从模仿学习向自主探索的范式转变,为后续研究建立了统一的评估标准。
实际应用
该数据集的实际应用场景紧密围绕工业精密装配领域。在电子元件插装、汽车零部件组装等自动化产线中,机器人需要根据自然语言指令(如“将销钉插入孔中”)完成高精度插入操作。数据集提供的联合控制格式可直接用于预训练通用机器人基础模型,再通过少量真实数据微调即可迁移至特定工位。在医疗领域,该范式也可应用于手术机器人器械的精准对接操作。此外,数据集设计的RLT两阶段训练流程(SFT预训练+在线强化学习)可直接复用于各类精细化操作任务,显著减少从零开始训练所需的物理交互数据量。
数据集最近研究
最新研究方向
该数据集聚焦于基于联合空间控制的视觉-语言-动作联合学习,是具身智能领域前沿研究的关键资源。当前,机器人操作任务正从传统的末端执行器控制向更精细的关节级策略演进,而rlt-maniskill-PegInsertionSide-v1-400-succ数据集恰好服务于这一趋势,通过提供包含第三视角与腕部RGB图像、9维关节状态及联合控制动作片段的标准化样本,为强化学习令牌(RLT)训练和开放物理智能(OpenPI)流水线提供了高质量训练基础。该数据集深度契合了模拟到现实对齐的迫切需求,支撑了从监督微调到在线强化学习的三阶段训练范式,其设计理念与近期大语言模型驱动的机器人策略学习热潮紧密相连,为在复杂精密任务(如轴孔装配)中实现零样本泛化和迁移学习铺平了道路。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务