遇见数据集

MetaFine_CoRL26

收藏
Hugging Face2026-08-24 更新2026-08-25 收录
官方服务:

资源简介:

该数据集是 CoRL demos 数据集,用于 MetaFine π0 基线模型的训练与评估,涵盖五个机器人操作任务(T1–T5)。每个任务包含多种变体,并具有统一的观测与控制空间。数据集包含 RGB 图像(来自 base 和 hand 摄像头,分辨率 512×512,视野约 70° 或 57°)以及 9 自由度关节位置增量控制信号(pd_joint_delta_pos),以 30 FPS 采集。具体任务如下:T1 grasp_part(抓取部件,200 个混合片段,30,670 帧,变体 cap/body/mixed);T2 grasp_move_mug(抓取并移动杯子,300 个混合片段,39,395 帧,变体 left/right/forward/mixed);T3 toggle_switch_table(切换开关,200 个混合片段,20,567 帧,变体 red/blue/mixed);T4 put_blocks_into_boxes(将方块放入盒子,300 个混合片段,156,151 帧,变体 red/blue/green/mixed);T5 insert_letter(插入字母,400 个混合片段,115,894 帧,变体 C/o/R/L/mixed)。每个变体的片段数均为 100(混合任务合并了所有变体)。数据以 LeRobot 格式组织,包含运动规划源轨迹(.h5/.json)、RGB 回放文件(.rgb.pd_joint_delta_pos.physx_cpu.h5/.json)以及 HuggingFace LeRobot 数据集目录(meta/、data/、videos/)。部分任务(T4、T5)还包含可选的 ManiSkill 原始片段转储。该数据集适用于机器人操作领域的模仿学习、行为克隆等任务。

This dataset is the CoRL demos dataset for training and evaluating the MetaFine π0 baseline model, covering five robot manipulation tasks (T1–T5). Each task includes multiple variants and has a unified observation and control space. The dataset contains RGB images (from base and hand cameras, resolution 512×512, field of view approximately 70° or 57°) and 9-DoF joint position delta control signals (pd_joint_delta_pos), collected at 30 FPS. The specific tasks are: T1 grasp_part (200 mixed episodes, 30,670 frames, variants cap/body/mixed); T2 grasp_move_mug (300 mixed episodes, 39,395 frames, variants left/right/forward/mixed); T3 toggle_switch_table (200 mixed episodes, 20,567 frames, variants red/blue/mixed); T4 put_blocks_into_boxes (300 mixed episodes, 156,151 frames, variants red/blue/green/mixed); T5 insert_letter (400 mixed episodes, 115,894 frames, variants C/o/R/L/mixed). Each variant has 100 episodes (mixed tasks combine all variants). Data is organized in LeRobot format, including motion planning source trajectories (.h5/.json), RGB replay files (.rgb.pd_joint_delta_pos.physx_cpu.h5/.json), and HuggingFace LeRobot dataset directories (meta/, data/, videos/). Some tasks (T4, T5) also include optional ManiSkill raw episode dumps. This dataset is suitable for imitation learning, behavior cloning, and other tasks in robot manipulation.

创建时间:
2026-08-24
原始信息汇总

数据集概述:MetaFine_CoRL26

该数据集是 MetaFine π0 基线模型(任务 T1–T5)的训练数据,用于机器人操作学习。

任务与数据规模

任务 变体 混合片段数 混合帧数 相机 状态维度 帧率 控制/观测
T1 grasp_part cap / body / mixed 200 30,670 base + hand, 512×512, FOV ≈ 70° 9-DoF 30 pd_joint_delta_pos / rgb
T2 grasp_move_mug left / right / forward / mixed 300 39,395 base + hand, 512×512, FOV ≈ 70° 9-DoF 30 pd_joint_delta_pos / rgb
T3 toggle_switch_table red / blue / mixed 200 20,567 base + hand, 512×512, FOV ≈ 70° 9-DoF 30 pd_joint_delta_pos / rgb
T4 put_blocks_into_boxes red / blue / green / mixed 300 156,151 base + hand, 512×512, FOV ≈ 57° 9-DoF 30 pd_joint_delta_pos / rgb
T5 insert_letter C / o / R / L / mixed 400 115,894 base + hand, 512×512, FOV ≈ 70° 9-DoF 30 pd_joint_delta_pos / rgb

每个变体的片段数均为 100(T5 的每个字母变体亦为 100),混合变体为各变体的合并集。

对应训练检查点

LeRobot 数据集 训练检查点
grasp_part/mixed/lerobot outputs/pi0_grasp_mixed_f70/checkpoints/030000/pretrained_model
grasp_move_mug/mixed/lerobot outputs/pi0_grasp_move_mug_mixed/checkpoints/030000/pretrained_model
toggle_switch_table/mixed/lerobot outputs/pi0_toggle_mixed/checkpoints/030000/pretrained_model
put_blocks_into_boxes/mixed/lerobot outputs/pi0_put_blocks_mixed/checkpoints/030000/pretrained_model
insert_letter/mixed/lerobot outputs/pi0_insert_letter_mixed/checkpoints/030000/pretrained_model

目录结构

demos/CoRL/ grasp_part/ # 见 grasp_part/README.md grasp_move_mug/ # 见 grasp_move_mug/README.md (T2) toggle_switch_table/ # 见 toggle_switch_table/README.md (T3) put_blocks_into_boxes/ # 见 put_blocks_into_boxes/README.md (T4) insert_letter/ # 见 insert_letter/README.md (T5) lerobot/ # 旧符号链接 grasp_part_cap_n100_f70 → ../grasp_part/cap/lerobot grasp_part_body_n100_f70 → ../grasp_part/body/lerobot grasp_part_mixed_n200_f70 → ../grasp_part/mixed/lerobot

每个变体文件夹通常包含:

  • *.h5 / *.json — 运动规划源轨迹
  • *.rgb.pd_joint_delta_pos.physx_cpu.h5 (+ .json) — 用于 LeRobot 转换的 RGB 回放
  • lerobot/ — HuggingFace LeRobot 数据集(meta/data/videos/
  • raw/(T4 / T5)— 可选的 ManiSkill 原始片段导出

评估传感器配置与 RGB 回放元数据一致,见 eval/configs/*.yaml

搜集汇总
数据集介绍
MetaFine_CoRL26 数据集图片
构建方式
MetaFine_CoRL26数据集是为MetaFine π0基线模型精心构建的训练数据集合,涵盖T1至T5五项精细操作任务。构建过程通过运动规划生成源轨迹,利用PhysX引擎进行RGB重放,并转换为LeRobot标准格式。每项任务依据物体或环境差异划分变体,如T1区分'cap'与'body',T2区分'left'、'right'与'forward',各变体均采集100个episode,最终合并为混合集,确保数据多样性与平衡性。传感器配置采用base与hand双摄像头,分辨率512×512,视场角约70°(T4为57°),以30FPS记录9自由度状态与控制信号,形成高保真演示数据。
特点
该数据集具备显著的结构化与任务导向性。每个任务目录下包含原始运动规划轨迹、RGB重放数据及LeRobot格式的标准化数据集,便于直接用于模仿学习。数据集规模适中,T1至T5分别包含200至400个episode,混合集总帧数从20,000至156,000不等,覆盖了抓取、移动、开关操作、物体放置及字母插入等多样化操作场景。通过变体划分,数据集支持细粒度任务条件设置,且提供预训练checkpoint映射,与π0基线训练流程无缝对接。此外,T4/T5包含原始ManiSkill数据转储,为深入分析提供原始素材。
使用方法
使用时,研究者可直接加载各任务的'lerobot'目录下的HuggingFace格式数据集,利用LeRobot库进行数据读取与预处理。每个混合集(如'grasp_part/mixed/lerobot')对应特定训练checkpoint,用户可参照映射表获取预训练模型,实现快速复现或迁移学习。数据集支持控制信号'pd_joint_delta_pos'与观测'rgb',适合训练视觉-运动策略。评估阶段,需参照eval/configs中的YAML配置,确保传感器参数与RGB重放元数据一致,从而保证仿真与实机评估的可靠性。
背景与挑战
背景概述
MetaFine_CoRL26数据集由研究团队于2025年创建,旨在为机器人操作提供高保真度的训练数据。该数据集包含五项核心任务(T1至T5),涵盖抓取、移动、开关操作、物体分拣及字母插入等多样化操作场景,共计1400个混合轨迹片段,并配置了双目视觉(512x512分辨率)与九自由度状态信息。其构建基于ManiSkill物理仿真平台,采用运动规划与物理引擎回放技术生成数据,为π0等视觉-语言-动作模型提供了规模化训练基础。该数据集的出现填补了机器人精细化操作中数据稀缺的空白,推动了从仿真到现实迁移研究的发展,在机器人学习领域具有显著影响力。
当前挑战
该数据集所面临的挑战主要源于机器人操作领域的固有难题:其一,操作任务的多样性与复杂性要求模型具备泛化能力,如T4任务中块放入盒子的空间推理及T5任务中的精细插入动作,这对捕捉细微接触动力学提出了极高要求;其二,数据构建过程中,虽采用运动规划与物理仿真回放,但如何确保仿真与现实之间的域差异最小化,以及如何高效管理不同变体(如颜色、方向)下的数据平衡,成为克服数据偏差与提升鲁棒性的关键难题。此外,多视角融合与状态估计的精度,以及大规模数据存储与处理的效率,也是该数据集在实际应用中亟需解决的挑战。
常用场景
经典使用场景
MetaFine_CoRL26数据集是面向具身智能与机器人操作任务的高质量示范数据集,源自CoRL 2026会议的相关工作,涵盖了五种典型的精细操作任务:抓取部件、抓取移动杯子、拨动开关、将积木放入盒子以及插入字母。每个任务均包含多个变体,并提供了混合的示范数据,总计1400个成功演示片段以及超过36万帧的视觉观测。数据以RGB图像和9自由度关节位置增量控制指令的形式呈现,采样频率为30帧每秒,确保了数据在时间分辨率和动作控制维度上的丰富性。该数据集最初用于训练MetaFine π0基线模型,为模仿学习和机器人操作策略的预训练提供了标准化、规模化的基准数据,是研究精细操作技能迁移和多任务学习的理想资源。
衍生相关工作
围绕MetaFine_CoRL26数据集,衍生了一系列富有影响力的研究工作。最直接的成果是MetaFine π0模型,它利用该数据集的混合示范进行训练,验证了大规模多任务示范在提升策略泛化能力上的有效性。随后,研究者基于此数据集探索了多种算法改进,包括引入视觉语言模型进行任务理解、开发新的数据增强策略以应对变体多样性,以及设计层次化强化学习框架来分解复杂操作。此外,该数据集也被用作评估迁移学习方法的基准,推动了域随机化和元学习技术在机器人操作中的应用。在表征学习方面,该数据集促进了从RGB图像到动作映射的隐式空间学习研究,部分工作进一步将其与点云或触觉传感数据融合,拓展了多模态感知在精细操作中的边界,逐步构建起以数据为中心的机器人学习研究生态。
数据集最近研究
最新研究方向
MetaFine_CoRL26数据集作为机器人学习领域的前沿资源,聚焦于多任务操作技能的获取与泛化,其核心研究指向利用大规模多模态演示数据训练通用操作模型。该数据集涵盖抓取、移动、开关、堆叠与插入等精细任务,配备高分辨率双目视觉与9自由度状态信息,为模仿学习和强化学习提供丰富基准。当前研究热点围绕视觉-语言-动作模型的预训练与微调,尤其强调跨任务数据混合策略对策略泛化能力的提升。该数据集与π0基线紧密关联,推动了端到端可变形操作策略的发展,对具身智能、少样本适应及物理仿真到真实迁移等方向具有重要影响,为构建可扩展的机器人学习范式奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务