遇见数据集

MiniCPM-RobotManip-LIBERO

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

MiniCPM-RobotManip LIBERO 数据集是专为机器人视觉-语言-动作任务设计的数据集,用于支持 MiniCPM-RobotManip 模型在 LIBERO 基准上的全参数微调。该数据集基于 LIBERO 基准的四个套件(LIBERO-10、LIBERO-Goal、LIBERO-Object、LIBERO-Spatial)构建,并转换为 LeRobot v3 格式。数据集中包含总计 1,636 个演示片段(episodes)、261,872 帧图像和 3,272 个视频,覆盖多种机器人操作场景。每个数据样本以 20 Hz 的频率采集,包含两个摄像头视角(agent view 和 wrist view)的视频流,分辨率为 256×256。动作目标采用绝对单臂 EE6D 表示(observation.xvla_abs_ee6d),是一个 10 维向量,其中前三维为 xyz 位置,中间六维为旋转表示(rotation6D),最后一维表示夹爪状态(0 为打开,1 为关闭)。数据集适用于机器人模仿学习、视觉-语言-动作对齐等任务,特别针对 starVLA 框架中的 MiniCPM-RobotManip 模型训练。数据经过过滤、转换和增强处理,保留了原始观测和动作字段,并包含元数据文件(meta/modality.json)以支持模型训练。数据集仅包含模拟演示数据,不涉及个人或人类主题数据,遵循 Apache 2.0 许可证发布。

提供机构:
OpenBMB
创建时间:
2026-07-28
原始信息汇总

数据集概述

数据集名称:MiniCPM-RobotManip LIBERO

数据集地址:https://huggingface.co/datasets/openbmb/MiniCPM-RobotManip-LIBERO

许可证:Apache-2.0

任务类别:机器人学(Robotics)

标签:LeRobot、LIBERO、机器人学、视觉-语言-动作、MiniCPM-RobotManip


数据集内容

该数据集包含四个LIBERO套件,已转换为LeRobot v3格式,用于MiniCPM-RobotManip LIBERO全参数微调示例(位于starVLA项目中)。

套件 片段数 帧数 视频数
LIBERO-10 358 95,740 716
LIBERO-Goal 405 48,131 810
LIBERO-Object 450 66,294 900
LIBERO-Spatial 423 51,707 846
总计 1,636 261,872 3,272
  • 格式:LeRobot v3
  • 频率:20 Hz
  • 摄像头:智能体视角(agent view)和腕部视角(wrist view)
  • 视频分辨率:256 × 256
  • 动作目标observation.xvla_abs_ee6d
  • 动作目标维度:10

EE6D目标

observation.xvla_abs_ee6d 包含绝对单臂目标:

  • [0:3]:xyz位置
  • [3:9]:旋转6D(rotation6D)
  • [9]:夹爪闭合状态(0 = 张开,1 = 闭合)

starVLA的MiniCPM-RobotManip配方使用当前行作为状态,偏移1–30帧作为动作块。它将此10维向量映射到MiniCPM-RobotManip统一80维状态/动作空间的左臂[7:17]槽位;其他通道在训练损失中被屏蔽。

每个套件包含meta/modality.json文件,其中包含starVLA预期的映射。


遗留辅助列

Parquet文件中保留了actino.xvla_abs_ee6d,这是原始转换流程中的遗留辅助字段。它被有意保留用于溯源,且不被已发布的starVLA配方使用。应使用observation.xvla_abs_ee6d作为状态和偏移动作目标。


下载

使用以下命令下载数据集:

bash hf download openbmb/MiniCPM-RobotManip-LIBERO --repo-type dataset --local-dir playground/Datasets/LIBERO_EE6D

预期的顶级目录结构:

text libero_10_agentview_rot180_wrist_raw_lerobot_v30_xvla_abs6d/ libero_goal_agentview_rot180_wrist_raw_lerobot_v30_xvla_abs6d/ libero_object_agentview_rot180_wrist_raw_lerobot_v30_xvla_abs6d/ libero_spatial_agentview_rot180_wrist_raw_lerobot_v30_xvla_abs6d/


使用starVLA训练

bash VLM_PATH=openbmb/MiniCPM-RobotManip LIBERO_EE6D_ROOT=playground/Datasets/LIBERO_EE6D bash examples/modelExtensions/MiniCPM-RobotManip/train_files/run_libero_train.sh

对应的公共基础检查点为:openbmb/MiniCPM-RobotManip


数据来源与处理

演示源自LIBERO基准测试。四个套件经过筛选、转换为20 Hz的LeRobot v3格式,并增加了与每个parquet行和视频帧对齐的绝对EE6D目标。保留了原始的观测和动作字段。

此版本仅包含仿真演示,不包含个人或人类受试者数据。


引用

使用该数据集时,请引用LIBERO和MiniCPM-Robot。

搜集汇总
数据集介绍
MiniCPM-RobotManip-LIBERO 数据集图片
构建方式
该数据集源自LIBERO基准测试套件,涵盖了LIBERO-10、LIBERO-Goal、LIBERO-Object与LIBERO-Spatial四个子集,共包含1,636个演示片段、261,872帧图像及3,272段视频。原始演示经筛选与转换,采用LeRobot v3格式,以20 Hz的频率进行重采样,并整合了代理视角与腕部视角的双摄像头配置,图像分辨率为256 × 256。进一步地,每个样本被赋予绝对EE6D目标,其中前三维代表末端执行器的空间位置,随后六维为旋转表示,最后一维指示夹爪的开合状态。该目标向量被嵌入MiniCPM-RobotManip统一80维状态/动作空间的左臂对应槽位,其余通道在训练过程中被掩蔽。
特点
该数据集的核心特点在于其结构化的多维动作表征与跨套件的统一兼容性。所有动作目标均采用`observation.xvla_abs_ee6d`字段存储,支持从当前状态到未来1至30帧的动作块预测。数据集保留了原始转换流程中的`actino.xvla_abs_ee6d`辅助字段,仅为追溯目的而存在,不参与主训练流程。此外,每个子集均包含`meta/modality.json`文件,明确描述了与starVLA框架相匹配的映射关系,使得数据集可直接用于全参数微调。所有数据为模拟演示,不含任何个人或人类受试者信息,并遵循Apache 2.0许可协议发布。
使用方法
使用者可通过Hugging Face的`hf download`命令一键下载数据集至指定目录,例如`playground/Datasets/LIBERO_EE6D`。下载后的目录结构包含四个独立子集文件夹,每个文件夹内存储了对应的parquet文件和视频数据。在starVLA框架中进行训练时,需设置环境变量`VLM_PATH`指向MiniCPM-RobotManip基础模型路径,并指定`LIBERO_EE6D_ROOT`为数据集根目录,随后执行提供的训练脚本即可启动全参数微调流程。该流程中,模型将以当前帧为状态输入,以偏移帧的EE6D目标为预测目标,利用掩蔽机制仅计算左臂对应通道的损失,从而实现高效精准的机器人操作策略学习。
背景与挑战
背景概述
MiniCPM-RobotManip-LIBERO数据集由OpenBMB团队于近年创建,旨在为机器人操作领域的视觉-语言-动作(VLA)模型提供标准化的训练与评估基准。该数据集基于经典的LIBERO基准套件,包含LIBERO-10、LIBERO-Goal、LIBERO-Object与LIBERO-Spatial四个子集,总计1636个演示片段、超过26万帧图像及3272段视频,覆盖多种机器人操作任务场景。通过将原始数据转换为LeRobot v3格式并统一为20 Hz采样频率、256×256分辨率的多视角视频(代理视角与腕部视角),该数据集为VLA模型的全参数微调提供了高质量、结构化的训练语料。其核心研究问题聚焦于如何利用大规模演示数据驱动机器人从语言指令中学习精细操作策略,推动终身学习与知识迁移在机器人操作领域的应用。作为MiniCPM-RobotManip项目的重要组成部分,该数据集在开源社区中具有广泛影响力,为后续VLA模型的性能评估与领域发展奠定了关键基础。
当前挑战
该数据集面临的核心挑战源于机器人操作领域固有的复杂性与数据构建的权衡。在领域问题层面,数据驱动的VLA模型需应对高维动作空间(10维绝对末端执行器位姿)与多步操作任务(如LIBERO-10中的长期规划)之间的映射难题,同时需克服仿真环境与真实世界之间的领域迁移鸿沟,确保学得策略在物理机器人上的泛化能力。在构建过程中,数据筛选与对齐构成主要挑战:原始LIBERO演示需经严格过滤以保证动作质量,并将20 Hz频率下的连续观测与视频帧精确对齐为绝对EE6D目标(位置、旋转6D表示及夹爪状态),这对时间戳同步与坐标系统一提出严苛要求。此外,统一多视角图像分辨率至256×256并保留原始模态信息的同时,需兼顾模型输入与计算效率的平衡,进一步增加了数据预处理的复杂度。
常用场景
经典使用场景
MiniCPM-RobotManip-LIBERO数据集在机器人操作领域占据着举足轻重的地位,它作为连接视觉-语言-动作(VLA)模型与真实物理世界交互的桥梁,被广泛用于训练和评估基于多模态大模型的机械臂操控策略。该数据集汇聚了LIBERO基准测试中四个经典子套件——LIBERO-10、LIBERO-Goal、LIBERO-Object与LIBERO-Spatial,提供了1636个高质量演示片段,涵盖从简单抓取到空间推理的多样化任务。研究者和工程师可借助其LeRobot v3标准格式,便捷地将状态信息与20Hz高帧率、双视角(智能体视角与腕部视角)的256×256视频流输入VLA模型,实现端到端的模仿学习与泛化能力验证。该数据集尤为经典的用途是在MiniCPM-RobotManip框架下进行全参数微调,通过将视觉观察与语言指令编码为联合表示,输出10维绝对末端执行器目标(EE6D),从而驱动机械臂完成精密操作,为多模态融合的机器人学习提供了标准化的实验平台。
解决学术问题
在学术研究中,机器人操作任务的长期可泛化性与知识迁移能力一直是亟待突破的瓶颈,而MiniCPM-RobotManip-LIBERO数据集精准回应了这一挑战。传统方法通常受限于单一场景或任务,难以在环境变化、物体位移或任务目标差异下保持稳定表现。该数据集通过整合LIBERO基准中四个具有不同任务结构和空间布局的子套件,为研究者提供了系统性评估终身学习、零样本迁移以及跨任务知识复用效果的标准化资源。它使得学术界能够深入探索视觉-语言-动作模型如何从稀疏的演示中提炼出可解释的动作先验,进而解决样本效率低下、任务模糊性以及避障规划等核心难题。该数据集的发布推动了多模态大模型在机器人控制领域的理论构建,尤其是其对绝对末端执行器位姿的精确标注,为研究动作空间表示对泛化性能的影响提供了可复现的实验基础,显著促进了机器人学习领域从封闭式任务向开放式智能的跨越。
衍生相关工作
MiniCPM-RobotManip-LIBERO数据集的诞生催生了一系列卓有影响力的衍生工作,尤其在多模态大模型与机器人学习的交叉领域。最典型的范例是starVLA框架,它利用该数据集展示了如何通过全参数微调将MiniCPM-RobotManip这类轻量级视觉-语言模型适配为高效的机器人操控策略,其公开基座模型与训练代码已成为后续研究的标准基线。在此基础上,研究者进一步探索了动作分块(action chunking)技术,通过将连续30步的动作目标映射到统一的状态-动作空间,显著提升了长时域任务规划的成功率。该数据集还启发了关于绝对末端执行器表示(EE6D)与传统相对位移动作对比的工作,促使学界更关注动作空间编码对策略鲁棒性的影响。同时,针对终身学习场景,基于该数据集的各子套件差异,研究者开发了避免灾难性遗忘的渐进式训练策略,拓展了持续学习理论在机器人控制中的边界。这些工作共同将MiniCPM-RobotManip-LIBERO塑造为机器人VLA研究不可或缺的测试床。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务