遇见数据集

LIBERO-MAX

收藏
github2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

LIBERO-MAX是一个用于机器人执行过程中动态鲁棒性的配对基准数据集,包含8000个动态场景,每个场景与一个基础控制配对,评估机器人策略在环境变化时的适应能力。

LIBERO-MAX is a paired benchmark dataset dedicated to evaluating dynamic robustness during robotic execution. It comprises 8000 dynamic scenarios, each paired with a baseline controller, with the goal of assessing the adaptability of robotic policies when confronted with environmental variations.

创建时间:
2026-08-05
原始信息汇总

LIBERO-MAX 数据集详情

数据集简介

LIBERO-MAX 是一个用于评估机器人策略在运行时动态变化环境下鲁棒性的成对基准数据集。其核心研究问题为:当世界在机器人已经开始执行动作后发生变化,策略能否恢复并适应? 该数据集由基准平台发布,配套有论文(待发布)和项目网站。

基准规模

  • 动态轨迹总数:8,000 个动态episode。
  • 配对设计:每个动态episode对应一个基础控制组(Base control),二者共享相同的任务、模拟器状态、策略种子和变化发生前的动作前缀,总计形成 8,000 对、16,000 次带评分的 rollout
  • 来源构成
    • LIBERO-Plus:5,600 个案例(视觉、场景和观测变化)
    • LIBERO-PRO:2,400 个案例(语义和几何源变化)
    • LIBERO-MAX:8,000 个案例(执行开始后施加八类变化)

动态事件类型

数据集在以下四大类中均衡分配,每类事件各 1,000 个案例:

类别 在线变化类型
观测 相机位移;传感器损坏
几何 目标重新定位;容器重新定位
外观与杂波 光照切换;视觉主题切换;干扰物突现
路径约束 障碍物插入

评估模型与主要结果

所有模型均在完整 8,000 对匹配数据上评估,成功率以全部数据作为分母计算:

模型系列 模型 基础成功率 (Base SR) 动态成功率 (Dynamic SR) 差距
VLA π0.5 79.7 65.7 −13.9
VLA OpenVLA-OFT 64.3 43.1 −21.1
VLA + WM VLA-JEPA 73.5 54.3 −19.2
WAM Cosmos-Policy 77.4 59.3 −18.2
WAM Fast-WAM 42.0 24.0 −18.0

所有五种策略在执行期间发生世界变化时,成功率损失 13.9 至 21.1 个百分点。重新定位、相机位移和传感器损坏是共同暴露的最大弱点。

数据集依赖与溯源

LIBERO-MAX 是扩展层而非上游代码库的复刻,其运行时动态事件、配对回放协议、冻结的清单、聚合和验证逻辑均在 src/libero_max 中自主开发。完全评估依赖以下外部基准:

  • LIBERO:提供机器人任务、模拟器环境、演示和成功谓词
  • LIBERO-Plus:提供 5,600 个 MAX 案例的固定源目录
  • LIBERO-PRO:提供 2,400 个 MAX 案例的语义、几何和视觉底层

快速使用

数据集和评估逻辑可独立运行,无需下载模型权重。基本流程:

bash git clone https://github.com/yunbeizhang/LIBERO-MAX.git cd LIBERO-MAX python3 -m venv .venv source .venv/bin/activate pip install -e . make validate-max8000 make test

评估结果可通过模型专用启动器复现,支持多GPU并行和断点续跑。

系统要求与数据规模

  • 磁盘空间:项目克隆后占用约 1.4 GB。
  • 训练数据规模:约 50,000 个任务(涵盖单任务、多任务和长期任务场景)。
  • 环境与模拟器:模拟环境基于 MuJoCo 构建,数据集包含 RGB、深度和分割掩码三类观测信息,其中分割掩码仅出现在单任务和多任务场景中。
  • 系统依赖:需安装 conda 环境,Python 版本建议为 3.8 或 3.9。

环境配置

项目依赖通过 environment.yml 文件管理,包含:

  • 核心模拟与渲染:MuJoCo、dm_control
  • 深度学习框架:PyTorch
  • 基础库:NumPy、Matplotlib、Pandas 等

配置命令为:

bash conda env create -f environment.yml conda activate robomimic

训练方法

  • BC-RNN:采用行为克隆方法,使用循环神经网络处理观测序列预测动作。
  • BC-Transformer:基于 Transformer 架构的行为克隆,使用因果注意力掩码。
  • IRIS:基于 transformer 的逆模型,交替预测潜变量状态和动作。
  • RoboFlamingo:基于跨模态微调的方法,适应多模态输入。

训练流程由 scripts/train.py 启动,支持多 GPU 分布式训练,并利用 Weights & Biases 进行实验跟踪。

评估与指标

评估采用 Rollout成功率 作为指标,在干净的模拟环境中运行策略并统计成功轨迹比例。评估配置通过 JSON 文件指定。

数据集结构

数据集目录结构与用途如下:

  • 低维观察:涵盖单任务、多任务和长期任务,包含轨迹与底层观测。
  • 图像观察:提供演示和 rollout 子集,包含图像观测。
  • 单任务演示:每个任务固定提供 50 个演示轨迹。

引用

在论文发布前,引用请使用以下文本:

text LIBERO-MAX Dataset LIBERO-MAX: Do Robot Policies Adapt When the World Changes? https://github.com/yunbeizhang/LIBERO-MAX

搜集汇总
数据集介绍
LIBERO-MAX 数据集图片
构建方式
LIBERO-MAX数据集是基于LIBERO、LIBERO-Plus与LIBERO-PRO三大上游基准构建的动态鲁棒性测评基准。其构建过程首先从LIBERO-Plus中提取5,600个受控视觉、场景与观测变化案例,从LIBERO-PRO中提取2,400个语义与几何源变化案例,总计8,000个动态任务。数据集采用配对协议,每个动态片段均匹配一个基准控制片段,二者在任务、模拟器状态、策略种子及变化前的动作前缀上完全一致,差异仅在于动态片段在执行过程中施加一种可行性环境变化。这些变化被均衡划分为八类事件,分属观测(相机偏移、传感器损坏)、几何(目标重定位、容器重定位)、外观与杂乱(光照切换、视觉主题切换、干扰物突现)以及路径约束(障碍物插入)四个家族。
特点
LIBERO-MAX的核心特点在于其动态鲁棒性评估范式,突破传统基准在重置时固定世界的设定,考察策略在机器人已开始执行后面对环境变化时的恢复能力。数据集包含8,000对配对评估,提供16,000次带评分的回放。其设计强调可控性与平衡性,八类变化事件各含1,000个案例,确保对各类干扰的均衡覆盖。同时,数据集附带了五种前沿模型(π0.5、OpenVLA-OFT、VLA-JEPA、Cosmos-Policy、Fast-WAM)的完整评估结果,揭示了所有策略在动态环境下成功率的显著下降(13.9至21.1个百分点),并暴露出重定位、相机偏移与传感器损坏等共性弱点,为机器人策略的动态适应能力研究提供了重要参照。
使用方法
使用LIBERO-MAX数据集时,用户首先通过克隆仓库并执行`make validate-max8000`来校验冻结数据集的完整性与校验和。评估流程需按照提供的脚本对五种模型进行适配,每个启动器接受显式的源路径与检查点路径,记录运行时配置,支持跨GPU分片与可恢复输出。典型命令如`python scripts/run_openvla_oft_persistent_benchmark.py`,需指定清单文件、输出目录、GPU列表及模型路径。评估结果聚合于`artifacts/`目录下,遵循`docs/RUNTIME_INTEGRATION.md`中的指导,确保配对回放与成功判定的一致性。该数据集不重新分发模型权重与上游仓库,用户需自行获取,但发布清单与聚合逻辑允许完全复现所报告的实验结果。
背景与挑战
背景概述
在机器人学习领域,现有基准测试如LIBERO及其扩展LIBERO-Plus和LIBERO-PRO,通常在固定或重置后的环境中评估策略,未能充分考察执行过程中环境动态变化对策略鲁棒性的影响。为填补这一空白,LIBERO-MAX数据集于2025年8月15日发布,由来自多所机构的研究人员合作开发。该数据集构建了一个包含8,000个动态情境的配对基准,每个动态情境均与一个基础控制情境严格配对,二者共享相同的任务、模拟器状态、策略种子及动作前缀,仅在机器人执行过程中引入一次环境变化。这些变化覆盖了观测、几何、外观及路径约束等四大类,共八种事件类型,旨在系统性评估视觉-语言-动作模型及世界模型在动态环境下的适应能力。通过对π0.5、OpenVLA-OFT、VLA-JEPA、Cosmos-Policy和Fast-WAM等五种先进模型的全面评估,LIBERO-MAX揭示了现有策略在面对执行中环境变化时普遍存在的性能下降现象,为动态鲁棒性研究提供了标准化测试平台。
当前挑战
LIBERO-MAX数据集直面机器人执行过程中环境动态变化带来的核心挑战。首要挑战在于,现有策略在环境变化后性能显著退化,基线成功率与动态成功率之间的差距高达13.9至21.1个百分点,表明模型缺乏对在线变化的实时适应能力。具体而言,任务目标重定位、相机移位和传感器损坏等事件对多数模型构成最大共享弱点,而视觉主题切换或干扰物突增则对特定模型产生差异化影响。其次,数据集构建本身面临复杂工程挑战,包括如何在执行中途可控地注入多种环境干预,同时保持配对状态和动作前缀的一致性,以及如何确保8,000个动态情境的任务多样性、均衡性和可复现性。此外,评估协议要求所有模型在相同条件下接受统一测试,这涉及多模型适配、计算资源调度和结果聚合的标准化,以保障基准的公正性和可重复性。这些挑战共同凸显了开发能够动态感知并快速调整策略的鲁棒机器人学习算法的重要性和紧迫性。
常用场景
经典使用场景
LIBERO-MAX数据集作为机器人操作策略动态鲁棒性评估的基准,其核心应用场景在于衡量策略在环境变化时的适应能力。该数据集基于LIBERO框架,精心设计了8,000个动态测试片段,涵盖观察、几何、外观及路径约束等八种在线变化类型,如相机位移、目标重定位、光源切换及障碍物插入。每个动态片段均配备严格匹配的基线控制,确保比较的公正性。研究者可借助该数据集,在仿真环境中系统性地触发环境突变,评估视触觉大模型与端到端操作模型在执行阶段应对扰动的表现,从而深入探究策略的恢复能力与鲁棒性边界。
解决学术问题
LIBERO-MAX直面机器人操作研究中一个长期被忽视的关键问题——策略在动态环境中的适应性。传统基准在重置时呈现固定世界状态,忽略了执行过程中的实时变化,导致评估结果无法真实反映策略在真实世界中的泛化性能。该数据集通过引入“在线变化”概念,构建了严格的配对评估协议,有效测量并量化了策略在环境突变瞬间的表现衰减幅度。研究揭示,主流VLA与WAM模型在动态条件下成功率普遍下降13.9至21.1个百分点,这一发现凸显了现有模型在鲁棒性层面的显著不足,为动态环境下的策略学习与适应机制研究提供了重要的基准与挑战,推动了该领域向更贴近实际部署的评估范式演进。
衍生相关工作
LIBERO-MAX的发布催生了一系列相关研究工作。其严谨的配对评估协议与动态事件运行时被后续研究者广泛采用,衍生出针对在线适应性学习的改进框架。例如,基于该基准,研究人员探索了结合世界模型的预训练策略在动态环境下的微调方法,致力于缩短动作执行与状态更新间的延迟。同时,该数据集也激发了对动态扰动分类与难度量化的研究,促使更细粒度的鲁棒性分析工具出现。此外,LIBERO-MAX与LIBERO-Plus、LIBERO-PRO等基准的协同使用,为跨场景的泛化能力评估提供了统一框架,推进了机器人策略从静态任务执行向动态环境适应方向的学术探索,形成了围绕动态鲁棒性评估的活跃研究社区。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务