Sapienza/DILLO-LIBERO-dataset
收藏官方服务:
资源简介:
该数据集包含用于DILLO(蒸馏语言-动作世界模型)的LIBERO策略rollouts标注。每个示例存储了一个分块的ACT策略rollout、边界帧图像、机器人状态轨迹、动作块以及用于蒸馏的VLM生成的描述/推理。
This dataset contains LIBERO policy rollouts labeled for DILLO (DIstiLLed Language-ActiOn World Model). Each example stores a chunked ACT policy rollout, boundary-frame images, robot state traces, action chunks, and VLM-generated descriptions/reasoning for distillation.
提供机构:
Sapienza搜集汇总
数据集介绍

构建方式
DILLO-LIBERO-dataset是一套专为知识蒸馏设计的机器人策略数据集,源自LIBERO仿真环境下的策略推理轨迹。该数据集覆盖130个不同任务,共收录1700个完整回合,每个回合均包含经过分块处理的ACT策略推理记录、关键帧图像、机器人状态序列、动作块以及由视觉语言模型生成的描述与推理文本。数据按照LIBERO套件(如LIBERO_10、LIBERO_90等)和具体任务进行层级组织,每个任务文件夹下存放对应回合的图像、数值数组和文本文件,并辅以metadata.jsonl等元数据文件以支持高效索引与加载。
使用方法
使用时,用户可通过Hugging Face仓库直接下载数据集,根目录下的metadata.jsonl文件提供了每个回合的相对路径与元数据,便于编程式加载。推荐使用Python的json和pathlib库解析manifest文件,以获取完整的任务指令和文件路径。对于DILLO模型的训练,用户只需将TRAIN_DATA变量指向指定套件的全局路径模式,例如'DILLO-LIBERO-dataset/LIBERO_GOAL/*/*',即可轻松接入训练流程。该设计大幅降低了数据预处理门槛,支持敏捷的模型迭代与实验验证。
背景与挑战
背景概述
在机器人学习领域,从仿真环境到现实世界的策略迁移一直面临数据效率低与泛化能力不足的瓶颈。LIBERO基准套件作为经典任务集,涵盖了操作、目标导向、物体交互与空间推理等多元场景。DILLO-LIBERO-dataset由罗马大学Sapienza团队于近期构建,核心研究问题聚焦于如何通过蒸馏世界模型将语言指导与动作规划深度融合。该数据集包含1700个完整轨迹、130项任务及超过3.3万份文件,覆盖LIBERO五大子套件,显著推动了策略蒸馏与视觉-语言-动作联合建模的发展,为跨任务策略泛化提供了标准化训练资源。
当前挑战
该数据集致力于解决领域内策略预测需依赖大量真实世界数据的核心问题,通过蒸馏范式降低对密集标注的依赖,提升模型在未见任务上的零样本适应能力。构建过程中面临的挑战包括:确保多源仿真数据(如夹具、关节位姿与边界帧图像)在格式与语义上的一致性,需在10至100余项不同任务间平衡样本分布,并设计高效的高维动作块与语言推理标签对齐流程。此外,动作块的高频率采样与存储(超过8500个.npy文件)对数据管理系统的完整性提出了严格要求,需校验轨迹成功掩码的准确性以避免蒸馏过程中的错误传递。
常用场景
经典使用场景
在机器人学习领域,DILLO-LIBERO-dataset为策略蒸馏和世界模型训练提供了标准化的数据基石。该数据集汇集了LIBERO模拟平台上130项任务、共计1700个回合的策略轨迹,每个样本均包含动作块序列、边界帧图像、机器人状态轨迹及VLM生成的语义描述与推理文本。研究者可借助这些结构化的演示数据,训练出能够将语言指令映射为连续动作的行动模型,或构建能够理解物理场景动态的世界模型。其分层存储格式与元数据清单极大地降低了数据处理门槛,使得从感知到决策的全链路学习成为可能。
解决学术问题
该数据集直面机器人领域中大规模高质量演示数据稀缺的困境,为语言-动作联合建模与策略蒸馏提供了可复现的基准。传统强化学习方法往往受限于样本效率和奖励函数设计,而DILLO-LIBERO-dataset通过提供已标注的成功轨迹和推理链,支撑了模仿学习与行为克隆范式的深入研究。它有效推动了视觉-语言模型在机器人操控中的泛化性研究,使学术工作能够聚焦于跨任务知识迁移、长时域动作规划以及基于世界模型的因果推理等核心难题,其公开的多任务划分还促进了模型鲁棒性与零样本适应能力的系统化评测。
实际应用
在现实工业与服务机器人领域,该数据集所支撑的DILLO框架展现出直接将自然语言指令转化为物理操作的潜力。例如,在智能仓储场景中,机器人可借助基于此数据集训练的视觉-语言模型理解“将蓝色杯子移至托盘左侧”等复杂指令,并实时调整机械臂轨迹。家庭服务机器人则能利用其中蕴含的常识推理链完成诸如“打开炉灶并放上摩卡壶”的多步任务。此外,该数据集中的状态跟踪与动作块数据可用于开发可解释的机器人决策系统,在辅助制造、医疗操作等对安全性和可追溯性要求极高的场景中发挥关键作用。
数据集最近研究
最新研究方向
该数据集聚焦于机器人操作领域的知识蒸馏与行为克隆前沿方向,通过将ACT策略的轨迹数据与视觉语言模型生成的语义推理相融合,构建了面向语言-行动世界模型训练的标准化蒸馏数据集。其核心价值在于弥合高层语言指令与底层运动控制之间的鸿沟,为具身智能体提供可解释的决策逻辑。在当前多模态大模型与机器人技术交叉的热点研究浪潮中,DILLO-LIBERO-dataset为研究策略精炼、数据效率提升以及跨任务泛化能力提供了关键资源,其包含的130项多样化任务与1700条完整轨迹,显著推动了机器人从简单模仿向语义驱动的自主操作范式演进。
以上内容由遇见数据集搜集并总结生成



