遇见数据集

lightwam-offline-cache

收藏
Hugging Face2026-06-09 更新2026-06-10 收录
官方服务:

资源简介:

Light-WAM离线缓存数据集是为论文《Light-WAM: Efficient World Action Models with State-Fusion Action Decoding》发布的配套预计算特征数据,旨在为高效的世界动作模型提供离线缓存支持,以加速相关研究中的训练或推理过程。数据集主要包含两部分内容:一是潜在特征缓存,涵盖了LIBERO基准测试中的多个子任务(包括空间推理、物体操作、目标导向以及10个任务的组合)以及RoboTwin2.0模拟环境的视觉观测特征;二是文本嵌入缓存,目前仅提供了LIBERO任务相关的文本描述嵌入。数据以目录结构组织,潜在缓存和文本嵌入缓存分别存放。该数据集适用于多任务机器人学习、具身智能以及视觉-语言-动作模型的研究与开发,特别是需要重用预提取特征以提升计算效率的场景。

创建时间:
2026-06-05
原始信息汇总

数据集概述

Light-WAM Offline Cache 是论文 Light-WAM: Efficient World Action Models with State-Fusion Action Decoding 的配套数据集,提供离线缓存文件,用于加速世界动作模型的训练与推理。

包含内容

  • LIBERO 潜在缓存:适用于 LIBERO 系列任务的潜在特征缓存。
  • RoboTwin2.0 潜在缓存:适用于 RoboTwin2.0 任务的潜在特征缓存。
  • LIBERO 文本嵌入缓存:LIBERO 任务的文本嵌入缓存。

不包含内容

  • RoboTwin2.0 文本嵌入缓存(未发布)。

仓库目录结构

text lightwam-offline-cache/ ├── latent_cache_Wan2.1-T2V-1.3B/ │ ├── libero_spatial_2cam224/ # LIBERO 空间任务(2摄像头,224分辨率) │ ├── libero_object_2cam224/ # LIBERO 物体任务(2摄像头,224分辨率) │ ├── libero_goal_2cam224/ # LIBERO 目标任务(2摄像头,224分辨率) │ ├── libero_10_2cam224/ # LIBERO-10 任务(2摄像头,224分辨率) │ └── robotwin_3cam384_sharded/ # RoboTwin2.0 任务(3摄像头,384分辨率,分片存储) └── text_embeds_cache/ └── libero/ # LIBERO 文本嵌入缓存

搜集汇总
数据集介绍
lightwam-offline-cache 数据集图片
构建方式
Light-WAM离线缓存数据集源于对高效世界动作模型的研究,旨在为Light-WAM框架提供预计算的潜在表示缓存。该数据集通过编码器对LIBERO和RoboTwin2.0两大基准任务中的多视角图像进行潜在特征提取,生成结构化的离线缓存文件。具体构建时,将LIBERO的四个子任务(spatial、object、goal、10)的双视角224分辨率图像,以及RoboTwin2.0的三视角384分辨率图像,统一输入Wan2.1-T2V-1.3B模型进行潜在编码,随后按任务类型分目录存储。此外,还单独提取了LIBERO任务的文本嵌入缓存,为模型提供语义先验。整个构建过程采用分片(sharded)存储策略以优化大规模数据的加载效率。
特点
该数据集的核心特点在于其为Light-WAM模型提供了预提取的高质量潜在缓存,显著加速了训练与推理过程中的特征计算环节。数据覆盖了LIBERO的四个空间操作任务(spatial、object、goal、10)以及RoboTwin2.0的复杂机器人操作场景,共计超过百万级帧的潜在表示。不同任务对应的图像分辨率与视角数存在差异,LIBERO为双视角224x224,RoboTwin2.0为三视角384x384,体现了对多源异构数据的兼容性。潜在编码采用Wan2.1-T2V-1.3B这一视频生成模型作为骨干,确保了特征提取的时空连贯性。文本嵌入缓存则独立存放,便于与视觉特征对齐。数据以分片形式组织,支持高效的分布式加载。
使用方法
使用时,用户可通过加载预存储的.npy或.h5文件直接获取任务对应的潜在缓存与文本嵌入,无需重复运行编码器。对于LIBERO任务,可按spatial、object、goal、10子目录分别索引双视角224潜在特征;对于RoboTwin2.0,则访问robotwin_3cam384_sharded目录下的分片文件。文本嵌入缓存位于text_embeds_cache/libero/路径下,可与视觉缓存拼接后输入Light-WAM模型的动作解码器。用户需注意RoboTwin2.0的文本嵌入缓存未被包含在本发布中,若需使用需自行计算。推荐结合PyTorch的DataLoader机制,通过内存映射(mmap)方式加载大文件以优化IO性能。
背景与挑战
背景概述
Light-WAM离线缓存数据集是Light-WAM(高效世界动作模型)研究项目的重要组成部分,该研究由多机构研究团队于2025年提出,核心论文发表于arXiv(编号2606.08242)。该数据集旨在解决机器人操作任务中多模态感知与动作生成的协同问题,通过提供LIBERO和RoboTwin2.0基准的潜在状态缓存与文本嵌入缓存,为世界模型的高效训练与推理奠定数据基础。作为Light-WAM框架的关键支撑,该数据集推动了机器人学习领域从高计算开销的在线处理向离线缓存范式的转变,显著降低了状态-动作建模的延迟与资源需求,对具身智能研究具有重要影响。
当前挑战
该数据集面临的核心挑战包括:领域问题层面,机器人操作任务要求模型在复杂动态环境中完成精确动作生成,但现有世界模型难以同时兼顾多传感器融合与实时性,Light-WAM通过离线缓存策略压缩潜在表示,却需应对不同任务间状态分布的偏移问题;构建过程中,缓存数据规模庞大(如RoboTwin2.0的3视角384分辨率分片缓存),存储与索引效率成为瓶颈,且LIBERO与RoboTwin2.0的视角、分辨率及编码器差异导致特征空间对齐困难,文本嵌入缓存的缺失进一步限制了跨模态度量学习的能力。
常用场景
经典使用场景
Light-WAM离线缓存数据集旨在为世界动作模型(World Action Models, WAM)的训练与推理提供高效的潜在表示预计算支持。该数据集通过存储LIBERO与RoboTwin2.0任务场景中的多视角视觉潜在编码及文本嵌入缓存,使研究者能够直接加载处理好的特征信息,从而显著降低动作模型在环境交互中的计算开销。其经典使用场景聚焦于离线强化学习中的世界模型预训练,尤其是在需要频繁重复利用环境表征的批量实验场景中,通过复用缓存数据加速模型迭代。
实际应用
在实际应用中,该数据集主要服务于机器人操作任务的策略学习与仿真验证。研究者可利用LIBERO与RoboTwin2.0的离线缓存,快速构建世界模型以执行动作规划,例如在物体拾取、空间导航和目标达成等任务中预演策略效果。此外,该缓存直接对接Wan2.1-T2V视觉编码器,支持从文本指令到动作序列的端到端推理,在虚拟仿真环境与真实机器人部署之间搭建了高效的数据桥梁,显著降低了模型部署前的调优周期。
衍生相关工作
该数据集衍生了多项重要工作,包括基于Light-WAM框架的跨场景动作泛化研究、多视角状态融合动作解码方法的发展,以及针对低延迟机器人控制系统的缓存优化策略。其中,Light-WAM原始论文中提出的状态融合解码器借助此缓存实现了对LIBERO基准的先进性能,并启发后续研究者探索更高效的视觉-动作联合表征。此外,RoboTwin2.0的潜在缓存成为双机器人协作任务建模的常见对照基准,推动了从静态数据集到动态世界模型训练的范式转变。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务