遇见数据集

physicalword-assets

收藏
Hugging Face2026-07-01 更新2026-07-02 收录
官方服务:

资源简介:

本数据集(PhysicalWord last05_mot2_action Assets)是一个用于训练last05_mot2_action模型的专用资产集合,旨在为无法直接访问原始网络存储(NAS)的环境提供必要的训练资源。它并非原始标注数据集,而是一个包含预训练模型、处理后的训练数据及配套文件的资产包。核心资产包括动作专家模型(位于ckpt/pretrained/目录,作为动作先验知识源)、RLBench训练数据(完整的rlbench目录,关联机器人操作任务)和LIBERO训练数据(位于data/libero_training_data_last05_lastest/libero_spatial_20hz_224_dual目录,关联具身AI与视觉语言任务)。数据规模约31.8GB,涵盖模型检查点文件、JSON元数据、图像帧和视频文件。主要用途是作为运行特定训练脚本的前提条件,用于训练与多模态动作理解和生成相关的模型。注意:不包含Cosmos Predict2.5-2B模型权重,需从官方渠道下载;部署对绝对路径有强依赖,需创建符号链接以确保资源正确定位。

This dataset repository (PhysicalWord last05_mot2_action Assets) is a specialized asset collection for training the last05_mot2_action model, designed to provide necessary training resources for environments without direct access to the original network storage (NAS). It is not an original annotated dataset but an asset package containing pre-trained models, processed training data, and supporting files. Core assets include: 1) Action Expert model (located in the ckpt/pretrained/ directory, serving as a source of action prior knowledge), 2) RLBench training data (complete rlbench directory, associated with robot manipulation tasks), and 3) LIBERO training data (located in data/libero_training_data_last05_lastest/libero_spatial_20hz_224_dual directory, associated with embodied AI and vision-language tasks). The total asset size is approximately 31.8GB, covering model checkpoint files, structured JSON metadata, image frames, and video files. The primary use is as a prerequisite for running specific training scripts (e.g., scripts/train_mot2_rlbench_keyframe.sh and scripts/train_mot2.sh) to train models related to multimodal action understanding and generation. Important notes: The repository does not include weights for the Cosmos Predict2.5-2B model, which must be downloaded separately from official sources after accepting the license. Asset deployment strongly depends on absolute paths (/mnt/nas/zhangyiming/database); if the download location differs, symbolic links must be created as required to ensure training scripts correctly locate resources.

创建时间:
2026-07-01
原始信息汇总

数据集概述

该数据集为 last05_mot2_action 模型的训练提供了必要的私有/定制资产。数据集地址为:https://huggingface.co/datasets/codemanCheng/physicalword-assets

包含内容

数据集包含以下三个主要部分:

  1. 预训练模型检查点

    • 路径ckpt/pretrained/LaST0_Pretrain_AE_chunk16/tfmr
    • 大小:约 4.0 GB
    • 用途:同时用作动作专家(Action Expert)以及分词器(Processor/Tokenizer)的来源。
    • 文件列表config.jsonmodel.safetensorspreprocessor_config.jsonprocessor_config.jsonspecial_tokens_map.jsontokenizer.jsontokenizer_config.json
  2. LIBERO 训练数据

    • 路径data/libero_training_data_last05_lastest/libero_spatial_20hz_224_dual
    • 大小:约 2.8 GB
    • 包含文件/目录train_with_atomic_action.jsontrain.jsontrain_rewritten_prompts.jsontrain_statistics.jsonvideos/cosmos_text_cache/cosmos_text_cache_raw_full_concat/cosmos_text_cache_rewritten_prompts_raw_full_concat/
    • 说明:JSON 文件中引用的视频路径位于 /mnt/nas/zhangyiming/database/data/libero_training_data_last05_lastest/libero_spatial_20hz_224_dual/videos/...
  3. RLBench 训练数据

    • 路径rlbench/
    • 大小:约 25 GB
    • 包含关键训练文件
      • rlbench/train/json/train_action_chunk1_sumpos_lastrot.json
      • rlbench/train/json/train_action_chunk1_sumpos_lastrot_statistics.json
      • rlbench/train/json/cosmos_text_cache_rlbench_keyframe/
      • rlbench/train/images/
    • 说明:JSON 文件中引用的图片路径位于 /mnt/nas/zhangyiming/database/rlbench/train/images/...

不包含内容

  • Cosmos Predict2.5 权重:需要从官方 Hugging Face 模型库 (nvidia/Cosmos-Predict2.5-2B) 下载,并接受许可协议。
  • MoT2 评估检查点:已训练好的评估模型检查点未包含在内。

使用说明

  • 目标布局:建议将本数据集直接下载至 /mnt/nas/zhangyiming/database 目录。
  • 路径兼容:训练 JSON 文件中的路径均为绝对路径,基于 /mnt/nas/zhangyiming/database。如果下载到其他位置,需要创建符号链接。
  • 关联代码库
    • GitHub:https://github.com/zhang-yi-ming/phyword.git
    • 分支:mot2_cosmos_ae
    • 提交:1495a9d

主要训练入口

  • RLBench:在 /mnt/nas/zhangyiming/last05_beta/last05_mot2_action 目录下执行 bash scripts/train_mot2_rlbench_keyframe.sh
  • LIBERO:在 /mnt/nas/zhangyiming/last05_beta/last05_mot2_action 目录下执行 bash scripts/train_mot2.sh
搜集汇总
数据集介绍
physicalword-assets 数据集图片
构建方式
PhysicalWord Assets数据集是为训练last05_mot2_action模型而构建的资产集合,旨在解决无法访问源NAS设备时的训练资源依赖问题。该数据集整合了预训练动作专家模型LaST0_Pretrain_AE_chunk16的检查点文件、RLBench仿真环境中的关键帧训练数据(包括图像与JSON标注)、以及LIBERO数据集中的空间任务视频与文本缓存。构建过程中严格保持了原始训练脚本所需的目录结构与绝对路径引用,并通过HuggingFace平台以数据集仓库形式发布,便于用户直接下载至指定挂载点。
使用方法
使用者需先通过HuggingFace CLI将数据集完整下载至/mnt/nas/zhangyiming/database目录,并手动下载Cosmos Predict2.5权重至指定路径。训练入口分别为RLBench的train_mot2_rlbench_keyframe.sh脚本与LIBERO的train_mot2.sh脚本,均位于last05_mot2_action代码仓库内。若数据集存储位置与预设路径不符,需使用符号链接将实际路径映射至/mnt/nas/zhangyiming/database。数据集内预训练动作专家模型同时承担处理器与分词器角色,不可替换为其他模型。
背景与挑战
背景概述
PhysicalWord Assets数据集由张一鸣团队在2024年创建,隶属于物理世界模拟研究体系,核心聚焦于机器人操作任务的预训练与微调。该数据集整合了RLBench和LIBERO两大仿真平台的训练资源,包含动作专家模型(LaST0_Pretrain_AE_chunk16)、高保真视觉-动作序列数据及对应的语言指令缓存,旨在解决具身智能体在复杂物理环境中泛化能力不足的问题。通过提供标准化数据与模型检查点路径,该数据集降低了多模态操作任务(如抓取、空间推理)的复现门槛,成为连接仿真训练与实际机器人部署的关键枢纽,在机器人学习社区中推动了对动作预测、跨任务迁移等前沿方向的探索。
当前挑战
该数据集所面临的挑战首先体现在领域问题层面:机器人操作任务需同时处理高维视觉输入、连续动作空间及非结构化环境干扰,现有方法在零样本泛化到新物体或布局时仍存在显著性能衰退。构建过程中,数据规模与多样性难以平衡——RLBench的25GB原始数据虽覆盖多场景,但动作标签的精细化程度不足;而LIBERO数据依赖绝对路径引用,导致跨机器迁移时常因存储结构差异引发训练中断。此外,第三方模型(如Cosmos-Predict2.5)的许可证限制与权重缺失,迫使研究者手动下载并调整路径,增加了复现成本。这些技术与管理上的双重挑战,制约了数据集在标准化基准测试中的广泛采用。
常用场景
经典使用场景
PhysicalWord-Assets数据集专为多模态机器人操作任务的模型训练而设计,其经典使用场景体现在对大规模动作-视觉联合表征的学习上。该数据集整合了RLBench虚拟仿真环境中的关键帧图像与动作序列、LIBERO空间任务的高频视频与原子动作标签,以及预训练的LaST0动作专家模型权重,为训练类MoT2架构的视觉-语言-动作多模态模型提供了标准化的数据资产与预训练基础。研究者可直接利用其中的训练JSON文件索引图像、视频与文本缓存,在无法访问原始NAS的算力受限环境下复现和迁移机器人操作学习的训练流程,尤其适用于基于Cosmos-Predict2.5等世界模型进行动作预测与轨迹规划的联合优化场景。
解决学术问题
该数据集核心解决了机器人学习领域中数据资产分散、环境依赖强与实验复现困难三大学术瓶颈。凭借其精心打包的RLBench与LIBERO子集,研究者得以规避自建仿真场景、采集演示数据及训练专用感知模型的高昂成本,聚焦于行为克隆、多模态动作规划以及视觉-语言-动作联合预训练等前沿课题。数据集提供的预训练动作专家与标准化的JSON配置,使得对不同模型架构的泛化能力、动作分块策略的有效性以及自回归世界模型在机器人任务中的耦合机制进行公平对比成为可能,显著推动了对具身决策系统在长程操作与空间泛化方面基础问题的探索。
实际应用
在实际产业与科研落地中,PhysicalWord-Assets数据集是赋能智能机器人柔性化部署的关键资源。工业场景下,开发者可利用其预训练的动作专家与场景数据,快速微调出适应特定装配或分拣任务的机械臂操控策略,显著压缩从仿真到实物的模型迁移周期。学术实验室则能依托该数据集开展自动化标注、低资源场景下的跨任务泛化验证,以及基于高频视频流的多模态感知与实时动作决策的联合调试工作。此外,数据集中集成的Cosmos文本缓存也为自然语言指令与物理世界操作的语义对齐提供了便捷的训练素材,助力构建更智能的人机协作系统。
数据集最近研究
最新研究方向
该数据集聚焦于基于视觉-语言模型的多任务机器人操作学习,其核心研究前沿在于利用大规模预训练模型进行动作预测与指令理解。值得关注的是,该工作与国际前沿的Cosmos视频生成模型深度融合,通过引入基于物理世界的多模态资产,如RLBench和LIBERO数据集合集,推动机器人学习从仿真环境向真实的零样本迁移。研究热点集中于利用LaST0预训练动作专家和MoT2架构,构建具备强泛化能力的具身智能系统,尤其强调在未见任务上的运动推理与行为生成能力。这一研究方向不仅加速了基础模型在机器人领域的落地,更通过公开高质量训练资产,为后续研究提供了关键的基准与可复现性支撑,深刻影响了视觉-语言-动作统一框架的工程化实现路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务