ABot-PhysWorld
收藏资源简介:
ABot-PhysWorld是由阿里巴巴AMAP CV实验室构建的机器人操作视频数据集,整合了AgiBot等五大开源数据集的三百万条视频片段。数据集通过光学流运动过滤、CLIP时序一致性检测等多阶段质量控制,确保视频包含真实的物理交互动态。采用分层动态采样策略平衡机器人类型、任务场景的分布,并创新性地通过Qwen3-VL模型生成四阶段物理感知标注,涵盖场景配置、动作细节等深度语义信息。该数据集专为训练物理合规的具身世界模型设计,可应用于机器人仿真、动作规划等领域,解决传统视频生成模型物理一致性不足的核心问题。
ABot-PhysWorld is a robotic manipulation video dataset constructed by Alibaba AMAP CV Laboratory. It integrates 3 million video clips from five open-source datasets including AgiBot. The dataset adopts multi-stage quality control measures such as optical flow motion filtering and CLIP-based temporal consistency detection to ensure that the videos contain realistic physical interaction dynamics. It employs a hierarchical dynamic sampling strategy to balance the distribution of robot types and task scenarios, and innovatively generates four-stage physically-aware annotations via the Qwen3-VL model, which covers in-depth semantic information including scene configuration and action details. This dataset is specifically designed for training physically compliant embodied world models, and can be applied to fields such as robot simulation and motion planning, addressing the core issue of insufficient physical consistency in traditional video generation models.
ABot-PhysWorld 数据集概述
数据集基本信息
- 数据集名称: ABot-PhysWorld
- 发布机构: AMAP CV Lab
- 核心定位: 一个物理一致、动作可控的机器人操作视频世界模型。
- 模型基础: 基于140亿参数的扩散变换器(Diffusion Transformer)构建。
- 核心目标: 生成真实且物理合理的机器人-物体交互视频,即使在零样本设置下。
关键贡献
-
工业级数据管道
- 从五个数据集(
AgiBot,RoboCoin,RoboMind,Galaxea,OXE)中筛选了约300万个真实世界操作视频片段。 - 应用了运动、语义和动作一致性过滤。
- 采用分层采样以实现平衡的泛化能力。
- 从五个数据集(
-
物理感知的DPO训练
- 引入解耦的基于VLM的判别器:Qwen3-VL生成任务特定的物理检查清单,Gemini 3 Pro通过思维链对视频进行评分。
- 结合LoRA增强的DPO在14B DiT模型上执行,以强制物理合理性。
-
用于动作控制的并行上下文块
- 通过将空间动作图残差注入到克隆的DiT块中,实现精确的动作条件生成。
- 在支持跨具身控制的同时,保留了物理先验。
-
EZSbench——首个真正的零样本基准
- 完全独立于训练数据的评估,涵盖未见过的机器人、场景和任务组合。
- 采用双模型评分以消除自评估偏差。
评估基准与性能
-
评估基准:
- 物理一致性: 通过PBench和EZSbench评估。
- 零样本泛化: 通过EZSbench评估。
- 动作条件可控性: 通过自定义的A2V基准评估。
-
性能总结: | 能力 | 基准 | ABot-PhysWorld | 最佳基线 | 提升 | | :--- | :--- | :--- | :--- | :--- | | 物理保真度 | PBench (领域得分) | 0.9306 | 0.8644 (Wan2.5) | +6.62% | | 零样本泛化 | EZSbench (领域得分) | 0.8366 | 0.7951 (WoW) | +4.15% | | 动作控制 | 轨迹一致性 | 0.8522 | 0.8157 (Enerverse) | +3.65% |
定性结果展示
展示了模型在多种零样本场景下的生成能力,证明了其强大的泛化能力和物理合理性。
- 场景1: 可变形物体——双臂折叠毛巾:展示了复杂的布料动力学和双手协调。
- 场景2: 精细操作——多样化物体处理:展示了堆叠杯子、搭建积木、放置刀具等任务。
- 场景3: 铰接物体——打开柜门:展示了执行旋转约束和正确施力方向。
- 场景4: 流体交互——倒水:展示了双手协调、倾斜控制和液体动力学。
- 场景5: 清洁任务——擦拭污渍:展示了保持接触、均匀压力和全覆盖。
- 场景6: 多场景泛化——水果分类:展示了在不同背景、光照和水果变化下的鲁棒性。
- PBench结果演示:在PAI-Bench基准数据集上的系统定性比较实验。
使用指南
快速开始:视频生成推理
-
环境要求:
- Python 3.10。
- PyTorch with CUDA。
- 推荐VRAM: >= 60GB(最佳性能,无需分块)。
- 最低VRAM: >= 24GB(默认启用分块VAE)。
-
推理方式:
- 从图像+文本提示生成视频:使用
inference.py脚本,支持单张图像或批量JSONL文件输入。 - 关键参数:可指定视频分辨率、帧数、去噪步数、分类器自由引导尺度等。
- 从图像+文本提示生成视频:使用
模型权重
- 自动下载:首次运行推理时,微调后的检查点会自动从 ModelScope (https://www.modelscope.cn/models/amap_cvlab/Abot-PhysWorld) 下载。
- 基础模型:Wan2.1-I2V-14B-480P 由 DiffSynth-Studio 自动下载。
引用
如需在研究中引用此工作,请使用提供的BibTeX条目。
致谢
该项目基于多个开源项目构建,包括 Wan2.1、VACE、DiffSynth-Studio、VideoX-Fun、Qwen3、Qwen3-VL、Physical AI Bench、FantasyTalking2。





