WorldMark
收藏资源简介:
WorldMark是由盛大AI研究院东京主导构建的首个交互式图像转视频世界模型标准化评测套件,包含50张参考图像生成的500个分层测试案例,涵盖第一/第三人称视角及写实/风格化场景。数据集通过WASD动作词汇统一映射层实现六种异构模型的控制指令标准化转换,包含20-60秒难度分级的动作序列,并集成视觉质量、控制对齐和世界一致性三维评估体系。该数据集旨在解决交互式视频生成模型因私有测试条件导致的跨模型可比性问题,为学术界提供公平的基准测试平台。
WorldMark is the first standardized benchmark suite for interactive image-to-video world models, led by the Tokyo branch of Shanda AI Research. It comprises 500 hierarchical test cases generated from 50 reference images, covering first-person and third-person perspectives as well as photorealistic and stylized scenarios. The dataset standardizes control instruction conversion for six heterogeneous models via a unified mapping layer of WASD action vocabulary. It includes difficulty-graded action sequences ranging from 20 to 60 seconds, and integrates a three-dimensional evaluation system covering visual quality, control alignment, and world consistency. This dataset aims to address the cross-model comparability issue of interactive video generation models caused by private test conditions, providing a fair benchmark platform for the academic community.
数据集概述:WorldMark
WorldMark 是一个用于评估交互式视频世界模型的统一基准测试套件,旨在解决当前不同模型因采用专属场景、轨迹和评估协议而无法进行公平比较的问题。它提供了标准化的测试条件,使得对异构输入模型的比较成为可能。
核心贡献
- 统一动作映射层:将共享的WASD风格动作词汇翻译成每个模型的原生控制格式,实现在相同场景和轨迹下对六个主要模型进行公平比较。
- 分层测试套件:包含 500个评估用例,覆盖第一人称和第三人称视角、逼真和风格化场景,以及从简单(20秒)到困难(60秒)三个难度等级。
- 模块化评估工具包:提供对 视觉质量、控制对齐和世界一致性 的三维评估,研究人员可复用标准化输入,并自定义评估指标。
数据集构成
-
图像套件:
- 包含 50 张多样化的参考图像,涵盖 自然、城市、室内 三类场景,真实、风格化 两种风格,以及 第一人称、第三人称 两种视角。
- 风格化子集包括油画、浮世绘、赛博朋克和Minecraft美学。
- 交叉视角对共生成 100张测试图像。
-
动作套件:
- 包含 15 个标准化的动作序列,使用共享的 WASD移动 + 左右偏航旋转 词汇表达。
- 简单(20秒):5个基础单段动作(如前进、后退、向左平移)。
- 中等(40秒):5个两段组合动作(如来回移动、边走边转)。
- 困难(60秒):5个三段复杂轨迹(如巡逻、之字形移动)。
- 结合100张测试图像,共产生约 500个标准化评估用例。使用VLM进行场景感知过滤,确保动作的物理合理性。
评估维度与指标
- 视觉质量:通过美学质量(LAION预测器)和成像质量(MUSIQ)评估。
- 控制对齐:通过平移误差和旋转误差(基于DROID-SLAM重建的相机位姿)评估。
- 世界一致性:通过重投影误差(3D空间一致性)、状态一致性、内容一致性和风格一致性评估。
定量结果
该基准在 YUME 1.5, MatrixGame 2.0, HY-World, HY-Game, Oasis, Genie 3 六个主要模型上进行了评估,并给出了以下分类的详细指标表格:
- 第一人称-真实场景
- 第一人称-风格化场景
- 第三人称场景(仅 MatrixGame 2.0, HY-World, Genie 3 支持)
关键发现
- 视觉质量与世界一致性大多不相关:YUME 帧质量最高但世界缺乏全局连贯性,而 Genie 3 世界一致性最好但帧质量一般。
- 强控制对齐不意味着整体质量:HY-Game 指令跟随精确但视觉保真度差,Genie 3 轨迹误差较大但保持了全局连贯的世界。
- 第三人称生成暴露严重弱点:MatrixGame 的旋转误差在第三人称下增长了约20倍。
- 领域特化训练不具有迁移性:在Minecraft上训练的Open-Oasis在所有指标上都无法胜任真实和风格化场景。




