haoyu
收藏资源简介:
WorldCompass 是一个用于评估视频世界模型的基准数据集,包含 370 个冻结的测试用例以及每个被评估模型生成的对应视频。每个用例由第一帧、指令和控制程序组成。数据集分为三个任务:T2(Subject Control,150 个用例)测试主体是否按指令在 3D 空间中移动;T4(State-Evolution Memory,100 个用例)测试当物体离开视野后,其状态演化是否被正确保持;T6(Terrain Interaction,120 个用例)测试视频是否响应地形特征(如高度变化、接触、障碍)。T4 和 T6 额外包含评分清单。所有第一帧均经过审核(gemini-3.1-pro 多数投票)以确保无已知缺陷。数据来源包括真实照片(T2 71/150、T4 85/100、T6 29/120)和生成图像。评分方法:T2 使用几何方法(SAM 2 分割、VGGT-Ω 3D 重建)计算得分;T4 和 T6 使用 VLM 清单评分,并强制包含“identity”和“legible”两个必须通过项,T6 还对具有可测量高度特征的地形进行几何评分。数据集已知限制包括:评分模型未经人类验证、T6 的 bridge 子类仅有 4 个用例、voyager 车道因原生片段长度限制导致部分用例得分为 0。
WorldCompass is a benchmark dataset for evaluating video world models, consisting of 370 frozen test cases and corresponding videos generated by each evaluated model. Each case is composed of a first frame, an instruction, and a control program. The dataset is divided into three tasks: T2 (Subject Control, 150 cases) tests whether the subject moves in 3D space as instructed; T4 (State-Evolution Memory, 100 cases) tests whether the state evolution of an object is correctly maintained after it leaves the field of view; T6 (Terrain Interaction, 120 cases) tests whether the video responds to terrain features (e.g., height changes, contact, obstacles). T4 and T6 additionally include scoring checklists. All first frames have been reviewed (gemini-3.1-pro majority voting) to ensure no known defects. Data sources include real photos (T2 71/150, T4 85/100, T6 29/120) and generated images. Scoring methods: T2 uses geometric methods (SAM 2 segmentation, VGGT-Ω 3D reconstruction) to compute scores; T4 and T6 use VLM checklist scoring, with mandatory inclusion of "identity" and "legible" items that must be passed; T6 also applies geometric scoring to terrains with measurable height features. Known limitations of the dataset include: scoring models not validated by humans, T6s bridge subclass having only 4 cases, and voyager lanes yielding zero scores for some cases due to native clip length limits.
WorldCompass 数据集概述
基本信息
- 名称: WorldCompass T2/T4/T6
- 许可证: CC-BY-4.0
- 任务类型: 视频分类 (Video Classification)
- 标签: 世界模型、视频生成、基准测试、评估
数据集简介
WorldCompass 是一个用于视频世界模型评估的基准数据集,包含 370 个冻结测试用例,以及每个被评估模型生成的对应视频。每个用例由 一个首帧 + 一条指令 + 一个控制程序 组成。其中 T4 和 T6 任务额外附带评分检查清单。所有首帧均通过审核(由 3 个独立的 gemini-3.1-pro 模型多数投票决定)后才被冻结,不包含已知缺陷的用例。
三大任务
| 任务 | 用例数 | 测试内容 |
|---|---|---|
| T2 主体控制 | 150 | 指示主体朝某方向移动,检测主体是否真正在3D空间中移动,而非仅摄像机推近而主体静止 |
| T4 状态演化记忆 | 100 | 演化中的物体离开画面,时间流逝后画面恢复,检测物体在未被观察时是否持续变化(而非被重置或替换) |
| T6 地形交互 | 120 | 视角被指令穿越地形特征,检测视频是否对地形作出响应(高度变化、接触、阻挡),而非悬浮掠过 |
数据布局
T2/ cases.jsonl frames/<case_id>.jpg videos/<model>/<case_id>.mp4 T4/ … T6/ …
cases.jsonl 中每个用例包含:模型接收的指令、编译后的控制程序、测试对象或地形、预期变化、评分检查清单以及首帧审核结果。
评分机制
T2 — 几何评分(无需评判模型)
- 使用 SAM 2 分割主体,VGGT-Ω 重建3D轨迹
- 将每个指令段与实际恢复的运动进行比较
- 公式:
S_sub = 100 · max(0, 1 − e_t / 0.5)
T4 和 T6 — VLM 检查清单评分
- 公式:
score = 100 × satisfied / n_items,若任何必过项失败则得分为 0 - 两个必过项为
identity(主体未被替换)和legible(画面清晰可判断) - 设置必过项的原因:防止噪点片段和被替换物体的片段获得高分
T6 — 额外几何评分
- 当地形具有可测量的高度特征时,额外评分包含三个维度:方向、幅度、轮廓形状(各占 1/3)
- 对于往返型轮廓(沟渠、土丘),评分基于行程而非净变化(因进入再离开净变化为零)
前置门控
评分前设置四道门控,未通过的视频得分为 0:
- 是否发生了任何移动
- 位移是否足够大以便读取
- 指令动作是否被执行
- 下半段是否崩溃
数据构成
- 真实照片占比:T2 71/150、T4 85/100、T6 29/120,其余为生成图像
- 采用真实照片的原因:避免单一图像生成器的光照、构图和材质风格被固化到每个用例中
已知限制
- 评判模型未经人工验证: 目前所有测量仅证明同一帧重复评判结果一致,并未证明评判结果正确
- T6
bridge子类仅含 4 个用例: 桥通常长而平且多为侧视拍摄,399 张候选照片无可用者,仅 4 张可测量 voyager通道限制: 原生片段仅 3.0 秒,无法完成 8 个用例所需的 150° 转弯,这些用例得分为 0 而非被排除(避免基准测试失去可证伪性)




