遇见数据集

haoyu

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

WorldCompass 是一个用于评估视频世界模型的基准数据集,包含 370 个冻结的测试用例以及每个被评估模型生成的对应视频。每个用例由第一帧、指令和控制程序组成。数据集分为三个任务:T2(Subject Control,150 个用例)测试主体是否按指令在 3D 空间中移动;T4(State-Evolution Memory,100 个用例)测试当物体离开视野后,其状态演化是否被正确保持;T6(Terrain Interaction,120 个用例)测试视频是否响应地形特征(如高度变化、接触、障碍)。T4 和 T6 额外包含评分清单。所有第一帧均经过审核(gemini-3.1-pro 多数投票)以确保无已知缺陷。数据来源包括真实照片(T2 71/150、T4 85/100、T6 29/120)和生成图像。评分方法:T2 使用几何方法(SAM 2 分割、VGGT-Ω 3D 重建)计算得分;T4 和 T6 使用 VLM 清单评分,并强制包含“identity”和“legible”两个必须通过项,T6 还对具有可测量高度特征的地形进行几何评分。数据集已知限制包括:评分模型未经人类验证、T6 的 bridge 子类仅有 4 个用例、voyager 车道因原生片段长度限制导致部分用例得分为 0。

WorldCompass is a benchmark dataset for evaluating video world models, consisting of 370 frozen test cases and corresponding videos generated by each evaluated model. Each case is composed of a first frame, an instruction, and a control program. The dataset is divided into three tasks: T2 (Subject Control, 150 cases) tests whether the subject moves in 3D space as instructed; T4 (State-Evolution Memory, 100 cases) tests whether the state evolution of an object is correctly maintained after it leaves the field of view; T6 (Terrain Interaction, 120 cases) tests whether the video responds to terrain features (e.g., height changes, contact, obstacles). T4 and T6 additionally include scoring checklists. All first frames have been reviewed (gemini-3.1-pro majority voting) to ensure no known defects. Data sources include real photos (T2 71/150, T4 85/100, T6 29/120) and generated images. Scoring methods: T2 uses geometric methods (SAM 2 segmentation, VGGT-Ω 3D reconstruction) to compute scores; T4 and T6 use VLM checklist scoring, with mandatory inclusion of "identity" and "legible" items that must be passed; T6 also applies geometric scoring to terrains with measurable height features. Known limitations of the dataset include: scoring models not validated by humans, T6s bridge subclass having only 4 cases, and voyager lanes yielding zero scores for some cases due to native clip length limits.

创建时间:
2026-08-23
原始信息汇总

WorldCompass 数据集概述

基本信息

  • 名称: WorldCompass T2/T4/T6
  • 许可证: CC-BY-4.0
  • 任务类型: 视频分类 (Video Classification)
  • 标签: 世界模型、视频生成、基准测试、评估

数据集简介

WorldCompass 是一个用于视频世界模型评估的基准数据集,包含 370 个冻结测试用例,以及每个被评估模型生成的对应视频。每个用例由 一个首帧 + 一条指令 + 一个控制程序 组成。其中 T4 和 T6 任务额外附带评分检查清单。所有首帧均通过审核(由 3 个独立的 gemini-3.1-pro 模型多数投票决定)后才被冻结,不包含已知缺陷的用例

三大任务

任务 用例数 测试内容
T2 主体控制 150 指示主体朝某方向移动,检测主体是否真正在3D空间中移动,而非仅摄像机推近而主体静止
T4 状态演化记忆 100 演化中的物体离开画面,时间流逝后画面恢复,检测物体在未被观察时是否持续变化(而非被重置或替换)
T6 地形交互 120 视角被指令穿越地形特征,检测视频是否对地形作出响应(高度变化、接触、阻挡),而非悬浮掠过

数据布局

T2/ cases.jsonl frames/<case_id>.jpg videos/<model>/<case_id>.mp4 T4/ … T6/ …

cases.jsonl 中每个用例包含:模型接收的指令、编译后的控制程序、测试对象或地形、预期变化、评分检查清单以及首帧审核结果。

评分机制

T2 — 几何评分(无需评判模型)

  • 使用 SAM 2 分割主体,VGGT-Ω 重建3D轨迹
  • 将每个指令段与实际恢复的运动进行比较
  • 公式: S_sub = 100 · max(0, 1 − e_t / 0.5)

T4 和 T6 — VLM 检查清单评分

  • 公式: score = 100 × satisfied / n_items若任何必过项失败则得分为 0
  • 两个必过项为 identity(主体未被替换)和 legible(画面清晰可判断)
  • 设置必过项的原因:防止噪点片段和被替换物体的片段获得高分

T6 — 额外几何评分

  • 当地形具有可测量的高度特征时,额外评分包含三个维度:方向、幅度、轮廓形状(各占 1/3)
  • 对于往返型轮廓(沟渠、土丘),评分基于行程而非净变化(因进入再离开净变化为零)

前置门控

评分前设置四道门控,未通过的视频得分为 0:

  1. 是否发生了任何移动
  2. 位移是否足够大以便读取
  3. 指令动作是否被执行
  4. 下半段是否崩溃

数据构成

  • 真实照片占比:T2 71/150、T4 85/100、T6 29/120,其余为生成图像
  • 采用真实照片的原因:避免单一图像生成器的光照、构图和材质风格被固化到每个用例中

已知限制

  1. 评判模型未经人工验证: 目前所有测量仅证明同一帧重复评判结果一致,并未证明评判结果正确
  2. T6 bridge 子类仅含 4 个用例: 桥通常长而平且多为侧视拍摄,399 张候选照片无可用者,仅 4 张可测量
  3. voyager 通道限制: 原生片段仅 3.0 秒,无法完成 8 个用例所需的 150° 转弯,这些用例得分为 0 而非被排除(避免基准测试失去可证伪性)
搜集汇总
数据集介绍
haoyu 数据集图片
构建方式
WorldCompass数据集以严谨的构建流程著称,涵盖三类任务T2、T4与T6,共370个冻结测试用例。每个用例由首帧图像、指令及控制程序构成,其中T4与T6额外配备评分检查表。首帧均经过三重独立审计,确保无已知缺陷。构建过程融合真实摄影与生成图像,以规避单一生成器风格偏差,并基于几何方法或视觉语言模型检查表实施评分,辅以门控机制过滤无效视频。
使用方法
使用者可遵循数据集布局,将每用例的首帧与指令输入待测视频生成模型,产出的视频存放于对应模型目录下。评分流程依据任务类型差异化执行:T2直接计算几何得分,T4/T6则通过检查表逐项判定,同时贯穿四道门控条件,任一不满足即整段视频计零。数据集的已知限制需在应用时纳入考量,尤其对T6的稀缺子类与特定模型的时长约束,应谨慎解读结果。
背景与挑战
背景概述
WorldCompass数据集由国际研究团队于2025年创建,旨在系统评估视频世界模型在复杂动态场景中的因果推理与物理一致性。该数据集针对当前视频生成模型在主体控制、状态演化记忆和地形交互三大核心能力上的不足,精心设计了370个冻结测试案例,每个案例包含首帧、指令和控制程序。其独特之处在于采用几何与视觉语言模型双重评分机制,并引入身份保持、可判读性等强制检查项,确保了评估的严谨性和可复现性。该数据集发布在HuggingFace平台,采用CC-BY-4.0许可,为视频生成领域提供了首个专门面向世界模型的细粒度基准,推动了从外观生成向物理正确生成的范式转变,对相关领域的研究具有重要的参考价值和影响力。
当前挑战
WorldCompass数据集的构建面临多重挑战。领域层面,视频世界模型需精确执行指令并保持3D一致性,但现有模型常出现相机推近冒充主体移动、对象离开视线后状态重置或替换、地形交互缺失等系统性问题,这些正是该数据集旨在解决的领域难题。构建过程中,首要挑战是数据质量控制,每个首帧需通过三个独立评审一致通过审核方可冻结,且T6任务中桥梁子类仅收集到4个合格案例,因桥梁侧视角与任务视角不匹配,其采用可测量但稀缺策略。此外,评分体系需兼顾几何和语义双重标准,并设立关键门控机制排除噪声干扰。部分模型因原生片段时长限制无法完成任务而计零分,确保基准的可证伪性。这些挑战促使数据集设计不断优化,以平衡严谨性与实用性。
常用场景
经典使用场景
WorldCompass T2/T4/T6数据集聚焦于视频世界模型的三大核心能力评测,即主体控制、状态演化记忆与地形交互。其经典使用场景涵盖三种任务:T2任务要求模型依据指令在三维空间中精确移动主体,以判别真实运动抑或相机推移的伪动态;T4任务考察模型在物体离屏期间是否持续维持状态演化,防止重置或对象替换;T6任务则检验模型对视域内地形特征的响应,包括高度变化、接触与遮挡。每个案例由首帧、指令及控制程序构成,并附带评分清单,适用于严谨的定量基准测试。
解决学术问题
该数据集从根本上解决了视频生成模型评估中缺乏可验证的三维几何一致性与时间连续性的问题。传统评测多依赖主观视觉或简单像素差异,难以捕捉模型将相机运动误作主体运动的系统性缺陷,或物体在不可见时段的状态坍缩。通过引入无裁判的几何评分(T2)与带有必过项(同一性与可读性)的清单评分(T4/T6),本数据集有效识别了模型在长时程推理、对象持久性及物理交互上的隐性失败,为世界模型研究提供了可复现、可量化的诊断工具,推动了从生成质量到世界理解能力的范式转变。
实际应用
在实际应用中,WorldCompass可直接作为视频生成模型与具身智能体的标准评测基准。模型开发者可利用其370个冻结案例测试模型在指令控制下的运动准确性、物体状态保持能力及地形交互物理合理性,从而指导模型架构优化与训练策略调整。此外,该数据集适用于自动生成视频内容质量审计,例如在自动驾驶模拟中验证场景动态的物理一致性,或用于游戏动画中角色与环境的交互真实性。其分层任务设计亦便于针对弱点进行专项强化,提升模型的泛化能力与可靠性。
数据集最近研究
最新研究方向
当前,视频世界模型的研究正从单纯的生成质量评估转向对物理一致性、状态持久性与交互真实性的深度检验。WorldCompass数据集应运而生,其创新性地将评估范式划分为三大前沿维度:主体控制(T2)、状态演化记忆(T4)与地形交互(T6),精准击中了现有模型在三维运动理解、长时间遮挡下的物体状态保持以及复杂环境物理响应等关键短板。该数据集采用无裁判的几何评分法(T2)与严格的必备项清单机制(T4/T6),并融入防止模型取巧的门控检查,确保评估的鲁棒性与公平性。尤为值得注意的是,其数据构成刻意混合真实摄影与生成图像,以规避风格偏差,并坦诚记录评估器未经人类校验、特定场景样本稀缺等已知局限,彰显了构建严谨、可证伪基准的学术追求,为驱动视频生成模型从‘图像级模仿’迈向‘物理级推理’提供了关键评估基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务