遇见数据集

WorldExam

收藏
arXiv2026-08-04 更新2026-08-05 收录
数据链接:
官方服务:

资源简介:

WorldExam是一个面向视频世界模型的层次化诊断基准,由中国科学院自动化研究所等机构联合创建,旨在系统评估模型从表面外观到内在反应的多维能力。该数据集包含1,474个精心设计的测试用例,横跨视觉质量、控制遵循、空间一致性与世界反应性四个层级,覆盖相机控制、主体控制、场景重访、地形交互、物体交互、社会交互、物理反应及目标完成共八项任务。数据构建基于原子控制单元,针对相机驱动、动作驱动与语言驱动三种范式进行统一接口适配,确保跨模型公平比较。该基准尤其关注模型对场景隐含反应的推断能力——即从初始状态推导未明确指定的因果后果,从而弥补现有评估偏重显式指令遵循的不足,为世界模型在交互式仿真与具身智能领域的进步提供关键诊断工具。

WorldExam is a hierarchical diagnostic benchmark for video world models, co-developed by the Institute of Automation, Chinese Academy of Sciences and other partner institutions. It aims to systematically evaluate the multi-dimensional capabilities of models ranging from surface appearances to internal responses. The dataset contains 1,474 carefully curated test cases, spanning four hierarchical levels: visual quality, control compliance, spatial consistency, and world reactivity, and covers a total of eight tasks: camera control, agent control, scene revisitation, terrain interaction, object interaction, social interaction, physical response, and goal completion. Built upon atomic control units, the dataset adapts unified interfaces for three paradigms including camera-driven, action-driven, and language-driven, ensuring fair cross-model comparison. This benchmark particularly focuses on the model's ability to infer implicit scene responses, namely deriving unspecified causal consequences from initial states, thus addressing the limitation of existing evaluations that overly emphasize explicit instruction following, and providing a critical diagnostic tool to advance world models in the fields of interactive simulation and embodied intelligence.

创建时间:
2026-08-04
原始信息汇总

WorldExam 数据集详情总结

数据集概述

WorldExam 是一个面向可控视频世界模型的层次化诊断基准(hierarchical diagnostic benchmark)。其核心目标不仅是评估模型的视觉外观表现和显式指令遵循能力,更关注模型能否保持连贯的世界状态并展现出固有反应性(Inherent Reactivity)——即模型能否从场景状态中推断世界应当如何反应,并生成输入中未显式描述但合理的后续结果。

数据集规模与构成

  • 测试用例总数:1,474 个
  • 控制接口:3 种(相机驱动、动作驱动、语言驱动)
  • 诊断层级:4 个
  • 评估任务:8 个

测试用例特点

  • 涵盖第一人称和第三人称视角
  • 主体类型包括人类、动物、车辆和机器人
  • 包含户外与室内的真实场景
  • 覆盖 3D 渲染、电影镜头、特写镜头、动画和行车记录仪视频等多种视频类型

诊断层级与评估任务

1. 视觉质量(Visual Quality)

评估视频的表观质量,包括成像质量、光度一致性、时间闪烁、主体一致性、运动平滑度和美学质量。

2. 控制遵循(Control Adherence)

衡量受控相机或主体是否遵循输入控制,具体任务包括:

  • 相机控制(Camera Control)
  • 主体控制(Subject Control)

3. 空间一致性(Spatial Consistency)

衡量当相机重新访问先前观察过的视角时,模型是否保持连贯的世界状态,具体任务包括场景重访(Scene Revisit)和 3D 一致性。

4. 世界反应性(World Reactivity)

评估超出输入显式指定的场景条件反应和目标导向行为,具体任务包括:

  • 地形交互(Terrain Interaction)
  • 物体交互(Object Interaction)
  • 社会交互(Social Interaction)
  • 物理反应(Physical Reaction)
  • 目标完成(Goal Completion)

注意:动态交互轨道包含主体控制和五项世界反应性任务,仅适用于兼容的动作驱动和语言驱动模型;目标完成任务仅限语言驱动模型。

与其他基准的对比

页面将 WorldExam 与 WorldScore、MIND、Omni-WorldBench、WorldMark、iWorld-Bench、WBench、WorldOlympiad、WorldRoamBench 等 8 个代表性世界模型基准进行了比较。WorldExam 是唯一同时支持相机驱动(C)、动作驱动(A)、语言驱动(L)三种模型范式,并完整覆盖全部 8 项评估任务(包括地形交互、物体交互、社会交互、物理反应和目标完成)的基准,评估了 20 个模型。

排行榜摘要

静态场景轨道(Static-Scene Track)

静态场景轨道的前 5 名模型为:

排名 模型 总体得分
1 NeoVerse 85.39
2 WorldPlay 81.61
3 InSpatio-World (1.3B) 81.40
4 TrajectoryCrafter 78.00
5 Infinite-World 74.33

该轨道评估的任务指标包括:相机控制、场景重访、3D 一致性、光度一致性、时间闪烁、美学质量和成像质量。

动态交互轨道(Dynamic-Interaction Track)

动态交互轨道的前 5 名模型为:

排名 模型 总体得分
🥇 Veo 3.1 72.77
🥈 Vidu Q3 72.35
🥉 Hailuo 2.3 72.03
4 HappyHorse 1.0 70.57
5 Wan 2.6 I2V 66.60

该轨道评估的任务指标包括:主体控制、地形交互、物体交互、社会交互、物理反应、目标完成、主体一致性、运动平滑度、美学质量和成像质量。

模型适用说明

排行榜支持按评估轨道(动态交互轨道/静态场景轨道)和模型范式(相机驱动/动作驱动/语言驱动)进行筛选,当前页面中动态交互轨道共展示了 9 个模型的评估结果(语言驱动 7 个,动作驱动 2 个)。所有保留的指标均已归一化,数值越高表示性能越好。

搜集汇总
数据集介绍
WorldExam 数据集图片
构建方式
WorldExam基准的构建基于分层诊断框架,涵盖四个层级:视觉质量、控制遵循、空间一致性和世界反应性。数据集包括1,474个测试用例,分布在八个评估任务中。通过将可控行为分解为原子控制单元,并适配至相机驱动、动作驱动和语言驱动三种模型接口,实现统一评估。测试用例的生成采用了模式库扩展、LLM场景生成器、候选图像生成与人工筛选、图像条件化案例精炼等步骤,确保场景初始状态支持预期行为并保留未明确说明的反应。
特点
WorldExam的核心特点在于其分层递进的诊断体系,尤其强调内在反应性的评估,即模型从场景状态推断世界应如何反应并生成合理后果的能力,而不仅仅是显式指令的满足。数据集覆盖多种视角、主体类型、视觉风格和场景内容,且每个任务内部包含多样化的子类别,避免对单一模板的依赖。此外,通过静态场景和动态交互两条轨道,分别评估不同模型范式,避免不实惩罚。
使用方法
WorldExam支持对相机、动作和语言驱动模型进行统一评估。评估过程中,静态场景轨道使用几何重建方法评估相机控制与场景重现,动态交互轨道则结合SAM2跟踪与VLN评判进行任务评分,其中部分任务基于检查表进行评估。数据集提供详细的接口适配方案和评估协议,用户可按需选取任务和指标。基准的发布将促进视频世界模型向深层反应性能力的发展。
背景与挑战
背景概述
WorldExam是由中国科学院自动化研究所、清华大学等机构的研究人员于2026年提出的一个分层诊断基准,旨在评估可控视频生成模型作为世界模型的内在反应性。该基准由Yuxue Yang、Shuyao Shang等人构建,包含1474个测试用例,横跨视觉质量、控制遵循、空间一致性和世界反应性四个诊断层级,并支持相机驱动、动作驱动和语言驱动三种模型范式。其核心研究问题是超越生成视频的表面外观,评估模型能否从场景状态推断世界应如何反应,并生成输入中未明确指定的合理后果。WorldExam通过引入世界反应性层级,填补了现有基准仅关注显式指令满足的空白,为视频世界模型社区提供了统一的评估框架,推动了该领域对内在反应性的系统化研究。
当前挑战
WorldExam面临的挑战主要来自两个方面。在领域问题层面,现有基准大多评估显式指令的完成度,如相机轨迹、动作序列或交互结果,却忽视了模型对场景条件反应和目标任务的内在推断能力,这一能力恰恰是世界模型的核心特征。在构建过程中,挑战在于如何针对不同模型范式统一表示控制行为,如何设计能够区分显式控制与内在反应的评估任务,以及如何确保测试用例的语义覆盖和物理合理性。此外,评估协议需兼顾几何重建的精度与视觉语言模型判断的可靠性,同时避免因模型接口差异导致的公平性问题。这些挑战促使WorldExam采用原子控制单元和自适应接口,以在多样化的模型间实现有意义的比较。
常用场景
经典使用场景
WorldExam作为世界模型评估基准,其经典用途在于对可控视频生成模型进行分层诊断,从视觉质量、控制遵循度、空间一致性和世界反应性四个维度全面衡量模型能力。该基准通过1,474个精心设计的测试用例,覆盖摄像机驱动、动作驱动和语言驱动三种主流模型范式,使得研究人员能够统一比较不同接口下的模型性能。其独特的接口适配机制将原子控制单元分别映射为三维相机轨迹、离散动作序列或自然语言提示,从而在同一任务框架下评估异构模型,特别适用于揭示模型在场景条件反应和目标导向行为上的表现差距。
实际应用
在实际应用中,WorldExam可用于算法竞赛和模型研发的权威评测,帮助企业和研究机构在部署世界模型前精准识别其能力短板。在游戏开发、自动驾驶仿真、机器人操作等产业场景中,该基准为筛选具备稳定空间记忆和动态交互能力的模型提供了可复现的量化标准。此外,其分层报告机制支持开发者定位模型在视觉生成、控制精度或反应真实性上的薄弱环节,从而指导数据收集和模型迭代,加速实用世界模型的落地与优化。
衍生相关工作
WorldExam衍生了多项重要研究工作,包括针对摄像机驱动模型的图像空间位移对齐方法,以及基于几何重建的模型评估协议,这些方法被后续研究广泛借鉴。它推动了世界模型评估从视觉质量向内在反应性的范式转变,启发了多个后续基准,如WorldOlympiad对长时程物理交互的探讨,以及WorldRoamBench对空间记忆和可控性的深入分析。其数据集构建流程和VLM评判员校验策略也成为其他领域评估基准的标准参考,促进了视频生成模型评估体系的成熟与规范化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务