WorldExam
收藏资源简介:
WorldExam是一个面向视频世界模型的层次化诊断基准,由中国科学院自动化研究所等机构联合创建,旨在系统评估模型从表面外观到内在反应的多维能力。该数据集包含1,474个精心设计的测试用例,横跨视觉质量、控制遵循、空间一致性与世界反应性四个层级,覆盖相机控制、主体控制、场景重访、地形交互、物体交互、社会交互、物理反应及目标完成共八项任务。数据构建基于原子控制单元,针对相机驱动、动作驱动与语言驱动三种范式进行统一接口适配,确保跨模型公平比较。该基准尤其关注模型对场景隐含反应的推断能力——即从初始状态推导未明确指定的因果后果,从而弥补现有评估偏重显式指令遵循的不足,为世界模型在交互式仿真与具身智能领域的进步提供关键诊断工具。
WorldExam is a hierarchical diagnostic benchmark for video world models, co-developed by the Institute of Automation, Chinese Academy of Sciences and other partner institutions. It aims to systematically evaluate the multi-dimensional capabilities of models ranging from surface appearances to internal responses. The dataset contains 1,474 carefully curated test cases, spanning four hierarchical levels: visual quality, control compliance, spatial consistency, and world reactivity, and covers a total of eight tasks: camera control, agent control, scene revisitation, terrain interaction, object interaction, social interaction, physical response, and goal completion. Built upon atomic control units, the dataset adapts unified interfaces for three paradigms including camera-driven, action-driven, and language-driven, ensuring fair cross-model comparison. This benchmark particularly focuses on the model's ability to infer implicit scene responses, namely deriving unspecified causal consequences from initial states, thus addressing the limitation of existing evaluations that overly emphasize explicit instruction following, and providing a critical diagnostic tool to advance world models in the fields of interactive simulation and embodied intelligence.
WorldExam 数据集详情总结
数据集概述
WorldExam 是一个面向可控视频世界模型的层次化诊断基准(hierarchical diagnostic benchmark)。其核心目标不仅是评估模型的视觉外观表现和显式指令遵循能力,更关注模型能否保持连贯的世界状态并展现出固有反应性(Inherent Reactivity)——即模型能否从场景状态中推断世界应当如何反应,并生成输入中未显式描述但合理的后续结果。
数据集规模与构成
- 测试用例总数:1,474 个
- 控制接口:3 种(相机驱动、动作驱动、语言驱动)
- 诊断层级:4 个
- 评估任务:8 个
测试用例特点
- 涵盖第一人称和第三人称视角
- 主体类型包括人类、动物、车辆和机器人
- 包含户外与室内的真实场景
- 覆盖 3D 渲染、电影镜头、特写镜头、动画和行车记录仪视频等多种视频类型
诊断层级与评估任务
1. 视觉质量(Visual Quality)
评估视频的表观质量,包括成像质量、光度一致性、时间闪烁、主体一致性、运动平滑度和美学质量。
2. 控制遵循(Control Adherence)
衡量受控相机或主体是否遵循输入控制,具体任务包括:
- 相机控制(Camera Control)
- 主体控制(Subject Control)
3. 空间一致性(Spatial Consistency)
衡量当相机重新访问先前观察过的视角时,模型是否保持连贯的世界状态,具体任务包括场景重访(Scene Revisit)和 3D 一致性。
4. 世界反应性(World Reactivity)
评估超出输入显式指定的场景条件反应和目标导向行为,具体任务包括:
- 地形交互(Terrain Interaction)
- 物体交互(Object Interaction)
- 社会交互(Social Interaction)
- 物理反应(Physical Reaction)
- 目标完成(Goal Completion)
注意:动态交互轨道包含主体控制和五项世界反应性任务,仅适用于兼容的动作驱动和语言驱动模型;目标完成任务仅限语言驱动模型。
与其他基准的对比
页面将 WorldExam 与 WorldScore、MIND、Omni-WorldBench、WorldMark、iWorld-Bench、WBench、WorldOlympiad、WorldRoamBench 等 8 个代表性世界模型基准进行了比较。WorldExam 是唯一同时支持相机驱动(C)、动作驱动(A)、语言驱动(L)三种模型范式,并完整覆盖全部 8 项评估任务(包括地形交互、物体交互、社会交互、物理反应和目标完成)的基准,评估了 20 个模型。
排行榜摘要
静态场景轨道(Static-Scene Track)
静态场景轨道的前 5 名模型为:
| 排名 | 模型 | 总体得分 |
|---|---|---|
| 1 | NeoVerse | 85.39 |
| 2 | WorldPlay | 81.61 |
| 3 | InSpatio-World (1.3B) | 81.40 |
| 4 | TrajectoryCrafter | 78.00 |
| 5 | Infinite-World | 74.33 |
该轨道评估的任务指标包括:相机控制、场景重访、3D 一致性、光度一致性、时间闪烁、美学质量和成像质量。
动态交互轨道(Dynamic-Interaction Track)
动态交互轨道的前 5 名模型为:
| 排名 | 模型 | 总体得分 |
|---|---|---|
| 🥇 | Veo 3.1 | 72.77 |
| 🥈 | Vidu Q3 | 72.35 |
| 🥉 | Hailuo 2.3 | 72.03 |
| 4 | HappyHorse 1.0 | 70.57 |
| 5 | Wan 2.6 I2V | 66.60 |
该轨道评估的任务指标包括:主体控制、地形交互、物体交互、社会交互、物理反应、目标完成、主体一致性、运动平滑度、美学质量和成像质量。
模型适用说明
排行榜支持按评估轨道(动态交互轨道/静态场景轨道)和模型范式(相机驱动/动作驱动/语言驱动)进行筛选,当前页面中动态交互轨道共展示了 9 个模型的评估结果(语言驱动 7 个,动作驱动 2 个)。所有保留的指标均已归一化,数值越高表示性能越好。




