遇见数据集

WRBench

收藏
github2026-06-21 更新2026-06-22 收录
数据链接:
官方服务:

资源简介:

WRBench是一个用于测试视频世界模型是否保持持久世界状态的相机控制基准测试,提供Natural-25场景/事件提示和第一帧图像,以及用于相机控制、视觉完整性、可见一致性和再观察一致性的D1-D6诊断评估工具。

WRBench is a camera control benchmark designed to test whether video world models maintain persistent world states. It provides Natural-25 scene/event prompts and first-frame images, along with D1-D6 diagnostic evaluation tools for camera control, visual integrity, visibility consistency, and re-observation consistency.

创建时间:
2026-06-17
原始信息汇总

WRBench 数据集详情总结

数据集概述

WRBench 是一个用于诊断视频世界模型(Video World Models)是否在摄像机移动并返回后保持世界状态一致性的基准测试。该基准测试专注于评估生成视频中的世界状态在摄像机视角变化时的持久性。

核心组件

组件 描述
Natural-25 包含25个场景/事件提示词及第一帧图像的集合,用于受控视点干预测试
Camera Compiler 将摄像机意图转换为模型原生控制格式的工具,支持位姿路径、提示文本、动作令牌或后端负载
Evaluation Toolkit 执行D1-D6诊断评估的完整工具包,涵盖摄像机控制、视觉完整性、可见一致性及重观测一致性
Re-observation Gate 标记视频是否实际将视野外内容重新带回画面,仅在满足条件时才进行D5/D6评分
Published Artifacts 已发布的结果表格、Hugging Face数据集、基准视频、人工标注及排行榜链接

模型输入模式

模式 额外输入 摄像机控制方式 示例模型
First-frame / TI2V Natural-25第一帧图像 位姿路径、动作令牌或模型特定摄像机负载 Wan-Fun, EasyAnimate, VerseCrafter, MagicWorld, Hunyuan WorldPlay, Lingbot, minWM-HY
Source-video / TV2V 源视频片段 重渲染或摄像机条件化的源视频协议 Hydra, Gen3C, LiveWorld, ReCamMaster, Spatia, InSpatio World
Prompt plus controls / T2V 仅提示词 原生摄像机令牌或模型特定提示/控制文件 minWM Wan Action2V(独立T2V赛道)
API prompt-camera 无显式位姿输入 摄像机指令写入提示词 Kling, Hailuo, Wan API, HappyHorse

评估维度(D1-D6)

维度 全称 评分器 适用条件
D1-CamPrec 请求摄像机精度 VGGT-Omega位姿估计 需要显式位姿/轨迹目标
D1-CamAlign 提示-摄像机对齐 LLM意图解析 提示/API摄像机控制模型
D2 视觉完整性 DINOv2局部/全局特征 所有模型
D3 可见空间一致性 Qwen-3.5B VLM 所有模型
D4 可见状态一致性 Qwen-3.5B VLM 所有模型
D5 重观测空间一致性 Qwen-3.5B VLM 仅重观测支持的行
D6 重观测事件状态一致性 Qwen-3.5B VLM 仅重观测支持的行

基准测试结果

已发布23个模型在WRBench诊断配置文件上的结果,包含9,600个生成视频和2,073个支持重观测的行用于D5/D6评分。

摄像机训练与视频到视频模型

模型 CamPrec ↑ CamAlign ↑ D2 ↑ D3 ↑ D4 ↑ D5 ↑ D6 ↑
Hydra 0.822 0.999 0.691 0.648 0.500 0.509 0.445
LiveWorld 0.812 0.977 0.775 0.703 0.541 0.661 0.600
VerseCrafter 0.781 0.904 0.846 0.707 0.508 0.607 0.584
Wan-Fun 2.1-1.3B 0.771 0.882 0.842 0.725 0.513 0.709 0.657
Wan-Fun 2.2-A14B 0.758 0.761 0.848 0.810 0.625 0.698 0.649
Wan-Fun 2.1-14B 0.757 0.740 0.846 0.733 0.530 0.659 0.621
Wan-Fun 2.2-5B 0.724 0.513 0.812 0.805 0.607 0.709 0.664
ReCamMaster 0.717 0.940 0.740 0.715 0.535 0.665 0.616
Spatia 0.704 0.620 0.763 0.731 0.541 0.600 0.586
Gen3C 0.699 0.902 0.749 0.723 0.558 0.681 0.640
InSpatio World 14B 0.693 0.835 0.824 0.821 0.668 0.734 0.664

交互与动作驱动模型

模型 CamPrec ↑ CamAlign ↑ D2 ↑ D3 ↑ D4 ↑ D5 ↑ D6 ↑
MagicWorld 0.764 0.851 0.543 0.623 0.458 0.584 0.574
Hunyuan WorldPlay 0.708 0.401 0.870 0.737 0.523 0.640 0.603
Hunyuan GameCraft 0.534 0.464 0.705 0.672 0.440 0.554 0.490
Lingbot World 0.513 0.220 0.870 0.876 0.735 0.717 0.663
Lingbot Act 0.468 0.326 0.856 0.874 0.719 0.771 0.725

API提示-摄像机模型

模型 CamAlign ↑ D2 ↑ D3 ↑ D4 ↑ D5 ↑ D6 ↑
Hailuo 2.3 0.075 0.829 0.891 0.759 0.719 0.642
HappyHorse 1.0 I2V 0.025 0.860 0.875 0.715 0.779 0.695
Kling v2.6 0.094 0.864 0.854 0.674 0.711 0.617
Wan2.2 I2V Plus 0.013 0.800 0.829 0.644 0.714 0.610
Wan2.6 I2V 0.016 0.856 0.855 0.682 0.659 0.556
Wan2.7 I2V 0.020 0.750 0.848 0.676 0.715 0.638
WanX2.1 I2V Turbo 0.030 0.713 0.839 0.651 0.855 0.777

发布资源

  • 论文: arXiv (2606.20545) · Hugging Face论文页面
  • 项目页面: https://jinplu.github.io/WRBench/
  • Hugging Face资源集合: https://huggingface.co/collections/WRBench/wrbench-current-world-models-lack-a-persistent-state-core-6a365c717251293c9fc2cc26
  • 排行榜: https://huggingface.co/spaces/WRBench/wrbench-leaderboard
  • Natural-25提示词与第一帧: https://huggingface.co/datasets/WRBench/wrbench-natural25
  • 23模型结果: https://huggingface.co/datasets/WRBench/wrbench-results
  • 人工标注判定: https://huggingface.co/datasets/WRBench/wrbench-human-annotations
  • 基准视频与逐视频评分: https://huggingface.co/datasets/WRBench/wrbench-videos

支持模型范式

  • TV2V / 源视频: Hydra, Gen3C, LiveWorld, ReCamMaster, Spatia, InSpatio World(使用D1-CamPrec)
  • 摄像机条件化 / TI2V: Wan-Fun系列, EasyAnimate, VerseCrafter, Lingbot, minWM-HY(使用D1-CamPrec)
  • 交互 / 动作驱动: Hunyuan WorldPlay, Hunyuan GameCraft, MagicWorld(使用D1-CamPrec或适配器特定摄像机诊断)
  • API提示-摄像机: Kling, Hailuo, Wan API, HappyHorse(使用D1-CamAlign)
  • T2V补充: minWM Wan Action2V(独立T2V诊断赛道)

许可协议

Apache 2.0

搜集汇总
数据集介绍
WRBench 数据集图片
构建方式
WRBench的构建围绕一个核心洞察展开:当前视频世界模型在相机视角发生移动并返回后,往往无法维持一个持久的世界状态。为系统性地诊断这一缺陷,数据集精心设计了Natural-25场景事件网格,包含25个场景与4类事件,并配以25张首帧图像。研究者开发了一套相机编译器,能够将统一描述的相机意图(如偏航、平移、预设轨迹)转化为不同模型原生支持的格式——包括姿态路径、动作令牌、提示文本或后端负载。基于这些编译后的控制信号,数据集要求模型生成视频,并通过一个包含六个维度的诊断契约(D1至D6)进行自动评估。D1评估相机控制精度,D2衡量视觉完整性,D3与D4分别考察可见空间与状态一致性,而D5与D6则专门用于检验当相机离开并返回后,世界状态的保持能力。只有通过重新观测门控(Re-observation gate)确认视频实际将离开视野的内容重新带回画面的样本,才会参与后两个维度的评分。
特点
该数据集的核心特色在于其诊断性而非单纯的视频质量排名。它巧妙地将世界状态持久性问题解耦为六个可独立评分的维度,使得模型的失败模式(如相机指令遵从良好但重访场景后状态崩塌)能够清晰可见。与常规视频生成基准不同,WRBench特别强调“重新观测一致性”——即当相机视角移出并返回后,场景中的物体与事件状态是否保持连贯。为此,数据集内置了重新观测门控机制,确保D5与D6评分仅在有效样本上执行,避免无效评估。另一个显著特点是多模式兼容性:支持首帧图像到视频(TI2V)、源视频到视频(TV2V)、纯文本加控制提示以及API提示相机控制等多种输入模式,广泛覆盖当前主流的23个模型架构。同时,数据集提供了包括人类标注裁决(2,547条)和9,600个基准视频在内的大规模公开工件,连同可交互的排行榜,为社区提供了一个透明、可复现的评估平台。
使用方法
使用WRBench基准测试遵循一个清晰的四步流程。首先,根据目标模型的输入模式选择相应的接口:对于支持首帧视频生成的模型,需加载Natural-25提供的首帧图像,而对于API驱动模型,则直接使用文本提示。其次,利用内置的相机编译器将期望的相机运动(例如,'yaw:left:60@40'表示在40帧内向左偏航60度)转化为特定模型的原生控制格式,这一过程无需GPU即可完成。随后,可将编译后的请求发送至相应的模型后端进行视频生成,或通过干燥运行模式先行检查有效负载。最后,生成视频后,使用数据集提供的D1-D6评分契约进行全面评估,评分器包括用于相机姿态估计的VGGT-Omega、用于视觉特征匹配的DINOv2,以及基于Qwen-3.5B视觉语言模型的高级语义一致性评分。评估结果可通过排行榜公开,或与已发布的23模型结果表进行对比分析。详细的评分配置文件、模型适配器编写指南以及成本分析工具均在文档中提供,支持研究人员便捷地加入并评估新模型。
背景与挑战
背景概述
WRBench是由Jinpeng Lu、Dexu Zhu等研究人员于2026年提出的诊断性基准数据集,旨在评估视频世界模型在摄像机视角干预下维持持久世界状态的能力。该研究聚焦于一个核心问题:当摄像机移开并返回时,生成的视频世界能否保持状态一致性。WRBench通过Natural-25场景提示集、摄像机控制编译器和六维诊断评估协议(D1-D6),系统性地量化模型在摄像机遵从性、视觉完整性和重观测一致性等方面的表现。其发布涉及9600个生成视频和2547条人工标注,覆盖23个主流模型,提供了一个可复现的评估框架,对视频生成领域的状态稳定性研究具有重要影响力,并已在Hugging Face等平台开放相关数据集与排行榜。
当前挑战
WRBench所应对的领域挑战在于现有视频世界模型普遍缺乏持久状态核心,难以在摄像机视角变化后维持场景元素在空间与事件层面上的一致性。具体而言,模型在摄像机精确控制(D1-CamPrec)方面表现参差不齐,许多模型无法精准执行预设的相机轨迹;在视觉一致性(D3)与状态一致性(D4)上存在明显短板,生成视频常出现物体变形、位置漂移或属性突变。构建过程中,研究者面临的关键挑战包括:设计自然且可复用的摄像机控制文法以适配多种模型输入模式,开发稳健的重观测门控机制来准确筛选支持D5/D6评估的视频片段,以及协调23个不同架构模型的标准化评估流程,确保诊断结果的横向可比性。
常用场景
经典使用场景
WRBench是一个面向视频世界模型持久状态核心的诊断性基准测试,其最经典的使用场景在于评估生成视频在摄像机运动并返回后,世界状态是否保持一致性。该数据集提供了Natural-25场景/事件提示与首帧图像,通过编译摄像机控制指令,驱动模型生成视频,并利用D1至D6多维评分合约对摄像机合规性、视觉完整性、可见一致性与再观察一致性进行解耦评估。这一范式使得研究者能够系统性地检测模型在处理摄像机视角干预时,其对场景中物体位置、形态及事件状态的记忆与保持能力,从而揭示当前世界模型在持久状态表征上的根本缺陷。
实际应用
在实际应用中,WRBench为视频生成技术从娱乐性内容创作迈向具备物理一致性的可信世界模拟提供了至关重要的评估工具。其评估范式可广泛应用于游戏引擎的实时场景生成、自动驾驶感知模拟器的环境一致性验证、以及虚拟现实系统中持续世界状态的保真度控制。例如,在游戏开发中,当虚拟摄像机在场景中移动并返回主角视角时,WRBench的评估维度能够确保场景内物体的空间布局与事件状态不发生突变或遗忘。此外,该数据集还服务于视频编辑与特效制作,帮助从业者验证摄像机轨迹重定向后故事世界的逻辑连续性,从而提升沉浸式体验的真实性与可靠性。
衍生相关工作
WRBench的发布已衍生出多项相关经典工作,推动了对视频世界模型持久性表征的深入探索。其中,基于WRBench评估框架涌现了一系列针对再观察一致性的改进模型,例如通过引入隐式状态记忆模块或显式场景图约束,来增强摄像机运动后的世界状态保持能力。此外,研究者利用WRBench提供的Human-annotation跨界数据,训练了专门用于评估视频状态一致性的自动评分模型,进一步降低了人工评估成本。在摄像机控制领域,WRBench所定义的Camera-Compliance与Camera-Alignment双轨度量标准,已被后续工作采纳为评价摄像机指令跟随能力的基准。这些衍生工作共同构建了一个围绕持久性世界状态的研究生态系统,显著提升了视频生成模型的物理真实感与逻辑自洽性。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务