meituan-longcat/WBench
收藏资源简介:
WBench是一个用于交互式视频世界模型评估的综合性多轮基准测试数据集。它包含289个多轮交互案例,共计1,058个交互轮次,用于评估模型在5个维度(视频质量、设置遵循、交互遵循、一致性和物理合规性)和22个指标上的表现。该基准测试涵盖多样化的场景、风格、主题,以及第一和第三人称视角,包含四种交互类型:导航、主题动作、事件编辑和视角切换。
数据集元信息: 语言:英语 许可证:MIT协议 样本规模类别:少于1000条样本 任务类别:文本转视频、图像转视频 友好名称:WBench 标签:视频生成、世界模型(world model)、基准测试、评估、多轮、交互式、导航、视频质量、一致性、物理合规性 配置项: - 配置名称:default 数据文件: - 拆分集:完整集,路径:splits/full.parquet - 拆分集:导航子集,路径:splits/navi.parquet - 拆分集:非导航子集,路径:splits/non_navi.parquet - 拆分集:第一人称子集,路径:splits/first_person.parquet - 拆分集:第三人称子集,路径:splits/third_person.parquet <div align="center"> <img src="assets/longcat-logo-full.png" width="300"> <h1>WBench 数据集</h1> <p><i>面向交互式视频世界模型评估的综合性多轮基准测试集</i></p> [](https://huggingface.co/papers/2605.25874) [](https://github.com/meituan-longcat/WBench) [](https://huggingface.co/meituan-longcat/WBench-weights) [](https://modelscope.cn/datasets/meituan-longcat/WBench) [](https://meituan-longcat.github.io/WBench/) </div> <div align="center"> <img src="assets/teaser.png" width="90%"> </div> <p align="center" style="color: grey;"> <b>核心要点</b> —— WBench 从5个维度、22项指标出发,对20个视频世界模型开展评估。 </p> ## 概述 WBench是一款面向交互式视频世界模型评估的综合性多轮基准测试集。其包含**289个多轮交互案例**,共计1058次交互轮次,用于从**22项指标**与**5个维度**对模型进行评估: 1. 视频质量 2. 场景贴合度 3. 交互贴合度 4. 一致性 5. 物理合规性 该基准测试集覆盖多样的场景、风格、主体,涵盖第一人称与第三人称两种视角,并包含四类交互类型:导航、主体动作、事件编辑与视角切换。 <div align="center"> <img src="assets/distribution.png" width="90%"> </div> ## 使用方式 ### 下载数据集 可通过Hugging Face CLI工具下载该数据集: bash pip install huggingface_hub huggingface-cli download meituan-longcat/WBench --repo-type dataset --local-dir data/ --exclude "splits/*" ### 框架使用 如需基于WBench框架(详见[GitHub仓库](https://github.com/meituan-longcat/WBench))从指定案例生成多轮视频: python from src.models import get_model # 支持的模型包括:wan、kling、seedance(或自行注册自定义模型) model = get_model("wan") # 从指定案例生成多轮视频 # case_dict 需从 'cases/' 目录加载 result = model.generate_multi_turn( case=case_dict, output_path="work_dirs/wan/videos/case_1_combined.mp4", data_root="data/", ) ## 数据集结构 ├── cases/ # 289个案例JSON文件(包含提示词、交互流程与标注信息) ├── images/ # 289张首帧图像 ├── masks/ # 188个主体分割掩码 ## 🏆 排行榜 **20个模型 —— 导航子集(5个维度,按平均分排序)** | 排名 | 模型 | **平均分** | 视频质量 | 场景贴合度 | 交互贴合度 | 一致性 | 物理合规性 | |:---:|:---|:---:|:---:|:---:|:---:|:---:|:---:| | 1 | Kling 3.0 | **79.2 🥇** | 83.0 🥈 | 91.0 🥈 | 70.3 | 82.5 | 69.3 🥉 | | 2 | LingBot-World | **78.8 🥈** | 81.5 | 72.6 | 79.8 | 88.9 🥇 | 71.2 🥈 | | 3 | Wan 2.7 | **78.5 🥉** | 82.6 🥉 | 91.4 🥇 | 66.0 | 80.5 | 71.8 🥇 | | 4 | HY-World 1.5 | **78.4** | 80.2 | 72.2 | 87.5 🥇 | 86.0 | 66.3 | | 5 | HY-Video 1.5 | **78.2** | 79.7 | 85.6 🥉 | 71.8 | 86.7 🥉 | 67.4 | *完整排行榜结果与指标细分可查阅[项目主页](https://meituan-longcat.github.io/WBench/#leaderboard)。* ## 引用格式 bibtex @article{ying2026wbenchcomprehensivemultiturnbenchmark, title={WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation}, author={Ying, Kaining and Hu, Hengrui and Ren, Siyu and Li, Jiamu and Chen, Fengjiao and Wang, Ziwen and Cao, Xuezhi and Cai, Xunliang and Ding, Henghui}, journal={arXiv preprint arXiv:2605.25874}, year={2026} }




