遇见数据集

meituan-longcat/WBench

收藏
Hugging Face2026-05-29 更新2026-06-14 收录
官方服务:

资源简介:

WBench是一个用于交互式视频世界模型评估的综合性多轮基准测试数据集。它包含289个多轮交互案例,共计1,058个交互轮次,用于评估模型在5个维度(视频质量、设置遵循、交互遵循、一致性和物理合规性)和22个指标上的表现。该基准测试涵盖多样化的场景、风格、主题,以及第一和第三人称视角,包含四种交互类型:导航、主题动作、事件编辑和视角切换。

数据集元信息: 语言:英语 许可证:MIT协议 样本规模类别:少于1000条样本 任务类别:文本转视频、图像转视频 友好名称:WBench 标签:视频生成、世界模型(world model)、基准测试、评估、多轮、交互式、导航、视频质量、一致性、物理合规性 配置项: - 配置名称:default 数据文件: - 拆分集:完整集,路径:splits/full.parquet - 拆分集:导航子集,路径:splits/navi.parquet - 拆分集:非导航子集,路径:splits/non_navi.parquet - 拆分集:第一人称子集,路径:splits/first_person.parquet - 拆分集:第三人称子集,路径:splits/third_person.parquet <div align="center"> <img src="assets/longcat-logo-full.png" width="300"> <h1>WBench 数据集</h1> <p><i>面向交互式视频世界模型评估的综合性多轮基准测试集</i></p> [![论文](https://img.shields.io/badge/Paper-red?style=for-the-badge&logo=arxiv&logoColor=white)](https://huggingface.co/papers/2605.25874) [![代码](https://img.shields.io/badge/Code-black?style=for-the-badge&logo=github&logoColor=white)](https://github.com/meituan-longcat/WBench) [![模型权重](https://img.shields.io/badge/Weights-FF9D00?style=for-the-badge&logo=huggingface&logoColor=white)](https://huggingface.co/meituan-longcat/WBench-weights) [![ModelScope](https://img.shields.io/badge/ModelScope-6B4EFF?style=for-the-badge&logo=data:image/svg+xml;base64,PHN2ZyBmaWxsPSJ3aGl0ZSIgZmlsbC1ydWxlPSJldmVub2RkIiBoZWlnaHQ9IjFlbSIgc3R5bGU9ImZsZXg6bm9uZTtsaW5lLWhlaWdodDoxIiB2aWV3Qm94PSIwIDAgMjQgMjQiIHdpZHRoPSIxZW0iIHhtbG5zPSJodHRwOi8vd3d3LnczLm9yZy8yMDAwL3N2ZyI+PHRpdGxlPk1vZGVsU2NvcGU8L3RpdGxlPjxwYXRoIGQ9Ik0yLjY2NyA1LjNIOHYyLjY2N0g1LjMzM3YyLjY2NkgyLjY2N1Y4LjQ2N0guNXYyLjE2NmgyLjE2N1YxMy4zSDBWNy45NjdoMi42NjdWNS4zek0yLjY2NyAxMy4zaDIuNjY2djIuNjY3SDh2Mi42NjZIMi42NjdWMTMuM3pNOCAxMC42MzNoMi42NjdWMTMuM0g4di0yLjY2N3pNMTMuMzMzIDEzLjN2Mi42NjdoLTIuNjY2VjEzLjNoMi42NjZ6TTEzLjMzMyAxMy4zdi0yLjY2N0gxNlYxMy4zaC0yLjY2N3oiPjwvcGF0aD48cGF0aCBjbGlwLXJ1bGU9ImV2ZW5vZGQiIGQ9Ik0yMS4zMzMgMTMuM3YtMi42NjdoLTIuNjY2VjcuOTY3SDE2VjUuM2g1LjMzM3YyLjY2N0gyNFYxMy4zaC0yLjY2N3ptMC0yLjY2N0gyMy41VjguNDY3aC0yLjE2N3YyLjE2NnoiPjwvcGF0aD48cGF0aCBkPSJNMjEuMzMzIDEzLjN2NS4zMzNIMTZ2LTIuNjY2aDIuNjY3VjEzLjNoMi42NjZ6Ij48L3BhdGg+PC9zdmc+&logoColor=white)](https://modelscope.cn/datasets/meituan-longcat/WBench) [![主页](https://img.shields.io/badge/Homepage-blue?style=for-the-badge&logo=google-chrome&logoColor=white)](https://meituan-longcat.github.io/WBench/) </div> <div align="center"> <img src="assets/teaser.png" width="90%"> </div> <p align="center" style="color: grey;"> <b>核心要点</b> —— WBench 从5个维度、22项指标出发,对20个视频世界模型开展评估。 </p> ## 概述 WBench是一款面向交互式视频世界模型评估的综合性多轮基准测试集。其包含**289个多轮交互案例**,共计1058次交互轮次,用于从**22项指标**与**5个维度**对模型进行评估: 1. 视频质量 2. 场景贴合度 3. 交互贴合度 4. 一致性 5. 物理合规性 该基准测试集覆盖多样的场景、风格、主体,涵盖第一人称与第三人称两种视角,并包含四类交互类型:导航、主体动作、事件编辑与视角切换。 <div align="center"> <img src="assets/distribution.png" width="90%"> </div> ## 使用方式 ### 下载数据集 可通过Hugging Face CLI工具下载该数据集: bash pip install huggingface_hub huggingface-cli download meituan-longcat/WBench --repo-type dataset --local-dir data/ --exclude "splits/*" ### 框架使用 如需基于WBench框架(详见[GitHub仓库](https://github.com/meituan-longcat/WBench))从指定案例生成多轮视频: python from src.models import get_model # 支持的模型包括:wan、kling、seedance(或自行注册自定义模型) model = get_model("wan") # 从指定案例生成多轮视频 # case_dict 需从 'cases/' 目录加载 result = model.generate_multi_turn( case=case_dict, output_path="work_dirs/wan/videos/case_1_combined.mp4", data_root="data/", ) ## 数据集结构 ├── cases/ # 289个案例JSON文件(包含提示词、交互流程与标注信息) ├── images/ # 289张首帧图像 ├── masks/ # 188个主体分割掩码 ## 🏆 排行榜 **20个模型 —— 导航子集(5个维度,按平均分排序)** | 排名 | 模型 | **平均分** | 视频质量 | 场景贴合度 | 交互贴合度 | 一致性 | 物理合规性 | |:---:|:---|:---:|:---:|:---:|:---:|:---:|:---:| | 1 | Kling 3.0 | **79.2 🥇** | 83.0 🥈 | 91.0 🥈 | 70.3 | 82.5 | 69.3 🥉 | | 2 | LingBot-World | **78.8 🥈** | 81.5 | 72.6 | 79.8 | 88.9 🥇 | 71.2 🥈 | | 3 | Wan 2.7 | **78.5 🥉** | 82.6 🥉 | 91.4 🥇 | 66.0 | 80.5 | 71.8 🥇 | | 4 | HY-World 1.5 | **78.4** | 80.2 | 72.2 | 87.5 🥇 | 86.0 | 66.3 | | 5 | HY-Video 1.5 | **78.2** | 79.7 | 85.6 🥉 | 71.8 | 86.7 🥉 | 67.4 | *完整排行榜结果与指标细分可查阅[项目主页](https://meituan-longcat.github.io/WBench/#leaderboard)。* ## 引用格式 bibtex @article{ying2026wbenchcomprehensivemultiturnbenchmark, title={WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation}, author={Ying, Kaining and Hu, Hengrui and Ren, Siyu and Li, Jiamu and Chen, Fengjiao and Wang, Ziwen and Cao, Xuezhi and Cai, Xunliang and Ding, Henghui}, journal={arXiv preprint arXiv:2605.25874}, year={2026} }

提供机构:
meituan-longcat
搜集汇总
数据集介绍
meituan-longcat/WBench 数据集图片
构建方式
WBench数据集由美团长猫团队构建,旨在系统评估交互式视频世界模型的多轮生成能力。该数据集精心设计了289个多轮交互案例,涵盖1058轮交互,覆盖了导航、主体动作、事件编辑和视角切换四种交互类型。每个案例包含初始提示词、多轮交互指令与详细标注信息,并配备了首帧图像与主体分割掩码,确保了评估的全面性与精细化。数据集按交互类型与视角维度细分为导航、非导航、第一人称与第三人称等多个子集,便于针对性地分析模型在不同场景下的表现。
特点
WBench具有鲜明的多维度评估特色,构建了包含22项指标的五维评估体系,分别衡量视频质量、设定遵循、交互遵循、一致性与物理合规性。该数据集场景多样,风格与主体丰富,同时覆盖第一人称与第三人称视角,能够全面检验模型在复杂交互任务中的表现。其独特之处在于引入了多轮交互的评估范式,突破了传统单轮生成的局限,为世界模型研究提供了高标准的测试基准。
使用方法
使用者可通过Hugging Face CLI下载WBench数据集,将其存放于本地目录。借助配套的GitHub框架,研究人员能够便捷地加载预注册的视频生成模型(如Wan、Kling等),并调用generate_multi_turn接口,传入案例字典与输出路径即可生成多轮交互视频。该框架支持自定义模型注册,方便研究者将自身开发的模型纳入评估流程。数据集结构清晰,包含cases、images与masks三个核心目录,便于灵活提取与分析。
背景与挑战
背景概述
在视频生成与物理世界模型飞速发展的背景下,如何系统性地评估模型在多轮交互、场景遵循与物理一致性等复杂维度的表现,成为该领域亟待解决的核心问题。WBench由美团LongCat团队于2026年创建,核心研究人员包括Ying、Hu、Ren等,旨在填补现有基准测试在交互式视频世界模型评估上的空白。该数据集包含289个多轮交互案例与1058个交互轮次,覆盖22个指标与5个维度(视频质量、设定遵循、交互遵循、一致性、物理合规性),并支持导航、主体动作、事件编辑与视角切换四种交互类型。WBench以其系统性的评估框架和维度划分,显著推动了视频世界模型从静态生成向交互式动态评估的转型,在学术界与工业界产生了广泛影响。
当前挑战
当前视频世界模型面临的多重挑战集中体现在:首先,领域问题层面,现有模型难以在长时序多轮交互中同时保证视频画质、用户指令遵循与物理世界规律的一致性,尤其是在导航与视角切换等复杂场景下,模型常出现动作断裂、物体变形或因果关系错误。其次,构建过程中,WBench面临案例设计的高复杂度与多样性需求,需要手动标注289个交互案例的精确时序与语义对应关系,并确保22个指标在不同交互类型(导航、主体动作等)上的公平量化。此外,如何从第一/第三人称双视角采集具有高度真实感的图像与分割掩码,同时维持交互轮次间的视觉连贯性,对数据采集与标注流程提出了极高要求。
常用场景
经典使用场景
WBench作为交互式视频世界模型的多轮评估基准,其核心使用场景是系统性地评估视频生成模型在复杂、多轮交互任务中的综合表现。该数据集包含289个多轮交互案例,总计1058轮交互,覆盖了导航、主体动作、事件编辑和视角切换四种交互类型。研究者通过该数据集可全面衡量模型在视频质量、设定遵循、交互遵循、一致性和物理合理性五个维度上的能力,为对比不同视频世界模型的性能提供了标准化、多维度的评测平台。
衍生相关工作
围绕WBench衍生了一系列基础性和前瞻性工作。该评测框架推动了多轮交互评估标准的确立,并催生了针对视频世界模型的性能排行榜,涵盖了20个主流模型在22项指标上的对比分析。此外,研究者基于其标注数据(包括分割掩码和逐轮交互文本)开发了更鲁棒的视频生成一致性度量方法,并启发了后续工作对模型物理合规性与指令对齐能力的深入研究,为视频生成领域的评估理论和技术迭代奠定了坚实基础。
数据集最近研究
最新研究方向
当前视频生成领域正从单向视觉合成迈向交互式世界模型构建,WBench作为首个多轮交互式视频世界模型评估基准,系统性地定义了视频质量、设定遵循、交互遵循、时空一致性与物理规律遵循五大评测维度,涵盖导航、主体动作、事件编辑和视角切换四类交互范式,并引入22项量化指标对20个前沿模型进行横向对比,推动了交互式视频生成从定性展示向量化评估的范武演进。该数据集对Kling 3.0、Wan 2.7等代表性模型的剖析,揭示了动态场景下物理真实性保持与交互可拓展性之间的技术落差,为构建高保真、可操控的数字世界提供了关键的评估锚点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务