遇见数据集

meituan-longcat/WBench-examples

收藏
Hugging Face2026-06-10 更新2026-06-14 收录
官方服务:

资源简介:

WBench-examples数据集是用于WBench基准测试的参考视频提交集合,WBench是一个针对交互式视频世界模型的评估基准。该数据集包含多个文件夹,每个文件夹代表一个可立即评估的提交包,用户只需将其放入`work_dirs/`目录并运行WBench管道即可进行测试。数据集中的视频内容基于不同模型生成,例如HY-World 1.5和Kling 3.0,覆盖了相机导航和文本生成等类型,并提供了多轮交互剪辑视频。这些提交旨在帮助研究人员和开发者评估视频世界模型在交互式场景中的性能。

WBench-examples dataset consists of reference video submissions for WBench, a benchmark for interactive video world models. Each folder in the dataset is a ready-to-evaluate submission package that can be dropped into the `work_dirs/` directory and run through the WBench pipeline. The videos are generated from various models, such as HY-World 1.5 and Kling 3.0, covering types like camera navigation and text generation, and include combined multi-turn clips. These submissions are designed to facilitate the evaluation of video world models in interactive scenarios.

提供机构:
meituan-longcat
搜集汇总
数据集介绍
meituan-longcat/WBench-examples 数据集图片
构建方式
WBench-examples数据集是专为交互式视频世界模型评估基准WBench构建的参考视频提交包集合。每个子文件夹代表一个可直接用于评估的模型提交包,内部包含三项核心文件:`meta.json`记录模型元数据,`turns.json`定义各视频的回合边界,以及`videos/`目录下以`case_<id>_combined.mp4`命名的多回合拼接视频片段。数据集当前收录了腾讯HY-World 1.5相机控制模型生成的158个导航视频,以及可灵AI Kling 3.0文本驱动模型生成的289个全规模视频,分别按模型名称组织为独立文件夹。
使用方法
使用WBench-examples进行评测时,需先克隆WBench官方代码仓库,将目标模型文件夹(如`kling3`)复制至项目根目录下的`work_dirs/`中,随后在WBench目录下执行`python main.py --model kling3`即可启动自动化评估流水线。该轻量化集成方式支持无额外配置的即用体验,用户亦可参照WBench提交格式文档构建自定义模型包,通过相同流程完成评测。数据集遵循CC-BY-NC-4.0许可协议,适用于非商业研究场景。
背景与挑战
背景概述
WBench-examples数据集由美团LongCat团队联合多位研究者于2026年创建,旨在为交互式视频世界模型提供标准化评估基准。该数据集作为WBench的参考视频提交包,涵盖HY-World 1.5与Kling 3.0等前沿模型生成的视频样本,聚焦于多轮交互场景下的视频生成质量评测。其核心研究问题在于如何系统性地评估视频生成模型在复杂动态环境中的表现力与连贯性,从而推动视频生成技术从单帧转向交互式动态建模。WBench的提出填补了多轮视频世界模型评估领域的空白,对视频生成、具身智能及虚拟环境建模等相关领域产生了重要影响,为跨模型性能对比提供了可靠的数据基础。
当前挑战
WBench-examples数据集所面临的挑战主要体现在两方面。在领域问题层面,当前视频生成模型评估多集中于单向生成任务,缺乏对交互式多轮生成的系统性度量,难以真实反映模型在动态反馈环境中的能力。在构建过程中,数据集的挑战在于如何设计统一的标准化提交格式,确保不同模型生成的视频在时序对齐、场景一致性及交互响应上具备可比性;同时,收集并标注涵盖多种交互类型的高质量视频样本,需平衡数据规模与标注精确度,避免噪声干扰评估结果。
常用场景
经典使用场景
在视频生成与交互式世界模型的研究领域中,WBench-examples数据集作为WBench基准测试的参考提交示例,为评估交互式视频世界模型提供了标准化范例。该数据集包含了来自HY-World 1.5和Kling 3.0等代表性模型的生成视频,覆盖了相机控制与文本驱动等多种任务类型。研究者可通过将提交包放置于WBench工作目录中,利用其完整评估流程对各模型生成的多轮视频进行系统评价。这一机制使得不同模型间的性能比较变得规范且透明,成为验证视频生成模型在交互场景中表现的核心工具。
解决学术问题
该数据集重点解决了视频生成领域缺乏统一多轮交互评估标准的问题。传统视频生成评估往往侧重于单轮生成质量,而忽略了用户与模型之间连续交互过程中的动态反馈与一致性。WBench-examples通过提供多轮视频片段及其对应的轮次边界信息,使得研究者能够量化模型在连续指令下的空时一致性、多模态对齐能力以及长期依赖性建模水平。其引入的标准化评测框架推动了学术界对交互式世界模型能力的深入理解,促进了视频生成从静态生成向动态交互的范式演进。
实际应用
在实际应用层面,该数据集为视频生成模型的场景测试与商业部署提供了参考基准。例如,数字娱乐行业中的虚拟影视制作、游戏中的实时场景渲染、以及教育领域的虚拟仿真环境构建,均需依赖能够理解用户连续指令并生成连贯视频的世界模型。通过WBench-examples中的示例,开发者可以评估模型在复杂交互任务中的表现,进而优化模型在智能助手、沉浸式体验及自动化内容创作等方向的实用效果。这一工具加速了视频生成技术从实验室走向产业应用的转化进程。
数据集最近研究
最新研究方向
WBench-examples作为WBench交互式视频世界模型基准测试的参考提交示例数据集,当前聚焦于推动多轮交互式视频生成技术的标准化评估。随着视频生成模型从文本到视频(T2V)向图像到视频(I2V)及多轮交互式方向演进,该数据集通过提供HY-World 1.5和Kling 3.0等前沿模型的标准化评估包,为衡量世界模型在理解物理规律、环境反馈及用户意图追踪等方面的能力树立了标杆。其核心价值在于填补了交互式视频评估体系缺失的空白,助力学术界与工业界在自动驾驶、机器人仿真及虚拟现实等热点领域构建更鲁棒的动态场景理解系统,加速世界模型从静态生成向具身智能的跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务