遇见数据集

PlayWorld

收藏
arXiv2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

PlayWorld是由香港大学、快手科技Kling团队等机构联合构建的基准数据集,旨在评估视频世界模型在长时交互目标下的性能。该数据集包含171个人工标注的场景,每个场景设定一个长时目标(如360度转身或走入水中),并配套基础动作序列,覆盖几何一致性、交互保真度、视线外演化与洞察演化四个核心维度,同时纳入基本能力指标。数据构建过程从Pexels和Google Images采集多样化初始图像,由标注者定义目标、编写动作序列并生成超过820个VQA问题,最终产出1400余条交互视频。该数据集解决了现有基准因固定动作预设无法公平比较不同模型长时交互能力的问题,实验揭示当前模型在空间一致性与状态持久演化方面仍存在显著不足。

PlayWorld is a benchmark dataset jointly constructed by The University of Hong Kong, the Kling Team of Kwai Technology and other institutions, designed to evaluate the performance of video world models under long-term interactive goals. This dataset contains 171 manually annotated scenarios, each with a long-term objective such as a 360-degree turn or walking into water, paired with basic action sequences. It covers four core evaluation dimensions: geometric consistency, interaction fidelity, off-screen evolution and insight-driven evolution, as well as basic capability metrics. During the dataset construction process, diverse initial images were collected from Pexels and Google Images. Annotators defined the objectives, drafted the action sequences and generated over 820 VQA questions, ultimately producing more than 1,400 interactive videos. This dataset addresses the issue that existing benchmarks cannot fairly compare the long-term interactive capabilities of different models due to their fixed action presets. Experimental results reveal that current models still have significant shortcomings in spatial consistency and persistent state evolution.

创建时间:
2026-08-14
原始信息汇总

PlayWorld 数据集详情

简介

PlayWorld 是一个用于基准测试交互式世界模型的评估数据集,通过智能体玩家在长周期目标下的表现来评估世界模型能力。

核心特征

  • 评估方式:无人工操作,全自动评估,引擎基于 Web 的世界模型执行,自动进入初始世界状态、等待世界可交互、派发控制指令并捕获观察结果,最后保留最终视频与执行记录。
  • 数据规模:171 个案例(Cases),1,417 个视频(Videos),每次推演(Rollout)时长 10–60 秒,覆盖 9 个以上模型。
  • 模型来源:涵盖多个代表性模型,如 Alibaba 的 HappyOyster、Google DeepMind 的 Genie 3、Tencent 的 HY-World2 等。

数据集内容

  • 精选模型推演(Model Demos):展示各模型在多种任务下的推演视频,任务类型包括几何一致性(Geometry Consistency)、交互保真度(Interaction Fidelity)等,每个视频标注了任务族(Task Family)与推演时长。
  • 完整玩家过程(Full Player Process):提供从世界创建、自适应动作执行到最终结果保存的完整记录视频,展现了不同模型在实际任务中的完整执行流程。

评估维度与对比

PlayWorld 在多个关键维度上覆盖完整,相比其他基准具有更全面的评估能力:

维度 PlayWorld 覆盖情况
输入形式 文本 + 图像 + 目标
闭环自适应(Closed-loop adaptation)
长周期重访(Long-horizon revisit)
几何一致性(Geometry consistency)
状态演化(State evolution)
交互保真度(Interaction fidelity)
时间尺度/视频 10–60 秒

访问链接

  • 项目主页:https://kxding.github.io/project/PlayWorld/
  • 论文(Paper)、GitHub、排行榜(Leaderboard)及数据集(Dataset)相关资源均已提供。
搜集汇总
数据集介绍
PlayWorld 数据集图片
构建方式
PlayWorld基准的构建始于从Pexels和Google Images搜集涵盖自然、城市与幻想等多样化风格的初始世界图像,经人工筛选确保场景结构清晰后,依据目标能力与内容选定第一或第三人称视角。随后,借助Gemini 3.1 Pro生成环境描述并由人工校验修订,在此基础上,标注者依据场景特有属性定义长时程目标、设定可验证的完成条件并编写基础动作序列。最后,针对每个案例构建特定的VQA评分细则,确保预期结果可观察且适配相应维度的评估需求。整个流程生成171个人工标注案例,涉及50余种动作模式,覆盖10至60秒的交互时长,为跨模型公平比较奠定坚实基础。
特点
PlayWorld的核心特点在于其开创性地采用多模态Agent Player模拟人类玩家,通过闭环交互自适应调整动作执行,从而在共享长时程目标下实现跨模型的公平评估。基准涵盖几何一致性、交互保真度、视野外演化及洞察演化四大评估维度,借助超过820个任务定制化VQA问题对1400余条交互视频进行细致剖析。案例设计强调长远目标的可达成性与状态持续性,能够揭示模型在空间一致性维护、物理响应合理性及隐藏状态演变等深层次能力上的差异,为业界提供了更具生态效度的世界模型评测基准。
使用方法
使用时,研究者向PlayWorld提供的Agent Player输入初始帧、长时程目标及人工标注的基础动作序列,Agent Player多模态模型基于当前观测帧与动作历史,动态生成Keep、Stop、Extend、Correct或End等调整决策,经接口转换后驱动待评估的世界模型,形成闭环交互直至目标达成或达到40步预算。随后,VQA评分验证器依据各维度特定规范对生成视频进行结构化评估,结合轨迹有效性、可达性等前置验证,最终输出1至5分的维度得分与总体性能指标。此流程支持对网页端闭源模型与本地开源模型的一致评估,并能分别计算基本能力指标,实现全方位、客观的世界模型能力刻画。
背景与挑战
背景概述
随着视频生成技术的迅猛发展,视频世界模型作为能够模拟交互式环境的前沿方向,正受到学术界与工业界的广泛关注。然而,如何公平且全面地评估这些模型的长程交互能力,始终是领域内的一大难题。针对此问题,香港大学、快手科技等机构的研究团队于2026年提出了PlayWorld基准,旨在从人类玩家的视角出发,通过多模态智能体(Agent Player)与模型进行闭环交互,从而实现对世界模型在长程目标下的系统性评测。该基准涵盖171个精心设计的场景,从几何一致性、交互保真度、视野外演化和洞察演化四个核心维度,对九种主流世界模型进行了深入剖析,为视频世界模型的评估体系树立了新的标杆,并推动了该领域向更真实、更可靠的方向演进。
当前挑战
PlayWorld基准所应对的挑战横跨多个层面。在领域问题层面,现有评估基准大多依赖预设的轨迹或固定动作序列,忽视了不同模型在动作粒度与响应动态上的差异,导致跨模型性能比较缺乏公平性。同时,如何量化模型在长程交互中的空间一致性、物理合理性以及持续性状态演化,亦是核心难题。在基准构建过程中,团队需解决自动化交互协议的可靠性问题,确保智能体决策的实时性与一致性,此外还需构建涵盖多样场景与严格验证的VQA评估体系,并处理不同模型接口异构性带来的适配挑战,最终实现自动化、可复现的端到端评估流程。
常用场景
经典使用场景
PlayWorld数据集在视频世界模型的评估领域开辟了全新的范式,其最具代表性的应用场景是模拟人类玩家在具有长时程目标的交互式环境中的行为评估。该基准精心构建了171个涵盖自然、城市、幻想等多样环境的交互场景,每个场景均配有清晰的长时程目标,如环绕雕塑360度并保持注视方向不变、走入水中观察涟漪变化等。通过引入多模态代理玩家(Agent Player),PlayWorld能够自适应地调整动作序列,在统一的评估协议下对不同世界模型进行公平比较,从而精准衡量模型在几何一致性、交互逼真度、视野外演化及隐含演化四个核心维度的综合表现。
解决学术问题
该数据集系统性地解决了现有世界模型评估中长期存在的关键难题:传统基准依赖预定义轨迹,难以适应不同模型在动作粒度与响应速度上的差异,导致跨模型比较失准。PlayWorld通过引入目标导向的评估范式,将评估从底层的动作控制提升至高层的语义目标,有效解决了固定操作序列无法公平评估模型能力的问题。其创新性的VQA评分验证器能够自动判断长时程目标是否完成,并通过维度特定的验证门控机制确保记忆类评估的可靠性。此外,该基准还为封闭源码的网页交互模型提供了自动化评估方案,显著降低了人工评估的成本与主观偏差。
衍生相关工作
PlayWorld的开创性评估范式催生了一系列重要的衍生研究工作。其Agent Player设计理念启发了后续研究探索更高效的多模态决策策略,例如结合强化学习的自适应控制机制,使评估代理能够更智能地规划交互路径。该基准中提出的长时程目标与基础动作序列相结合的控制策略,为后续工作提供了重要参照,衍生出若干专注于提升世界模型长期记忆能力与几何一致性的新型算法。此外,PlayWorld的VQA评分验证器及多维评估框架,成为后续多项基准工作的基础组件,推动研究者进一步探索更具挑战性的评估维度,如跨模态一致性、物理因果推理等,共同拓展了交互式视频生成领域的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务