WildWorld
收藏资源简介:
WildWorld是由Alaya Studio与盛大AI研究院东京联合构建的大规模动态世界建模数据集,源自AAA级游戏《怪物猎人:荒野》的自动化采集。该数据集包含1.08亿帧高清画面,涵盖450余种战斗动作(移动/攻击/施法等),同步提供角色骨骼、世界状态、相机位姿及深度图等逐帧标注。通过定制化工具链实现自动化游戏过程录制与多源数据对齐,并衍生出WildBench基准测试以评估动作跟随与状态对齐能力,为研究状态感知的视频生成及长时序一致性建模提供了首个具备显式状态标注的游戏引擎级数据集。
WildWorld is a large-scale dynamic world modeling dataset jointly developed by Alaya Studio and Tokyo Research Institute of Shengda AI, automatically collected from the AAA-grade video game *Monster Hunter: Wilds*. This dataset includes 108 million frames of high-definition footage, covering over 450 types of combat actions such as movement, attack and spell casting. It also provides synchronized per-frame annotations including character skeletons, world states, camera poses and depth maps. Constructed via a customized toolchain for automated gameplay recording and multi-source data alignment, WildWorld further spawned the WildBench benchmark to assess action following and state alignment capabilities. As the first game-engine-level dataset with explicit state annotations, it offers a critical resource for research on state-aware video generation and long-term temporal consistency modeling.
WildWorld 数据集概述
数据集简介
WildWorld 是一个面向生成式动作角色扮演游戏(Generative ARPG)的大规模动态世界建模数据集,其核心特点是包含动作和显式状态信息。该数据集旨在解决现有数据集中动作空间多样性不足、且动作通常与视觉观察直接绑定而非通过底层状态进行中介的问题。
数据集特点
- 核心贡献:提供了带有显式状态标注的大规模动作条件世界建模数据。
- 数据来源:数据自动采集自写实风格的AAA级动作角色扮演游戏《Monster Hunter: Wilds》。
- 数据内容:包含RGB帧、对齐的深度图、相机位姿、骨架信息以及动作/状态的真实标注。
- 标注信息:同时提供了细粒度的动作级描述和样本级描述,使数据集适用于多种实验设置。
数据集规模与构成
- 数据量:包含超过 1.08亿 个标注帧。
- 动作多样性:涵盖 450多种 动作类型。
- 场景元素:
- 涉及 29种 怪物物种。
- 包含 4种 玩家角色。
- 包含 4种 武器类型。
- 包含 5个 不同的开放世界场景。
- 场景分布:66%为战斗场景,34%为移动场景,动作分布呈现自然的长尾分布。
数据集构建流程
构建流程分为四个阶段:
- 自动化游戏进行:通过程序化UI导航和行为树驱动的AI实现。
- 多流录制:采用带时间戳的逐帧同步记录。
- 数据处理与过滤:移除短片段、镜头切换、卡顿、极端光照和遮挡情况。
- 分层标注:基于状态真实标注生成动作级描述,并通过大语言模型生成样本级摘要。
配套基准:WildBench
WildBench 是一个包含200个精选测试样本的综合基准,用于从四个维度评估交互式世界模型:
- 视频质量:运动平滑度、动态程度、美学质量、图像质量(使用VBench评估)。
- 相机控制:通过运动恢复结构(SfM)计算绝对轨迹误差(ATE)和相对位姿误差(RPE)。
- 动作跟随:评估生成视频是否忠实反映输入动作。
- 状态对齐:通过关键点跟踪评估生成状态与真实状态演变之间的对齐程度。
实验设置
在WildWorld数据集上评估了多种交互式视频生成方法,条件设置包括:
- Baseline:Wan2.2-TI2V-5B,仅使用文本和图像生成视频,无显式控制信号。
- CamCtrl:使用真实逐帧相机位姿进行相机条件生成。
- SkelCtrl:使用渲染的骨架姿态视频进行骨架条件生成。
- StateCtrl:联合使用相机、骨架和世界状态进行状态条件生成。
- StateCtrl-AR:自回归变体,仅从第一帧预测状态。
引用信息
- 标题:WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG
- 作者:Zhen Li, Zian Meng, Shuwei Shi, Wenshuo Peng, Yuwei Wu, Bo Zheng, Chuanhao Li, Kaipeng Zhang
- 年份:2026
- arXiv:https://arxiv.org/abs/2603.23497
- 主分类:cs.CV




