遇见数据集

基于Unreal Engine的自定义视频世界模型数据集

收藏
arXiv2026-06-30 更新2026-07-02 收录
数据链接:
官方服务:

资源简介:

该数据集是基于Unreal Engine渲染构建的定制化视频世界模型专用数据集,专门设计用于解决视频生成模型在长期场景一致性和记忆机制方面的挑战。数据集包含大量具有复杂场景遮挡和动态对象的长视频序列,并配备了精确的相机姿态标注,数据来源通过游戏引擎渲染生成确保了标注的准确性。创建过程通过定制化场景设计,系统性地引入了遮挡物和运动物体以模拟真实世界复杂环境。该数据集主要应用于视频世界模型的训练与评估,旨在解决现有方法在遮挡场景和动态对象处理中泛化能力不足的问题,为学习型上下文查询机制提供关键训练支撑。

This is a customized dataset dedicated to video world models, built using Unreal Engine rendering. It is specifically designed to address the challenges faced by video generation models in long-term scene consistency and memory mechanisms. The dataset contains a large number of long video sequences with complex scene occlusions and dynamic objects, and is equipped with precise camera pose annotations. As all data is generated via game engine rendering, the accuracy of the annotations is fully ensured. In the dataset construction process, customized scene designs were used to systematically introduce occluders and moving objects, simulating the complex real-world environments. This dataset is mainly used for the training and evaluation of video world models. Its core goal is to solve the problem of insufficient generalization ability of existing methods when dealing with occluded scenes and dynamic objects, providing critical training support for learned context query mechanisms.

创建时间:
2026-06-30
搜集汇总
数据集介绍
构建方式
该数据集基于Unreal Engine构建,专注于解决视频世界模型中因遮挡和动态对象导致的场景不一致问题。通过定制化场景与动态对象设计,收集了工厂、街道、自然景观等13种具有丰富遮挡关系的场景,并引入人类和动物等动态对象以增强多样性。采用蓝图脚本实现自动化轨迹生成,支持任意长度的随机相机路径与自动避障,最终产出100段长视频,每段平均超18000帧,总计16.7小时内容。
特点
数据集的核心特点在于其针对视频世界模型记忆机制的精细设计。每个视频均配备精确的逐帧相机位姿标注,并特别关注遮挡关系和动态对象的重访模式,弥补了现有数据集在动态场景与边界条件上的不足。结合渲染数据的高精度与真实世界的多样性,通过多数据集训练策略,利用独立相机编码器处理不同类型数据,使模型同时受益于精确位姿监督与视觉真实性。
使用方法
数据集采用分块自回归生成范式,历史上下文帧与待生成帧的潜在表示沿帧维度拼接后输入条件扩散Transformer。训练时,使用查询令牌(Q tokens)作为上下文与预测令牌间的信息桥梁,利用视频生成模型自身的预训练视觉先验进行端到端学习,无需额外模块。推理时,通过分层注意力机制和计算优化策略,在5层查询层中实现上下文自适应提取,适用于长视频生成、交互式控制及存在遮挡与动态对象的复杂场景评估。
背景与挑战
背景概述
在视频世界模型领域,实现长时程场景一致性生成始终是核心挑战之一,其关键在于构建有效的记忆机制。2025年,由香港大学、复旦大学、浙江大学及快手科技联合提出的MemLearner框架,正是为了解决现有规则驱动上下文检索方法在面对遮挡与动态物体时的泛化性不足而设计。该研究团队基于Unreal Engine引擎精心构建了一组自定义视频数据集,该数据集包含丰富遮挡关系、动态物体与精确相机姿态标注,弥补了现有数据集在此类复杂场景下的空白。通过引入可学习查询令牌实现自适应上下文记忆提取,MemLearner开创了从硬编码规则到端到端学习的范式转变,为交互式视频世界模型的长时一致性研究提供了重要基准,对推动视频生成模型迈向更具记忆与推理能力的智能系统具有深远影响。
当前挑战
数据集构建面临双重挑战。其一,视频世界模型需解决的核心领域问题在于:现有模型由于上下文窗口限制,生成长视频时随着时间推移会出现严重的场景不一致现象,尤其是在包含遮挡、动态物体及场景重访的复杂情境下,规则化的视场角重叠或点云匹配检索方式难以泛化;其二,数据集构建过程遭遇显著困难:真实世界视频虽视觉真实、内容丰富,但缺乏精确相机位姿标注;渲染视频虽能提供精准位姿,却受限于视觉真实感与场景多样性不足。现有数据集如CaM、SpatialVid等均无法同时满足对长视频、遮挡关系、动态物体、重访模式及精确位姿等关键需求的完整覆盖,因此团队最终通过Unreal Engine自动轨迹脚本与定制化动静态场景组合,自主采集了含13个场景、逾18000帧每段、总计16.7小时的专用长视频数据集。
常用场景
经典使用场景
该数据集专为视频世界模型的记忆机制研究而构建,其核心使用场景在于评估和训练模型在长时程视频生成中的场景一致性。具体而言,研究者利用该数据集模拟包含遮挡关系与动态物体的复杂环境,通过提供精确的逐帧相机位姿标注与丰富的场景遍历轨迹,验证模型在遭遇视角遮挡或物体移动时,能否从历史帧中自适应地检索并整合有效上下文信息,从而维持生成视频的时空连贯性。该数据集尤其适用于测试基于可学习查询机制的上下文记忆方法,为对比规则式检索与学习式查询的性能边界提供了标准化的评测平台。
解决学术问题
该数据集针对视频世界模型长期存在的记忆缺失问题提供了关键的数据支撑。现有方法在处理场景遮挡和动态物体时,规则式上下文检索常因视野重叠不足或点云估计失效而导致生成内容不一致。通过定制化设计包含频繁遮挡、动态交互及场景重访的长视频序列,该数据集使研究者能够量化评估模型在复杂动态环境下的记忆保持能力,推动了从硬编码规则向可学习上下文查询的范式转变。其意义在于首次为端到端训练的记忆机制提供了具备精确标注的基准数据,显著促进了视频生成领域在长期一致性、交互稳定性等核心问题上的学术探索。
衍生相关工作
该数据集催生了一系列围绕可学习记忆机制的经典工作,其中最典型的代表是MemLearner,它首次提出利用查询令牌在扩散变换器内部实现自适应上下文提取,取代了传统的规则式检索。此外,后续研究在数据集基础上探索了注意力模式剪枝、查询层数优化以及基于相机位姿的几何对应隐式学习等创新方向。这些衍生工作共同构建了从记忆表示(如压缩令牌、分层特征)到高效推理(如层拆分、冗余计算消除)的完整技术路线,推动了视频世界模型在长时间交互生成中的实用性突破,并为后续探索上下文压缩与选择性遗忘等更高级记忆范式奠定了方法论与实验基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务