遇见数据集

asdfo123/ForgeWM-data

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

ForgeWM训练数据是用于训练ForgeWM的预编码潜在表示数据集。它是GameFactory GF-Minecraft数据集的重新打包版本,已编码为Wan2.1 VAE潜在表示,并以LMDB格式分片,便于直接用于ForgeWM训练脚本。底层游戏视频来自GameFactory,本数据集使其更易于训练使用。数据集包含4000个剪辑、10个LMDB文件,潜在形状为(21, 16, 44, 80),对应解码后的84帧352×640视频,并包括键盘(W/S/A/D一键热编码)和鼠标(偏航、俯仰,已归一化)动作数据,总大小约89 GB。处理时,GameFactory的俯仰约定(+俯仰=向下看)已转换为MG2约定(mouse[0] > 0 =向上看)。

Pre-encoded latents for training ForgeWM. This is a repackaging of the GameFactory GF-Minecraft dataset, encoded into Wan2.1 VAE latents and sharded as LMDB for direct use by ForgeWM training scripts. The underlying gameplay videos are from GameFactory — we just made them training-ready. The dataset includes 4000 clips, 10 LMDB shards, latent shape of (21, 16, 44, 80) corresponding to 84 frames @ 352×640 decoded, keyboard actions (one-hot W/S/A/D), mouse actions ([yaw, pitch], normalized), and total size of ~89 GB. Processing note: GameFactorys pitch convention (+pitch = look-down) is flipped to MG2s (mouse[0] > 0 = look-up) at encoding time.

提供机构:
asdfo123
搜集汇总
数据集介绍
asdfo123/ForgeWM-data 数据集图片
构建方式
ForgeWM-data 数据集专为训练动作可控的世界模型 ForgeWM 而设计,基于对 GameFactory 项目中的 GF-Minecraft 数据集进行重新封装与再加工而成。原始游戏视频片段经 Wan2.1 VAE 编码器转换为紧凑的潜变量表示,并按照 ForgeWM 训练脚本的需求,将处理后的潜变量分割为 10 个 LMDB 格式的分片,每个分片包含 4000 个剪辑,总计 40000 个训练样本。在编码过程中,还对原始数据集中的俯仰角符号进行了调整,使其与 MG2 的标准保持一致。
特点
该数据集的显著特点在于其高度结构化的潜变量存储形式与丰富的动作控制信息。每个潜变量张量的形状为 (21, 16, 44, 80),对应 Wan2.1 VAE 编码后的 84 帧、分辨率 352×640 的视频内容。动作控制维度包括键盘按键(W/S/A/D 的单热编码)以及鼠标移动(归一化的偏航角与俯仰角),为条件视频扩散模型提供了精准的交互信号。整体数据量约 89 GB,规模适中,兼顾了训练效率与多样性。
使用方法
使用 ForgeWM-data 数据集前,需通过 HuggingFace CLI 工具下载至本地目录,命令为 'huggingface-cli download asdfo123/ForgeWM-data --local-dir ./data/action_lmdb --repo-type dataset'。下载完成后,在 ForgeWM 的配置文件中将数据路径指定至该本地目录即可直接接入训练流程。由于数据已预先编码为潜变量并分片存储,用户无需进行额外的预处理或格式转换,显著降低了数据集的使用门槛。
背景与挑战
背景概述
在生成式人工智能与交互式仿真交汇的前沿领域,世界模型(World Model)的构建正成为理解并模拟动态环境因果结构的关键技术。ForgeWM-data数据集创建于2026年,由ForgeWM团队发布,其核心研究问题在于提供一种可复现、可扩展的训练方案,以实现动作可控的视频扩散世界模型。该数据集是基于KlingAI Research团队于2025年发布的GameFactory项目中的GF-Minecraft游戏视频数据,经过Wan2.1 VAE编码器重编码为潜空间特征,并分片为LMDB格式,旨在降低研究者复现与训练的门槛。作为GameFactory数据的高效封装,ForgeWM-data不仅推动了Minecraft环境下动作条件视频生成的研究,也为世界模型在开放世界游戏中的通用性提供了数据基准,对视频扩散与强化学习交叉领域具有显著的奠基意义。
当前挑战
该数据集所面对的领域挑战首要在于,现有世界模型训练常依赖大规模、长时序、动作标记精确的视频数据,但诸如Minecraft等开放世界游戏的交互数据采集成本极高,且原始数据中动作与视觉之间的对应关系天然存在歧义,如鼠标视角变化与键盘位移的耦合。其次,数据处理过程中面临的挑战包括:对GameFactory原始视频中俯仰角约定(正值为向下看)需转换为符合MG2标准的向上为正的归一化格式,这一方向性翻转若未妥善处理将直接导致模型学得错误的行为映射。此外,为适配Wan2.1 VAE的潜空间,每段视频需切割为固定84帧(包含21个潜时间步),并处理为统一的(21, 16, 44, 80)潜张量形状,这一过程中帧对齐与边界截断均可能引入时序信息的缺失或冗余。
常用场景
经典使用场景
在开放世界游戏与具身智能的交叉领域,ForgeWM-data数据集为动作可控世界模型的训练提供了标准化数据基石。该数据集通过对GameFactory的GF-Minecraft视频素材进行Wan2.1 VAE潜空间编码与分片处理,构建了包含40,000个视频片段的大规模潜变量库,每个片段对应21帧潜变量张量,覆盖84帧原始Minecraft游戏画面。研究者可直接将LMDB格式的潜变量作为输入,训练基于扩散模型的世界模拟器,实现从键盘鼠标离散动作到连续视频帧的端到端预测。这一经典范式使得智能体能够在潜空间中高效学习环境动态规律,显著降低原始像素级建模的计算开销。
衍生相关工作
围绕ForgeWM-data这一数据基建,已涌现出多项具有启发性的衍生工作。其前置工作GameFactory展示了从游戏视频中提取高保真动作标注的可行性,为后续数据再加工奠定了方法论基础。ForgeWM项目本身则首次提出了可复现的动作可控世界模型训练管线,证明了在潜空间完成多步视频扩散的巨大潜力。紧随其后,研究者们开始探索将此类数据用于多任务世界模型预训练,验证统一动作空间下不同游戏间知识迁移的可能性。在更前沿的交叉领域,有工作尝试结合强化学习与基于该数据集的潜空间扩散模型,实现零样本策略泛化,这些方向共同勾勒出数据驱动世界模型从专用模拟走向通用环境理解的技术路线图。
数据集最近研究
最新研究方向
该数据集聚焦于动作可控世界模型的前沿探索,通过将GameFactory的Minecraft游戏视频重构为Wan2.1 VAE潜空间表示,为训练ForgeWM这类基于视频扩散模型的交互式世界模拟器提供了标准化数据基础。其核心创新在于将离散键盘动作(W/S/A/D)与连续鼠标控制(偏航/俯仰)对齐至潜变量序列,实现了对游戏动态生成的细粒度操控。这一方向紧密关联生成式交互视频与开放世界模拟的热点,通过将无标注游戏视频转化为动作标注的潜变量序列,突破了传统视频生成模型缺乏物理交互性的瓶颈,为构建可部署的交互式世界模型提供了可复现的训练范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务