遇见数据集

SolarWM

收藏
arXiv2026-09-03 更新2026-09-04 收录
官方服务:

资源简介:

SolarWM是一个完全开放的数据集基础设施,旨在为交互式视频世界模型提供可扩展的训练基础。该数据集包含约143万条规范剪辑,总数据量超过25TB,覆盖真实、合成和游戏环境,涵盖多样的场景布局、相机运动和运动模式。其创建过程通过可重配置的多源数据引擎,将10个异构源数据集统一为帧对齐的表示,包括视觉观察、相机几何、字幕和质量元数据,并解耦源预处理与训练混合构建。该数据集服务于长时域交互式视频生成任务,旨在解决数据异构性和模型适应性耦合的挑战,支持可重复、可扩展的世界模型研究。

SolarWM is a fully open dataset infrastructure designed to provide a scalable training foundation for interactive video world models. This dataset contains approximately 1.43 million standardized video clips with a total volume exceeding 25 TB, covering real, synthetic, and gaming environments, and encompasses diverse scene layouts, camera motions, and movement patterns. Its creation process leverages a reconfigurable multi-source data engine to unify 10 heterogeneous source datasets into frame-aligned representations, including visual observations, camera geometry, subtitles, and quality metadata, while decoupling source preprocessing and training mixture construction. This dataset targets long-term interactive video generation tasks, aiming to address the challenges of coupled data heterogeneity and model adaptability, and supports reproducible and scalable world model research.

创建时间:
2026-09-03
原始信息汇总

SolarWM 数据集详情

基本信息

  • 名称: SolarWM(太阳世界模型)
  • 子标题: Open Data and Scalable Training for Long-Horizon Video World Models
  • 发布时间: 2026年
  • 基础设施: 开放基础设施(Open Infrastructure)

核心特性

1. 高效实时推理

  • 仅在五秒视频片段上训练
  • 支持分钟级乃至小时级的实时推理
  • 在长时间推演中保持响应式交互与连贯的世界演化

2. 开放数据管线

  • 数据规模: 143万(1.43M)个视频片段,总数据量达25 TB
  • 完全开放: 发布完整的数据处理流程,包括:
    • 尺度一致的相机标注(scale-consistent camera annotations)
    • 细粒度过滤(fine-grained filtering)
    • 多种训练策略(multiple training recipes)

3. 统一框架,多骨干支持

统一框架支持多种架构和参数规模的最新视频模型,包括:

  • SolarWM-Wan-5B
  • SolarWM-Wan-14B
  • SolarWM-LTX-2.5
  • SolarWM-Minimax-H3

演示示例

页面提供了以下模型的演示视频:

  • SolarWM-Wan-5B: 因果学生模型(Causal Student),4步生成
  • SolarWM-Wan-14B
  • SolarWM-LTX-2.5
  • SolarWM-Minimax-H3: 双向模型(Bidirectional Model)生成

引用信息

对应论文的BibTeX引用条目已提供,论文发表于arXiv(编号2609.02886,分类cs.CV),由来自CUHK-SZ、SLAI、NUS、CUHK、HKUST、HKUST-GZ、NVIDIA、UCLA、MSRA等多个机构的研究者共同完成。

资源链接

页面提供以下可用资源入口:

  • Paper(论文)
  • Code(代码)
  • Checkpoint(模型检查点)
  • Dataset(数据集)
  • Dataset Access Form(数据集访问申请表)
搜集汇总
数据集介绍
SolarWM 数据集图片
构建方式
SolarWM数据集构建了一套可重构的多源数据引擎,将来自10个数据集的143万个标准片段统一为帧对齐的合约格式,涵盖视觉观测、度量相机几何、密集字幕、质量元数据、选择决策与溯源信息。每个源数据经相机标定、LTX Clean Plate处理、密集字幕生成及多轴质量评估后,按照源感知的过滤政策分配至高、极高或拒绝层级,并形成14个可独立寻址的处理分区。物理语料库达25.85TB,通过解耦源处理与混合构建,支持灵活调配训练配方。
使用方法
研究者可直接复现论文中发布的默认混合配方及训练流程,或利用拒绝分区与注释自定义过滤准则、源权重和时序视图,无需重复昂贵的前处理。数据集配套了执行从源到训练的完整pipeline及精确的超参数配置,支持端到端的四模型(5B至33B)复现。此外,通过WebDataset格式和独立测试视图,便于数据载入验证与多阶段训练(双向适应、AR初始化和DMD蒸馏)的无缝集成。
背景与挑战
背景概述
交互式视频世界模型作为生成式人工智能的前沿方向,旨在依据初始观察与外部控制信号,持续输出高保真、时序连贯的未来观测,其研究可追溯至Genie、GameNGen等早期系统,近年来已从受限的游戏环境拓展至开放视觉领域。SolarWM数据集由香港中文大学(深圳)等多家机构于2026年联合构建,核心研究问题在于如何统一异构数据源与视频生成骨干网络,以实现可扩展的长期交互式世界建模。研究团队整合10个数据集、约143万条规范片段(逾25TB物理数据),覆盖真实、合成、游戏等多种环境,并构建了统一的帧对齐表示(包括视觉、相机几何、标注质量与来源元数据)。该数据集与配套的训练流程(双向适应、自回归初始化和分布匹配蒸馏)共同支撑了4个5B至33B参数的模型训练,仅需5秒训练序列即可支持分钟至小时量级的实时交互,为相关领域提供了可复现、可扩展的开放基础。
当前挑战
SolarWM数据集面临的具体挑战包括:其一,领域内共性难题——异构数据源在时序尺度、相机几何、视觉质量、运动分布与标注风格上存在显著差异,简单拼接易引入监督信号冲突,导致多源训练时模型性能退化;同时,不同视频生成骨干网络(如Wan2.2、LTX-2.5、MiniMax-H3)在潜在表示、注意力结构、条件机制上各异,统一适配需平衡可扩展性与对预训练能力的保持。其二,构建过程中的挑战——从25TB物理数据中生成143万条规范样本,需完成度量尺度的相机标注、密集描述生成、动态物体移除(Clean Plate处理)等步骤,每一阶段均可能引入误差;为保证训练质量,还需设计源感知的过滤策略与分级体系,并在不重跑昂贵源代码处理的前提下支持灵活的训练配方重构,同时确保数据溯源完整性与可审计性。这些挑战凸显了数据引擎与模型适配框架紧密耦合的必要性。
常用场景
经典使用场景
SolarWM数据集的经典使用场景在于为交互式视频世界模型的训练提供大规模、多源且统一规范的数据基础。其涵盖从真实世界场景、合成环境到游戏领域的约143万个标准片段,并配套完整的元数据、相机参数、密集字幕及质量标注,使得研究者能够构建可复现的数据混合策略,进而训练出具备长时程预测能力的世界模型。该数据集特别适用于需要帧级对齐的相机控制、跨域泛化以及持续时序生成的研究任务。
解决学术问题
该数据集解决了交互式世界模型研究中长期存在的多源数据异构性与训练规范性不足这一核心学术难题。通过设计可重构的多源数据引擎,SolarWM将来自不同数据集的时间尺度、相机几何、视觉质量及字幕风格等差异统一为一种帧对齐的规范表示,有效避免了朴素混合导致的不一致监督问题,从而为跨骨干网络的模型训练提供了标准化且可复现的基础,推动了世界模型从短片段生成向长时程交互预测的跨越。
实际应用
在实际应用中,SolarWM数据集支撑了多种基于视觉的交互式模拟系统,涵盖游戏环境、自动驾驶仿真、具身智能体训练以及虚拟内容创作等领域。借助该数据集训练的模型能够在分钟至小时级的时间跨度上保持视觉连贯性和时序一致性,同时响应用户的相机操作或语义指令,为构建可实时交互的虚拟环境、智能体探索平台及视频生成工具提供了高质量的训练资源,显著拓展了生成模型在互动场景中的落地可能。
数据集最近研究
最新研究方向
SolarWM数据集的最新研究方向聚焦于构建完全开放、可扩展的交互式视频世界模型基础框架,核心在于统一多源异构数据与多视频生成骨干网的协同训练。该数据集整合了来自10个数据源的143万条规范切片,覆盖真实、合成及游戏环境,并通过可重构数据引擎实现源处理与混合构造解耦,提供统一的帧对齐表示,涵盖视觉观测、度量相机几何、语义描述与质量元数据。在此基础上,研究提出了骨干原生适配框架,在保留各视频生成器原生表征与目标的前提下,通过共享的相机条件化接口与三阶段训练流程(双向适应、教师强制的自回归初始化及分布匹配蒸馏),训练出5B至33B参数规模的模型系列。实验表明,仅基于5秒序列训练即可实现分钟至小时级的长时程交互推演,显著推动了长时程视界模型在仿真、具身学习及交互内容生成等领域的实用化进程。
相关研究论文
  • 1
    SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models香港中文大学(深圳); 上海人工智能实验室; 新加坡国立大学; 香港中文大学; 香港科技大学; 香港科技大学(广州); 英伟达; 加州大学洛杉矶分校; 微软亚洲研究院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务