遇见数据集

SpatialCrafter 数据集 (未命名,指代该大规模场景数据集)

收藏
arXiv2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

SpatialCrafter 论文构建了首个专为图像到场景生成任务设计的大规模混合数据集,包含约115K个高保真3D场景。该数据集整合了合成室内场景渲染与真实世界视频,通过深度估计和相机位姿重建生成一致的3D几何,并经过严格筛选以剔除不可靠样本。数据覆盖室内外多样化环境,提供精确的几何标注,旨在解决单图像场景生成中缺乏合适训练数据的瓶颈,从而支持3D一致的世界建模,应用于游戏、机器人、虚拟现实等领域。

The paper *SpatialCrafter* presents the first large-scale hybrid dataset specifically designed for image-to-scene generation tasks, containing approximately 115K high-fidelity 3D scenes. This dataset integrates synthetic indoor scene renderings and real-world videos, generates consistent 3D geometry via depth estimation and camera pose reconstruction, and undergoes rigorous filtering to eliminate unreliable samples. It covers diverse indoor and outdoor environments and provides precise geometric annotations. The dataset aims to address the bottleneck of lacking suitable training data for single-image scene generation, thereby supporting 3D-consistent world modeling, with applications in fields such as gaming, robotics, virtual reality, and more.

创建时间:
2026-08-27
搜集汇总
数据集介绍
SpatialCrafter 数据集 (未命名,指代该大规模场景数据集) 数据集图片
构建方式
SpatialCrafter数据集是为解决单视图图像到三维场景生成任务中训练数据匮乏问题而构建的大规模混合数据集,其构建流程系统而严谨。该数据集整合了来自SpatialGen的57,431个室内全景渲染场景、RealEstate10K的65,683段真实世界视频以及DL3DV的10,510段视频,覆盖了广泛的室内外环境。在数据构建中,首先从各种来源提取或估计深度信息,进而通过反投影生成稠密点云,并利用TRELLIS处理流程将这些点云和多视角图像转换为结构化的三维潜在表示及粗质高斯模型。同时,对于合成数据,对精选的2.2K个高质量场景沿多条连续相机轨迹重新渲染,生成时间上密集的RGB-D视频序列;对于真实视频数据,则通过严格的筛选协议剔除重建质量不佳的样本,确保配对的视频数据具有高保真度。最终,该数据集包含115,295个用于图像到场景生成的场景对以及87,115个用于可控视频生成的视频对,每个场景都配有精确的几何标注和由视觉语言模型生成的文本描述,从而为端到端的模型训练提供了扎实的数据基础。
特点
SpatialCrafter数据集最显著的特点在于其首次为图像到场景生成任务提供了大规模、混合来源且具有精确几何标注的训练资源。该数据集融合了高质量合成数据与真实世界数据,既包含了SpatialGen中受控的室内布局和光照条件,又引入了RealEstate10K与DL3DV中复杂逼真的动态环境,使模型能够习得广泛场景的泛化表达能力。每一场景均通过统一的处理管线构建了精细的三维几何代理,该代理以点云、体素潜在特征及三维高斯的形式显式编码了场景的完整空间结构,与输入视角严格对齐,为视频扩散模型提供了密集、连续且可靠的空间引导。此外,数据集中同期的粗质RGB-D渲染序列与对应的干净真实视频构成成对训练样本,辅以文本描述,使得模型能够在学习高保真外观合成的同时,维持三维一致性和几何精确度,有效避免了以往基于非完整重建代理方法所产生的随机幻觉和长期漂移问题。
使用方法
SpatialCrafter数据集在支持两阶段生成框架的训练和评估方面具有卓越的实用性。对于第一阶段的全局三维代理生成器,该数据集提供的高质量点云和多视图图像可通过TRELLIS流程生成结构化的三维潜在表示,并利用图像条件扩散模型进行训练,以学习从单一图像合成合理且空间对齐的全局场景结构。对于第二阶段的生成式延迟细化器,数据集中配对的粗质RGB-D视频序列与真实视频序列为训练视频扩散模型提供了直接的条件输入和回归目标,其中粗质序列通过渲染三维高斯代理获得,而真实序列则作为金标准。用户可以根据需要自定义相机轨迹,从单个参考图像出发,生成任意视角下的高保真RGB-D视频。此外,数据集中的文本描述支持文本条件控制,实现多样化的场景生成。该数据集兼顾了大规模的覆盖范围和细粒度的几何标注,适合用于训练稳健的世界模型,并可作为基准评估不同方法在极端相机运动和视角变化下的三维一致性表现。
背景与挑战
背景概述
SpatialCrafter数据集由香港科技大学、阿里巴巴通义实验室及多家机构的研究人员于2026年构建,旨在解决单图像至可探索三维场景生成这一核心问题。该数据集规模宏大,包含约11.5万个三维场景,融合了合成室内渲染与真实世界视频,首次为图像到场景生成任务提供了大规模、高精度的几何标注。其构建依托于可扩展的数据引擎,整合了SpatialGen、RealEstate10K和DL3DV等数据源,通过先进的深度估计与三维重建技术,生成了兼具多样性与一致性的高质量训练数据。该数据集的问世填补了该领域的空白,为三维世界建模、视频扩散模型等研究提供了关键支撑,对推动人工智能在虚拟现实、机器人导航等领域的应用具有深远影响。
当前挑战
SpatialCrafter数据集面临的挑战是多维度的。在领域问题层面,现有方法依赖不完整的重建代理或二维图像记忆,难以在复杂相机运动下维持三维一致性,易产生长程漂移和随机幻觉,而该数据集旨在提供完整、全局的三维代理,从根本上解决这一难题。在数据构建层面,挑战尤为严峻:一是需要从单一图像生成全局三维代理,要求数据具备精确的几何标注与空间对齐,而此前此类数据极度匮乏;二是整合异构数据源时,需对真实视频进行可靠的深度估计与重建,并过滤不可靠样本,以保证质量;三是为训练视频扩散模型,还需生成时间上连续、配对良好的RGB-D序列,这涉及复杂的渲染与对齐流程。这些挑战共同构成了数据集构建的核心难点,其克服过程也为后续研究树立了标杆。
常用场景
经典使用场景
SpatialCrafter数据集作为首个专为单图像到场景生成任务设计的大规模混合数据集,在三维世界建模与可控视频生成领域具有基石性地位。该数据集汇集了约11.5万个高保真三维场景,涵盖丰富多样的室内外环境,每一场景均配有精确的几何标注与对应的粗粒度RGB-D视频序列,为训练从单一视角图像预测全局三维代理并进而合成连续、一致的新视角视频提供了理想的数据支撑。其经典使用场景聚焦于图像到场景的生成与探索,研究者可基于此数据集训练和评估视频扩散模型在复杂相机轨迹下的空间一致性与视觉逼真度,从而推动可交互、可探索的三维内容生成技术迈向新高度。
实际应用
在实际应用层面,该数据集所支撑的技术栈正加速向沉浸式媒体、智能机器人及虚拟现实等前沿领域渗透。基于其训练的模型能够从单张静态图像出发,沿用户自定义轨迹生成连贯且逼真的三维场景视频,这一能力在游戏场景自动构建、电影特效预可视化、虚拟旅游体验以及增强现实导航等场景中展现出巨大潜力。此外,该数据集构建的全局三维代理还可服务于机器人环境感知与路径规划,使智能体在未知环境中凭借单目视觉即可获得结构化空间理解,进而提升自主探索与交互决策的可靠性。其高质量几何标注亦为三维重建、深度估计等下游任务提供了宝贵的训练与验证素材,促进了从学术成果到产业应用的顺畅转化。
衍生相关工作
该数据集的发布催生了一系列衍生研究工作,深刻影响了三维生成与视频建模的演进方向。一方面,它启发了后续研究者探索更高效的显式三维表征与生成范式,如基于稀疏结构流匹配的全局代理预测、并行几何注入与代理感知损坏训练等创新模块,这些技术被后续工作广泛借鉴并拓展至多视角重建、动态场景生成等领域。另一方面,该数据集作为统一基准,促使多种视频扩散模型与三维感知方法在同一平台上进行公平比较,加速了迭代优化与理论深化。在此推动下,有关三维一致性视频生成、可探索世界模型、以及具身智能空间记忆等方向的研究也相继涌现,共同编织出以高质量数据为根基的三维视觉生成研究生态网络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务