遇见数据集

Image2Splat Dataset

收藏
github2026-06-18 更新2026-06-19 收录
官方服务:

资源简介:

Image2Splat是一个从单张图像生成200个视图的3D高斯溅射训练数据集的工具。它基于Microsoft TRELLIS.2和TencentARC的Pixal3D,通过5层采样器系统、探针模式、自动裁剪和AuraSR超分辨率预处理,为每个输入图像生成包含200张3000×3000 PNG渲染图像、相机内外参(Nerfstudio和COLMAP格式)的数据集,适用于PostShot、LichtFeld、gsplat等3D高斯溅射训练器。

Image2Splat is a tool for generating 3D Gaussian splatting training datasets with 200 views from a single input image. Built upon Microsoft TRELLIS.2 and Pixal3D from TencentARC, it generates datasets for each input image via a 5-layer sampler system, probe mode, automatic cropping, and AuraSR super-resolution preprocessing. Each dataset includes 200 rendered PNG images at 3000×3000 resolution, alongside camera intrinsic and extrinsic parameters in Nerfstudio and COLMAP formats, and is compatible with 3D Gaussian splatting trainers such as PostShot, LichtFeld, and gsplat.

创建时间:
2026-05-22
原始信息汇总

数据集概述:Image2Splat

Image2Splat 是一个将单张物体图片转换为高质量多视角训练数据集的工具,专为 3D Gaussian Splatting(3DGS)模型训练而设计。它基于 Microsoft TRELLIS.2 和 TencentARC 的 Pixal3D 模型,并扩展了多项功能,使用户能够为不同类型的资产精细化控制生成美学效果。

核心功能与创新

  • 5级采样器系统: 提供五种经过验证的配置(Tiers),分别对应不同的资产类型(如有机/石材/风化物、硬表面/机械、最大雕刻细节),作为“创意旋钮”而非固定默认值。各等级参数如下:
等级 步数 (Steps) 形状引导 (Shape guidance) 纹理引导 (Tex guidance) 最佳适用场景
1 — 默认 (Default) 12 7.5 1.1 安全生产基线
2 — 微妙 (Subtle) 13 7.6 1.2 温和凸起,保守效果
3 — 均衡 (Balanced) 14 7.7 1.25 数学中点
4 — 精致 (Refined) 15 7.6 1.2 硬表面 + 有机雕刻细节
5 — 雕刻 (Sculpted) 15 8.0 1.5 最大细节,硬表面,机械
  • 探测模式 (Probe Mode): 在提交完整 200 视图渲染前,对单张图片以所有 5 个等级和种子进行单一视图(第 129 帧)快速比较,帮助用户选择最佳美学效果。
  • 种子量化器 (Seed-quantifier): 在探测模式下,可指定随机种子数量或固定种子列表,以观察同一等级下不同种子的生成变化。
  • 自动裁剪预处理 (AutoCrop Preprocessor): 自动识别并紧贴裁剪输入图像中的主体,去除空白背景,使主体在 Pixal3D 的 1024 像素图像条件中占据更大比例,提升有效像素密度。
  • AuraSR 生成式放大预处理: 使用 GAN 网络将软/低分辨率/压缩的源图像进行 4 倍超分辨率放大,补充微细节,再送入后续流程。
  • 热文件夹守护进程 (Hot-folder Daemon): 监视指定文件夹,自动处理放入其中的图片,并支持自动重启、故障隔离和断电续跑。
  • Windows BAT 文件: 提供可直接运行的 BAT 文件,用于启动守护进程、自动裁剪和放大功能,简化 Windows 用户操作。

输出数据

为每张输入图片生成一个独立的训练数据集,包含:

datasets/<image_slug>/USER_Alt2_200v_3000px/ images/ ← 200 张 PNG 渲染图,分辨率 3000×3000,沿轨道轨迹拍摄 000.png ... 199.png transforms.json ← Nerfstudio 格式的相机内参和外参 cameras.txt ← COLMAP 格式的外参 images.txt points3D.txt

注意: 输出的是训练数据集,而非完成训练的 3D Gaussian Splatting 模型。用户需要将数据集导入 PostShot、LichtFeld、gsplat 等训练器中进行训练。

工作流模式

  1. 单等级生产模式: 单图片 → 选择等级(1-5)→ 生成 200 视图 → 训练 Splat。
  2. 探测后生产模式: 单图片 → 探测模式(等级6)比较 → 选择最佳等级和种子 → 生成 200 视图 → 训练 Splat。
  3. 多等级生产模式: 单图片 → 在不同等级下多次生成 200 视图 → 在 Photoshop 中挑选最佳视图 → 训练出“最佳组合”的 Splat。
  4. 完整预处理链: 图片 → 自动裁剪 → AuraSR 放大 → 选择等级生成 200 视图 → 训练 Splat。

已知限制与未来规划

  • GPU 锁定: 需要支持 CUDA 的 NVIDIA GPU(≥24 GB VRAM),已验证在 RTX 5090/4090/A6000/H100 上运行,Apple Silicon 或 CPU 路径未经测试。
  • 单资产方向: 假定输入图像主轴与资产的垂直方向一致,对于特殊姿势的图片可能需要预先旋转。
  • 探测模式单视图限制: 目前探测模式仅限于单视图(第129帧),未来可能扩展至多视图探测。

技术架构

输入图片 → [可选:自动裁剪] → [可选:AuraSR 放大] → 热文件夹守护进程 → 预处理(背景移除) → 相机估计 → Pixal3D 生成 → 网格提取 → 多视角渲染(200 视图,3000px,HDRI 照明) → 后处理(锐化+噪点) → COLMAP / Nerfstudio 数据集导出 → 最终数据集

代码仓库布局

  • src/:包含流水线的核心 Python 源代码(骨干网络、相机、渲染、后处理等)。
  • scripts/:包含各种运行脚本和工具(守护进程、裁剪、探测验证等)。
  • upscale/:AuraSR 放大脚本。
  • bat/:Windows 系统用的 BAT 文件。

许可与致谢

  • 许可协议: MIT
  • 致谢: 项目基于 Microsoft TRELLIS.2、TencentARC Pixal3D、valeoai/MoGe、BiRefNet、nvdiffrast、fal/AuraSR 和 CuMesh 等开源项目。
搜集汇总
数据集介绍
Image2Splat Dataset 数据集图片
构建方式
Image2Splat数据集构建于Microsoft TRELLIS.2与TencentARC Pixal3D之上,采用一种创新的五层采样器系统。用户将单张物体图像投入指定文件夹后,系统通过Pixal3D的稀疏结构、形状与纹理SLat采样生成三维网格,并利用nvdiffrast执行200视角的斐波那契球轨道渲染,输出3000×3000像素的PNG图像。随后经锐化与胶片颗粒后处理,导出COLMAP与Nerfstudio格式的相机参数与点云数据,最终形成可直接用于3D高斯泼溅训练的数据集。
特点
该数据集的核心特色在于其五层美学调谐系统,涵盖Default、Subtle、Balanced、Refined与Sculpted五种配置,分别针对有机材质、硬表面与机械细节等不同物体类型优化。探针模式允许用户在投入完整200视图渲染前,于单一视角下对比所有配置及随机种子效果,实现精确美学选择。自动裁剪与AuraSR生成式超分预处理可显著提升主体像素密度,热文件夹守护进程具备自愈、三击隔离与重启恢复能力,保障批量处理稳定性。
使用方法
使用前需在支持CUDA的NVIDIA GPU上通过WSL或Linux环境安装,并设置热文件夹。用户将图像放入inbox目录,双击启动守护进程后选择采样层级,系统自动完成处理并输出数据集至datasets目录。生成的数据集可导入PostShot、LichtFeld或gsplat等训练器进行3D高斯泼溅训练。对于目录风格来源,建议先运行Autocrop.bat裁剪背景空白,再通过AuraSR超分提升细节,最后启动守护进程获取最大主体密度效果。
背景与挑战
背景概述
Image2Splat数据集由sdimaging团队于2025年构建,旨在解决从单张图像高效生成高质量三维高斯泼溅训练数据的难题。该数据集基于微软TRELLIS.2与腾讯ARC的Pixal3D模型,通过创新的五级采样器系统与美学调谐机制,允许用户针对不同资产类型(如有机体、硬表面、机械结构)选择最优渲染参数。数据集输出包含200张3000×3000像素的轨道渲染图及COLMAP/Nerfstudio格式的相机内外参,可直接用于PostShot、LichtFeld、gsplat等主流泼溅训练器。其核心贡献在于将采样参数从固定默认值转化为可调节的创意工具,显著提升了从单图到三维重建的灵活性与质量,对计算机视觉与图形学领域的少样本三维重建研究具有重要推动作用。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两方面。在领域层面,单张图像到三维重建的固有歧义性导致输出质量高度依赖输入图像质量与采样参数选择,尤其是在处理低分辨率、压缩或背景杂乱的图像时,容易产生几何失真或纹理模糊。构建过程中,数据集依赖高显存GPU(≥24GB VRAM)与CUDA环境,限制了在苹果芯片或CPU平台上的部署;同时,200视角的渲染流水线需5-15分钟/资产,且存在因病态资产导致GPU崩溃的风险。此外,采样器配置(如步数、形状/纹理引导系数)需大量手动调参才能适配不同美学风格,无法自动泛化至多样化场景,且当前探针模式仅支持单视图比较,难以捕捉全局最优解。
常用场景
经典使用场景
Image2Splat数据集的核心应用在于将单张物体照片转化为可用于三维高斯泼溅训练的多视角数据集。研究者与创作者可将任意物体图像投入系统,经由自动化的背景移除、相机位姿估计、多级精细度控制的网格生成与渲染管线,最终获得包含200张高分辨率环视渲染图及对应COLMAP与Nerfstudio格式相机参数的完整训练包。这一流程尤其适用于文化遗产数字归档、电商产品三维化、虚拟现实资产构建等需要从单一视角生成多视角监督数据的场景,显著降低了传统多视角数据采集对物理设备与专业布光的依赖。
衍生相关工作
Image2Splat衍生了一系列推动单图像三维重建边界的经典工作。其底层依赖的Microsoft TRELLIS.2与TencentARC Pixal3D模型,通过稀疏体素结构与像素对齐反投影机制,为单图生成高精度纹理网格奠定了架构基础。MoGe单目几何估计模块提供了稳定的相机姿态先验,而BiRefNet背景移除与AuraSR生成式超分则分别解决了输入预处理中的两大痛点。在应用层面,该数据集启发了对采样策略的深度探索——例如‘探测模式’中基于种子量化的多层级对比,以及‘批量运行’中对跨层级最优视角的拼合策略,这些方法论已在后续的多视角一致性训练与纹理锐度优化研究中被广泛引用与扩展。
数据集最近研究
最新研究方向
Image2Splat数据集代表了单图像到多视角三维重建领域的前沿突破,通过将单张二维图像转化为200视角的密集三维高斯溅射训练数据,实现了从传统多视图摄影测量到智能生成式三维重建的范式跃迁。该工作基于微软TRELLIS.2架构与腾讯Pixal3D模型,创新性地引入了五层级美学采样器系统,覆盖从有机材质到硬表面机械结构的参数空间,并通过probe模式实现可视化的种子变异量化评估。其核心价值在于打破了现有图像转三维工具输出单一美学的局限,将采样参数转变为创造性控制旋钮,配合自适应的自动裁剪与生成式超分辨率预处理流水线,显著提升了对象在模型条件空间中的像素密度。这一技术路径不仅为数字资产快速生产提供了工业级解决方案,更通过后门监控守护进程与弹性的三重崩溃隔离机制,标志着三维内容生成从研究原型向稳定生产力工具的实质性跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务