遇见数据集

gzzyyxy/layout_diffusion_scannetpp_voxel0.2

收藏
Hugging Face2024-05-16 更新2024-05-25 收录
官方服务:

资源简介:

--- license: apache-2.0 dataset_info: features: - name: scene_id dtype: string - name: id dtype: string - name: target dtype: image - name: source dtype: string - name: source_image dtype: image - name: labels dtype: array2_d: shape: - 584 - 876 dtype: int32 - name: cond_depths dtype: array2_d: shape: - 584 - 876 dtype: float32 - name: extrin dtype: array2_d: shape: - 4 - 4 dtype: float32 - name: intrin dtype: array2_d: shape: - 4 - 4 dtype: float32 - name: depth dtype: string - name: item_id dtype: string - name: prompt dtype: string splits: - name: train num_bytes: 131813916499.633 num_examples: 27799 download_size: 73439626164 dataset_size: 131813916499.633 configs: - config_name: default data_files: - split: train path: data/train-* ---

许可证:Apache-2.0 数据集信息: 特征项: - 场景ID(scene_id):数据类型为字符串 - 编号(id):数据类型为字符串 - 目标图像(target):数据类型为图像 - 来源(source):数据类型为字符串 - 源图像(source_image):数据类型为图像 - 标签(labels):数据类型为二维数组(array2_d),形状为584×876,数据类型为int32 - 条件深度图(cond_depths):数据类型为二维数组(array2_d),形状为584×876,数据类型为float32 - 外参矩阵(extrin):数据类型为二维数组(array2_d),形状为4×4,数据类型为float32 - 内参矩阵(intrin):数据类型为二维数组(array2_d),形状为4×4,数据类型为float32 - 深度信息(depth):数据类型为字符串 - 项目编号(item_id):数据类型为字符串 - 提示词(prompt):数据类型为字符串 数据拆分: - 训练集(train):占用字节数131813916499.633,样本总量27799 下载总大小:73439626164字节,数据集总存储大小:131813916499.633字节 配置项: - 默认配置(default):数据文件对应训练拆分的路径为data/train-*

提供机构:
gzzyyxy
原始信息汇总

数据集概述

数据集特征

  • scene_id: 数据类型为字符串。
  • id: 数据类型为字符串。
  • target: 数据类型为图像。
  • source: 数据类型为字符串。
  • source_image: 数据类型为图像。
  • labels: 数据类型为二维数组,形状为(584, 876),数据类型为int32。
  • cond_depths: 数据类型为二维数组,形状为(584, 876),数据类型为float32。
  • extrin: 数据类型为二维数组,形状为(4, 4),数据类型为float32。
  • intrin: 数据类型为二维数组,形状为(4, 4),数据类型为float32。
  • depth: 数据类型为字符串。
  • item_id: 数据类型为字符串。
  • prompt: 数据类型为字符串。

数据集分割

  • train: 包含27799个样本,数据集大小为131813916499.633字节,下载大小为73439626164字节。

配置信息

  • config_name: default
    • data_files:
      • split: train
        • path: data/train-*
搜集汇总
数据集介绍
gzzyyxy/layout_diffusion_scannetpp_voxel0.2 数据集图片
构建方式
该数据集源自SceneCraft论文,旨在为布局引导的3D场景生成提供训练数据。构建基于ScanNet++场景,通过将原始3D场景体素化为0.2米分辨率的网格,提取场景的布局信息。每个样本包含场景标识、目标图像、源文本描述、源图像、语义标签图、条件深度图、内外参数矩阵及深度图等多元数据。数据划分仅包含训练集,共计27799个样本,规模庞大,覆盖多样室内场景。
特点
数据集的核心特点在于其多模态与结构化信息的深度融合。每个样本不仅提供目标渲染图像和源文本提示,还附带精细的语义标签图(584×876分辨率)和条件深度图,支持像素级布局理解。内外参数矩阵的完整记录使得相机位姿与场景几何关系可精确复现。体素化分辨率的设定平衡了细节与计算效率,适用于3D场景生成任务的训练与评估。
使用方法
数据集适用于文本到3D场景生成模型的训练,特别是布局引导的扩散模型。用户可通过HuggingFace Datasets库加载,指定配置为默认,数据路径为data/train-*。加载后,可利用source字段的文本描述或source_image作为条件输入,结合labels和cond_depths进行布局与深度约束,训练模型生成符合语义和几何结构的目标图像。推荐与SceneCraft论文中的方法结合使用。
背景与挑战
背景概述
三维场景生成是计算机视觉与图形学领域的前沿研究方向,旨在从文本描述或条件信号中自动构建具有语义一致性的三维空间。由gzzyyxy团队于2024年创建的layout_diffusion_scannetpp_voxel0.2数据集,依托ScanNet++的丰富室内场景,专为布局引导的三维场景生成任务设计。该数据集的核心研究问题在于如何将文本提示与空间布局约束相结合,驱动扩散模型生成高保真度的三维体素表示。其影响力体现在为SceneCraft等先进方法提供了标准化训练基准,推动了文本到三维生成技术在室内场景建模、虚拟现实和机器人仿真等领域的应用。数据集包含27799个训练样本,每个样本涵盖多模态信息——场景标识、相机内外参、深度图、语义标签及条件深度图,为模型学习空间结构与外观的联合分布奠定了数据基础。
当前挑战
当前数据集面临的核心挑战包括:其一,领域问题层面,文本到三维生成需解决从稀疏语义描述到密集体素空间的高维度映射难题,尤其是如何保持室内场景中物体间的几何拓扑与语义一致性。其二,构建过程中,数据源自ScanNet++的RGB-D序列,需通过多视角融合与体素化处理生成584×876分辨率的标签与深度图,这一过程面临传感器噪声、遮挡导致的空洞修复以及不同场景光照差异带来的纹理不一致问题。此外,相机外参的精确标定与跨场景的尺度归一化也是数据预处理中的关键难点,直接影响模型对空间布局的泛化能力。
常用场景
经典使用场景
在三维场景智能生成与布局可控视觉合成的交叉领域中,gzzyyxy/layout_diffusion_scannetpp_voxel0.2数据集凭借其精细的体素化结构标注与多模态对齐特性,成为布局引导式3D场景扩散模型训练的核心基准。该数据集以ScanNet++真实扫描场景为基底,通过将空间布局编码为584×876分辨率的语义标签与深度条件图,为条件扩散模型提供了从二维布局到三维体素空间映射的标准化训练范式。其经典用法体现在利用成对的源图像、深度条件与目标视图,驱动模型学习在给定空间几何约束下生成连贯且语义一致的场景画面,尤其适用于室内场景的视角合成与布局可控生成任务。
衍生相关工作
基于该数据集已衍生出多项开创性研究工作,其中最具代表性的是SceneCraft框架,该工作首次将布局扩散模型与体素条件生成相结合,实现了从二维布局到三维场景的端到端合成。后续研究进一步拓展了其应用边界,例如LayoutDiffuse系列通过引入跨视角注意力机制,解决了多视图生成中的几何一致性难题;而SceneDreamer则借鉴该数据集的体素标注范式,探索了无边界场景的渐进式生成策略。这些工作共同构成了布局可控三维生成的技术谱系,验证了该数据集在推动空间感知生成模型发展中的基石地位。
数据集最近研究
最新研究方向
在三维场景生成领域,布局引导的扩散模型正成为前沿热点,gzzyyxy/layout_diffusion_scannetpp_voxel0.2数据集为这一方向提供了关键支撑。该数据集源自ScanNet++,以0.2米体素分辨率存储584×876像素的深度、标签与相机参数,配合27799个训练样本,专为SceneCraft这类布局引导的3D场景生成任务设计。SceneCraft论文利用该数据集,实现了从文本提示和2D布局到高保真3D场景的端到端生成,显著提升了室内场景合成的可控性与真实感。这一进展与数字孪生、具身智能等热点事件紧密相连,为虚拟现实、机器人导航等应用提供了可复用的数据基础,推动了从平面布局到立体空间生成的范式转变,在计算机视觉与图形学交叉领域具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务