遇见数据集

2023-10-nature-preview

收藏
Hugging Face2026-08-16 更新2026-08-17 收录
官方服务:

资源简介:

该数据集是Infinigen程序化生成器生成的2023年10月13日预览版自然世界视频数据集。Infinigen是一种能够生成逼真3D自然世界的程序化生成器。本数据集包含10个不同的自然场景,每个场景配备一对立体相机(camera_0和camera_1),每台相机拍摄192帧,总计3840张图像,分辨率为1280x720(深度图分辨率为2560x1440)。数据集总大小约为249GB,每个场景约25GB。数据集提供了27种地面真值通道,包括:RGB图像(PNG和EXR格式)、相机内外参矩阵、深度图(npy和可视化png)、表面法线、光流(3D流和深度变化)、遮挡边界、物体语义分割(索引压缩格式)、物体信息(JSON格式,包含名称、位姿、边界框等)、环境光遮蔽、漫反射颜色、漫反射直接/间接光照、镜面反射颜色、镜面直接/间接光照、透射颜色、透射直接/间接光照、体积直接光照。该数据集适用于深度估计、图像分割、光流估计、表面法线估计、立体视觉、3D场景理解等计算机视觉任务。注意:这是一个初步测试版本,仅包含10个视频样本,实例分割和标签分割掩码未包含在此版本中。

This dataset is a preview of natural world videos generated by the Infinigen procedural generator, released on October 13, 2023. Infinigen is a procedural generator capable of creating realistic 3D natural worlds. The dataset contains 10 different natural scenes, each equipped with a pair of stereo cameras (camera_0 and camera_1), each capturing 192 frames, resulting in a total of 3840 images at a resolution of 1280x720 (depth maps at 2560x1440). The total dataset size is approximately 249GB, with each scene about 25GB. The dataset provides 27 types of ground truth channels, including: RGB images (PNG and EXR formats), camera intrinsic and extrinsic matrices, depth maps (npy and visualization png), surface normals, optical flow (3D flow and depth change), occlusion boundaries, object semantic segmentation (indexed compressed format), object information (JSON format including name, pose, bounding box, etc.), ambient occlusion, diffuse color, diffuse direct/indirect illumination, specular color, specular direct/indirect illumination, transmission color, transmission direct/indirect illumination, and volumetric direct illumination. The dataset is suitable for computer vision tasks such as depth estimation, image segmentation, optical flow estimation, surface normal estimation, stereo vision, and 3D scene understanding. Note: This is a preliminary test version containing only 10 video samples. Instance segmentation and label segmentation masks are not included in this version.

创建时间:
2026-08-16
原始信息汇总

Infinigen 2023-10 Nature Preview 数据集详情

数据集概览

  • 名称: Infinigen 2023-10 Nature Preview
  • 许可协议: BSD 3-Clause
  • 数据集规模: 1K-10K 样本
  • 任务类型: 深度估计、图像分割
  • 标签: 合成数据、程序化生成、视频、立体视觉、光流、表面法线、3D
  • 来源: 基于 Infinigen 程序化生成器(Princeton University)生成的预生成视频数据,为 2023_10_13_preview 版本

数据内容

  • 场景数量: 10个场景
  • 相机配置: 每场景2个相机(camera_0camera_1,构成立体对)
  • 每相机帧数: 192帧(编号 00010192
  • 总图像数: 3,840张
  • 分辨率: 1280x720(Depth_npy/Depth_png 为 2560x1440)
  • 数据总量: 249 GB(每场景约25 GB)
  • Infinigen 版本: 1.2_rc_0
  • 数据发布格式版本: 0.2.0
  • 场景种子: 1a1f2004, 1d8d6f8e, 1f25974d, 2d2c1104, 2e962781, 4bbdd3e0, 5be1f943, 22ca3b8b, 560a8258, f020c43

地面真值通道

共27个地面真值通道,涵盖以下类型:

通道 大小 描述
Image_png 6.2 GB RGB图像(PNG格式)
Image_exr 40.8 GB RGB图像(EXR格式,高动态范围)
camview_npz 0.02 GB 相机内参矩阵与位姿矩阵
Depth_npy 40.2 GB 深度图(2H×2W float32)
Depth_png 3.9 GB 深度图可视化 PNG(仅供可视化)
SurfaceNormal_npy 35.3 GB 表面法线(H×W×3 float32)
SurfaceNormal_png 7.0 GB 表面法线可视化 PNG(仅供可视化)
Flow3D_npy 29.5 GB 光流及深度变化(H×W×3 float32)
Flow3D_png 1.0 GB 光流可视化 PNG(仅供可视化)
Flow3DMask_png 0.4 GB 光流遮挡掩码
OcclusionBoundaries_png 3.1 GB 遮挡边界
ObjectSegmentation_npz 0.2 GB 语义分割掩码(压缩存储)
ObjectSegmentation_png 0.4 GB 分割掩码可视化 PNG(仅供可视化)
Objects_json 36.3 GB 对象名称、位姿及包围盒(用于2D/3D检测框)
AO_png 3.6 GB 环境光遮蔽
DiffCol_png 5.0 GB 漫反射颜色(反照率)
DiffDir_png 5.6 GB 漫反射直接光照
DiffInd_png 5.7 GB 漫反射间接光照
Emit_png 1.3 GB 自发光通道
Env_png 1.5 GB 环境光通道
GlossCol_png 3.0 GB 光泽颜色
GlossDir_png 4.8 GB 光泽直接光照
GlossInd_png 5.5 GB 光泽间接光照
TransCol_png 1.4 GB 透射颜色
TransDir_png 1.3 GB 透射直接光照
TransInd_png 2.0 GB 透射间接光照
VolumeDir_png 3.9 GB 体积直接光照

注意: 同一物理量的 .png.npy/.npz 文件同时存在时,.png 仅用于可视化,训练数据请使用数组文件。InstanceSegmentationTagSegmentation 掩码不包含在此次发布中,将在未来版本中提供。

数据格式说明

  • 深度图: 2H×2W float32 数组
  • 表面法线: H×W×3 float32 数组,坐标系为 +X右、+Y上、+Z后
  • 遮挡边界: ≥2H×2W PNG,边界处为255,其余为0
  • 光流: H×W×3 float32 数组,通道1和2为标准光流(像素单位),通道3为深度变化;序列末帧值无意义
  • 遮挡掩码: H×W PNG,共视像素为255,遮挡像素为0;通过比较三角形面ID计算,存在椒盐噪声式误报,可用最大池化缓解
  • 相机参数: .npz 文件包含 K(3×3内参矩阵)、T(4×4相机到世界外参矩阵)、HW(图像高宽);世界坐标系采用计算机视觉约定(+X右、+Y下、+Z前),与Blender内部约定不同
  • 对象分割: H×W int32 数组,压缩为 valsindicesshape 三个字段,可通过 vals[indices].reshape(shape) 重构;每个整数映射至 Objects_json 中相同 object_index 的条目
  • 对象JSON: 每个对象包含 object_indexnamechildrennum_vertsnum_facesmaterialsunapplied_modifierstags、对象坐标系下的包围盒角点 min/max 以及实例的4×4对象到世界变换矩阵 model_matrices;3D包围盒可由这些信息计算

仓库结构与使用

  • 目录结构: metadata.json(场景/相机/通道清单)、renders/{scene}/{scene}_{Pass}_camera_{c}.tar.gz(540个压缩包)、thumbnails/{scene}_thumbnail.png(每场景预览图)
  • 数据组织: 每个压缩包包含单场景单相机单个通道的全部192帧,解压后路径为 {scene}/frames/{Pass}/camera_{c}/{Pass}_0_0_{frame:04d}_{c}.{ext}
  • 选择性下载: 支持通过 Hugging Face snapshot_download 或命令行工具按需下载,建议只下载所需通道以节省存储空间
  • 数据加载: Infinigen 提供了 PyTorch 风格的 dataset_loader.py 工具类,可调用 get_infinigen_dataset 加载数据;该文件可独立于主代码库使用,但需同时复制依赖文件 suffixes.py

引用信息

该数据集基于以下论文工作,引用格式参见原始 README 文件中的 BibTeX 条目。

搜集汇总
数据集介绍
2023-10-nature-preview 数据集图片
构建方式
该数据集源自普林斯顿大学视觉与学习实验室研发的Infinigen程序化生成引擎,通过随机参数组合构建出逼真的三维自然场景。2023年10月预览版包含10个独特场景,每个场景配备双目相机对(camera_0与camera_1),每台相机采集192帧连续影像,总计3840张高分辨率图像。所有数据以标准格式封装,共有27种地面真值通道,涵盖深度、表面法线、光流、语义分割及材质属性等多模态信息。生成过程严格遵循计算机视觉坐标规范,并保留场景种子以保证可复现性,为几何与感知研究提供了高度可控的合成数据来源。
特点
该数据集的核心特征在于其全方位的地面真值覆盖与程序化生成的多样性。27种标注通道不仅包含RGB图像与深度图,还提供相机内外参数、三维光流、遮挡边界、物体级语义分割及逐物体变换矩阵,支持从二维像素到三维结构的完整推理任务。所有标注均与图像像素精确对齐,且深度与法线以浮点数组存储,确保数值精度。场景覆盖自然地貌与生态群落,通过程序化随机生成实现无限变化,克服了真实数据采集的高成本与标注不完整性,为视觉算法提供了大规模、参数可控的训练与评估基准。
使用方法
数据集的下载与使用遵循模块化设计理念,用户可按需获取特定场景与通道,避免冗余传输。推荐通过Hugging Face的snapshot_download接口或命令行工具筛选所需的tar.gz压缩包,解压后即可获得按帧组织的标注文件。官方提供PyTorch风格的dataset_loader.py加载器,支持自定义数据类型组合,便于无缝集成至深度学习流程。数据集适用于立体视觉、光流估计、语义分割及三维重建等任务,其丰富的标注格式要求用户参考《GroundTruthAnnotations.md》文档以精确解析各类数组与掩码,从而最大化利用该合成数据资源。
背景与挑战
背景概述
该数据集由普林斯顿大学视觉与学习实验室于2023年10月发布,作为Infinigen程序化生成系统的初步预览版本,旨在为计算机视觉研究提供高度逼真且可控的自然场景合成数据。Infinigen通过程序化生成技术,能够创建无限多样的三维自然世界,并配套提供丰富的真值标注,涵盖深度、表面法线、光流、语义分割、相机位姿等多种模态,为多任务学习与三维场景理解研究提供了坚实的基准。该数据集基于Infinigen 1.2_rc_0版本生成,包含10个场景、双摄像头立体视频流,共3840帧图像及27种真值通道,在数据规模、标注丰富度与场景多样性方面展现出显著优势,对推动视觉算法在复杂自然环境下的泛化能力具有重要参考价值。
当前挑战
该数据集所应对的领域核心挑战在于真实世界数据采集的高昂成本与标注的局限性,尤其是三维场景中像素级精确标注的稀缺性,这限制了模型对深度、表面属性及动态场景的深度理解与泛化。构建过程中,团队面临多重技术难题:其一,程序化生成需在保持视觉逼真度的同时确保场景结构与物体关系的合理性,对生成器的复杂性与鲁棒性要求极高;其二,实现多模态真值(如光流、遮挡边界、物体分割)的同步输出,需精密设计渲染管线与数据对齐机制;其三,数据集的体量庞大,单场景约25GB,总计249GB,对存储、传输与处理效率提出了严峻挑战;此外,当前版本尚缺实例分割与标签分割掩码,且小规模样本限制了统计效度,未来版本需在场景多样性、标注完整性与数据规模上持续拓展,以满足更广泛的科研需求。
常用场景
经典使用场景
该数据集为计算机视觉领域提供了丰富的合成自然场景视频,涵盖立体图像、深度、表面法线、光流、语义分割、物体边界框及多种渲染通道(如漫反射、高光、透射等)等27种精确标注。其经典使用场景聚焦于训练和评估深度估计、光流计算、语义分割、表面法线预测等视觉任务模型,尤其适用于需要像素级精确真值的监督学习场景,可有效避免人工标注的高昂成本与不一致性。
衍生相关工作
围绕该数据集已衍生出一系列经典工作,如基于Infinigen的生成器改进研究,探索更大规模场景的自动构建与标注扩展。Princeton团队公开的配套工具链和数据集加载器成为后续研究的基石。相关论文包括《Infinite Photorealistic Worlds Using Procedural Generation》,其提出的方法被用于多任务基准测试,并推动了如单目深度估计的域自适应、光流场的无监督学习等方向的进展,进一步催化了合成数据在三维视觉中的广泛应用。
数据集最近研究
最新研究方向
该数据集依托程序化生成引擎Infinigen,为计算机视觉领域提供了高度逼真且可无限扩展的自然场景合成数据。其最新研究方向聚焦于利用大规模生成式模型提升多任务学习性能,尤其在深度估计、语义分割、光流与表面法线等底层视觉任务中,以克服真实数据标注成本高昂与场景覆盖不足的瓶颈。通过提供同步的立体图像、相机位姿及27种逐像素地面真值,该数据集支持在复杂自然环境中训练和评估视觉模型,推动模型在开放世界下的泛化能力与鲁棒性研究。此外,其程序化生成的随机性与可控性,为自监督学习和领域自适应提供了理想的数据源,对构建可迁移至真实应用的视觉系统具有重要理论与实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务