2023-10-nature-preview
收藏资源简介:
该数据集是Infinigen程序化生成器生成的2023年10月13日预览版自然世界视频数据集。Infinigen是一种能够生成逼真3D自然世界的程序化生成器。本数据集包含10个不同的自然场景,每个场景配备一对立体相机(camera_0和camera_1),每台相机拍摄192帧,总计3840张图像,分辨率为1280x720(深度图分辨率为2560x1440)。数据集总大小约为249GB,每个场景约25GB。数据集提供了27种地面真值通道,包括:RGB图像(PNG和EXR格式)、相机内外参矩阵、深度图(npy和可视化png)、表面法线、光流(3D流和深度变化)、遮挡边界、物体语义分割(索引压缩格式)、物体信息(JSON格式,包含名称、位姿、边界框等)、环境光遮蔽、漫反射颜色、漫反射直接/间接光照、镜面反射颜色、镜面直接/间接光照、透射颜色、透射直接/间接光照、体积直接光照。该数据集适用于深度估计、图像分割、光流估计、表面法线估计、立体视觉、3D场景理解等计算机视觉任务。注意:这是一个初步测试版本,仅包含10个视频样本,实例分割和标签分割掩码未包含在此版本中。
This dataset is a preview of natural world videos generated by the Infinigen procedural generator, released on October 13, 2023. Infinigen is a procedural generator capable of creating realistic 3D natural worlds. The dataset contains 10 different natural scenes, each equipped with a pair of stereo cameras (camera_0 and camera_1), each capturing 192 frames, resulting in a total of 3840 images at a resolution of 1280x720 (depth maps at 2560x1440). The total dataset size is approximately 249GB, with each scene about 25GB. The dataset provides 27 types of ground truth channels, including: RGB images (PNG and EXR formats), camera intrinsic and extrinsic matrices, depth maps (npy and visualization png), surface normals, optical flow (3D flow and depth change), occlusion boundaries, object semantic segmentation (indexed compressed format), object information (JSON format including name, pose, bounding box, etc.), ambient occlusion, diffuse color, diffuse direct/indirect illumination, specular color, specular direct/indirect illumination, transmission color, transmission direct/indirect illumination, and volumetric direct illumination. The dataset is suitable for computer vision tasks such as depth estimation, image segmentation, optical flow estimation, surface normal estimation, stereo vision, and 3D scene understanding. Note: This is a preliminary test version containing only 10 video samples. Instance segmentation and label segmentation masks are not included in this version.
Infinigen 2023-10 Nature Preview 数据集详情
数据集概览
- 名称: Infinigen 2023-10 Nature Preview
- 许可协议: BSD 3-Clause
- 数据集规模: 1K-10K 样本
- 任务类型: 深度估计、图像分割
- 标签: 合成数据、程序化生成、视频、立体视觉、光流、表面法线、3D
- 来源: 基于 Infinigen 程序化生成器(Princeton University)生成的预生成视频数据,为
2023_10_13_preview版本
数据内容
- 场景数量: 10个场景
- 相机配置: 每场景2个相机(
camera_0与camera_1,构成立体对) - 每相机帧数: 192帧(编号
0001–0192) - 总图像数: 3,840张
- 分辨率: 1280x720(
Depth_npy/Depth_png为 2560x1440) - 数据总量: 249 GB(每场景约25 GB)
- Infinigen 版本:
1.2_rc_0 - 数据发布格式版本:
0.2.0 - 场景种子:
1a1f2004,1d8d6f8e,1f25974d,2d2c1104,2e962781,4bbdd3e0,5be1f943,22ca3b8b,560a8258,f020c43
地面真值通道
共27个地面真值通道,涵盖以下类型:
| 通道 | 大小 | 描述 |
|---|---|---|
Image_png |
6.2 GB | RGB图像(PNG格式) |
Image_exr |
40.8 GB | RGB图像(EXR格式,高动态范围) |
camview_npz |
0.02 GB | 相机内参矩阵与位姿矩阵 |
Depth_npy |
40.2 GB | 深度图(2H×2W float32) |
Depth_png |
3.9 GB | 深度图可视化 PNG(仅供可视化) |
SurfaceNormal_npy |
35.3 GB | 表面法线(H×W×3 float32) |
SurfaceNormal_png |
7.0 GB | 表面法线可视化 PNG(仅供可视化) |
Flow3D_npy |
29.5 GB | 光流及深度变化(H×W×3 float32) |
Flow3D_png |
1.0 GB | 光流可视化 PNG(仅供可视化) |
Flow3DMask_png |
0.4 GB | 光流遮挡掩码 |
OcclusionBoundaries_png |
3.1 GB | 遮挡边界 |
ObjectSegmentation_npz |
0.2 GB | 语义分割掩码(压缩存储) |
ObjectSegmentation_png |
0.4 GB | 分割掩码可视化 PNG(仅供可视化) |
Objects_json |
36.3 GB | 对象名称、位姿及包围盒(用于2D/3D检测框) |
AO_png |
3.6 GB | 环境光遮蔽 |
DiffCol_png |
5.0 GB | 漫反射颜色(反照率) |
DiffDir_png |
5.6 GB | 漫反射直接光照 |
DiffInd_png |
5.7 GB | 漫反射间接光照 |
Emit_png |
1.3 GB | 自发光通道 |
Env_png |
1.5 GB | 环境光通道 |
GlossCol_png |
3.0 GB | 光泽颜色 |
GlossDir_png |
4.8 GB | 光泽直接光照 |
GlossInd_png |
5.5 GB | 光泽间接光照 |
TransCol_png |
1.4 GB | 透射颜色 |
TransDir_png |
1.3 GB | 透射直接光照 |
TransInd_png |
2.0 GB | 透射间接光照 |
VolumeDir_png |
3.9 GB | 体积直接光照 |
注意: 同一物理量的
.png和.npy/.npz文件同时存在时,.png仅用于可视化,训练数据请使用数组文件。InstanceSegmentation和TagSegmentation掩码不包含在此次发布中,将在未来版本中提供。
数据格式说明
- 深度图: 2H×2W float32 数组
- 表面法线: H×W×3 float32 数组,坐标系为 +X右、+Y上、+Z后
- 遮挡边界: ≥2H×2W PNG,边界处为255,其余为0
- 光流: H×W×3 float32 数组,通道1和2为标准光流(像素单位),通道3为深度变化;序列末帧值无意义
- 遮挡掩码: H×W PNG,共视像素为255,遮挡像素为0;通过比较三角形面ID计算,存在椒盐噪声式误报,可用最大池化缓解
- 相机参数:
.npz文件包含K(3×3内参矩阵)、T(4×4相机到世界外参矩阵)、HW(图像高宽);世界坐标系采用计算机视觉约定(+X右、+Y下、+Z前),与Blender内部约定不同 - 对象分割: H×W int32 数组,压缩为
vals、indices、shape三个字段,可通过vals[indices].reshape(shape)重构;每个整数映射至Objects_json中相同object_index的条目 - 对象JSON: 每个对象包含
object_index、name、children、num_verts、num_faces、materials、unapplied_modifiers、tags、对象坐标系下的包围盒角点min/max以及实例的4×4对象到世界变换矩阵model_matrices;3D包围盒可由这些信息计算
仓库结构与使用
- 目录结构:
metadata.json(场景/相机/通道清单)、renders/{scene}/{scene}_{Pass}_camera_{c}.tar.gz(540个压缩包)、thumbnails/{scene}_thumbnail.png(每场景预览图) - 数据组织: 每个压缩包包含单场景单相机单个通道的全部192帧,解压后路径为
{scene}/frames/{Pass}/camera_{c}/{Pass}_0_0_{frame:04d}_{c}.{ext} - 选择性下载: 支持通过 Hugging Face
snapshot_download或命令行工具按需下载,建议只下载所需通道以节省存储空间 - 数据加载: Infinigen 提供了 PyTorch 风格的
dataset_loader.py工具类,可调用get_infinigen_dataset加载数据;该文件可独立于主代码库使用,但需同时复制依赖文件suffixes.py
引用信息
该数据集基于以下论文工作,引用格式参见原始 README 文件中的 BibTeX 条目。





