遇见数据集

infinigen2-flying-indoors

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

Infinigen2 Flying Indoors 是一个由 Infinigen 2.0.0a2 预发布版本生成的程序化室内场景立体视频数据集。该数据集包含总计 48,000 帧立体视频,每段视频长度为 24 帧,展示完全程序化生成的室内背景,其中包含飞行物体和动态灯光。每 4 条轨迹为一组,提供同一场景的同步视角。数据提供多种真值标注,包括:RGB 图像、深度图、光流、表面法线、语义分割、材质分割、反照率、点跟踪等。其中,左相机包含完整的真值通道,右相机仅提供 RGB 和深度。数据以压缩的 .mkv 视频格式存储,通过 cvdpack 工具可解压为 .png(图像)和 .npy(数值)文件。相机数据以 .npz 文件提供内参和每帧位姿,物体数据以 .npz 文件提供每个物体的位置、旋转、缩放、包围盒、分割索引等信息。注意,该版本存在部分家具表面未细分、法线完全平坦等局限,不适合用于表面法线训练。材质分割索引未提供语义名称。该数据集适用于计算机视觉任务,如深度估计、光流估计、点跟踪、语义分割等。

Infinigen2 Flying Indoors is a stereoscopic video dataset of procedurally generated indoor scenes produced by the Infinigen 2.0.0a2 pre-release version. The dataset consists of a total of 48,000 frames of stereo video, each video clip is 24 frames long, showcasing fully procedurally generated indoor backgrounds with flying objects and dynamic lighting. Every 4 trajectories form a group, providing synchronized views of the same scene. The data provides multiple ground truth annotations including: RGB images, depth maps, optical flow, surface normals, semantic segmentation, material segmentation, albedo, point tracking, etc. The left camera includes full ground truth channels, while the right camera only provides RGB and depth. Data is stored in compressed .mkv video format and can be decompressed into .png (images) and .npy (numerical) files using the cvdpack tool. Camera data is provided in .npz files with intrinsics and per-frame poses, and object data is provided in .npz files with position, rotation, scale, bounding box, segmentation index, etc. Note that this version has limitations such as some furniture surfaces not being subdivided and normals being completely flat, making it unsuitable for surface normal training. Material segmentation indices do not provide semantic names. The dataset is suitable for computer vision tasks such as depth estimation, optical flow estimation, point tracking, semantic segmentation, etc.

创建时间:
2026-08-14
原始信息汇总

Infinigen2 Flying Indoors 数据集概述

基本信息

  • 许可证: BSD-3-Clause
  • 数据集规模: 总计 48,000 帧立体视频帧
  • 视频时长: 每个视频包含 24 个时间步长
  • 场景内容: 全程序化生成的室内场景,包含飞行物体和灯光
  • 场景数量: 每 4 个轨迹组成一组,提供同一场景的同步视图

数据内容

提供的地面真值

  • 深度(Depth)
  • 光流(Flow)
  • 表面法线(Surface Normals)
  • 分割掩码(Segmentation)
  • 反照率(Albedo)
  • 点跟踪(Point Tracking)

相机配置

  • 双目立体相机(左右各一个)
  • 右侧相机仅提供 RGB 和深度数据
  • 左侧相机提供所有地面真值数据

数据结构

每个轨迹文件夹包含以下文件:

  • rgb-CameraLeft.mkv / rgb-CameraRight.mkv: RGB 视频
  • depth-CameraLeft.mkv / depth-CameraRight.mkv: 深度视频
  • diffuse-color-CameraLeft.mkv: 漫反射颜色
  • environment-CameraLeft.mkv: 环境光照
  • optical-flow-CameraLeft.mkv: 光流
  • surface-normal-CameraLeft.mkv: 表面法线
  • semantic-segmentation-CameraLeft.mkv: 语义分割
  • material-segmentation-CameraLeft.mkv: 材质分割
  • camera-CameraLeft.npz / camera-CameraRight.npz: 相机参数
  • object-data.npz: 物体数据
  • metadata.json: 元数据

相机参数规范

  • 图像分辨率: 720×1280
  • 内参: fx = fy = 600, cx = 640, cy = 360
  • 坐标系统:
    • 世界坐标系采用 Blender 惯例(右手系,+Z 向上,单位为米)
    • 相机坐标系采用 OpenCV 惯例(+X 向右,+Y 向下,+Z 向前)
  • 深度定义: 沿相机 +Z 轴的平面深度(非射线长度)
  • 立体基线: 每场景随机化,范围约 0.06m 至 0.36m,轨迹内恒定

物体数据规范

包含场景中每个网格物体的 3D 地面真值:

  • 位置、旋转(欧拉角)、缩放
  • 局部包围盒
  • 物体索引、名称、类型
  • 数据块名称和 ID

已知限制

  1. 表面细分不足: 部分家具物体(如窗户、架子)未进行密集细分
  2. 法线质量差: 许多表面法线完全平坦,不建议用于表面法线训练
  3. 材质语义缺失: 材质分割 ID 不提供语义名称,仅能区分物体的子部分
  4. 三角形伪影: 墙壁网格和小物体在靠近相机时会出现明显三角形化

生成版本

  • 使用预发布版本 infinigen==2.0.0a2 生成
  • 后续将发布修复这些缺陷的新版本

下载方式

数据集提供多种下载方式:

  • 选择性下载(指定场景、轨迹、地面真值类型)
  • 完整数据集下载
  • 支持 SLURM 集群并行解压
  • 使用 cvdpack 工具(基于 FFMPEG)压缩/解压,节省 80% 下载和存储空间

引用方式

如使用此数据集,请引用:

  • @misc{raistrick2026procfunc, title={ProcFunc: Function-Oriented Abstractions for Procedural 3D Generation in Python}, ...}
搜集汇总
数据集介绍
infinigen2-flying-indoors 数据集图片
构建方式
该数据集由普林斯顿大学视觉与学习实验室基于其自主研发的Infinigen2程序化生成引擎构建,采用函数式抽象与Python脚本驱动的方式,在Blender环境中自动生成包含动态飞行动物与漂浮物体的室内三维场景。每个场景均通过随机种子参数化,确保生成内容的高度多样性。数据集包含48,000帧立体视频,每组24帧,每场景提供四条同步相机轨迹,形成多视角观测。地面真值涵盖深度、光流、法线、语义分割、反照率及点追踪等,并通过cvdpack工具进行高效压缩存储,以视频格式封装原始图像,兼顾下载效率与数据完整性。
特点
该数据集的核心特色在于其完全程序化的生成机制,使得场景内容无重复且可无限扩展,突破了传统人工采集或静态合成数据的局限性。每帧图像均配备丰富且精确的像素级标注,包括平面Z深度、双目视觉中已知基线的立体配对、连续旋转欧拉角及逐帧物体位姿,支持复杂动态场景的三维理解任务。尽管当前版本在曲面细分与材质命名上存在局限,但其对室内环境、飞行动物及光照变化的模拟精度,为视觉感知模型提供了宝贵的训练资源,尤其适用于深度估计、光流计算与语义分割等任务的预训练与评估。
使用方法
使用该数据集需先安装ffmpeg及cvdpack工具,通过命令行按需选择场景、轨迹及地面真值类型进行解压,亦可利用SLURM集群并行处理以加速大规模下载。解压后的数据以PNG图像和NPY数组存储,配合camera-*.npz中的相机内参与位姿、object-data.npz中的物体级标注,用户可灵活构建自定义数据加载流程。需注意深度为沿相机Z轴的平面深度,语义分割ID需结合object-data.npz进行名称映射。该数据集适用于训练与评估立体视觉、动态场景理解及生成模型,推荐引用时注明Infinigen2 Flying Indoors Part A及相应论文。
背景与挑战
背景概述
Infinigen2 Flying Indoors数据集由普林斯顿大学视觉与学习实验室(Princeton VL)于2026年发布,是Infinigen2程序化生成引擎的预览数据集,旨在为计算机视觉研究提供大规模、高精度的室内场景合成视频数据。该数据集包含48,000帧立体视频,每段视频24帧,展示完全程序化生成的室内环境,配有飞行动态物体与光源,并提供深度、光流、法线、分割、反照率、点跟踪等多种真值标注。其核心研究问题在于利用程序化生成技术为动态场景理解、多视图几何和视频预测等任务提供可控、可扩展且标注精确的训练数据。作为Infinigen系列的一部分,该数据集继承了程序化生成的无限场景多样性优势,对推动视觉模型泛化能力研究具有重要价值。
当前挑战
该数据集面临的首要挑战是为动态室内场景提供全面而精准的真值标注,包括深度、光流、点跟踪等,以应对复杂遮挡与运动模糊。然而,当前版本存在明确局限:部分家具表面未细分,导致深度和流场无法反映材质位移的细微几何;表面法线严重失真,因许多表面呈完全平坦状态,不适宜用于法线训练。此外,语义分割仅提供全局逐像素材质ID,缺失语义名称,限制了直接的类别级学习。构建过程中,还需解决大规模数据压缩与高效传输问题,cvdpack工具虽节省80%存储,但解压带来的CPU开销和复杂流程增加了使用门槛。未来版本需修正几何细分和标注完备性,以提升数据质量与应用范围。
常用场景
经典使用场景
Infinigen2 Flying Indoors数据集以其全程序化生成的室内场景与飞行物体轨迹,为计算机视觉领域提供了大规模、高精度的立体视频数据。其经典使用场景聚焦于多视图几何与运动估计研究,研究者可利用其同步的双目视频序列、相机内外参及稠密深度真值,开展立体匹配、光流估计、场景流计算及点跟踪等经典任务的算法开发与基准测试。数据集中的24帧短轨迹设计,模拟了相机在复杂室内环境中的快速运动,特别适合验证动态场景下几何重建与运动分割算法的鲁棒性,成为视觉几何与动态场景理解研究的理想试验场。
解决学术问题
该数据集直面学术界长期困扰的动态场景标注难题,通过程序化生成技术,为动态室内环境提供了像素级精确的真值标签,涵盖深度、光流、法向、语义分割及点跟踪等全方位信息,突破了传统手工标注的局限与误差。它有效解决了动态场景中运动物体与静态背景的精确分离问题,以及多视角一致性与时序一致性难以保证的问题,为评估和推动动态三维重建、视觉里程计及同时定位与建图(SLAM)等研究提供了可靠基准,推动了计算机视觉从静态场景向动态复杂环境理解的范式演进。
衍生相关工作
该数据集衍生出一系列开创性工作,尤其在基于合成数据的视觉学习与程序化生成领域。以Infinigen系列为代表的程序化生成框架,促使研究者探索从合成数据到真实场景的域自适应技术,发展出多种无监督域适应与域随机化方法。同时,数据集中的丰富真值激励了多任务学习模型的创新,如联合估计深度、光流与物体姿态的统一架构。此外,其高质量的时序标注推动了动态场景重建与神经渲染技术(如动态NeRF)的发展,为处理非刚性运动提供了数据基础。这些衍生工作不仅验证了数据集的潜力,也促进了视觉智能体在动态环境中感知与交互能力的持续突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务