遇见数据集

2026-08-flying-indoor-preview

收藏
Hugging Face2026-08-19 更新2026-08-20 收录
官方服务:

资源简介:

Flying Indoor 是一个由 Infinigen 2.0 生成的合成室内场景数据集,用于支持计算机视觉任务。数据集的 Part 1 包含 1,750 个轨迹,每个轨迹有 24 帧,覆盖 438 个独特的 3D 室内场景。每个场景是一个矩形房间,具有详细的墙壁材料、家具、多个沿随机路径移动的物体,以及最多四个沿随机路径移动的立体相机轨迹。每个轨迹提供来自左相机和右相机的 RGB 图像、深度图、光流、表面法线、语义分割、材质分割等 ground truth 数据,以及相机参数和场景中所有物体的姿态、边界框等信息。数据以压缩的 MKV 视频文件形式提供,可通过 cvdpack 工具解压为 PNG 图像和 NPY 数值文件。该数据集适用于单目和立体深度估计、光流、场景流、语义分割、物体检测与跟踪等任务。但当前版本存在一些限制:部分家具物体的表面细分不足,导致位移纹理(如木纹)仅通过凹凸映射影响 RGB,而未正确影响几何 ground truth,表面法线受此影响严重,不建议用于法线训练(除非掩码掉问题物体);材质分割提供了全局逐像素材质 ID,但未附带语义名称。未来版本将修复这些问题。

Flying Indoor is a synthetic indoor scene dataset generated by Infinigen 2.0, designed to support computer vision tasks. Part 1 of the dataset contains 1,750 trajectories, each with 24 frames, covering 438 unique 3D indoor scenes. Each scene is a rectangular room with detailed wall materials, furniture, multiple objects moving along random paths, and up to four stereo camera trajectories moving along random paths. Each trajectory provides ground truth data such as RGB images, depth maps, optical flow, surface normals, semantic segmentation, and material segmentation from both left and right cameras, along with camera parameters and the poses and bounding boxes of all objects in the scene. The data is provided as compressed MKV video files, which can be decompressed into PNG images and NPY numerical files using the cvdpack tool. This dataset is suitable for tasks such as monocular and stereo depth estimation, optical flow, scene flow, semantic segmentation, object detection and tracking. However, the current version has some limitations: insufficient surface subdivision for some furniture objects causes displacement textures (e.g., wood grain) to affect RGB only via bump mapping, without correctly affecting geometric ground truth; surface normals are severely affected, making them unsuitable for normal training (unless the problematic objects are masked out). Material segmentation provides global per-pixel material IDs but does not include semantic names. These issues will be fixed in future versions.

创建时间:
2026-08-14
原始信息汇总

Infinigen2 Flying Indoors 数据集概述

基本信息

  • 许可证:BSD-3-Clause
  • 数据规模:48,000帧立体视频帧,每段视频包含24个时间步长,展示完全程序化生成的室内场景,包含飞行物体和灯光
  • 版本状态:基于预发布版本 infinigen==2.0.0a2 生成,为预览数据集

数据内容

包含的标注类型

  • 深度(Depth)
  • 光流(Optical Flow)
  • 表面法线(Surface Normal)
  • 语义分割(Semantic Segmentation)
  • 材质分割(Material Segmentation)
  • 反照率(Albedo)
  • 点跟踪(Point Tracking)

场景结构

  • 每个场景包含4条轨迹(trajectory),提供同一场景的同步视图
  • 包含多个渲染通道(pass),如RGB、深度、漫反射颜色、环境光等

已知局限性

  1. 几何细分不足:部分家具物体(如窗户、架子)未进行密集细分;墙面网格或小物体在靠近相机时会出现明显的三角化
  2. 表面法线精度受限:许多表面法线完全平坦,即使深度差异较小,不建议用于表面法线训练
  3. 材质ID无语义名称:虽然提供全局逐像素材质ID,但不包含语义名称,仅可用于区分物体的子部分

技术规格

图像参数

  • 分辨率:720 × 1280(高 × 宽)
  • 相机内参:fx = fy = 600,主点位于图像中心(640, 360)
  • 立体相机:已校正,右相机为左相机沿+X轴平移,基线范围约0.06m至0.36m

坐标约定

  • 世界坐标系:Blender右手坐标系,+Z向上,单位为米,地面接近z=0
  • 相机坐标系:OpenCV约定,+X向右,+Y向下,+Z沿视线方向向前
  • 深度值:沿相机+Z轴的平面深度(米),而非射线长度

文件结构

打包格式

每个轨迹目录包含多个.mkv视频文件(每通道一个)及.npz/.json元数据文件:

  • rgb-*.mkv:RGB图像
  • depth-*.mkv:深度
  • diffuse-color-*.mkv:漫反射颜色
  • surface-normal-*.mkv:表面法线
  • semantic-segmentation-*.mkv:语义分割
  • material-segmentation-*.mkv:材质分割
  • camera-*.npz:相机内外参数
  • object-data.npz:物体数据
  • metadata.json:种子和渲染时间

解压后格式

解压后每通道生成逐帧的.png(RGB、漫反射、环境)或.npy(深度、光流、法线、分割)文件。

立体相机数据

  • 右相机仅提供RGB和深度数据
  • 其余标注需通过左相机深度和已知立体基线重投影恢复

数据访问

下载方式

推荐使用 cvdpack 工具(开源,基于FFMPEG压缩/解压),可节省80%下载和存储空间,需先手动安装ffmpeg。

选择性下载

可通过 --subset 参数指定场景(scene)、轨迹(traj)、标注类型(gt_type)和相机(cam)进行选择性下载,支持逗号分隔列表。

完整下载

支持整数据集下载,也可在SLURM集群上并行解压(需安装 cvdpack[hf,slurm] 额外依赖)。

引用信息

若使用本数据集,请引用为 "Infinigen2 Flying Indoors A",并引用相关论文(ProcFunc: Function-Oriented Abstractions for Procedural 3D Generation in Python,arXiv:2604.26943)。

搜集汇总
数据集介绍
2026-08-flying-indoor-preview 数据集图片
构建方式
本数据集由Infinigen2生成器以全程序化方式构建,模拟室内环境中飞行的物体与光源。每个场景包含4条摄像机轨迹,每条轨迹提供24个时间步的立体视频帧,共计48,000帧。数据涵盖RGB、深度、光流、法线、分割、反照率及点追踪等多种真值,并同步提供左右摄像机的位姿及场景内物体的详细信息。
特点
该数据集以完全程序化生成的室内场景为特色,包含多样化的物体与动态光源,提供丰富的视觉真值标注。每个场景包含约128至200个物体,并记录其名称、位姿及包围盒。数据采用视频压缩格式存储,大幅节省下载与存储空间,同时支持按场景、轨迹及真值类型进行选择性下载。
使用方法
使用cvdpack工具可高效解压数据,支持命令行参数指定下载场景、轨迹及真值类型。解压后,用户可获得原始PNG图像及NPY格式的深度、光流等数据。摄像机内参、位姿及物体数据均以NPZ格式存储,便于进行三维重建、运动分析及场景理解等研究。
背景与挑战
背景概述
Infinigen2 Flying Indoors数据集由普林斯顿大学视觉实验室于2026年发布,作为ProcFunc项目的一部分,由Alexander Raistrick等人开发。该数据集旨在推动计算机视觉领域在复杂室内动态场景下的多模态感知研究,提供了48,000帧立体视频,涵盖深度、光流、法线、分割、反照率及点追踪等丰富地面真值。其核心研究问题在于如何从程序化生成的室内环境中高效获取大规模、高精度的训练数据,以支持各类视觉任务的模型训练与评估。该数据集的发布为三维视觉、场景理解及自动驾驶等应用研究提供了宝贵的资源,对推动程序化数据生成及多模态学习的交叉发展具有重要影响力。
当前挑战
该数据集面临多重挑战。领域层面,其旨在解决复杂室内场景中多模态感知的难题,如动态物体与光照变化对深度估计、语义分割及点追踪的影响,现有数据集常缺乏高精度、多视角的同步标注。构建层面,数据集作者遇到了技术限制,如部分家具表面未细分,导致法线估计不准确,且未提供材质语义名称,限制了细粒度分割研究。此外,数据压缩与解压过程依赖自定义工具,增加了使用复杂度,同时存储与分发的效率也是需权衡的难题,这些因素共同构成了数据集当前应用中的主要障碍。
常用场景
经典使用场景
本数据集以全程序化生成的室内场景为基础,提供48,000帧立体视频及对应的深度、光流、法线、分割、反照率、点跟踪等丰富标注,为计算机视觉领域的研究者提供了一个高度可控且多样化的合成数据平台。其经典使用场景聚焦于运动感知与场景理解任务,如利用多视角同步轨迹进行三维重建、动态场景的稠密光流估计,以及基于点跟踪的长期对应关系学习。由于场景中蕴含着丰富的运动物体与光源变化,该数据集尤其适合训练和评估面向复杂室内动态环境的深度估计、实例分割和视觉SLAM算法,为多模态视觉模型提供了坚实的验证基准。
实际应用
在实际应用中,该数据集可作为视觉算法开发和验证的关键资源,服务于机器人导航、增强现实和自动驾驶等对感知鲁棒性要求极高的领域。其合成的室内飞行视角视频数据,能够模拟具身智能体在真实环境中的感知输入,用于预训练视觉模型、测试视觉里程计与稠密建图算法。此外,通过数据引擎生成的多样化场景,能够有效补充真实数据分布中的长尾情况,加速安防监控、智能家居等应用中视觉系统的迭代优化与部署。
衍生相关工作
该数据集有望衍生一系列基于合成数据驱动的视觉研究经典工作。例如,利用其多模态真值开发联合学习框架,实现深度估计、光流计算与语义分割的协同优化;或者基于其点跟踪标注,探索长程运动对应关系的新方法,提升视频理解模型的时序建模能力。数据集的程序化生成管线本身也催生了关于可微渲染、场景抽象表示的相关研究,如ProcFunc中函数式三维生成思想的延伸,为后续研究提供了新的视角和基础工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务