遇见数据集

OmniScene

收藏
Hugging Face2026-07-11 更新2026-07-12 收录
官方服务:

资源简介:

OmniScene是一个用于深度估计任务的光线级逼真合成数据集,由NVIDIA Isaac Sim渲染生成。该数据集专为训练X-Lens模型而设计,通过一个6相机阵列采集每个场景,包括4个鱼眼相机(提供全向视角)和2个针孔相机(提供前向和后向视角),所有相机分辨率均为1920×1200。每个样本同时包含针孔、鱼眼及异构混合视图,并附带度量级真实深度标签。数据集按场景打包,每个场景为一个.tar文件,包含训练集、验证集和测试集分割。每个场景包含以下内容:RGB图像(8位JPG格式)、深度图(16位PNG格式,需除以256转换为米制深度)、每相机的静态有效镜头掩码、天空掩码(当场景包含天空时)以及每帧的相机参数(包含所有6个视角的内参、外参和完整标定信息)。数据集规模在100B到1T之间,适用于深度估计、多视角视觉、鱼眼图像处理等任务,特别适合研究异构相机系统的深度感知。数据集采用CC BY-NC 4.0许可,仅限非商业研究使用。

OmniScene is a photorealistic synthetic dataset for depth estimation tasks, rendered using NVIDIA Isaac Sim. It is designed for training the X-Lens model, capturing each scene with a 6-camera array consisting of 4 fisheye cameras (providing omnidirectional views) and 2 pinhole cameras (providing forward and backward views), all with a resolution of 1920×1200. Each sample includes pinhole, fisheye, and heterogeneous hybrid views, along with metric-accurate ground truth depth labels. The dataset is packaged by scene, with each scene as a .tar file containing splits for training, validation, and testing. Each scene includes: RGB images (8-bit JPG format), depth maps (16-bit PNG format, requiring division by 256 to convert to metric depth), per-camera static valid lens masks, sky masks (when the scene includes sky), and per-frame camera parameters (including intrinsic, extrinsic, and full calibration information for all 6 views). The dataset size ranges from 100B to 1T, suitable for tasks such as depth estimation, multi-view vision, and fisheye image processing, particularly for research on depth perception in heterogeneous camera systems. It is licensed under CC BY-NC 4.0 for non-commercial research use only.

创建时间:
2026-07-06
原始信息汇总

数据集概览

OmniScene 是一个用于深度估计的合成数据集,专为训练 X-Lens 模型而设计。

  • 渲染工具: NVIDIA Isaac Sim
  • 采集设备: 6 摄像头阵列(4 个鱼眼 + 2 个针孔)
  • 标注: 包含度量真实深度(metric ground-truth depth)
  • 分辨率: 1920×1200
  • 许可协议: CC BY-NC 4.0(仅限非商业研究用途)

数据规模与划分

  • 文件大小: 100B < n < 1T
  • 划分: 训练集(train/)、验证集(valid/)、测试集(test/),每个场景打包为单个 .tar 文件

文件结构

train/<scene>.tar valid/<scene>.tar test/<scene>.tar texture/ # 共享的鱼眼光线方向查找表(LUT)

每个 .tar 解压后的目录结构为:

<scene>/ ├── rgb/ CAM_/<frame>.jpg # 8-bit RGB 图像 ├── depth/ CAM_/<frame>.png # 16-bit 度量深度图 ├── mask/ CAM_*_mask.png # 每个相机的静态有效镜头遮罩 ├── sky_mask/ _meta.json + 帧级天空遮罩 └── common/ <frame>.npy # 所有6个视角的相机参数

摄像头阵列

视角 模型 说明
CAM_A, CAM_B, CAM_C, CAM_D 鱼眼(全向,Mei / unified-sphere: xi + radtan) 4 个侧面摄像头
CAM_Front, CAM_Back 针孔(透视,3×3 内参 K) 前后摄像头

深度解码

  • 深度图为 16-bit PNG,真实深度(米)= 像素值 / 256
  • 像素值为 0 表示无效区域或天空(需配合 sky_mask 使用)
  • 加载方法:cv2.imread(path, cv2.IMREAD_UNCHANGED) 确保读取16位数据

使用示例

python from huggingface_hub import hf_hub_download import tarfile

下载单个场景

p = hf_hub_download("henryzhou998/OmniScene", "test/<scene>.tar", repo_type="dataset") tarfile.open(p).extractall("omniscene/")

下载整个测试集划分

from huggingface_hub import snapshot_download snapshot_download("henryzhou998/OmniScene", repo_type="dataset", allow_patterns="test/*", local_dir="omniscene_tars")

许可证

  • CC BY-NC 4.0(非商业研究使用)
搜集汇总
数据集介绍
OmniScene 数据集图片
构建方式
OmniScene是一个基于NVIDIA Isaac Sim渲染的光照逼真合成数据集,专为支撑X-Lens模型的训练而设计。每个场景均通过一个六相机阵列捕获,该阵列包含四颗鱼眼镜头和两颗针孔镜头,提供全景多视角的度量深度真值。数据集以每个场景打包为一个独立的.tar文件进行组织,分为训练、验证和测试三个子集,并附带共享的鱼眼射线方向查找表,便于高效读取。深度图以16位PNG格式存储,通过除以256即可还原为米制单位,零值则对应无效或天空区域,需结合天空掩码使用。
特点
OmniScene的核心特点在于其异构相机系统与统一的数据表达:四颗鱼眼镜头采用全向的Mei/统一球面模型与radtan畸变校正,而两颗针孔镜头则提供标准透视投影,所有视图均以1920×1200分辨率输出。每个样本的相机参数帧文件以NumPy字典格式提供,涵盖内参矩阵、外参矩阵以及相对位姿,支持灵活的多视角几何计算。此外,数据集内置了静态的镜头有效区域掩码和天空掩码,为深度估计任务中的遮挡与无限远区域提供了精细标识。
使用方法
用户可通过HuggingFace Hub工具便捷获取OmniScene数据:使用hf_hub_download函数下载单场景的.tar文件,并通过tarfile解压至本地目录,即可访问RGB图像、深度图、掩码及相机参数。若需批量获取整个数据子集,snapshot_download接口配合文件名通配符可实现高效同步。数据集以CC BY-NC 4.0许可证发布,仅限非商业科研用途,其格式设计兼容常见深度学习框架,可直接迭代加载用于模型训练与评估。
背景与挑战
背景概述
在全景感知与自主导航领域,多视角鱼眼相机因其广阔的视场角与丰富的环境信息而成为关键传感器,然而现有深度估计数据集多局限于单一针孔或鱼眼视图,难以支撑异构相机系统(如鱼眼与针孔混合)的联合训练与评估。为弥补这一空白,OmniScene数据集应运而生,由研究者Zhou Heng等人在NVIDIA Isaac Sim中渲染生成,于2024年发布,旨在为异构多相机深度估计提供基准。该数据集模拟了一套六相机阵列(四枚鱼眼与两枚针孔相机),每帧图像均包含公制真实深度,覆盖室内外多样化场景,共包含数百个场景,数据规模庞大。OmniScene的提出推动了全向深度估计领域的发展,尤其为结合鱼眼与针孔特征的混合模型训练提供了标准化资源,被视为相关研究的重要基石。
当前挑战
OmniScene所针对的核心领域挑战在于如何从异构多相机系统(鱼眼与针孔混合)中准确估计深度。鱼眼相机的大畸变与针孔相机的透视投影差异显著,现有单视图模型难以泛化至此类复杂设置,且缺乏统一的多模态训练数据。数据构建过程中亦面临多重困难:首先,需在仿真环境下精确标定六相机阵列的联合内外参数,确保鱼眼模型的合理性;其次,深度标签需兼容鱼眼特有的射线映射与非平面几何;此外,数据集采用压缩tar包与共享纹理文件结构以适配HuggingFace存储限制,但需保证各场景解码效率与无损精度;最后,天空区域的无深度值标识(通过掩膜处理)增加了后处理复杂度。
常用场景
经典使用场景
OmniScene数据集为全向深度估计领域提供了极具价值的合成数据资源。该数据集通过NVIDIA Isaac Sim渲染生成,采用独特的六相机阵列(四颗鱼眼镜头与两颗针孔镜头)同步采集,每个样本同时包含鱼眼、针孔及异构混合视角的度量级真实深度信息。研究者可利用该数据集训练和评估能够处理多种相机模型的全向深度估计模型,尤其适用于探索从鱼眼图像到全景深度图的端到端映射方法,以及多视角异构相机的联合深度推理任务。
衍生相关工作
OmniScene数据集是全景深度估计领域代表性工作X-Lens的核心训练与评估基准。该工作通过引入异构相机深度对齐策略,在OmniScene上验证了从鱼眼-针孔混合输入到高质量全景深度图的跨模型泛化能力。数据集提供的标准六相机配置与度量级深度真值,已催生出多项后续研究,包括基于扩散模型的全向深度补全方法、面向鱼眼镜头的无监督深度自监督学习框架,以及多视角全景深度的一致性优化模型,形成了从数据基准到算法创新的良性研究生态。
数据集最近研究
最新研究方向
OmniScene作为面向全向感知与异构相机系统的多模态深度估计数据集,根植于计算机视觉与机器人感知的前沿交汇点。当前,随着自主导航、增强现实与沉浸式空间计算对360度环境理解的需求激增,融合鱼眼与针孔相机的异构多视角系统成为突破传统透视相机视野限制的关键路径。该数据集通过NVIDIA Isaac Sim合成的高保真数据,为异构相机联合深度估计、跨视角几何一致性学习以及全向深度补全等挑战性任务提供了标准化评测基准。其独特的多视点标定参数与逐像素度量深度标注,直接服务于无边界场景理解这一热点方向——从自动驾驶环视感知到VR/AR空间映射,OmniScene推动的异质传感器融合范式正在重塑实时三维重建的技术边界,为消除广角畸变与透视投影之间的表征鸿沟奠定了数据基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务