遇见数据集

OmniScene

收藏
arXiv2026-07-15 更新2026-07-16 收录
数据链接:
官方服务:

资源简介:

OmniScene是一个新发布的大规模合成数据集,由D-Robotics等机构构建,旨在支持异构相机的度量深度感知研究。该数据集包含约26.6万帧同步六视角图像,总计170万张独立图像,覆盖103个室内外场景,提供高质量渲染和精确标定的相机配置。数据通过合成渲染技术生成,包含多样化的场景布局和逼真的视觉内容,专门用于训练和评估跨相机模型的深度估计能力。该数据集主要应用于计算机视觉和机器人领域,旨在解决异构相机系统中度量深度估计的数据稀缺问题,推动实时空间感知算法的发展。

OmniScene is a newly released large-scale synthetic dataset constructed by institutions including D-Robotics, aiming to support metric depth perception research for heterogeneous camera systems. This dataset contains approximately 266,000 frames of synchronized six-view images, totaling 1.7 million independent images, covering 103 indoor and outdoor scenes, and provides high-quality rendering and precisely calibrated camera configurations. Generated via synthetic rendering technology, the dataset features diverse scene layouts and realistic visual content, and is specifically designed for training and evaluating the depth estimation capabilities of cross-camera models. Primarily applied in the fields of computer vision and robotics, this dataset aims to address the data scarcity issue of metric depth estimation in heterogeneous camera systems, and promote the development of real-time spatial perception algorithms.

创建时间:
2026-07-15
原始信息汇总

数据集名称

OmniScene —— 大规模多视角异构相机合成数据集

基本统计

  • 场景数量: 103 个室内外复杂场景
  • 运动序列: 564 个
  • 总帧数: 约 266K 帧(每帧六视图同步)
  • 图像数量: 超过 170 万张已标定图像

相机配置

  • 使用固定的六相机模组,包含:
    • 4 个 180° 鱼眼相机
    • 2 个针孔相机
  • 所有相机已标定,提供每帧的 OpenCV 约定内参和外参

场景内容

  • 场景来自 Kujiale(酷家乐)和 Unreal Engine 的专业资产
  • 覆盖住宅、商业、工业、城市及科幻等类别
  • 包含训练集(源自训练场景)、验证集(源自训练场景但单独划分)和测试集(完全未见过的场景)

标注信息

每一帧提供精确的噪声无关度量地面真值:

  • 像素级 z 深度
  • 有效掩码
  • 天空指示器
  • 每帧 OpenCV 约定的内参和外参

发布链接

  • 数据集已公开发布于 Hugging Face,可通过 🤗 下载链接获取
搜集汇总
数据集介绍
OmniScene 数据集图片
构建方式
OmniScene通过精心设计的合成渲染管线构建,整合了103个涵盖室内外多样场景的专业级素材,包括住宅、商业、工业及科幻环境。数据集采用六相机异构传感系统,包含四个遵循Kannala-Brandt模型的180°视场鱼眼相机与两个标准针孔相机,所有相机以504×798分辨率同步渲染。轨迹生成采用占用感知的约束随机游走算法,在可通行路点集上采样平滑运动路径,并通过滑动窗口空间范围验证确保轨迹多样性,最终产出约266K帧同步多视图数据及1.7M单张图像。
使用方法
使用OmniScene时,研究者可直接加载同步的六视角RGB图像及对应相机标定参数,用于训练或评估异构多视角度量深度估计算法。数据集提供规范的OpenCV格式内参和外参,无需额外去畸变或全景拼接预处理。评测基准包括六视图异构(OmniScene-Full)、四视图鱼眼(OmniScene-Quad)及单视图鱼眼(OmniScene-Single)三种设定,便于系统评估模型在不同输入配置下的泛化能力。此外,数据集还可与现有针孔相机数据集联合使用,以增强跨相机类型的深度估计鲁棒性。
背景与挑战
背景概述
在自主机器人与具身智能系统蓬勃发展的当下,精准的3D空间感知能力已成为构建持久世界表征、进行物理场景推理与安全执行复杂任务的核心基石。然而,现有深度估计模型大多基于针孔相机假设,难以直接处理日益常见的混合鱼眼与针孔异构相机系统。为弥合这一领域空白,来自D-Robotics、东京大学与苏州大学的研究人员于2026年发布了OmniScene大规模合成数据集。该数据集包含约26.6万帧同步六视图影像、超过170万张独立图像,覆盖103个室内外多样化场景(涵盖住宅、办公室、商场、工业仓库与科幻空间等),为异构相机下的度量深度估计研究提供了前所未有的丰富训练资源。OmniScene的问世显著推动了多视图几何感知领域的发展,为构建鲁棒的跨相机度量深度模型奠定了坚实的数据基础。
当前挑战
OmniScene所解决的问题领域挑战在于:真实世界中的机器人系统常搭载混合鱼眼与针孔相机,而现有方法或依赖单一相机模型、或采用全景拼接方式处理宽视场输入,导致跨视图特征匹配与度量尺度对齐困难,尤其在实时性约束下难以兼顾精度与效率。构建过程中面临的核心挑战包括:1) 缺乏现有多样化异构相机深度训练语料,需从头合成大规模高质量数据;2) 鱼眼相机极端非线性投影带来的几何失真,要求设计统一的射线空间表征与训练策略;3) 确保多相机系统间的时间同步、姿态标注与深度真值的像素级精确对齐;4) 需生成多样化运动轨迹以避免路径退化,并剔除因相机-几何碰撞导致的无效帧。OmniScene通过精心设计的传感器套件、占据感知路径采样器与严格的质量控制流程,成功克服了上述挑战。
常用场景
经典使用场景
在三维视觉与空间智能领域,OmniScene最经典的使用场景是作为异构相机系统下度量深度估计的综合性训练与评估基准。该数据集通过精心设计的六相机刚性套件——包含四颗鱼眼相机与两颗针孔相机——同步采集了约26.6万帧多视角图像,覆盖103个室内外多样化场景。研究者可借助OmniScene提供的密集、无噪声的度量真值,系统性地训练与评测多相机融合深度模型,尤其适用于验证模型在混合投影几何下的跨视角特征对齐与尺度一致性能力。其高保真渲染与丰富的场景布局使其成为推动异构相机深度感知研究的基石性资源。
解决学术问题
OmniScene的问世有效解决了学术研究中长期存在的异构相机深度数据匮乏这一瓶颈问题。现有开源数据集大多局限于单一相机模型或特定驾驶场景,难以支撑跨鱼眼与针孔相机的通用深度建模研究。该数据集通过提供同步的多视角、多相机类型、带有精确内参外参的密集深度标注,使得研究者能够系统性地探索不同投影模型间的几何差异对深度估计精度的影响。其场景多样性也显著提升了模型的零样本泛化评估可靠性,从而催生出一系列在异构相机设置下实现跨视角度量深度融合的方法论创新。
实际应用
在实际工业与机器人应用中,OmniScene所支撑的异构相机深度估计技术展现出广阔的应用前景。例如,在具身智能与自主导航系统中,机器人常需融合车体四周的鱼眼广角相机与正前方的针孔长焦相机以实现无盲区感知。基于OmniScene训练的深度模型可直接部署于此类混合相机平台,实时输出准确的度量深度,为路径规划、避障决策以及物体抓取等下游任务提供可靠的几何输入。此外,在增强现实与虚拟现实设备中,OmniScene也能助力实现跨鱼眼与透视摄像头的空间一致性映射,提升用户体验的沉浸感。
数据集最近研究
最新研究方向
OmniScene数据集为异构相机(鱼眼与针孔)联合推理提供了大规模、高保真的合成训练资源,推动了实时度量深度估计从单一相机模型向多相机、多投影几何融合的前沿演进。与现有以驾驶场景为中心的广角数据集不同,OmniScene覆盖百余种室内外复杂环境,配备同步六视图标定与稠密度量真值,填补了异构多相机感知训练数据稀缺的空白。基于此,X-Lens模型通过学习可标定令牌与雅可比畸变偏置,首次实现了轻量级(0.04B参数)前馈网络对异构相机输入的鲁棒度量深度估计,在OmniScene全视图设定下将AbsRel降低25.4%,参数减少88.9%,显著提升了零样本泛化与实时推理能力。该数据集与模型的出现,为具身智能、视觉-语言-动作世界模型等依赖精确空间感知的实时系统提供了关键几何推理底座。
相关研究论文
  • 1
    X-Lens: Real-Time Metric Depth Estimation with Heterogeneous CamerasD-Robotics; 东京大学; 苏州大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务