遇见数据集

KITTI-Pseudo-Depth

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

该数据集为KITTI原始数据集提供了高质量的伪深度图,这些深度图是使用先进的Depth Anything V2模型生成的。它旨在促进单目深度估计、3D目标检测以及自动驾驶应用领域的研究。数据集遵循标准的Eigen划分方式,包含训练集、验证集和测试集。原始图像来源于KITTI视觉基准测试套件(原始数据),深度图由Depth Anything V2模型生成。数据格式方面,RGB图像为.png格式,深度图为.npy格式(float32精度,以实现零损失精度)。

This dataset provides high-quality pseudo-depth maps for the KITTI raw dataset, generated using the advanced Depth Anything V2 model. It aims to facilitate research in monocular depth estimation, 3D object detection, and autonomous driving applications. The dataset follows the standard Eigen split, including training, validation, and test sets. Original images are sourced from the KITTI vision benchmark suite (raw data), and depth maps are generated by the Depth Anything V2 model. Regarding data formats, RGB images are in .png format, and depth maps are in .npy format (float32 precision for lossless accuracy).

创建时间:
2026-06-25
原始信息汇总

数据集概述:KITTI Pseudo Depth (Eigen Split) with Depth Anything V2

这是一个为 KITTI 原始数据集提供高质量伪深度图的数据集,使用 Depth Anything V2 模型生成,旨在支持单目深度估计、3D 目标检测和自动驾驶相关研究。

任务类别

  • 深度估计
  • 图像到图像

语言

  • 英语

标签

  • kitti, depth-anything-v2, monocular-depth-estimation, autonomous-driving

数据集规模

  • 样本数量: 10,000 < N < 100,000

数据划分

  • 采用标准的 Eigen Split 划分(训练、验证、测试)。

数据格式

  • 原始图像: RGB 图片,格式为 .png
  • 深度图: 深度图文件格式为 .npy(float32 类型),保证零精度损失。

数据来源

  • 原始图像: KITTI Vision Benchmark Suite(原始数据)
  • 深度生成器: Depth Anything V2

引用与致谢

使用本数据集时,请引用以下文献:

  • Depth Anything V2:

    @article{depth_anything_v2, title={Depth Anything V2}, author={Yang, Lihe and Kang, Bingyi and Huang, Zilong and Zhao, Zhen and Xu, Xiaogang and Feng, Jiashi and Zhao, Hengshuang}, journal={arXiv preprint arXiv:2406.09414}, year={2024} }

  • KITTI 数据集:

    @article{Geiger2013IJRR, author = {Andreas Geiger and Philip Lenz and Christoph Stiller and Raquel Urtasun}, title = {Vision meets Robotics: The KITTI Dataset}, journal = {International Journal of Robotics Research (IJRR)}, year = {2013} }

    @inproceedings{Menze2015CVPR, author = {Moritz Menze and Andreas Geiger}, title = {Object Scene Flow for Autonomous Vehicles}, booktitle = {Conference on Computer Vision and Pattern Recognition (CVPR)}, year = {2015} }

搜集汇总
数据集介绍
KITTI-Pseudo-Depth 数据集图片
构建方式
KITTI-Pseudo-Depth数据集基于KITTI原始视觉基准套件构建,采用标准的Eigen分割策略划分训练、验证与测试集。借助先进的Depth Anything V2模型,为每一帧RGB图像生成了高质量的伪深度图,深度数据以float32精度的.npy格式存储,确保了零损失的数值准确性。这种构建方式巧妙融合了真实驾驶场景的视觉信息与前沿单目深度估计技术,为自动驾驶研究提供了可靠的深度标注数据。
特点
该数据集的核心优势在于其高质量与高精度,深度图由当今领先的Depth Anything V2模型生成,显著优于传统方法。数据格式上,RGB图像采用无损的.png格式,而深度图以.npy文件保存单精度浮点数,既保留了完整的深度细节,又避免了量化误差。此外,数据集严格遵循KITTI的Eigen分割,涵盖约数万样本,规模适中,非常适合用于单目深度估计、3D目标检测等任务的训练与评估。
使用方法
使用该数据集时,研究人员可便捷地加载RGB图像与对应的深度图进行模型训练。具体而言,通过读取.png文件获取视觉输入,利用numpy库加载.npy文件获得深度真值。数据集已按Eigen分割整理好目录结构,用户可直接将其接入PyTorch或TensorFlow等深度学习框架的数据加载管道。建议结合KITTI原始标定文件使用,以支持多模态融合或几何相关的下游任务。
背景与挑战
背景概述
KITTI-Pseudo-Depth数据集诞生于2024年,由学术界与工业界研究人员基于Depth Anything V2模型构建而成,旨在为单目深度估计与自动驾驶场景理解提供高质量的伪深度标注资源。该数据集依托经典的KITTI视觉基准套件,沿用Eigen划分协议,将原始RGB图像转换为像素级精确的深度图,弥补了真实激光雷达数据在稀疏性与成本上的缺陷。其背后研究问题聚焦于如何利用大规模预训练模型生成稠密且准确的深度线索,以推动3D物体检测、路径规划等下游任务的发展。自发布以来,该数据集因兼具KITTI的领域权威性与深度估计的前沿性,成为评估单目深度算法在实际驾驶场景中泛化能力的重要标杆,对自动驾驶感知系统的进步产生了积极影响。
当前挑战
该数据集所解决的领域挑战主要源于单目深度估计固有的歧义性:单一RGB图像缺乏立体视觉的几何约束,导致远处物体与纹理匮乏区域的深度预测极不可靠;同时,真实驾驶场景包含运动模糊、光照剧变与遮挡等复杂要素,对模型鲁棒性提出严苛要求。在构建过程中,挑战尤为显著——需确保Depth Anything V2生成的伪深度与KITTI原始激光雷达稀疏深度在尺度上与语义上保持一致,避免因模型偏差引入系统性误差;此外,Eigen划分的训练-测试集存在场景重叠风险,可能导致深度估计性能的高估,且大规模数据的高效处理与存储格式的标准化(如.npy零损精度保留)亦构成了工程实施上的障碍。
常用场景
经典使用场景
KITTI-Pseudo-Depth数据集在单目深度估计领域扮演着基石角色。研究者利用该数据集中由Depth Anything V2模型生成的高质量伪深度图,配合原始RGB图像,可以训练或微调端到端的深度回归网络。经典的训练与测试协议遵循Eigen Split划分,使得不同模型在同一基准下公平比较。该场景下,伪深度标签替代了昂贵的激光雷达真实标注,大幅降低了数据获取成本,同时保持了足够的监督信号强度,是推动单目深度估计模型泛化能力与精度提升的关键工具。
实际应用
在自动驾驶与机器人导航的实际应用中,KITTI-Pseudo-Depth数据集成为视觉感知系统验证的重要平台。基于该数据集训练的深度估计模型可直接部署在车载摄像头模块上,实时输出像素级深度信息,辅助三维障碍物检测、可行驶区域分割及路径规划。同时,由于伪深度图具有连续且全图的特性,它特别适用于算法在复杂光照与动态场景下的鲁棒性测试。不少企业研发团队将其作为低成本原型验证数据,加速从学术模型到工程落地的转化进程。
衍生相关工作
KITTI-Pseudo-Depth的出现催生了一系列衍生研究工作。一方面,研究者基于该数据集提出了多种伪标签质量评估与纠正机制,如动态阈值筛选和多尺度一致性检验方法。另一方面,该数据集被广泛用于对比不同蒸馏策略——如特征级蒸馏、logit级蒸馏——在单目深度估计任务中的效果。此外,还涌现了将伪深度图作为辅助监督信号融合进三维目标检测与场景流估计的联合训练框架。这些工作共同构建了一个以伪标签为核心的算法演进生态,促进了深度学习在三维视觉领域的交叉发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务