遇见数据集

KITScenes

收藏
arXiv2026-07-01 更新2026-06-05 收录
数据链接:
官方服务:

资源简介:

KITScenes数据集家族由卡尔斯鲁厄理工学院创建,旨在为自动驾驶研究提供高保真和长尾评估基准。该数据集包含KITScenes Multimodal和KITScenes LongTail两个子集,前者提供多模态传感器数据和生产级高清地图,专注于欧洲密集城市环境中的高保真评估;后者通过低成本记录和人类推理痕迹,针对长尾场景进行闭环评估。数据来源于真实世界记录,采用高精度传感器和标注策略,旨在解决自动驾驶中在线地图构建、规划决策和长尾事件评估等关键问题,推动Level 4自治系统的可信基准测试。

KITScenes Multimodal is a high-fidelity multimodal autonomous driving dataset jointly created by the Karlsruhe Institute of Technology and other institutions, aiming to address the gaps in geographic diversity and spatial perception capability of existing datasets. This dataset includes 1007 scenarios, with a total of 5.7 hours of synchronized multimodal data, covering a high-definition map of 62 square kilometers. It integrates multi-sensor information such as 72-megapixel global shutter cameras, long-range LiDAR with a detection range exceeding 400 meters, and 4D imaging radars. The data was collected in three typical European cities to enhance geographic representativeness. The dataset features high-precision calibration and annotations in Lanelet2 format, enabling 3D traffic element annotations with pixel-level reprojection accuracy, and has been validated via autonomous driving software stacks. Its core applications are to advance spatial perception research for Level 4 autonomous driving, support cutting-edge tasks including online high-definition map construction, long-range depth estimation, neural rendering, and end-to-end driving, and provide a critical data foundation for geometric reasoning and topological understanding in complex urban environments.

创建时间:
2026-07-01
原始信息汇总

数据集概述:KITScenes

KITScenes是一个由卡尔斯鲁厄理工学院(KIT)测量与控制系统研究所(MRT)发布的一组自动驾驶数据集。该数据集旨在解决从研究到L4级自动驾驶安全性的全谱系挑战,包括整体多模态空间推理、高精地图感知以及罕见长尾场景中的安全行为。

数据集构成

KITScenes包含两个主要数据集:

  • KITScenes LongTail

    • 内容:包含1,000个罕见驾驶场景,例如施工区域、恶劣天气、夜间和超车等。每个场景被捕捉为一个9秒的360°视频片段,并附有轨迹、高级指令以及英语、西班牙语和中文的专业推理轨迹。
    • 规模:1,000个场景,360°摄像机覆盖,支持3种推理语言(EN / ES / ZH)。
    • 状态(截至2026年3月):发布了测试集和3个训练样本,用于少样本评估。完整的训练和验证集将在后续发布。
  • KITScenes Multimodal (早期发布)

    • 内容:一个高保真传感器套件,搭配生产级Lanelet2高精地图,覆盖真实世界L4自动驾驶所需的所有元素。已验证可与开源Autoware堆栈用于闭环使用。
    • 规模:72.5 MPix摄像头分辨率,400+米激光雷达测距范围,62平方公里Lanelet2高精地图。
    • 状态(截至2026年5月):在HuggingFace上发布了早期预览版,主要用于管线探索,不建议用于最终基准报告。

数据获取与资源

  • 数据获取方式:数据集可通过HuggingFace平台获取。具体链接可参见网站上的“Dataset on Huggingface ↗”按钮。
  • 论文:相关论文已发布(arXiv:2603.23607)。

关联任务与基准

该数据集支持多项自动驾驶研究任务,例如:

  • 长尾端到端驾驶
  • 多模态端到端驾驶
  • 关系型高精地图感知
  • 新视角合成
  • 单目深度估计
搜集汇总
数据集介绍
KITScenes 数据集图片
构建方式
KITScenes Multimodal数据集由卡尔斯鲁厄理工学院等机构联合构建,旨在弥补现有自动驾驶数据集在传感器保真度、地图完整性和地理多样性方面的不足。数据集采用全同步传感器套件,集成了高分辨率全局快门相机、有效探测距离超过400米的远程激光雷达、4D成像雷达以及冗余GNSS/INS定位系统。数据采集于德国卡尔斯鲁厄、法兰克福和辛德尔芬根三座城市,涵盖规则放射状布局、密集金融中心城区及城郊工业混合区等多种欧洲典型城市环境,并于2025年夏季和2025/2026年冬季分别采集,以纳入季节变化因素。
使用方法
数据集配套发布四个基准任务,用于评估空间学习能力:在线高清地图构建任务要求从传感器数据预测完整的Lanelet2地图结构;远程单目深度估计任务针对200米以外的深度感知能力;新视角合成任务利用高保真图像和稠密激光雷达评估场景重建的几何保真度;端到端驾驶任务则支持从单目相机到多模态融合的多种输入配置。数据集已划分严格的地理不重叠训练/验证/测试集,测试集不公开地图标签以保障评测公正性。研究者可通过项目网站获取数据及其转换工具。
背景与挑战
背景概述
KITScenes Multimodal数据集由卡尔斯鲁厄理工学院与FZI信息科技研究中心于2026年联合发布,旨在突破现有自动驾驶数据集在传感器保真度、地图完整性与地理多样性方面的局限。该数据集聚焦于欧洲复杂城市环境的空间智能推理,核心研究问题在于如何通过高精度传感器与拓扑完整的高精地图,支持从在线地图构建到端到端驾驶的多层次空间学习。凭借同步全局快门相机、超400米探测距离的激光雷达、4D成像雷达及冗余GNSS/INS定位系统,KITScenes不仅提供了当前最全面的公开高精地图(覆盖62平方公里、29种道路特征与120类交通标志),更通过四个基准测试揭示了现有方法在完整地图预测、远距离深度估计等任务中的系统性短板,对推动L4级自动驾驶的空间感知能力产生了深远影响。
当前挑战
该数据集所面临的挑战首先体现在复杂的空间感知领域:现有方法在完整Lanelet2地图预测中表现急剧下降,显示出对拓扑结构与交通要素联合建模的不足;远距离深度估计(超过200米)成为显著瓶颈,当前最优模型在此区间精度大幅衰退。其次,数据构建过程面临严苛工程挑战:需实现七台激光雷达与九台相机的高精度硬件同步与亚像素级标定,同时保证162公里路测数据的重投影级定位精度;高精地图的手工标注耗费逾万工时,且需将二维航拍图像与三维传感器数据融合为包含全部法规要素的拓扑关联地图,并经过闭环自动驾驶验证。此外,在保持传感器高保真度的前提下完成图像隐私匿名化,亦是技术复杂性极高的挑战。
常用场景
经典使用场景
在自动驾驶领域,KITScenes Multimodal 数据集最经典的使用场景在于支撑高精度在线高清地图构建(Online HD Map Construction)研究。借助其覆盖62平方公里、包含29种道路要素类别和120种交通标志类别且经由闭环自动驾驶验证的Lanelet2格式地图,研究者能够评估模型从传感器数据中预测完整拓扑结构、交通信号灯及其车道归属的能力,突破了以往仅预测简单几何基元的局限。
解决学术问题
该数据集系统性地揭示了现有方法在多个空间感知任务中的能力鸿沟。在长距离单目深度估计方面,它首次提供了超过400米的密集激光雷达真值,暴露了当前模型在200米以上范围性能急剧下降的问题。在线高清地图构建任务中,它揭示了模型在完整Lanelet2结构预测上的巨大不足,而新颖视图合成基准则凸显了现有神经场景表示方法在侧向平移时几何保真度的严重退化。这些发现为学术界指明了亟需突破的关键方向。
实际应用
在实际应用中,KITScenes Multimodal 可直接服务于L4级自动驾驶系统的开发与验证。其生产级高清地图已被证实可在开源自动驾驶栈Autoware中实现闭环驾驶,因此可用于仿真环境中的规划算法测试。同时,高保真多模态传感器数据(包括1600万像素全局快门相机、超过400米探测范围的激光雷达和4D成像雷达)为模型在复杂欧洲城市环境中的部署提供了可靠的训练与评估基础,尤其适用于非结构化路口和混合交通流场景。
数据集最近研究
最新研究方向
KITScenes Multimodal数据集聚焦于高保真度多模态感知与空间推理的耦合研究,推动自动驾驶领域从物体检测向全局语义理解跃迁。前沿方向包括:基于Lanelet2的完整在线高精地图构建,通过图神经网络实现拓扑关系预测,突破现有任务在简单几何基元上的饱和瓶颈;长距离单目深度估计,揭示当前方法在200米以外性能骤降的盲区;横向新视角合成,利用地图基评估揭示现有神经渲染在几何保真度上的结构性失真;以及多模态端到端驱动,通过地图锚定的安全度量揭示稀疏欧洲城区场景下的域迁移鸿沟。该数据集以欧洲不规则路网与混合交通模式填补了地理多样性空白,其完备的地图注释与长距传感器能力为L4级自主驾驶的空间认知提供了关键验证基准。
相关研究论文
  • 1
    The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset卡尔斯鲁厄理工学院; FZI信息技术研究中心; 马德里卡洛斯三世大学; 代尔夫特理工大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务