遇见数据集

Voxel51/kitscenes-multimodal

收藏
Hugging Face2026-06-08 更新2026-06-14 收录
官方服务:

资源简介:

KITScenes Multimodal(KIT-MRT)是一个高保真的欧洲城市自动驾驶多模态数据集,已整合为分组的FiftyOne数据集。它包含4个验证场景,每个场景由多个帧组成,总共有680组(帧)。每组对应一个时间戳帧,包含10个样本:来自九个全局快门摄像头的360度覆盖图像(形成环视和长距离立体视觉),以及一个融合的3D激光雷达/雷达点云(融合了七个激光雷达和三个雷达的数据)。数据集还提供了丰富的标注信息,包括投影的激光雷达深度热图、Lanelet2高精地图折线、自我轨迹路径点以及基于Mapillary-Vistas分类的实例预测(如车辆、行人、交通标志等)。此外,每个样本都包含场景上下文、时间戳、自我姿态(位置和方向)、GNSS数据(如经纬度、海拔)等字段。该数据集适用于多模态浏览与标注、高精地图感知、长距离深度估计、轨迹分析和2D对象分析等任务,但请注意,这是一个预览子集,不包含3D边界框或动态代理的跟踪,且实例预测为模型输出而非人工标注。数据采集自德国法兰克福等城市,使用CC-BY-NC-4.0许可证,仅限非商业用途。

KITScenes Multimodal (KIT-MRT) is a high-fidelity European urban autonomous-driving multimodal dataset, ingested into a grouped FiftyOne dataset. It includes 4 validation scenes, with a total of 680 groups (frames). Each group corresponds to a timestamped frame and contains 10 samples: synchronized captures from nine global-shutter cameras providing 360° coverage (forming surround view and long-range stereo vision), plus a fused 3D lidar/radar point cloud (combining seven lidars and three radars). The dataset is enriched with annotations such as projected lidar-depth heatmaps, Lanelet2 HD-map polylines, ego trajectory waypoints, and instance predictions based on the Mapillary-Vistas taxonomy (e.g., cars, pedestrians, traffic signs). Each sample also includes contextual fields like scene ID, timestamp, ego pose (translation and orientation), GNSS data (e.g., longitude, latitude, altitude), and more. This dataset is suitable for multimodal browsing and curation, HD-map perception, long-range depth estimation, trajectory/motion analysis, and 2D object analysis. Note that it is an early-release preview subset and does not include 3D bounding boxes or tracking for dynamic agents; the instance predictions are model outputs, not human annotations. Data was recorded in cities like Frankfurt, Germany, under the CC-BY-NC-4.0 license for non-commercial use only.

提供机构:
Voxel51
搜集汇总
数据集介绍
Voxel51/kitscenes-multimodal 数据集图片
构建方式
KITScenes Multimodal (KIT-MRT) 是一个面向欧洲城市自动驾驶场景的高保真多模态数据集,由卡尔斯鲁厄理工学院(KIT)测量与控制系统研究所(MRT)及FZI信息技术研究中心联合构建。该数据集基于FiftyOne框架进行封装,将来自完整机器人出租车传感器套装的同步数据组织为分组数据集。每个时间戳帧为一个分组,包含九台全局快门相机(覆盖360°环视及长焦立体视野)、七台远程激光雷达与三台4D成像雷达的融合点云,并配以Lanelet2高精度地图标签、投影激光雷达深度热图、未来自车轨迹路径及图像实例预测结果。数据集的构建通过官方kitscenes Python开发工具包完成几何与标签的投影与解码,确保了传感器、标定与地图数据的完整性和对齐精度。
使用方法
该数据集以FiftyOne分组数据集形式提供,可通过Hugging Face hub直接加载。用户需先安装FiftyOne库(指令:pip install -U fiftyone),随后使用fiftyone.utils.huggingface模块中的load_from_hub函数,传入数据集标识符“Voxel51/kitscenes-multimodal”即可完成加载。加载后的数据集可调用fo.launch_app启动可视化界面,支持在九路相机与三维点云间自由浏览。数据集预置了三个动态分组视图,分别以场景-帧索引及场景为单位组织前向环视、后向环视及激光雷达切片,便于多模态标注与感知任务的交互式探索。用户还可利用FiftyOne的查询与过滤功能,按传感器、场景或标签类型进行灵活的数据筛选与分析。
背景与挑战
背景概述
KITScenes Multimodal(KIT-MRT)数据集由卡尔斯鲁厄理工学院(KIT)测量与控制系统研究所(MRT)及FZI信息技术研究中心于2026年创建,核心研究团队包括Richard Schwarzkopf、Fabian Immel等学者。该数据集聚焦于欧洲城市自动驾驶感知任务,提供了来自9个全局快门相机、7个长距激光雷达和3个4D成像雷达的同步多模态数据,并配备了生产级Lanelet2高精地图标签、激光雷达深度投影、未来自车轨迹及实例预测结果。作为自动驾驶领域的高保真基准数据集,KIT-MRT通过将多传感器数据整合为FiftyOne分组数据集,显著提升了多模态感知研究的可复现性与探索效率,尤其在高精地图感知、长距离深度估计及轨迹预测等任务中展现出重要影响力。
当前挑战
该数据集的构建与使用面临多重挑战。领域问题层面,自动驾驶感知需融合相机、激光雷达与雷达的异构数据,解决传感器标定、时间同步与跨模态对齐难题,同时高精地图标签的像素级精准投影对道路结构理解提出严苛要求。构建过程中,数据采集需协调九台相机与十组三维传感器在10Hz频率下的同步捕获,激光雷达运动畸变校正与雷达多普勒补偿增加了预处理复杂度;此外,当前版本仅包含4个验证场景(680帧),作为早期预览子集尚缺乏三维边界框与动态目标跟踪标注,限制了其在完整基准测试中的应用,且实例预测结果来自模型而非人工标注,需谨慎评估其监督质量。
常用场景
经典使用场景
在多模态自动驾驶感知研究中,KITScenes Multimodal 数据集凭借其同步捕获的九台全局快门相机、七台远程激光雷达与三台四维成像雷达的完整传感器套件,成为评测多传感器融合算法的理想基准。该数据集将每一时刻的多源观测数据封装为分组样本,使研究者能够在统一的时间戳下同时访问360度环视图像、融合点云以及Lanelet2高清地图标签。经典使用场景集中于跨模态目标检测与深度估计:利用激光雷达投影深度热图监督单目深度预测网络,或借助相机图像与点云的联合表征提升动态目标识别精度。此外,高清地图中的车道线、路沿及交通标志多段线为几何语义推理提供了精标注真值。
解决学术问题
学术层面,该数据集直面自动驾驶领域长期存在的多模态时空对齐与长程深度估计难题。通过提供厘米级精度的外参标定数据及运动去畸变的点云,它使研究者能够系统验证激光雷达与相机投影间的空间一致性,从而推动跨模态特征对齐理论与端到端融合架构的演进。数据集包含的4D成像雷达多普勒速度信息,为运动状态解耦与行为预测开辟了新维度——雷达的即时径向速度测量可弥补纯视觉方案在低光照及恶劣天气下的可靠性短板。高清地图多段线的引入,则将结构化先验知识与感知管道有机结合,促进了可泛化的拓扑理解模型的发展。
实际应用
实际应用中,该数据集的价值体现在自动驾驶系统开发的多个核心环节。在数据驱动型感知pipeline验证阶段,研究者可利用其分组结构便捷地对比不同传感器配置的感知鲁棒性,或对环视相机与雷达点云的融合策略进行消融实验。在仿真测试层面,数据集提供的自车轨迹与GNSS协同定位信息,可用于评估预测模块在真实城市交通流中的表现。商业层面,自动驾驶公司可将其作为传感器选型的参考依据——通过对比立体视觉与多线激光雷达在400米探测距离内的深度建图质量,优化量产车型的感知系统设计预算分配。
数据集最近研究
最新研究方向
依托KITScenes Multimodal数据集,当前最前沿的研究方向聚焦于全模态感知融合与高精地图引导的自主驾驶技术。该数据集整合了9路环视相机、7线激光雷达与3个4D成像雷达的同步数据,并提供了Lanelet2高清地图矢量、投影深度热力及未来自车轨迹等标注,为研究长距离深度估计、多传感器时空对齐、以及地图感知联合学习提供了高保真评测平台。其引入的EuroCity实车场景与CC-BY-NC许可,正推动着面向欧标交通符号、复杂城区路况的多模态模型开发,成为验证全栈自动驾驶感知系统鲁棒性与可泛化能力的关键基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务