遇见数据集

WHU-Infra3D

收藏
github2026-06-09 更新2026-06-16 收录
官方服务:

资源简介:

WHU-Infra3D是一个大规模多模态基准数据集,用于城市路边基础设施清单。该数据集旨在通过联合提供全景图像、激光雷达点云、2D-3D实例关联以及丰富的属性/状态标注,来桥接几何感知和细粒度认知诊断。关键特点包括跨城市收集(武汉、上海、南京)、大规模覆盖(53.8公里城市轨迹)、5,449张图像和175,021个2D框标注、核心集中3,199个3D实例和181,351个属性/状态标签,并全面支持检测、匹配、定位、分割和属性识别任务。

WHU-Infra3D is a large-scale multimodal benchmark dataset for urban roadside infrastructure inventory. This dataset aims to bridge geometric perception and fine-grained cognitive diagnosis by jointly providing panoramic images, LiDAR point clouds, 2D-3D instance associations, and abundant attribute and status annotations. Its key features include multi-city collection (Wuhan, Shanghai, Nanjing), large-scale coverage with 53.8 kilometers of urban trajectories, 5,449 images and 175,021 2D bounding box annotations, focus on 3,199 3D instances and 181,351 attribute and status labels, and full support for tasks including detection, matching, localization, segmentation, and attribute recognition.

创建时间:
2026-05-27
原始信息汇总

WHU-Infra3D 数据集概述

简介

WHU-Infra3D 是一个大规模多模态基准数据集,用于城市路边基础设施清单管理。该数据集通过联合提供全景图像、LiDAR点云、2D-3D实例关联以及丰富的属性/状态标注,旨在弥合几何感知与细粒度认知诊断之间的鸿沟。

关键特性

  • 跨城市采集:覆盖武汉、上海、南京三个城市。
  • 大规模覆盖:53.8公里的城市轨迹。
  • 2D标注:5,449张图像,175,021个2D框标注。
  • 3D标注:核心集中包含3,199个3D实例和181,351个属性/状态标签。
  • 全栈支持:支持检测、匹配、定位、分割和属性识别。

数据集结构

每个城市(武汉/上海/南京)的文件夹布局如下:

WHU-Infra3D/ ├── Wuhan/ │ ├── BaseSet/ # 大规模图像池 │ │ ├── PanoImages/ # 全景图像 │ │ └── coco_base.json │ └── CoreSet/ # 核心子集,用于基准构建 │ ├── PanoImages/ # 核心全景图像 │ ├── image_detect_track_3dbox/ # 感知标注TXT文件 │ ├── coco_core.json │ ├── INSPose_refined.txt # 相机位姿文件 │ ├── Attributes/ # 细粒度属性标注JSON文件 │ └── PointCloud/ # 点云数据 ├── Shanghai/ └── Nanjing/

标注维度

WHU-Infra3D 提供四个互补的标注维度:

  1. 2D检测标注:在全景图像上的2D边界框。
  2. 3D感知标注:语义标签、实例掩码和3D几何信息。
  3. 跨帧与跨模态实例关联ID:实现跨视图重复观测管理。
  4. 细粒度属性与状态标注:用于资产诊断。

类别

包含10种路边基础设施类别:

label_id 类别名称
1 Traffic Sign
2 Street Light
3 Signal Light
4 Surveillance Camera
5 Cylindrical Bollard
6 Fire Hydrant
7 Trash Bin
8 Manhole
9 Traffic Cone
10 Spherical Bollard

类别分布呈现明显的长尾模式。

关键数据格式

属性JSON格式

每个Attributes/中的JSON文件包含detected_objects列表,每个对象包含idlabel_idbbox(像素坐标,8192×4096全景图像)、category(中文类别名)和attributes(属性字典)。

常见属性键包括:

  • 状态相关:损坏情况、工作状态、破损情况、隐患情况、遮挡情况
  • 物理属性:类型、形状、颜色、材质、位姿状态
  • 类别特定:灯臂数量(路灯)、反光属性(护柱)、表面图案(井盖)、设备类型(信号灯)

相机位姿文件(INSPose_refined.txt)

每行包含9个字段:frame_idtime_1time_2pos_xpos_ypos_zrollpitchheading。坐标已通过城市级中心化进行匿名化处理。

感知标注TXT文件(image_detect_track_3dbox)

每行13个逗号分隔字段:class_name、2D框坐标x1,y1,x2,y2、3D框尺寸h,w,l、3D框中心坐标x,y,z、方向角rot_y、跨图像实例IDobject_id

点云字段

点云包含坐标(x, y, z)及附加字段:Intensity(强度)、Semantic(语义标签,1-10对应10个类别)、Instance(实例ID)。

基准任务

WHU-Infra3D 定义了五项基准任务:

  1. 2D基础设施检测
  2. 2D跨视图匹配
  3. 3D地理定位
  4. 点云分割
  5. 属性识别

下载与联系

数据需填写问卷获取:数据请求表单

联系邮箱:liuchongwhu@whu.edu.cn

搜集汇总
数据集介绍
WHU-Infra3D 数据集图片
构建方式
WHU-Infra3D数据集面向城市路侧基础设施的精细化感知与诊断需求,融合多模态传感器数据与全栈式标注范式。其构建以全景相机与LiDAR同步采集为核心,涵盖武汉、上海、南京三大城市长达53.8公里的连续轨迹,获取5,449张全景图像与对应点云。数据经过严格的两阶段处理:首先定义包含10个类别的路侧资产清单,继而通过跨帧与跨模态的实例关联,将原始观测转化为结构化的数字孪生表达。标注体系涵盖2D边界框、3D语义与实例掩码、以及细粒度属性状态标签,共计175,021个2D标注、3,199个3D实例与181,351条属性标签,形成从几何感知到认知诊断的完整闭环。
特点
该数据集最突出的特点在于其全栈式架构与细粒度属性诊断能力。不同于传统仅提供类别与位置标注的数据集,WHU-Infra3D为每个实例配备详尽的属性描述,涵盖损坏情况、工作状态、材质、形状等维度,使模型能超越简单检测而实现基础设施的健康评估。多城市采集带来的域差异与类别长尾分布,真实反映了实际部署中的泛化挑战。此外,跨视角与跨帧的全局实例关联机制,有效解决了多源观测中的重复与遮挡问题,为精准的3D定位与跟踪提供了坚实支撑。这些特性共同构建了一个集检测、匹配、分割与属性识别于一体的综合性基准。
使用方法
数据集按城市划分为基础集与核心集,使用前需通过问卷申请获取下载链接。基础集提供大规模全景图像与COCO格式的2D检测标注,适用于预训练与数据扩充。核心集则包含完整的2D-3D联合标注、点云数据、精化相机位姿及属性JSON文件,支持五项基准任务。针对2D检测与跨视角匹配,可直接加载`coco_core.json`文件;3D地理定位需结合`INSPose_refined.txt`中的位姿信息与`image_detect_track_3dbox`中的3D框;点云分割任务则需解析`PointCloud`文件夹中带有语义与实例标签的激光雷达数据;属性识别任务可直接读取`Attributes`目录下的JSON文件,每个文件以图像名为键,内含实例级属性字典。
背景与挑战
背景概述
WHU-Infra3D数据集由武汉大学刘冲团队于2025年发布,旨在弥合城市道路基础设施几何感知与细粒度认知诊断之间的鸿沟。该数据集通过跨武汉、上海、南京三座城市长达53.8公里的轨迹采集,融合全景图像、LiDAR点云、2D-3D实例关联及丰富的属性/状态标注,为道路基础设施的全面数字化建模提供了全栈式的多模态基准。其核心研究问题在于如何将原始多模态观测高效转化为兼具精确几何结构与细粒度运维语义的数字化资产清单,从而支撑基础设施的自动检测、匹配、定位、分割及属性识别等任务。该数据集的问世,为智慧城市基础设施管理与运维决策提供了坚实的多模态数据支撑,显著推动了相关领域从浅层感知向深度认知的跨越。
当前挑战
该数据集所解决的领域核心挑战在于城市道路基础设施对象存在显著的类别长尾分布、跨视角与跨模态的精确实例关联困难,以及从几何感知到运维状态认知的异构信息鸿沟。例如,交通标志、路灯等常见物体样本丰富,而消防栓、球形护栏等稀有类别数据稀缺,导致模型泛化困难。在构建过程中,团队面临跨城市大规模采集带来的域差异、对高精度2D-3D空间配准与跨帧数据关联的严苛要求,以及为所有实例标注涵盖破损情况、工作状态、材质等细粒度属性的高昂成本。此外,确保点云、全景图像与相机位姿之间的时空同步与坐标系统一,亦是保证数据质量与可用性的重大工程挑战。
常用场景
经典使用场景
WHU-Infra3D数据集的核心应用场景聚焦于城市道路基础设施的三维数字化建模与全栈式智能感知。该数据集通过融合全景影像与激光雷达点云,为交通标志、路灯、信号灯、消防栓等10类路侧设施提供了精准的2D-3D联合标注,并辅以跨视角、跨帧的实例关联信息。研究者可借助该数据开展高鲁棒性的基础设施目标检测、跨模态实例匹配与点云语义分割任务,其多城市、长轨迹的采集策略(横跨武汉、上海、南京,总里程达53.8公里)保证了模型在城市级域迁移中的泛化能力。配套的精细属性和状态标签(如破损分级、工作状态、材质分类)更将几何感知拓展至认知诊断层面,为智慧城市中基础设施的运维决策提供了前所未有的数据支撑。
解决学术问题
WHU-Infra3D精准回应了城市道路基础设施管理中长期悬而未决的学术挑战:如何从原始多模态观测中自动生成兼具精确几何与细粒度维护语义的结构化资产档案。传统数据集或止步于2D检测,或局限于单一城市场景,且普遍缺失对基础设施服役状态(如设备完整度、工作工况)的语义化描述。该数据集通过引入全栈式标注架构(涵盖2D检测、3D定位、跨帧关联与属性识别),首次将几何感知与认知诊断系统性地耦合。其标志性的长尾分布特性真实反映了现实资产的不均衡性,为不平衡学习、少样本泛化等前沿课题提供了标准化基准。由此,学术界获得了一块衔接计算机视觉、点云处理与城市设施管理学的关键拼图,推动了从‘看到’到‘认知’的范式跃迁。
衍生相关工作
WHU-Infra3D的发布催生了一系列富有影响力的衍生学术工作。在基础研究方向,基于其密集的2D边界框与点云实例掩码,研究者构建了首个面向路侧基础设施的多任务联合学习框架,实现了检测、分割与属性识别的端到端协同优化。在跨模态融合领域,数据集丰富的2D-3D关联ID激发了弱监督几何对齐方法的探索,通过全景图像的鱼眼畸变先验与LiDAR点云的稀疏深度特征,提出了适用于复杂城市场景的跨视图实例匹配算法。此外,其细粒度的属性标签(如‘灯臂数量’、‘反光属性’)直接催生了基于结构先验的属性识别网络,将零样本学习与知识蒸馏技术引入设施状态诊断任务。这些工作不仅反哺了基础模型在真实场景下的鲁棒性验证,更将WHU-Infra3D从单一数据基准推升为连接视觉计算与城市管理研究的枢纽性平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务