WHU-Infra3D
收藏资源简介:
WHU-Infra3D是一个大规模多模态基准数据集,用于城市路边基础设施清单。该数据集旨在通过联合提供全景图像、激光雷达点云、2D-3D实例关联以及丰富的属性/状态标注,来桥接几何感知和细粒度认知诊断。关键特点包括跨城市收集(武汉、上海、南京)、大规模覆盖(53.8公里城市轨迹)、5,449张图像和175,021个2D框标注、核心集中3,199个3D实例和181,351个属性/状态标签,并全面支持检测、匹配、定位、分割和属性识别任务。
WHU-Infra3D is a large-scale multimodal benchmark dataset for urban roadside infrastructure inventory. This dataset aims to bridge geometric perception and fine-grained cognitive diagnosis by jointly providing panoramic images, LiDAR point clouds, 2D-3D instance associations, and abundant attribute and status annotations. Its key features include multi-city collection (Wuhan, Shanghai, Nanjing), large-scale coverage with 53.8 kilometers of urban trajectories, 5,449 images and 175,021 2D bounding box annotations, focus on 3,199 3D instances and 181,351 attribute and status labels, and full support for tasks including detection, matching, localization, segmentation, and attribute recognition.
WHU-Infra3D 数据集概述
简介
WHU-Infra3D 是一个大规模多模态基准数据集,用于城市路边基础设施清单管理。该数据集通过联合提供全景图像、LiDAR点云、2D-3D实例关联以及丰富的属性/状态标注,旨在弥合几何感知与细粒度认知诊断之间的鸿沟。
关键特性
- 跨城市采集:覆盖武汉、上海、南京三个城市。
- 大规模覆盖:53.8公里的城市轨迹。
- 2D标注:5,449张图像,175,021个2D框标注。
- 3D标注:核心集中包含3,199个3D实例和181,351个属性/状态标签。
- 全栈支持:支持检测、匹配、定位、分割和属性识别。
数据集结构
每个城市(武汉/上海/南京)的文件夹布局如下:
WHU-Infra3D/ ├── Wuhan/ │ ├── BaseSet/ # 大规模图像池 │ │ ├── PanoImages/ # 全景图像 │ │ └── coco_base.json │ └── CoreSet/ # 核心子集,用于基准构建 │ ├── PanoImages/ # 核心全景图像 │ ├── image_detect_track_3dbox/ # 感知标注TXT文件 │ ├── coco_core.json │ ├── INSPose_refined.txt # 相机位姿文件 │ ├── Attributes/ # 细粒度属性标注JSON文件 │ └── PointCloud/ # 点云数据 ├── Shanghai/ └── Nanjing/
标注维度
WHU-Infra3D 提供四个互补的标注维度:
- 2D检测标注:在全景图像上的2D边界框。
- 3D感知标注:语义标签、实例掩码和3D几何信息。
- 跨帧与跨模态实例关联ID:实现跨视图重复观测管理。
- 细粒度属性与状态标注:用于资产诊断。
类别
包含10种路边基础设施类别:
| label_id | 类别名称 |
|---|---|
| 1 | Traffic Sign |
| 2 | Street Light |
| 3 | Signal Light |
| 4 | Surveillance Camera |
| 5 | Cylindrical Bollard |
| 6 | Fire Hydrant |
| 7 | Trash Bin |
| 8 | Manhole |
| 9 | Traffic Cone |
| 10 | Spherical Bollard |
类别分布呈现明显的长尾模式。
关键数据格式
属性JSON格式
每个Attributes/中的JSON文件包含detected_objects列表,每个对象包含id、label_id、bbox(像素坐标,8192×4096全景图像)、category(中文类别名)和attributes(属性字典)。
常见属性键包括:
- 状态相关:损坏情况、工作状态、破损情况、隐患情况、遮挡情况
- 物理属性:类型、形状、颜色、材质、位姿状态
- 类别特定:灯臂数量(路灯)、反光属性(护柱)、表面图案(井盖)、设备类型(信号灯)
相机位姿文件(INSPose_refined.txt)
每行包含9个字段:frame_id、time_1、time_2、pos_x、pos_y、pos_z、roll、pitch、heading。坐标已通过城市级中心化进行匿名化处理。
感知标注TXT文件(image_detect_track_3dbox)
每行13个逗号分隔字段:class_name、2D框坐标x1,y1,x2,y2、3D框尺寸h,w,l、3D框中心坐标x,y,z、方向角rot_y、跨图像实例IDobject_id。
点云字段
点云包含坐标(x, y, z)及附加字段:Intensity(强度)、Semantic(语义标签,1-10对应10个类别)、Instance(实例ID)。
基准任务
WHU-Infra3D 定义了五项基准任务:
- 2D基础设施检测
- 2D跨视图匹配
- 3D地理定位
- 点云分割
- 属性识别
下载与联系
数据需填写问卷获取:数据请求表单
联系邮箱:liuchongwhu@whu.edu.cn





