COCO-OLAC; Cityscapes-OLAC
收藏资源简介:
COCO-OLAC和Cityscapes-OLAC是两个专注于遮挡建模的图像数据集,由华威大学研究团队创建。COCO-OLAC基于COCO数据集扩展,为每张图像标注了低、中、高三种遮挡级别;Cityscapes-OLAC则遵循相同协议对Cityscapes数据集进行标注,包含2,975张训练图像和500张验证图像,数据来源均为真实场景图像。数据集的创建过程涉及手动标注图像级遮挡标签,并通过背景黑化预处理来增强分类器对前景特征的关注。这些数据集旨在解决复杂场景中遮挡导致的全景分割性能下降问题,应用于自动驾驶和机器人视觉等领域,以提升模型在遮挡条件下的鲁棒性。
COCO-OLAC and Cityscapes-OLAC are two image datasets focused on occlusion modeling, created by the research team at the University of Warwick. COCO-OLAC is extended based on the COCO dataset, with three occlusion levels (low, medium, high) annotated for each image. Cityscapes-OLAC annotates the Cityscapes dataset following the same protocol, containing 2,975 training images and 500 validation images, with all data sourced from real-world scene images. The dataset creation process involves manually annotating image-level occlusion labels, and uses background darkening preprocessing to help classifiers focus more on foreground features. These datasets aim to address the degradation of panoptic segmentation performance caused by occlusions in complex scenes, and are applied in fields such as autonomous driving and robotic vision to improve the robustness of models under occlusion conditions.
数据集概述:PEMOLA(Occlusion-Aware Panoptic Segmentation with Joint Position Embedding and Occlusion-Level Attention)
核心概念
PEMOLA 是一种面向遮挡感知的全景分割方法,通过联合位置嵌入和遮挡级别注意力机制,提升在遮挡场景下的分割性能。该方法已发表于 ICME 2026。
主要特性
- 即插即用:可直接集成到基于 Transformer 的全景分割器(如 Mask2Former、Mask DINO)中,无需修改骨干网络或掩码解码器架构。
- 遮挡感知查询:在联合位置嵌入中结合空间(Grad-CAM)和通道维度(标签嵌入)的遮挡线索。
- 轻量化:推理时仅需一次分类器前向传播和一次查询调制,额外 FLOPs 增加小于 1%。
- 骨干网络无关:已在 ResNet-50 上完成端到端验证,并提供 ResNet-101、Swin-T/S/B/L 的即用配置。
- 跨数据集泛化:在 COCO-OLAC 和新标注的 Cityscapes-OLAC 数据集上均提升全景质量(PQ),在重度遮挡子集上增益最大。
数据集
PEMOLA 在两个遮挡标注数据集上评估:
- COCO-OLAC:基于 COCO 的遮挡级别标注数据集,包含训练集、验证集及遮挡分类任务。
- Cityscapes-OLAC:本工作新引入的 Cityscapes 遮挡级别标注数据集,包含 2975 张训练图和 500 张验证图,每张图像划分为低/中/高三个遮挡等级。
数据集需放置于 datasets/data/ 目录下,结构如下:
datasets/data/ ├── coco_olac/ │ ├── train/, val/ # RGB 图像 │ ├── annotations/ # 全景 + 实例 JSON │ └── occlusion_label_{train,val}.json # 实例级遮挡等级 ├── cityscapes/ # 官方 Cityscapes 数据 └── cityscapes_olac/ # 通过脚本生成 ├── leftImg8bit/{train,val}_{low,mid,high}/ └── gtFine/ └── coco_olac_cls/ # 背景黑化后的分类器训练裁剪图 ├── train/<class>/.jpg └── val/<class>/.jpg
实验结果
COCO-OLAC 全景分割(ResNet-50 骨干,50 轮):
- Mask2Former 基线:PQ 40.7,PQ^Th 44.5,PQ^St 35.0,AP_pan^Th 30.0,mIoU_pan 54.2
- + PEMOLA:PQ 41.5,PQ^Th 45.2,PQ^St 35.9,AP_pan^Th 30.4,mIoU_pan 54.8
- Mask DINO 基线:PQ 44.0,PQ^Th 48.5,PQ^St 37.3,AP_pan^Th 33.5,mIoU_pan 53.4
- + PEMOLA:PQ 44.8,PQ^Th 49.4,PQ^St 37.8,AP_pan^Th 34.2,mIoU_pan 55.3
Cityscapes-OLAC 全景分割(ResNet-50 骨干,90k 迭代):
- Mask2Former 基线:PQ 61.5,PQ^Th 54.0,PQ^St 66.9,AP_pan^Th 35.2,mIoU_pan 76.1
- + PEMOLA:PQ 62.3,PQ^Th 55.4,PQ^St 67.2,AP_pan^Th 38.5,mIoU_pan 77.4
遮挡分类器(辅助任务,COCO-OLAC 三分类 Top-1 精度):
- ResNet-50 (224输入):70.51%
- ResNet-101 (224输入):70.95%
- Swin-T (224输入):71.63%
- Swin-S (224输入):72.13%
- Swin-B (224输入):72.75%
- Swin-B (384输入,ImageNet-22K→1K):75.32%
- Swin-L (224输入):73.29%
- Swin-L (384输入,ImageNet-22K→1K):75.56%
安装与使用
- 环境:推荐 3× NVIDIA A100 (40 GB),CUDA 13.0,Python 3.12,PyTorch 2.11。
- 安装:通过
bash install_env.sh一键创建包含 conda 环境、GCC 14、CUDA 工具包、detectron2 0.6、MSDeformAttn CUDA 算子及依赖的完整环境。 - 训练:使用
scripts/下的脚本训练遮挡分类器或 PEMOLA 全景分割模型。 - 评估:使用
scripts/下的评估脚本,需指定检查点路径。 - 推理与可视化:使用
predict.py进行单张图像全景预测,使用occ_cls_predict.sh获取实例级遮挡等级,使用occ_cls_draw_cam.sh可视化 Grad-CAM 遮挡注意力图。
许可证
本项目采用 MIT License 许可。

- 1Occlusion-Aware Panoptic Segmentation with Joint Position Embedding and Occlusion-Level Attention华威大学 · 2026年



