遇见数据集

COCO-OLAC; Cityscapes-OLAC

收藏
arXiv2026-07-21 更新2026-07-22 收录
数据链接:
官方服务:

资源简介:

COCO-OLAC和Cityscapes-OLAC是两个专注于遮挡建模的图像数据集,由华威大学研究团队创建。COCO-OLAC基于COCO数据集扩展,为每张图像标注了低、中、高三种遮挡级别;Cityscapes-OLAC则遵循相同协议对Cityscapes数据集进行标注,包含2,975张训练图像和500张验证图像,数据来源均为真实场景图像。数据集的创建过程涉及手动标注图像级遮挡标签,并通过背景黑化预处理来增强分类器对前景特征的关注。这些数据集旨在解决复杂场景中遮挡导致的全景分割性能下降问题,应用于自动驾驶和机器人视觉等领域,以提升模型在遮挡条件下的鲁棒性。

COCO-OLAC and Cityscapes-OLAC are two image datasets focused on occlusion modeling, created by the research team at the University of Warwick. COCO-OLAC is extended based on the COCO dataset, with three occlusion levels (low, medium, high) annotated for each image. Cityscapes-OLAC annotates the Cityscapes dataset following the same protocol, containing 2,975 training images and 500 validation images, with all data sourced from real-world scene images. The dataset creation process involves manually annotating image-level occlusion labels, and uses background darkening preprocessing to help classifiers focus more on foreground features. These datasets aim to address the degradation of panoptic segmentation performance caused by occlusions in complex scenes, and are applied in fields such as autonomous driving and robotic vision to improve the robustness of models under occlusion conditions.

提供机构:
华威大学
创建时间:
2026-07-21
原始信息汇总

数据集概述:PEMOLA(Occlusion-Aware Panoptic Segmentation with Joint Position Embedding and Occlusion-Level Attention)

核心概念

PEMOLA 是一种面向遮挡感知的全景分割方法,通过联合位置嵌入和遮挡级别注意力机制,提升在遮挡场景下的分割性能。该方法已发表于 ICME 2026

主要特性

  • 即插即用:可直接集成到基于 Transformer 的全景分割器(如 Mask2Former、Mask DINO)中,无需修改骨干网络或掩码解码器架构。
  • 遮挡感知查询:在联合位置嵌入中结合空间(Grad-CAM)和通道维度(标签嵌入)的遮挡线索。
  • 轻量化:推理时仅需一次分类器前向传播和一次查询调制,额外 FLOPs 增加小于 1%。
  • 骨干网络无关:已在 ResNet-50 上完成端到端验证,并提供 ResNet-101、Swin-T/S/B/L 的即用配置。
  • 跨数据集泛化:在 COCO-OLAC 和新标注的 Cityscapes-OLAC 数据集上均提升全景质量(PQ),在重度遮挡子集上增益最大。

数据集

PEMOLA 在两个遮挡标注数据集上评估:

  • COCO-OLAC:基于 COCO 的遮挡级别标注数据集,包含训练集、验证集及遮挡分类任务。
  • Cityscapes-OLAC:本工作新引入的 Cityscapes 遮挡级别标注数据集,包含 2975 张训练图和 500 张验证图,每张图像划分为低/中/高三个遮挡等级。

数据集需放置于 datasets/data/ 目录下,结构如下:

datasets/data/ ├── coco_olac/ │ ├── train/, val/ # RGB 图像 │ ├── annotations/ # 全景 + 实例 JSON │ └── occlusion_label_{train,val}.json # 实例级遮挡等级 ├── cityscapes/ # 官方 Cityscapes 数据 └── cityscapes_olac/ # 通过脚本生成 ├── leftImg8bit/{train,val}_{low,mid,high}/ └── gtFine/ └── coco_olac_cls/ # 背景黑化后的分类器训练裁剪图 ├── train/<class>/.jpg └── val/<class>/.jpg

实验结果

COCO-OLAC 全景分割(ResNet-50 骨干,50 轮)

  • Mask2Former 基线:PQ 40.7,PQ^Th 44.5,PQ^St 35.0,AP_pan^Th 30.0,mIoU_pan 54.2
  • + PEMOLA:PQ 41.5,PQ^Th 45.2,PQ^St 35.9,AP_pan^Th 30.4,mIoU_pan 54.8
  • Mask DINO 基线:PQ 44.0,PQ^Th 48.5,PQ^St 37.3,AP_pan^Th 33.5,mIoU_pan 53.4
  • + PEMOLA:PQ 44.8,PQ^Th 49.4,PQ^St 37.8,AP_pan^Th 34.2,mIoU_pan 55.3

Cityscapes-OLAC 全景分割(ResNet-50 骨干,90k 迭代)

  • Mask2Former 基线:PQ 61.5,PQ^Th 54.0,PQ^St 66.9,AP_pan^Th 35.2,mIoU_pan 76.1
  • + PEMOLA:PQ 62.3,PQ^Th 55.4,PQ^St 67.2,AP_pan^Th 38.5,mIoU_pan 77.4

遮挡分类器(辅助任务,COCO-OLAC 三分类 Top-1 精度)

  • ResNet-50 (224输入):70.51%
  • ResNet-101 (224输入):70.95%
  • Swin-T (224输入):71.63%
  • Swin-S (224输入):72.13%
  • Swin-B (224输入):72.75%
  • Swin-B (384输入,ImageNet-22K→1K):75.32%
  • Swin-L (224输入):73.29%
  • Swin-L (384输入,ImageNet-22K→1K)75.56%

安装与使用

  • 环境:推荐 3× NVIDIA A100 (40 GB),CUDA 13.0,Python 3.12,PyTorch 2.11。
  • 安装:通过 bash install_env.sh 一键创建包含 conda 环境、GCC 14、CUDA 工具包、detectron2 0.6、MSDeformAttn CUDA 算子及依赖的完整环境。
  • 训练:使用 scripts/ 下的脚本训练遮挡分类器或 PEMOLA 全景分割模型。
  • 评估:使用 scripts/ 下的评估脚本,需指定检查点路径。
  • 推理与可视化:使用 predict.py 进行单张图像全景预测,使用 occ_cls_predict.sh 获取实例级遮挡等级,使用 occ_cls_draw_cam.sh 可视化 Grad-CAM 遮挡注意力图。

许可证

本项目采用 MIT License 许可。

搜集汇总
数据集介绍
COCO-OLAC; Cityscapes-OLAC 数据集图片
构建方式
在复杂场景理解中,遮挡现象普遍存在,然而现有多数全景分割方法缺乏对遮挡的显式建模。为此,研究者基于COCO与Cityscapes数据集,引入遮挡感知的标注体系。COCO-OLAC数据集对每张图像标注了低、中、高三种遮挡等级,并采用将非物体区域黑化的预处理策略,以引导分类器关注前景特征。Cityscapes-OLAC遵循同样的标注协议,对2,975张训练图像和500张验证图像进行了人工遮挡等级标注,其遮挡分布呈现高度不平衡的特点,体现了城市街景中特有的遮挡模式,为评估跨数据集泛化能力提供了基础。
使用方法
使用这两个数据集时,首先可通过预训练的遮挡分类器提取遮挡级注意力与遮挡标签嵌入。分类器推荐采用Swin-L架构,在输入图像经背景黑化预处理后,可达到最优分类准确率。所得遮挡级注意力经Grad-CAM生成,并上采样至位置嵌入的空间分辨率,与通过嵌入函数映射的遮挡标签向量联合调制原始位置嵌入。该调制过程通过残差缩放实现,仅作用于像素解码器,而非变换器解码器,以保持特征空间的兼容性。整体模块可无缝嵌入Mask2Former、Mask DINO等现有全景分割框架,引入极小的计算开销。
背景与挑战
背景概述
全场景解析(Panoptic Segmentation)旨在为图像中每个像素同时赋予语义与实例标签,是实现自动驾驶与机器人等复杂场景理解的核心任务。然而,现实环境中物体间的频繁遮挡常导致现有方法出现边界混淆甚至目标遗漏。为应对这一瓶颈,华威大学计算机科学系的Wenbo Wei、Jun Wang、Shan Raza与Abhir Bhalerao于2026年提出了COCO-OLAC与Cityscapes-OLAC数据集。前者在COCO基础上为每幅图像标注了低、中、高三种遮挡等级,后者则遵循相同协议对Cityscapes城市街景图像进行遮挡标注,旨在为遮挡感知的全场景解析研究提供标准化评测基准。这两个数据集不仅推动了遮挡建模在分割任务中的系统性研究,也为跨数据集泛化能力评估奠定了重要基础。
当前挑战
当前全场景解析面临的核心挑战在于:现有基准如COCO与Cityscapes仅标注物体可见部分,缺乏细粒度遮挡信息(如深度顺序、不可见掩膜、遮挡比例),导致模型难以学习遮挡鲁棒特征。同时,基于Transformer的先进分割方法依赖内容无关的位置编码,在遮挡场景下上下文不完整,注意力机制无法有效捕获像素关系。数据集构建过程中亦存在显著困难:COCO-OLAC需对数十万张图像进行人工遮挡等级标注,需确保标注一致性;Cityscapes-OLAC则面临极端类别分布不均(高遮挡图像占比超85%),且城市场景遮挡模式多样(车辆、行人、路灯柱等),对标注协议的可迁移性提出严峻考验。
常用场景
经典使用场景
在计算机视觉的广阔疆域中,全景分割致力于为图像中每一个像素赋予语义类别与实例标识,是实现场景理解的核心任务。COCO-OLAC与Cityscapes-OLAC数据集专为遮挡条件下的全景分割研究而设计,其经典使用场景聚焦于评估和提升模型在复杂遮挡环境中的分割鲁棒性。研究者常利用这两个数据集训练遮挡分类器,以生成遮挡级别的注意力图,并将其作为空间先验信息融入基于Transformer的全景分割架构中,如Mask2Former与Mask DINO。通过在像素解码器中调制位置编码,模型能够动态感知不同遮挡程度下的空间关系,从而在全景分割质量上实现显著且一致的提升,尤其在中度至重度遮挡场景中表现突出。
解决学术问题
在学术研究领域,COCO-OLAC与Cityscapes-OLAC数据集直击现有全景分割方法普遍忽视遮挡建模的痛点。传统视觉基准仅标注物体可见部分,缺乏对遮挡细节如深度顺序、不可见掩码及遮挡比例的精细描述,导致模型难以学到遮挡感知的特征表达。该数据集通过引入图像级别的遮挡严重性标注(低、中、高),为研究者提供了基于遮挡先验改进位置编码的可行路径。其核心贡献在于揭示了遮挡先验与Transformer位置编码的融合机制,通过遮挡级别注意力与可学习嵌入向量的联合调制,使位置编码从内容无关的静态表示变为动态适应场景遮挡状况的感知编码,显著缓解了因遮挡导致的边界混淆与实例遗漏问题,推动了遮挡建模在场景理解中的理论发展。
实际应用
在现实世界中,遮挡现象普遍存在于自动驾驶、机器人导航、智能监控等关键应用场景。COCO-OLAC与Cityscapes-OLAC数据集为这些领域提供了宝贵的遮挡评估基准。例如,在自动驾驶场景中,Cityscapes-OLAC包含大量城市街景图像,其中的车辆、行人及路边设施频繁相互遮挡,该数据集使算法能够针对性地优化对遮挡物体的分割与识别,提升自主系统在拥挤交通环境中的感知可靠性。同时,数据集的核心方法PEMOLA作为一种轻量级模块,可无缝集成至现有分割网络,引入的计算开销极微,非常适用于实时性要求高的边缘计算平台,如车载芯片与嵌入式机器人系统,助力实现复杂遮挡条件下的稳健环境理解。
数据集最近研究
最新研究方向
在全景分割领域,遮挡建模已成为突破复杂场景理解瓶颈的关键前沿方向。COCO-OLAC与Cityscapes-OLAC数据集为这一研究提供了系统性支撑,其创新性地引入了图像级遮挡严重程度标注(低、中、高),弥补了现有基准仅关注可见区域标注的不足。基于这些数据集,研究者提出了PEMOLA模块,通过联合位置嵌入调制与遮挡级别注意力机制,将遮挡先验融入Transformer架构,显著提升了遮挡场景下的分割质量。这一工作不仅揭示了遮挡信息对空间表征的动态调控价值,更推动了遮挡感知学习从粗粒度分类向精细化分割的范式演进。该数据集与方法的发布,为自动驾驶、机器人导航等强遮挡应用场景提供了理论基石与评测平台,同时启发了跨数据集的遮挡泛化研究,是当前计算机视觉领域迈向鲁棒场景理解的重要里程碑。
相关研究论文
  • 1
    Occlusion-Aware Panoptic Segmentation with Joint Position Embedding and Occlusion-Level Attention华威大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务