SpuriousAD
收藏数据链接:
官方服务:
资源简介:
一个受控的异常检测数据集,其中每个异常图像都包含一个真正的缺陷和一个与标签相关的空间上不连续的虚假标记,以及一个用于衡量检测器热图是否落在缺陷或标记上的指标。
A controlled anomaly detection dataset, where each anomalous image contains a genuine defect and a label-related, spatially discontinuous spurious marker, alongside an evaluation metric for measuring whether the detector's heatmap falls on the defect or the spurious marker.
创建时间:
2026-08-15
原始信息汇总
SpuriousAD 数据集详情
SpuriousAD 是一个合成异常检测基准数据集,专门用于探究无监督异常检测器是否会因虚假标记(spurious mark)而非真实缺陷(true defect)做出判断。该数据集由一名应用计算机科学(AI)专业三年级学生构建。
核心设计理念
- 受控特性:数据集中每张异常图像同时包含一个真实缺陷和与标签相关的、空间上分离的虚假标记。
- 数据生成方式:数据并非预先下载,而是通过程序动态生成,从而能够精确控制两个区域(缺陷与标记)的真实位置。
- 研究目的:验证一个假设——无监督检测器能否在获得完美 AUROC(1.000)的同时,其热力图指向错误的区域(虚假标记)。
关键评估指标
- CAR(Confound Attribution Ratio,混淆归因比):衡量热力图质量落在虚假标记上而非真实缺陷上的比例,公式为
mass(confound) / (mass(defect) + mass(confound)),数值范围 0 至 1。 - peak_on_defect:热力图中最热点落在真实缺陷上的比例。
- background_share:报告热力图中落在两个目标区域之外的背景部分占比(实验中约为 0.89)。
- 随机对照(random control):CAR 比较必须结合随机热力图对照进行解读,因为 CAR 的零假设值(约 0.61)由两区域相对面积决定。
主要实验发现
1. AUROC 完全失明:在混淆-标签相关性 ρ 从 0 到 1 的扫描中,图像级 AUROC 始终保持完美的 1.000,说明该指标对模型是否依赖虚假标记完全无感知。
2. CAR 看似上升实则并非混淆寻求:
- CAR 在 ρ=1 时从 0.133 升至 0.560(提升 4.2 倍),但随机热力图对照值为 0.610,表明检测器并未主动“追求”混淆,只是退化到接近均匀噪声水平。
- 即使 ρ=1 时,最热点仍有 80.8% 概率落在真实缺陷上。
3. 消除实验推翻前提:
- 将训练集中虚假标记出现率固定在 0.465 后,即使 ρ=1.0(标记完美预测标签),CAR 几乎不移动(0.133 → 0.130)。
- 这意味着标签相关性(标签捷径)几乎无贡献;CAR 的上升完全源于训练集缺失效应(标记在正常训练集消失,成为真正的外分布样本)。
- 核心洞察:无监督检测器看不到标签,所以“标签捷径”机制在机械上不可用;PatchCore 等检测器建模正常分布,标记从训练集消失后在测试时出现,本质上确实是“分布偏离”,标记被标记是合理行为而非 Clever Hans 效应。
与相关工作的关系
- 不矛盾 Kauffmann et al. 的 The Clever Hans Effect in Unsupervised Learning(arXiv:2408.08041)——该工作事后审计原生数据,发现的是学习机制中的归纳偏差导致的 Clever Hans 效应,属于不同机制。
- 非批评 AUPIMO(arXiv:2401.01984)——CAR 的区别在于有特定竞争区域的概念,使得“热力去了错误区域”可被测量。
运行与实现
- 命令:
make setup && make test(8 项测试,覆盖生成器和指标);make sweep && make mechanism(在 CPU 或 Apple MPS 上运行,各需几分钟)。 - 无需数据集下载,全部由生成器产生。
局限性
- 纯合成数据:纹理为正弦波,缺陷为斑点,特定 CAR 数值在 MVTec 上会变化。
- 单一检测器家族:仅测试 PatchCore 风格的内存库 kNN;预计 PaDiM 和反向蒸馏同样适用但未验证。
- 随机子采样:非贪婪核心集选择。
- 负结果是主要贡献:未演示真正的无监督 Clever Hans 效应,仅证明该构造无法产生这种效应。
许可证
MIT 许可证(见 LICENSE)。
搜集汇总
数据集介绍

构建方式
SpuriousAD数据集是一种精心设计的受控异常检测基准,其核心构建理念在于植入与标签强相关但在空间上互斥的伪标记,以揭示检测器定位行为的潜在偏差。该数据集通过生成合成图像实现,每个异常样本均包含一个真实缺陷及一个与之空间分离的伪标记,从而精确控制混杂因子与标签之间的相关性强度ρ(从0至1)。构建过程还引入了可分离的训练机制,即将伪标记在正常训练集中的出现率固定于0.465,以区分标签捷径与训练分布偏移两种潜在机制。所有图像由程序生成,确保了像素级真值标注的精确性,为后续指标计算提供了无歧义的基础。
特点
该数据集最鲜明之处在于其内置的评估指标——混杂归因比(CAR),用于量化检测器热力图落在伪标记而非真实缺陷上的证据质量。CAR基于区域质量而非峰值,避免了像素级不稳定性,并引入随机对照以校正区域面积差异带来的非零零假设。基准结果揭示了一个反直觉的事实:在ρ=1时,图像级AUROC仍为1.000,但CAR仅为0.560,与随机热力图的0.610无显著差异,表明检测器并未成为混杂寻求者,而是衰减至噪声水平。更关键的消融实验表明,当固定训练集中伪标记出现率时,CAR不随ρ变化,从而证明标签相关性并非驱动定位偏差的主因,真正的机制是训练分布中伪标记的缺失。
使用方法
运行该基准需先通过make setup和make test进行环境配置与基本测试验证。核心实验通过make sweep和make mechanism执行,前者遍历ρ值以评估整体性能,后者固定训练率以分离机制。所有实验可在CPU或Apple MPS上完成,无需下载外部数据集,因为数据为动态生成。用户可基于生成器与CAR指标,复现不同检测器(如PatchCore风格)的性能,并对比heatmap与随机对照,以检验其是否在真实缺陷上聚焦。该工具旨在提供受控环境下的异常定位测评,适用于验证无监督检测器的可信度,并揭示标签相关性之外的分布偏移效应。
背景与挑战
背景概述
SpuriousAD数据集由一位应用计算机科学(AI)专业三年级学生构建,旨在探究无监督异常检测器中虚假相关(spurious correlation)对定位性能的影响。该数据集通过生成合成图像,在每个异常样本中植入真实缺陷和与标签相关的空间分离的虚假标记,并提供了量化指标CAR(Confound Attribution Ratio)来衡量热力图落在缺陷还是标记上的比例。其核心研究问题是:无监督检测器能否在取得完美AUROC的同时定位到错误区域?实验表明,AUROC在所有虚假相关性水平下均为1.000,但CAR仅在相关性为1时显著上升至0.560,且经消融实验发现,该现象主要由训练集缺失而非标签捷径导致。该数据集对异常检测领域的基准测试方法提出了警示,影响了后续研究对Clever Hans效应的构建与评估方式。
当前挑战
SpuriousAD数据集所面临的挑战主要包含两个方面。领域问题方面,异常检测领域长期依赖AUROC等分类指标,这些指标对定位质量不敏感,无法揭示检测器是否依赖虚假相关;现有基准如MVTec等缺乏对特定竞争区域(如虚假标记)的量化评估,且构建标签相关混淆物的直观方法可能因引入分布伪影而失效。构建过程方面,需要精确控制混淆物与标签的相关性以及训练集中的出现频率,以区分标签捷径与分布外效应;合成图像需保证缺陷与标记在空间上分离且区域面积影响CAR的零假设;此外,单一检测器系列和合成数据限制了结论的普适性,且随机子采样与贪婪核心集选择的差异可能影响可推广性。
常用场景
经典使用场景
SpuriousAD数据集作为精心设计的异常检测基准,其核心用途在于评估无监督异常检测算法在存在标签相关混杂因素时的鲁棒性。该数据集通过生成合成图像,在正常图像中植入真实缺陷与空间上不相关的虚假标记,并系统性地改变混杂因素与标签之间的相关性(ρ从0到1)。研究者可利用该数据集进行全面的基准测试,比较不同检测器(如PatchCore、PaDiM等)在图像级AUROC、定位精度及混杂归因比率(CAR)上的表现。此外,该数据集独特的双区域地面真值设计,使其成为探究检测器热力图归因机制的理想平台,尤其适用于分析模型是否真正关注缺陷区域而非虚假标记。
实际应用
在实际应用中,SpuriousAD数据集对于工业视觉检测、医疗影像分析等需要高可靠性异常定位的领域具有重要参考价值。在这些场景中,待检测样本常含有与缺陷无关的干扰因素(如光照变化、传感器噪声或环境标记),若检测器依赖这些虚假线索,将导致定位偏差。该数据集支持开发者验证和调优生产级异常检测系统,通过衡量CAR指标来评估模型对干扰因素的敏感性,确保系统在实际部署时能够真正聚焦于物理缺陷。同时,其合成生成机制使得研究者可以低成本地扩展到特定工业纹理或缺陷类型,为定制化检测器的性能验证提供了便捷的测试平台,有助于提升AI辅助决策的可信度。
衍生相关工作
SpuriousAD数据集及其发现催生了多个方向的后续研究。其一,是提出了CAR(Confound Attribution Ratio)这一新的量化指标,用于衡量检测器热力图在缺陷与混杂区域间的注意力分配,这一指标已被后续工作采纳并扩展至更复杂的多区域场景。其二,该研究对无监督异常检测中的基准构建方法提出了批判性反思,引导学界重新审视合成混杂数据的构造方式,避免无意识地引入分布外伪影。其三,基于其揭示的“训练分布缺失”机制,衍生了关于如何设计正常样本分布以增强检测器泛化性的研究,例如通过控制正常样本中的背景多样性来降低对非缺陷特征的敏感度。此外,该数据集也激发了对于评估协议(如随机控制、区域面积校准)在公平比较不同检测器中的重要性探讨。
以上内容由遇见数据集搜集并总结生成




