ImageNet-R
收藏官方服务:
资源简介:
ImageNet-R数据集由西澳大利亚大学创建,包含15,554张对对抗性攻击具有高度抵抗力的图像,这些图像在遭受攻击后能更容易地恢复。数据集通过Flickr API收集,确保与ImageNet训练集无数据泄露。该数据集旨在为对抗性攻击和防御算法的无偏见基准测试提供支持,特别适用于评估模型在面对复杂攻击时的鲁棒性。
The ImageNet-R dataset was created by the University of Western Australia. It contains 15,554 images that exhibit strong resistance to adversarial attacks and can be more easily recovered after being targeted by such attacks. The dataset was collected via the Flickr API, ensuring no data leakage between itself and the ImageNet training set. This dataset is intended to provide an unbiased benchmark for adversarial attack and defense algorithms, and is particularly well-suited for evaluating model robustness against complex adversarial attacks.
提供机构:
西澳大利亚大学创建时间:
2020-11-05
搜集汇总
数据集介绍

构建方式
在对抗性机器学习领域,数据集偏差常导致防御性能评估失真。为揭示图像内在鲁棒性差异,研究团队从Flickr平台收集了约一百万张图像,覆盖ImageNet全部1000个类别。首先利用DenseNet-121、ResNet-50和Inception-v3三种预训练模型进行筛选,仅保留所有模型正确分类且标签一致的图像(共434,337张)。随后对筛选后的图像施加投影梯度下降(PGD)攻击,设定扰动阈值ε=0.01,最终提取出在攻击下仍被所有模型正确识别的15,554张鲁棒图像,构成ImageNet-R数据集。
特点
ImageNet-R数据集的核心特质在于其图像对扰动的高度抵抗性与防御友好性。实验表明,该数据集中的图像在遭受小幅度对抗攻击(如FGSM、PGD、DDN)时,分类准确率显著高于随机选取的ImageNet子集,甚至在某些模型上达到100%的鲁棒准确率。更关键的是,这些图像在通过BaRT或ResUpNet等防御机制恢复时,其正确分类的恢复率也远高于普通图像,展现出“防御友好”特性。此外,纹理特征分析(如灰度共生矩阵的对比度和非相似性)被证实与图像鲁棒性存在关联,使得该数据集成为研究图像内在鲁棒性机制的独特资源。
使用方法
ImageNet-R数据集专为对抗性攻击与防御的公正基准测试而设计。研究者可将其作为测试集,评估不同攻击算法(如PGD、C&W)或防御方法(如对抗训练、图像去噪)的真实效能,避免因数据集偏差导致性能高估。同时,配套提出的ARD、AMP和ADF三项指标,可量化数据集的整体鲁棒性与防御友好程度,辅助构建无偏评估体系。此外,该数据集还可用于训练轻量级鲁棒性预测器,通过GLCM统计特征或CNN模型快速判别图像是否属于鲁棒样本,为大规模数据筛选提供高效代理工具。
背景与挑战
背景概述
在对抗性机器学习领域,数据集偏差已成为评估防御机制时不可忽视的问题。ImageNet-R数据集由西澳大学Camilo Pestana等研究人员于2020年创建,旨在揭示并量化图像在对抗攻击中的鲁棒性差异。该数据集聚焦于一个核心研究问题:现有基准数据集(如ImageNet、CIFAR-10)中,部分图像天然具备更强的抗扰动能力,且在使用简单防御策略后更易恢复正确分类,这种现象可能导致对攻击或防御算法性能的误导性评估。ImageNet-R包含超过15000张经过严格筛选的鲁棒图像,并配套提出了ARD、AMP和ADF三项指标,用于衡量数据集的鲁棒性偏差。该数据集对对抗性机器学习领域产生了重要影响,为构建无偏基准测试提供了关键资源,推动了对抗攻击与防御算法的公平比较。
当前挑战
ImageNet-R数据集所解决的领域问题在于,传统数据集在评估对抗攻击与防御算法时存在显著的偏差,即某些图像天然难以被扰动,导致防御算法在特定子集上表现优异而无法泛化。这一挑战的核心在于如何量化并隔离这种由图像自身属性引发的鲁棒性差异。在构建过程中,研究者面临的挑战包括:从Flickr API收集的百万级图像中,仅43%能被多个预训练模型一致正确分类;进一步筛选后,仅有15554张图像在低扰动(ε=0.01)下仍保持鲁棒性,凸显了鲁棒图像在自然数据中的稀缺性。此外,如何设计高效且可迁移的鲁棒性度量指标(如ARD、AMP、ADF)以避免计算开销,以及如何利用纹理特征(如灰度共生矩阵)构建代理分类器来预测图像鲁棒性,也是构建过程中的关键技术挑战。
常用场景
经典使用场景
在对抗性机器学习领域,ImageNet-R 数据集的核心用途在于评估和比较不同对抗攻击与防御算法的真实性能。由于传统数据集如 ImageNet 验证集中存在大量对扰动具有天然鲁棒性的图像,导致在评估防御机制时产生偏差,误判其有效性。ImageNet-R 专门收集了超过 15,000 张经过严格筛选的鲁棒图像,这些图像不仅易于被多种架构的深度模型正确分类,而且对常见梯度攻击(如 FGSM、PGD 和 DDN)表现出显著的抵抗力。研究者可借助该数据集,在标准化的鲁棒图像子集上测试攻击的成功率与防御的恢复能力,从而获得更公正、可复现的基准结果。
解决学术问题
该数据集直面当前对抗性机器学习研究中的关键瓶颈——数据集偏差导致的评估失真。过去,许多防御方法在 MNIST 或 CIFAR-10 上表现优异,却在 ImageNet 上失效;即便在 ImageNet 内部,不同子集的选取也会使结果大相径庭。ImageNet-R 通过提供一组“防御友好”图像,揭示了图像自身纹理特征(如低对比度、高均匀性)与鲁棒性之间的内在关联,并配套提出了 ARD、AMP 和 ADF 三项量化指标。这使学界得以首次系统性地度量数据集的鲁棒性偏倚,推动了对“自然鲁棒图像”这一现象的深入理解,为后续设计无偏的评估协议奠定了方法论基础。
衍生相关工作
ImageNet-R 的提出催生了多条富有启发的研究脉络。其一,它直接补充了 Hendrycks 等人构建的 ImageNet-A(自然对抗样本)数据集,二者形成互补——前者关注最难被扰动的图像,后者关注最易导致模型错误的图像,共同构建了更完整的鲁棒性评估框架。其二,该数据集所揭示的纹理特征与鲁棒性之间的关联,呼应了 Geirhos 等人关于 CNN 偏重纹理而非形状的发现,促使后续工作探索如何通过改变训练数据的纹理分布来提升模型的泛化与抗扰动能力。其三,Pestana 等人基于 YCbCr 色彩空间中 Y 通道的鲁棒性优势,进一步开发了 ResUpNet 防御方法,该工作直接受益于 ImageNet-R 提供的验证基准。
以上内容由遇见数据集搜集并总结生成



