uoft-dsp-lab/DataDAM
收藏官方服务:
资源简介:
该数据集包含了通过注意力匹配技术进行蒸馏的多个图像分类数据集,包括CIFAR10、CIFAR100、ImageSquack和ImageWoof的蒸馏数据和ConvNet权重。此外,还提供了CIFAR10和CIFAR100的推荐合成初始化参数。用户可以直接加载训练好的模型参数进行推理,也可以访问蒸馏数据参数以训练自己的模型。
该数据集包含了通过注意力匹配技术进行蒸馏的多个图像分类数据集,包括CIFAR10、CIFAR100、ImageSquack和ImageWoof的蒸馏数据和ConvNet权重。此外,还提供了CIFAR10和CIFAR100的推荐合成初始化参数。用户可以直接加载训练好的模型参数进行推理,也可以访问蒸馏数据参数以训练自己的模型。
提供机构:
uoft-dsp-lab原始信息汇总
DataDAM: Efficient Dataset Distillation with Attention Matching
数据集详情
本仓库包含以下精简数据集及其对应的ConvNet模型权重参数:
- CIFAR10: 精简数据(IPC 1 & 10 & 50)和ConvNet权重
- CIFAR100: 精简数据(IPC 1 & 10 & 50)和ConvNet权重
- ImageSquack: 精简数据(IPC 1 & 10)和ConvNet权重
- ImageWoof: 精简数据(IPC 1 & 10)和ConvNet权重
此外,还包括运行精简过程时推荐的CIFAR10和CIFAR100的合成初始化参数。
评估
本仓库提供在精简数据集上训练的模型参数,可直接加载到ConvNet模型中进行推理。用户只需下载文件夹,放置在当前工作目录,并运行新的测试脚本(distill_test.py)。
若用户希望在精简数据上训练自己的模型,可通过以下代码片段访问数据参数(其中args为标准解析器参数对象): python data_save = torch.load(os.path.join(args.save_path, syn_data_%s_ipc_%d.pt%(args.dataset.lower(), args.ipc)))["data"] image_syn_eval = torch.tensor(data_save[0]) label_syn_eval = torch.tensor(data_save[1])
搜集汇总
数据集介绍

构建方式
在图像分类领域,数据集蒸馏旨在从原始大规模数据中提炼出精简而富有代表性的样本,以降低存储与训练成本。DataDAM数据集基于注意力匹配机制构建,通过将原始图像数据与合成数据在注意力层上的分布进行对齐,从而高效压缩信息。该数据集涵盖了CIFAR10、CIFAR100、ImageSquack与ImageWoof等多个基准,每个数据集均提供不同每类图像数量(IPC)的蒸馏版本,如IPC 1、10及50,并附带了相应的卷积神经网络权重参数,便于直接评估蒸馏效果。
特点
DataDAM数据集的核心特点在于其注意力引导的蒸馏范式,能够保留原始数据中关键的判别性特征,同时极大减少样本数量。蒸馏后的数据不仅体积小巧,且在不同IPC设置下均保持了较高的分类性能,展现出优越的泛化能力。此外,该数据集还包含了针对CIFAR10与CIFAR100的推荐合成初始化策略,为后续研究提供了标准化起点。其配套的预训练模型权重进一步简化了验证流程,使得研究人员能够快速对比不同蒸馏方法的效能。
使用方法
使用DataDAM数据集时,用户可直接加载提供的预训练ConvNet模型权重进行推理,仅需下载对应文件夹并运行测试脚本distill_test.py。若需自行训练模型,可通过加载.pt格式的蒸馏数据文件,其中包含合成图像张量与对应标签,例如使用torch.load函数读取'syn_data_%s_ipc_%d.pt'文件,并提取data键下的内容。该设计支持灵活的实验配置,允许研究者调整训练参数以探索蒸馏数据的潜力。
背景与挑战
背景概述
在深度学习领域,数据集规模的膨胀给模型训练带来了高昂的计算与存储成本,数据集蒸馏(Dataset Distillation)作为一种新兴的解决方案应运而生,旨在从大规模数据中合成紧凑且信息丰富的代表性样本。由多伦多大学DSP实验室于2023年提出的DataDAM数据集,聚焦于通过注意力匹配机制提升蒸馏效率,其核心研究问题在于如何利用注意力分布差异指导合成数据的生成,从而在极小样本量下保留原始数据的关键判别特征。该数据集基于CIFAR-10、CIFAR-100、ImageSquack和ImageWoof等经典图像分类基准构建,提供了每类1、10、50张合成样本的多种配置,并配套预训练卷积网络权重,显著推动了高效数据压缩与模型泛化能力的交叉研究。
当前挑战
DataDAM所应对的领域挑战在于图像分类任务中数据冗余与算力瓶颈的矛盾——传统蒸馏方法往往忽略样本间的语义关联,导致合成数据在复杂场景下丢失类别间细微差异。其构建过程面临双重困难:首先,注意力匹配机制需要精确对齐原始模型与蒸馏模型的特征激活图,高维注意力张量的计算复杂度极易引发梯度不稳定;其次,跨数据集泛化(如从CIFAR-10迁移至细粒度ImageWoof)时,合成样本的初始化策略需平衡随机噪声与先验知识,否则会陷入局部最优。此外,极低每类样本量(IPC=1)下如何避免过拟合蒸馏模型,仍是当前方法突破的瓶颈。
常用场景
经典使用场景
在图像分类任务中,数据集蒸馏旨在从原始大规模数据集中合成少量但信息丰富的样本,以替代完整数据集进行模型训练。DataDAM作为这一领域的代表性成果,其经典使用场景是作为高效的压缩替代数据集,研究者可直接加载其提供的蒸馏图像与标签(如CIFAR-10/100的IPC 1、10、50版本),在保持较高分类精度的前提下,大幅降低模型训练的计算与存储开销。该数据集尤其适用于资源受限环境下的快速原型验证与算法比较。
解决学术问题
DataDAM解决了传统数据集蒸馏方法中合成样本分布与真实数据分布对齐不佳、导致泛化性能下降的核心学术难题。通过引入注意力匹配机制,该数据集实现了合成样本在特征空间中对原始数据关键模式的精准捕获,从而在极低样本率(如每类仅1张图像)下仍能维持接近全数据训练的模型性能。这一突破显著推动了小样本学习、模型压缩与知识蒸馏等领域的理论发展,为探索数据效率与模型性能之间的最优权衡提供了关键基准。
衍生相关工作
DataDAM的提出催生了一系列后续研究,包括基于注意力蒸馏的跨架构迁移方法、动态IPC分配策略以及多模态数据蒸馏框架。例如,后续工作将注意力匹配机制扩展至Transformer架构,验证了其在视觉Transformer上的有效性;另有研究结合元学习思想,利用DataDAM的蒸馏数据作为元训练集,提升了模型在未知任务上的快速适应能力。这些衍生工作共同构建了从数据蒸馏到高效学习的完整技术生态。
以上内容由遇见数据集搜集并总结生成



