遇见数据集

AdvSV

收藏
arXiv2024-01-16 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

AdvSV数据集是为研究自动语音验证(ASV)系统对抗性攻击而创建的开放源代码数据集。该数据集基于Voxceleb1验证测试集构建,包含314,496个样本,旨在模拟空中攻击设置。数据集创建过程中使用了代表性的ASV模型,并通过扰动生成算法、扬声器、麦克风和声学环境来生成对抗样本。AdvSV数据集主要应用于解决ASV系统在对抗性攻击下的安全问题,特别是在可重复性研究中提供标准数据集。

The AdvSV dataset is an open-source dataset developed for research on adversarial attacks against automatic speaker verification (ASV) systems. Built upon the VoxCeleb1 verification test set, it contains 314,496 samples and is designed to simulate over-the-air adversarial attack scenarios. During the dataset construction, representative ASV models, perturbation generation algorithms, real-world speakers, microphones, and acoustic environments were utilized to generate adversarial samples. The AdvSV dataset is mainly used to address the security issues of ASV systems under adversarial attacks, and specifically serves as a standard benchmark dataset for reproducible research.

创建时间:
2023-10-09
搜集汇总
数据集介绍
AdvSV 数据集图片
构建方式
AdvSV数据集以Voxceleb1验证集为基础,从中随机保留25%的样本以确保说话人分布一致。利用投影梯度下降(PGD)及其集成版本(Ensemble PGD)两种算法,针对四种先进的声纹识别模型(ECAPA、RawNet、ResNet、XVec)生成对抗样本。在消声室中模拟空中攻击场景,选用高、中、低三档扬声器(价格约300、90、50美元)与三款移动设备(iOS、Android高端、Android低端)作为录音设备,固定扬声器与麦克风间距0.3米、角度90度,最终通过组合录制获得共计314,496条样本。
特点
该数据集聚焦于空中对抗攻击,真实模拟了从扰动生成到物理回放与录制的完整链路。涵盖数字与空中两种攻击形态,并提供了白盒与黑盒(迁移攻击)两种威胁场景。通过多种扬声器与麦克风组合,体现了不同硬件质量对攻击成功率的影响。实验表明,集成PGD攻击可将黑盒迁移成功率提升至55%以上,而针对空中攻击的检测基线等错误率(EER)仍高于30%,揭示了当前防御手段的局限性。
使用方法
研究者可直接使用原始音频样本进行声纹识别模型的鲁棒性评估,或利用提供的对抗样本与真实样本训练攻击检测器。数据集附带了基于单分类方法的检测基线,该基线通过World声码器或Opus编解码器重合成音频并去除说话人与内容信息后输入分类器。用户可按照扬声器、麦克风、攻击算法等维度筛选子集,复现论文中的攻击成功率与检测性能实验,或扩展至新型对抗攻击与防御策略的基准测试。
背景与挑战
背景概述
随着深度学习在自动说话人验证(ASV)系统中的广泛应用,其安全性问题日益凸显。尽管ASV系统在受控环境下表现出色,但研究表明其对对抗性攻击极为脆弱。为填补该领域缺乏标准化基准数据集的空白,香港中文大学(深圳)数据科学学院及新加坡IEEE成员等研究团队于2023年创建了AdvSV数据集。该数据集以Voxceleb1验证集为基础,聚焦于空中传输(Over-the-Air)对抗攻击场景,通过集成多种扬声器、麦克风及攻击算法(如PGD和集成PGD),系统性地模拟了真实世界中的攻击条件。AdvSV的发布为可重复研究提供了重要支撑,推动了ASV系统对抗攻击与防御策略的标准化评估,其影响力已延伸至语音安全领域的基准构建与算法比较。
当前挑战
AdvSV数据集所解决的领域核心挑战在于ASV系统对空中传输对抗攻击的脆弱性。此类攻击需同时应对扰动生成、扬声器-麦克风组合及声学环境(如混响与噪声)的多重变量,导致攻击成功率因配置差异而剧烈波动。例如,高端扬声器与手机组合的攻击成功率显著高于低端设备,而黑盒迁移攻击的成功率虽低于白盒攻击,但仍可超过50%,凸显了防御的紧迫性。在数据集构建过程中,挑战包括:1)需协调多种硬件设备(三种扬声器与三种麦克风)及固定角度距离(0.3米、90度)以平衡实验复杂度与代表性;2)通过25%子集采样降低录制负担,同时确保数据分布的代表性;3)设计可扩展的数据集框架,以支持未来纳入更多攻击类型与对抗防御方法的基准测试。
常用场景
经典使用场景
AdvSV数据集最经典的使用场景在于为自动说话人验证(ASV)系统的空中(Over-the-Air)对抗攻击研究提供标准化的基准平台。该数据集基于VoxCeleb1验证集构建,覆盖了多种扬声器、麦克风及攻击算法组合,模拟真实世界中攻击者通过播放含扰动音频来欺骗ASV系统的过程。研究者可利用该数据集评估不同ASV模型在白盒与黑盒攻击场景下的脆弱性,尤其是探究攻击成功率随设备等级、环境噪声及攻击策略变化的规律,从而推动对抗攻击领域可复现研究的规范化发展。
衍生相关工作
AdvSV数据集衍生了一系列经典工作,主要集中在对抗攻击的迁移性与防御机制两大方向。在攻击方面,研究者基于该数据集验证了集成PGD算法能显著提升黑盒攻击的成功率,并探索了利用房间脉冲响应模拟混响以增强攻击鲁棒性的方法。在防御方面,该数据集催生了基于单类分类的扰动检测基线、利用神经声码器进行样本重合成以滤除扰动的策略,以及通过对抗训练提升ASV模型韧性的研究。这些工作共同构成了从攻击生成到防御检测的完整研究链条,推动了说话人验证领域安全性的系统性提升。
数据集最近研究
最新研究方向
在当前声纹识别安全领域,对抗性攻击的威胁日益凸显,然而缺乏标准化基准数据集成为制约可重复研究与技术落地的关键瓶颈。AdvSV数据集应运而生,它基于VoxCeleb1验证集构建,聚焦于空中传输(Over-the-Air)对抗攻击这一前沿方向,系统性地引入了扬声器、麦克风及声学环境等多维度变量,模拟真实攻击场景。该数据集不仅涵盖了基于投影梯度下降(PGD)及集成PGD的多种攻击算法,还提供了针对四类主流声纹识别模型的攻击成功率评估,揭示了白盒与黑盒攻击下的脆弱性差异。尤为重要的是,AdvSV推动了对抗攻击检测的基准化研究,其基线实验表明,区分空中传输过程与对抗扰动本身是更具挑战性的任务,为后续开发鲁棒性更强的防御机制奠定了数据基础,对推动声纹识别系统在现实世界中的安全部署具有深远意义。
相关研究论文
  • 1
    AdvSV: An Over-the-Air Adversarial Attack Dataset for Speaker Verification数据科学与大数据技术学院,深圳大数据研究院,香港中文大学(深圳) · 2024年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务