遇见数据集

ASVspoof2021_DF

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

ASVspoof 2021 DF数据集是ASVspoof 2021挑战赛的DeepFake评估子集,专门用于语音反欺骗和深度伪造语音检测的基准测试。该数据集的核心任务是二元分类:区分真实的人类语音(bonafide)与合成、转换或经过其他方式操纵的伪造语音(spoof)。数据集共包含611,829个语音样本,其中真实语音22,617个,伪造语音589,212个。所有音频文件均经过标准化处理,转换为16kHz单声道FLAC格式,确保在各种音频解码器中的兼容性,同时保持了原始PCM样本的精确性。数据集包含四个主要字段:path(稳定的存档相对路径)、audio(16kHz单声道音频波形)、label(分类标签,0表示真实,1表示伪造)以及notes(包含utterance_id、speaker_id、subset、codec、source、attack_id、vocoder等元数据的JSON字符串)。该数据集适用于语音反欺骗、音频深度伪造检测、说话人验证安全等研究领域,并提供了标准化的评估协议。

The ASVspoof 2021 DF dataset is the DeepFake evaluation subset of the ASVspoof 2021 challenge, specifically designed for benchmarking speech anti-spoofing and deepfake voice detection. Its core task is binary classification: distinguishing real human speech (bonafide) from synthetic, converted, or otherwise manipulated fake speech (spoof). The dataset contains a total of 611,829 speech samples, including 22,617 real speech samples and 589,212 fake speech samples. All audio files are standardized and converted to 16kHz mono FLAC format, ensuring compatibility across various audio decoders while preserving the accuracy of the original PCM samples. The dataset includes four main fields: path (stable archive relative path), audio (16kHz mono audio waveform), label (classification label, 0 for real, 1 for fake), and notes (JSON string containing metadata such as utterance_id, speaker_id, subset, codec, source, attack_id, vocoder). This dataset is suitable for research areas such as speech anti-spoofing, audio deepfake detection, and speaker verification security, and provides standardized evaluation protocols.

创建时间:
2026-05-30
原始信息汇总

数据集名称:ASVspoof 2021 DF

任务类型

  • 音频分类:二分类任务,区分 真实语音(bonafide)伪造语音(spoof)(包括合成、转换或篡改的语音)。

数据集规模

  • 总样本数:611,829
  • 真实语音(bonafide):22,617
  • 伪造语音(spoof):589,212

数据划分

  • 仅包含 测试集(test) 划分,数据文件位于 data/test-*.parquet

数据模式(Schema)

列名 类型 描述
path string 数据集内唯一的相对路径(如 DF_E_2000011.flac
audio Audio(16000) 16 kHz 单声道音频波形
label ClassLabel 类别标签:"bonafide"(索引0)或 "spoof"(索引1)
notes string JSON格式的元数据,包含 utterance_id, speaker_id, subset, codec, source, attack_id, vocoder

数据来源与处理

  • 原始数据集来自 ASVspoof 2021 挑战赛
  • 音频已统一转码为 16 kHz 单声道 FLAC,PCM样本在重编码后保持位精确(无损),采样率不变。
  • 标签和评估协议未做修改。

许可证与分发

  • 采用 Open Data Commons Open Database License (ODbL) 许可证重新分发。

快速加载示例(Python)

python from datasets import load_dataset ds = load_dataset("SpeechAntiSpoofingBenchmarks/ASVspoof2021_DF", split="test") print(ds[0])

{path: DF_E_2000011.flac, audio: {array: ..., sampling_rate: 16000},

label: 1, notes: {"utterance_id": "DF_E_2000011", ...}}

评估与提交

  • 评估说明和提交格式请参考 submissions/README.md 文件。

引用

  • 原始论文:arXiv:2109.00537
  • 同行评审出版:@inproceedings{yamagishi21_asvspoof, ...}

维护者

  • 联系方式:k.n.borodin@mtuci.ru
搜集汇总
数据集介绍
ASVspoof2021_DF 数据集图片
构建方式
ASVspoof2021_DF数据集源自ASVspoof 2021挑战赛的深度伪造(DeepFake)评估子集,旨在推动语音反欺骗与合成语音检测技术的进步。原始音频资源经过精心转码处理,统一转换为16 kHz单声道FLAC格式,以解决源文件中部分FLAC编码无法被标准`libsndfile`/`soundfile`解码器读取的问题。在转码过程中,PCM样本得以位精确保留,采样率保持不变,从而确保了数据完整性与通用可读性。数据集的构建严格遵循官方评估协议,标签与评价标准未经任何修改,为研究者提供了一套基准化的评测数据。
特点
该数据集的核心特点在于其规模庞大且类别分布极具挑战性,总计包含611,829个样本,其中真实语音(bonafide)仅22,617条,而欺骗性语音(spoof)高达589,212条,呈现出显著的不平衡性。样本涵盖多种合成、转换及操控手段,每个样本均附有详细的元数据注释,包括话语ID、说话人ID、子集类型、编码格式、攻击类型及声码器信息,以JSON格式嵌入`notes`字段。这种丰富的结构化信息不仅支持基础的二分类任务,更为细粒度的攻击类型分析及跨域泛化研究提供了数据基础。
使用方法
通过Hugging Face `datasets`库即可便捷加载该数据集,研究者只需执行`load_dataset("SpeechAntiSpoofingBenchmarks/ASVspoof2021_DF", split="test")`即可获取测试集。每条数据包含四个字段:`path`(文件路径)、`audio`(16 kHz波形数组及采样率)、`label`(二分类标签:bonafide或spoof)以及`notes`(元数据JSON字符串)。开发者可直接利用`audio`字段进行特征提取与模型输入,同时借助`label`字段进行监督学习。数据集以Apache Parquet格式存储,支持高效的分片读取,适合在大规模实验中快速迭代。
背景与挑战
背景概述
ASVspoof2021_DF数据集由国际联合研究团队于2021年创建,核心成员包括Junichi Yamagishi、Xin Wang等来自多个顶尖机构的研究者,旨在应对语音合成与深度伪造技术对自动说话人验证系统构成的严峻威胁。该数据集聚焦于深度伪造(DeepFake)语音检测这一核心研究问题,通过提供大规模、多样化的伪造语音样本,推动了反欺骗与音频深度伪造检测领域的基准化评估。作为ASVspoof挑战系列的重要组成部分,它不仅在学术界引发了广泛关注,其相关论文发表于arXiv及ASVspoof 2021研讨会,更为工业界开发鲁棒的语音防伪系统提供了关键验证资源,显著提升了该领域的研究标准化与可复现性。
当前挑战
该数据集所解决的领域核心挑战在于,随着语音合成与转换技术的飞速进步,尤其是生成式对抗网络等先进方法的应用,使得伪造语音的逼真度极高,传统检测手段难以有效区分真实语音与深度伪造内容,从而威胁语音身份认证系统的安全性。在构建过程中,挑战亦十分显著:原始音频数据编码格式多样,大量FLAC文件采用标准解码器(如libsndfile)无法读取的编码方式,需逐一解码并重新编码为统一的16 kHz单声道FLAC格式,同时确保脉冲编码调制(PCM)样本的比特级无损保留,这一预处理流程对数据复用的准确性与可靠性提出了极高要求。
常用场景
经典使用场景
ASVspoof2021_DF数据集作为语音反欺骗与深度伪造检测领域的标杆性基准,其最经典的使用场景在于训练和评估面向真实世界场景的音频二分类模型。具体而言,研究者利用该数据集中包含的61万余条语音样本,将任务设定为区分真实人类语音(bonafide)与经过合成、转换或其他方式操控的欺骗语音(spoof)。该数据集不仅涵盖了多种先进的语音伪造技术(如基于传统声码器的攻击、神经网络合成攻击等),还提供了标准化评估协议,使得不同模型在该统一框架下的性能比较成为可能,从而推动了语音反欺骗技术从实验室理想条件向实际复杂环境过渡的进程。
衍生相关工作
围绕ASVspoof2021_DF数据集,学术界衍生出了一系列具有深远影响的代表性工作。其中,基于轻量级卷积神经网络(如LCNN、ResNet)的端到端反欺骗框架成为经典基线,推动了模型效率与检测精度的平衡探索。另一方面,注意力机制与Transformer架构被引入以捕获语音中的细微伪造伪影,例如RawNet2及其变体在时序特征建模上取得了突破性进展。此外,该数据集还催生了跨域泛化研究,如对抗域适应与自监督预训练策略,旨在提升模型在未知攻击类型上的适应能力。这些衍生工作共同构建了从数据到理论、从模型到算法的完整技术生态,持续引领着语音安全领域的创新浪潮。
数据集最近研究
最新研究方向
ASVspoof2021_DF作为语音反欺骗与深度伪造检测领域的权威基准数据集,当前研究焦点集中于探索更鲁棒的音频伪造检测模型以应对多样化攻击手法。前沿方向包括利用自监督预训练模型如wav2vec 2.0进行特征提取,以及设计轻量化端侧解决方案以提升实时检测效率。该数据集涵盖了611,829条测试样本,其中伪造样本占比高达96.3%,真实反映了语音深度伪造技术的泛滥态势,为评估模型在逻辑可解释性与跨领域泛化能力上的突破提供了关键验证平台,有力推动了欧盟《人工智能法案》下可信语音认证技术的标准化进程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务