遇见数据集

ASVspoof5

收藏
Hugging Face2026-06-07 更新2026-06-08 收录
官方服务:

资源简介:

ASVspoof 5(Track 1,评估集)是ASVspoof 5挑战赛中用于语音反欺骗和合成/深度伪造语音检测任务的基准数据集,专门包含Track 1的完整评估分区。该数据集旨在支持语音防伪研究,任务为二分类:区分真实人类语音(bonafide)与合成或转换的欺骗语音(spoof)。数据集规模为680,774个语音片段(trials),其中包含138,688个真实样本和542,086个欺骗样本。数据以表格形式组织,包含四个核心字段:path(唯一文件名,格式为<utterance_id>.flac)、audio(16 kHz单声道FLAC格式的原始音频数据,未重新编码)、label(分类标签,bonafide对应0,spoof对应1)以及notes(JSON格式的元数据字符串,包含话语ID、说话人ID、性别、编解码器、编解码器ID、源ID、攻击条件和攻击ID等信息)。该数据集基于原始ASVspoof挑战赛数据,按照Open Data Commons Attribution License (ODC-By) v1.0许可重新分发,适用于语音深度伪造检测、音频分类等任务的模型训练与评估。

ASVspoof 5 (Track 1, Evaluation Set) is a benchmark dataset from the ASVspoof 5 challenge for speech anti-spoofing and synthetic/deepfake speech detection tasks, specifically containing the complete evaluation partition for Track 1. The dataset is designed to support speech anti-counterfeiting research, with a binary classification task: distinguishing between genuine human speech (bonafide) and synthetic or converted spoof speech. The dataset comprises 680,774 speech trials, including 138,688 bonafide samples and 542,086 spoof samples. Data is organized in a tabular format with four core fields: path (unique filename in the format <utterance_id>.flac), audio (raw audio data in 16 kHz mono FLAC format, not re-encoded), label (classification label, where bonafide corresponds to 0 and spoof to 1), and notes (a JSON-formatted metadata string containing utterance ID, speaker ID, gender, codec, codec ID, source ID, attack condition, and attack ID). The dataset is based on the original ASVspoof challenge data and is redistributed under the Open Data Commons Attribution License (ODC-By) v1.0, suitable for model training and evaluation in tasks such as speech deepfake detection and audio classification.

创建时间:
2026-06-07
原始信息汇总

数据集概述

ASVspoof 5 (Track 1, Eval) 是一个面向音频深度伪造检测的基准测试数据集,专门用于语音反欺骗和合成/深度伪造语音检测任务。

  • 任务类型:音频二分类(真实语音 vs. 欺骗语音)
  • 标签bonafide(真实人声,标签0) / spoof(合成/转换语音,标签1)
  • 数据规模:总计 680,774 条样本,其中真实语音 138,688 条,欺骗语音 542,086 条
  • 数据格式:16 kHz 单声道 FLAC 音频,嵌入在数据集中(位精确解码验证通过)
  • 许可协议:Open Data Commons Attribution License (ODC-By) v1.0

数据模式(Schema)

列名 类型 说明
path string 音频文件名(<utterance_id>.flac
audio Audio(16000) 16 kHz 单声道 FLAC 音频
label ClassLabel "bonafide" (0) / "spoof" (1)
notes string JSON 格式元数据,包含:utterance_idspeaker_idgendercodeccodec_idsource_idattack_conditionattack_id

快速使用示例

python from datasets import load_dataset

ds = load_dataset("SpeechAntiSpoofingBenchmarks/ASVspoof5", split="test") print(ds[0])


关键统计信息

指标 数值
总样本数 680,774
真实语音(Bonafide) 138,688
欺骗语音(Spoof) 542,086

数据来源与引用

  • 原始挑战赛:https://www.asvspoof.org/
  • 评估协议文件ASVspoof5.eval.track_1.tsv
  • 相关论文:Wang et al., "ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale", ASVspoof Workshop 2024.
  • 维护者联系方式:k.n.borodin@mtuci.ru
搜集汇总
数据集介绍
ASVspoof5 数据集图片
构建方式
ASVspoof5数据集是ASVspoof挑战赛第五代Track 1(欺骗/深度伪造检测)评估分区的基准封装版本,专为语音反欺骗与合成/深度伪造语音检测任务设计。该数据集基于原始挑战赛的评估协议构建,音频以16 kHz单声道FLAC格式无损嵌入(无重新编码),并经过681k条样本的完整解码探测验证。数据集的标签与评估协议保持原样,未作修改,确保了与原始挑战赛的一致性。其Schema包含路径、音频、标签及注释字段,其中注释字段以JSON格式存储了说话人ID、性别、编码器信息、攻击条件等详细元数据。
特点
该数据集的显著特点在于其规模与多样性:总计680,774条试用样本,其中真实语音(Bonafide)138,688条,欺骗语音(Spoof)542,086条。作为二分类任务(真实 vs. 欺骗)的评估集,它涵盖了多种欺骗攻击条件与编码器类型,包含26个攻击ID(A26)及7种编码器条件(C05),为深度伪造检测模型的泛化能力评估提供了极具挑战性的基准。数据集遵循Open Data Commons Attribution License (ODC-By) v1.0许可,允许广泛使用与再分发。
使用方法
用户可通过Hugging Face Datasets库便捷加载该数据集:使用`load_dataset('SpeechAntiSpoofingBenchmarks/ASVspoof5', split='test')`命令即可获取测试分区的完整数据。加载后的数据集包含音频数组(16kHz采样率)及对应标签(0代表真实,1代表欺骗)。数据集还提供了详细的评估指南与提交格式说明,位于`submissions/README.md`文件中,方便研究者在统一基准下比较模型性能。此外,注释字段中的元数据可用于进行细粒度分析,如按攻击类型或编码器条件评估模型表现。
背景与挑战
背景概述
ASVspoof5数据集诞生于2024年,由Xin Wang、Héctor Delgado、Hemlata Tak等多位研究人员在ASVspoof Workshop 2024上提出,核心研究问题聚焦于语音反欺骗与音频深度伪造检测。作为ASVspoof挑战赛的第五代版本,该数据集专注于Track 1(欺骗/深度伪造检测)的评估分区,旨在推动自动说话人验证(ASV)系统中对合成或转换语音的识别能力。其影响力在于提供了一个大规模、标准化、包含复杂攻击条件的基准测试平台,涵盖680,774条音频样本,其中包含真实人类语音与多种欺骗攻击语音。ASVspoof5的发布显著促进了反欺骗技术从学术研究向实际应用场景的过渡,成为评估语音安全系统鲁棒性的关键资源。
当前挑战
该数据集主要解决的领域挑战在于语音欺骗检测中合成语音与真实语音的细微区分,特别是在面对多样化、未知的攻击条件和编码方式时。构建过程中面临的核心挑战包括:1) 数据来源的多样性与质量控制,需从众包数据中确保大规模语音样本的真实性与攻击样本的有效性;2) 攻击条件的复杂标注,需精细编码不同攻击类型、编码器参数及说话人属性以支持系统评估;3) 保真度与可复现性的平衡,需在确保音频无损压缩(16kHz FLAC)的同时维护680,774条样本的完整性与一致性。
常用场景
经典使用场景
ASVspoof5数据集作为语音反欺骗与深度伪造检测领域的权威基准,其追踪1(Track 1)评估分区被广泛用于二分类任务:区分真实人类语音(bonafide)与经由合成或转换生成的欺骗性语音(spoof)。该数据集包含超过68万条16kHz单声道FLAC格式的高质量音频样本,标注了语音的真伪标签,并附带丰富的元信息(如说话人身份、编码方式、攻击类型等),为研究者提供了一个标准化的、规模宏大的评估平台。研究者通常基于此数据集训练和评测各类分类模型,以衡量其在真实场景下对各类欺骗攻击的鲁棒性,进而推动自动说话人验证系统安全性的提升。
解决学术问题
长期以来,自动说话人验证系统面临语音合成、语音转换以及重放攻击等欺骗手段的严重威胁,传统反欺骗方法在应对新型攻击时往往表现乏力,且缺乏大规模、多场景的统一评测基准。ASVspoof5数据集的发布有效解决了这一困境,它系统性地覆盖了多种攻击条件(attack_condition)与攻击标识(attack_id),并引入了众包语音数据与对抗样本,使得学术研究能够更加客观地评估和对比不同反欺骗算法在复杂环境下的泛化能力与鲁棒性。这一资源极大地推动了语音深度伪造检测领域的标准化进程,为构建更安全、更可靠的语音认证系统奠定了坚实的数据基础。
衍生相关工作
ASVspoof5数据集的发布催生了众多经典的相关工作,其中包括基于前端特征工程(如LFCC、CQCC)与后端分类器(如GMM、CNN)的传统反欺骗流水线,以及融合注意力机制、残差网络和Transformer架构的深度学习检测模型。研究者还探索了领域自适应与对抗训练策略以提升模型对未知攻击的泛化能力,并发展了多任务学习框架以同时预测说话人身份与语音真实性。这些衍生工作不仅加深了对语音欺骗特征的理解,也推动了面向工业级部署的轻量化反欺骗模型的研发,标志着语音安全领域研究进入了一个新的阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务