遇见数据集

ASVspoof2019_LA

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

ASVspoof 2019 LA数据集是ASVspoof 2019挑战赛中逻辑访问(LA)评估分区的基准就绪版本,专门用于语音反欺骗和合成语音检测研究。该数据集的核心任务是二元分类:区分真实的人类语音(bonafide)与合成或转换的伪造语音(spoof)。数据集包含总计71,237个语音样本,其中真实语音样本7,355个,伪造语音样本63,882个。每个样本由四个字段构成:`path`(稳定的归档相对路径)、`audio`(16 kHz采样率的单声道音频波形)、`label`(分类标签,0对应‘bonafide’,1对应‘spoof’)以及`notes`(一个包含`utterance_id`、`speaker_id`和`subset`信息的JSON字符串,用于标识话语、说话人及所属子集)。该数据集以Parquet格式提供,适用于训练和评估语音反欺骗模型,是音频深度伪造检测领域的一个重要基准数据集。

The ASVspoof 2019 LA dataset is a benchmark-ready version of the logical access (LA) evaluation partition from the ASVspoof 2019 challenge, specifically designed for research in speech anti-spoofing and synthetic speech detection. The core task is binary classification: distinguishing genuine human speech (bonafide) from synthetic or converted spoofed speech. It contains a total of 71,237 speech samples, with 7,355 bonafide samples and 63,882 spoof samples. Each sample consists of four fields: `path` (stable archive relative path), `audio` (mono audio waveform sampled at 16 kHz), `label` (classification label, 0 for bonafide, 1 for spoof), and `notes` (a JSON string containing `utterance_id`, `speaker_id`, and `subset` information to identify the utterance, speaker, and subset). The dataset is provided in Parquet format, suitable for training and evaluating speech anti-spoofing models, and serves as an important benchmark in the field of audio deepfake detection.

创建时间:
2026-05-19
原始信息汇总

ASVspoof 2019 LA 数据集详情

基本信息

  • 数据集名称: ASVspoof 2019 LA
  • 许可证: Open Data Commons Attribution License (ODC-By)
  • 语言: 英语
  • 任务类别: 音频分类(audio-classification)
  • 规模: 10K < n < 100K
  • 标签: 反欺骗、音频深度伪造检测、语音、基准测试、Arena-ready
  • PapersWithCode ID: asvspoof-2019
  • 相关论文: arXiv: 1911.01601

数据集概述

该数据集是ASVspoof 2019挑战赛中逻辑访问(Logical Access, LA)评估分区的基准测试封装版本,用于语音反欺骗和合成语音检测。任务为二分类:区分真实(bonafide) 人类语音与伪造(spoof) 合成或转换语音。

数据模式

字段 类型 描述
path string 稳定的归档相对路径(如 LA_E_2834763.flac),数据集中唯一
audio Audio(16000) 音频波形,16 kHz 单声道
label ClassLabel "bonafide"(索引0)或 "spoof"(索引1)
notes string JSON格式,包含 utterance_idspeaker_idsubset

notes 示例: json {"utterance_id": "LA_E_2834763", "speaker_id": "LA_0039", "subset": "eval"}

数据统计

统计项 数值
总样本数 71,237
真实样本(Bonafide) 7,355
伪造样本(Spoof) 63,882

配置与文件

  • 配置名称: default
  • 数据文件: data/test-*.parquet(测试集)

快速使用

python from datasets import load_dataset

ds = load_dataset("SpeechAntiSpoofingBenchmarks/ASVspoof2019_LA", split="test") print(ds[0])

{path: LA_E_2834763.flac, audio: {array: ..., sampling_rate: 16000},

label: 1, notes: {"utterance_id": "LA_E_2834763", ...}}

来源信息

  • 原始数据集: https://www.asvspoof.org/index2019.html
  • 评估协议: protocols/ASVspoof2019.LA.cm.eval.trl.txt

引用

原始论文: https://arxiv.org/abs/1911.01601

arXiv版本引用: bibtex @misc{wang2020asvspoof2019largescalepublic, title={ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech}, author={Xin Wang and Junichi Yamagishi and Massimiliano Todisco and Hector Delgado and Andreas Nautsch and Nicholas Evans and Md Sahidullah and Ville Vestman and Tomi Kinnunen and Kong Aik Lee and Lauri Juvela and Paavo Alku and Yu-Huai Peng and Hsin-Te Hwang and Yu Tsao and Hsin-Min Wang and Sebastien Le Maguer and Markus Becker and Fergus Henderson and Rob Clark and Yu Zhang and Quan Wang and Ye Jia and Kai Onuma and Koji Mushika and Takashi Kaneda and Yuan Jiang and Li-Juan Liu and Yi-Chiao Wu and Wen-Chin Huang and Tomoki Toda and Kou Tanaka and Hirokazu Kameoka and Ingmar Steiner and Driss Matrouf and Jean-Francois Bonastre and Avashna Govender and Srikanth Ronanki and Jing-Xuan Zhang and Zhen-Hua Ling}, year={2020}, eprint={1911.01601}, archivePrefix={arXiv}, primaryClass={eess.AS}, url={https://arxiv.org/abs/1911.01601}, }

同行评审出版物引用(Computer Speech & Language, 2020): bibtex @article{wang2020asvspoof, title={ASVspoof 2019: A large-scale public database of synthesized, converted and replayed speech}, author={Wang, Xin and Yamagishi, Junichi and Todisco, Massimiliano and Delgado, Hector and Nautsch, Andreas and Evans, Nicholas and Sahidullah, Md and Vestman, Ville and Kinnunen, Tomi and Lee, Kong Aik and others}, journal={Computer Speech & Language}, volume={64}, pages={101114}, year={2020}, publisher={Elsevier} }

维护者

联系: k.n.borodin@mtici.ru

搜集汇总
数据集介绍
ASVspoof2019_LA 数据集图片
构建方式
ASVspoof2019_LA数据集源自ASVspoof 2019挑战赛,专注于逻辑访问(Logical Access)场景下的语音反欺骗与合成语音检测任务。该数据集的构建整合了多种现代语音合成与转换技术生成的欺骗样本,以及真实的人类语音样本,形成二元分类任务。原始数据由官方渠道分发,此处以HuggingFace Datasets形式重新封装,保留了完整的评估协议与文件结构,所有音频均统一重采样为16kHz单声道格式,并附有稳定的归档路径、标签及包含话语ID、说话人ID和子集信息的JSON注释字段。数据划分仅提供测试集,共计71,237条样本,其中真实语音7,355条,欺骗语音63,882条,确保了评估的全面性与挑战性。
特点
该数据集的核心特点在于其高度专业化与标准化,专为语音反欺骗与深度伪造检测任务设计。采用简洁的二元标签体系(bonafide与spoof),覆盖多种生成式攻击手段,适用于评估模型对未知欺骗方式的泛化能力。数据以Parquet格式高效存储,并集成HuggingFace的Audio特征类型,便于直接加载与处理。每一条样本均附带详尽的元信息,如话语ID和说话人ID,支持细粒度分析与跨说话人评估。此外,数据集遵循ODC-By许可协议开放分发,确保了科研与工业应用的可复现性。其前瞻性的内容使其成为该领域公认的基准测试资源。
使用方法
使用ASVspoof2019_LA数据集极为便捷,可通过HuggingFace的datasets库一键加载。用户只需调用`load_dataset`函数指定数据集名称与评估切分(split='test'),即可获得包含音频波形、采样率、标签及注释的字典结构。典型用法包括直接迭代样本进行推理、基于音频数组提取声学特征(如MFCC或谱图),并利用标签计算二分类指标。为便于标准化评估,数据集还提供了配套的提交格式指南与协议文件,确保社区间结果的可比较性。研究人员可在此基础上快速复现经典反欺骗模型或开展新型检测算法的实验,无需处理原始数据的复杂格式转换。
背景与挑战
背景概述
ASVspoof 2019 LA(Logical Access)数据集由日本国立信息学研究所的Xin Wang、Junichi Yamagishi等众多国际知名研究机构于2019年联合创建,旨在应对自动说话人验证(ASV)系统面临的语音合成与转换攻击挑战。该数据集聚焦于逻辑访问场景下的反欺骗检测,提供了大规模、标准化的二分类评测基准,用于区分真实人类语音(bonafide)与机器生成的伪造语音(spoof)。作为ASVspoof挑战系列的重要组成部分,该数据集推动了语音反欺骗和音频深度伪造检测领域的发展,成为评估前沿模型性能的标杆,相关研究论文发表于Computer Speech & Language期刊并获广泛引用。
当前挑战
该数据集所解决的领域核心挑战在于:随着语音合成与转换技术的飞速进步,高质量伪造语音逐渐逼近真实人声,传统ASV系统极易受欺骗,亟需鲁棒的反欺骗检测方法。数据集的构建过程面临多重困难:首先需从不同算法(如波形拼接、参数合成、神经网络声码器)生成的多样化攻击样本中收集与筛选,确保涵盖广泛的攻击类型;其次,需标注大规模样本(总计71,237条,其中欺骗样本63,882条),平衡真实与伪造数据的分布,模拟真实攻击中的类别不均衡问题;最终,通过统一16kHz采样率和标准化协议,构建可复现的评估基线,克服了数据来源异构和评测标准缺失的瓶颈。
常用场景
经典使用场景
在语音反欺骗与深度伪造检测领域,ASVspoof2019_LA数据集被广泛视作评估模型泛化能力的黄金标准。其逻辑访问(Logical Access)子集专注于检测由文本到语音合成、语音转换及重放攻击生成的虚假语音,要求模型在仅有真实与伪造二分类标签的条件下,精准区分自然语音与各类伪造语音。研究者通常基于该数据集的评估分区(含71,237条样本,其中伪造样本占比高达89.7%)开展模型训练与性能验证,通过等错误率(EER)和串联检测成本函数(t-DCF)等指标衡量系统的鲁棒性,使其成为语音生物特征安全领域不可或缺的基准测试平台。
解决学术问题
该数据集的核心价值在于系统性地揭示了自动说话人验证(ASV)系统在面对多样化语音伪造技术时的脆弱性,并推动了对抗性攻击防御策略的学术探索。通过提供涵盖数十种不同语音合成与转换算法的标准化评估协议,ASVspoof2019_LA有效解决了以往研究中数据集规模小、伪造方法单一、评估指标不统一等关键瓶颈。其发布促使学界重新审视传统ASV系统的安全性边界,催生了面向未知攻击类型(unseen attacks)的通用反欺骗架构研究,显著提升了语音深度伪造检测领域的理论深度与实验可复现性,为构建可信语音交互系统奠定了数据基础。
衍生相关工作
围绕ASVspoof2019_LA衍生出的一系列经典工作已成为语音安全领域的发展脉络。基于该基准,研究者提出了前端声学特征增强与后端分类器联合优化的范式,如采用轻量级残差网络(ResNet)结合局部二值模式(LBP)进行伪造痕迹挖掘;随后,大规模预训练模型(如Wav2Vec 2.0、HuBERT)被引入并展现了惊人的跨域泛化能力,标志着从手工特征到自监督表征的范式迁移。更具里程碑意义的是,该数据集催生了专注于未知攻击检测的领域泛化(domain generalization)方法,例如基于对抗域自适应和特征解耦的算法,以及融合子带分析与时域差异信息的端到端架构,这些成果持续推动着语音反欺骗技术迈向更高层次的智能化。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务