遇见数据集

ASVspoof2021_LA

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

ASVspoop 2021 LA是一个用于语音反欺骗和合成/深度伪造语音检测的基准就绪数据集,包含ASVspoop 2021挑战赛中的逻辑访问(LA)评估子集。该数据集的任务是二分类,旨在区分真实(bonafide,即真实人类语音)与欺骗(spoof,即合成、转换或重放语音)。LA分区在2019年LA攻击基础上增加了真实的电话编解码器/传输条件,以模拟更实际的场景。数据集中音频已转码为标准16 kHz单声道FLAC格式,确保通用可解码性,同时保持PCM样本比特精确和采样率不变。数据集包含181,566个试验,其中真实样本18,452个,欺骗样本163,114个。每个样本包含以下字段:path(稳定存档相对路径)、audio(16 kHz单声道音频波形)、label(分类标签,真实或欺骗)、notes(JSON格式的元数据,包括utterance_id、speaker_id、codec、transmission、attack_id、trim和phase)。该数据集适用于语音反欺骗、深度伪造检测和音频分类基准测试,采用Open Data Commons Attribution License (ODC-By)许可。原始数据集和评估协议可在ASVspoop官网获取,相关研究论文发表于arXiv:2109.00537。

ASVspoop 2021 LA is a benchmark-ready dataset for speech anti-spoofing and synthetic/deepfake speech detection, containing the logical access (LA) evaluation subset from the ASVspoop 2021 challenge. The task is binary classification: distinguishing between bonafide (i.e., genuine human speech) and spoof (i.e., synthetic, converted, or replayed speech). The LA partition incorporates real telephony codec/transmission conditions on top of the 2019 LA attacks. The audio in the dataset has been transcoded to standard 16 kHz mono FLAC format to ensure universal decodability while preserving PCM sample bit-exactness and sampling rate. The dataset includes 181,566 trials, with 18,452 bonafide samples and 163,114 spoof samples. Each sample contains the following fields: path (stable archive relative path), audio (16 kHz mono audio waveform), label (classification label, bonafide or spoof), and notes (JSON-formatted metadata including utterance_id, speaker_id, codec, transmission, attack_id, trim, and phase). This dataset is suitable for speech anti-spoofing, deepfake detection, and audio classification benchmarking, licensed under the Open Data Commons Attribution License (ODC-By). The original dataset and evaluation protocol are available on the ASVspoop website, with related research papers published at arXiv:2109.00537.

创建时间:
2026-05-31
原始信息汇总

ASVspoof 2021 LA 数据集概述

该数据集是 ASVspoof 2021 挑战赛中 逻辑访问(Logical Access, LA)评估分区 的基准封装版本,专用于语音反欺骗和合成/深度伪造语音检测任务。

任务类型

  • 音频分类(audio-classification)
  • 二分类任务:区分 真实语音(bonafide)与 欺骗语音(spoof,包括合成、转换或重放的语音)

数据集规模

  • 总样本数:181,566 条
  • 真实语音(Bonafide):18,452 条
  • 欺骗语音(Spoof):163,114 条
  • 阶段划分(通过 notes.phase 字段):
    • 评估集(eval):148,176 条
    • 进度集(progress):16,464 条
    • 隐藏集(hidden):16,926 条
  • 规模类别:100K < n < 1M

数据格式与结构

列名 类型 说明
path string 数据集内唯一、稳定的相对路径(如 LA_E_9332881.flac
audio Audio(16000) 16 kHz 单声道音频波形
label ClassLabel 类别标签:"bonafide"(索引 0)或 "spoof"(索引 1)
notes string JSON 格式,包含 utterance_idspeaker_idcodectransmissionattack_idtrimphase 等信息

核心特点

  • 在 ASVspoof 2019 LA 攻击基础上,增加了真实的电话 编解码/传输 条件
  • 音频已重新编码为标准 16 kHz 单声道 FLAC 格式,PCM 样本比特级精确,采样率保持不变
  • 标签和评估协议未作修改

许可与来源

  • 许可协议:Open Data Commons Attribution License (ODC-By)
  • 原始数据集地址:https://www.asvspoof.org/index2021.html
  • 原始论文:arXiv:2109.00537
  • 维护者:k.n.borodin@mtuci.ru

快速使用

python from datasets import load_dataset ds = load_dataset("SpeechAntiSpoofingBenchmarks/ASVspoof2021_LA", split="test") print(ds[0])

引用信息

bibtex @inproceedings{yamagishi21_asvspoof, title = {{ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection}}, author = {Junichi Yamagishi and Xin Wang and Massimiliano Todisco and Md Sahidullah and Jose Patino and Andreas Nautsch and Xuechen Liu and Kong Aik Lee and Tomi Kinnunen and Nicholas Evans and Héctor Delgado}, year = {2021}, booktitle = {{2021 Edition of the Automatic Speaker Verification and Spoofing Countermeasures Challenge}}, pages = {47--54}, doi = {10.21437/ASVSPOOF.2021-8}, }

搜集汇总
数据集介绍
ASVspoof2021_LA 数据集图片
构建方式
ASVspoof2021_LA数据集源于ASVspoof 2021挑战赛的逻辑接入子集,旨在服务于语音反欺骗与合成/深度伪造语音检测任务。在原始ASVspoof 2019数据基础上,该数据集融入了逼真的电话编解码与传输条件,增强了现实场景的模拟。构建过程中,原始音频被统一转码为16 kHz单声道FLAC格式,以确保与标准解码器及Hugging Face数据集音频解码器的兼容性,同时保持PCM样本的比特精确性。数据集的评估协议与标签保持原样,提供了包含'真实'与'欺骗'类别的二元分类标注,共计181,566条样本,其中真实语音仅占少数,欺骗样本占据主导。
使用方法
使用ASVspoof2021_LA数据集极为便捷,研究者可通过Hugging Face的datasets库直接加载。具体实现中,调用`load_dataset`函数指定数据集名称与分割即可获取完整的测试集,每个样本以字典形式返回,包含路径、音频波形与标签。音频数据已预先处理为16 kHz采样率,可直接输入至深度学习模型进行特征提取或分类训练。对于评估任务,数据集附带的`submissions/README.md`文件提供了标准的提交格式指南,确保实验结果的可比性。此外,元数据中的编解码与传输信息允许用户进行细粒度的性能分析,适用于反欺骗系统鲁棒性研究。
背景与挑战
背景概述
在语音防伪与深度伪造检测领域,ASVspoof系列挑战赛扮演着推动技术演进的关键角色。ASVspoof2021_LA数据集由J. Yamagishi、X. Wang等国际知名研究团队于2021年创建,专注于逻辑访问(Logical Access)场景下的语音欺骗检测。该数据集的核心研究问题是区分真实人类语音与经过合成、转换或重放的欺骗语音,旨在应对日益严峻的深度伪造语音威胁。ASVspoof2021_LA作为ASVspoof2021挑战赛的评估子集,不仅延续了2019年版本的技术路线,更引入了现实电话编解码与传输条件,显著提升了任务的真实性与复杂度。该数据集共包含181,566条测试样本,其中真实样本18,452条,欺骗样本163,114条,已成为语音防伪与音频深度伪造检测领域最重要的基准数据集之一,其影响力广泛渗透于生物特征识别、信息安全与司法鉴定等交叉学科。
当前挑战
数据集所应对的领域挑战主要源于语音欺骗技术的迅猛演进,包括基于生成对抗网络和神经声码器的高保真合成语音,以及经过不同类型电话编解码器(如alaw)和网络传输条件(如ita_tx)损害的音频,这些因素使得传统防伪特征在跨域场景下难以保持鲁棒性。构建过程中的挑战则体现为音频编码兼容性问题:原始ASVspoof2021文件采用标准libsndfile或soundfile解码器无法读取的特殊FLAC编码格式,因此设计团队必须对所有16 kHz单声道音频进行解码并重新编码为通用可读的FLAC格式。这一过程虽能保证PCM采样数据比特级无损,却增加了数据预处理的技术门槛与计算资源消耗。此外,数据集包含多阶段(eval/progress/hidden)分层结构,同时需维护utterance_id、speaker_id等细粒度元数据,对数据的组织规范性和协议一致性提出了严苛要求。
常用场景
经典使用场景
在语音安全与深度伪造检测领域,ASVspoof2021_LA数据集作为一项权威基准测试资源,为研究人员提供了评估语音反欺骗与合成语音检测算法的标准化平台。该数据集涵盖了逻辑接入场景下的真实语音与多种欺骗攻击样本,包括合成、转换及重放语音,并额外引入了电话编解码与传输失真条件,使得其成为检验模型在复杂信道环境下鲁棒性的经典测试集。研究者常将其用于二分类任务,即区分真实人类语音与欺骗性语音,从而推动自动说话人验证系统中的防御技术发展。
解决学术问题
该数据集着重解决了语音反欺骗领域中模型面对新型攻击与信道畸变时的泛化能力不足问题。传统的反欺骗模型往往在与训练数据分布相似的场景下表现优异,但面对未经见的攻击或编码失真时性能显著下降。ASVspoof2021_LA提供了包含多种最新攻击手段与真实传输条件的测试样本,使学术界能够系统性地评估和比较不同方法的抗干扰与抗攻击能力。其发布极大地促进了深度伪造语音检测技术的进步,为构建更可靠的说话人验证系统奠定了重要基准。
实际应用
在实际应用中,ASVspoof2021_LA数据集直接服务于语音生物识别系统的安全防护。金融机构、客服中心以及智能音箱等依赖语音交互的场景,均需部署高效的伪造语音检测模块以防止欺诈入侵。基于该数据集训练的模型可用于实时鉴定来电语音的真伪,有效拦截由合成或重放技术生成的冒充语音。此外,该数据集还应用于数字取证与语音证据的可信度评估,为司法与安全领域提供技术支撑。
数据集最近研究
最新研究方向
ASVspoof2021_LA数据集作为语音反欺骗与深度伪造检测领域的核心基准,当前研究聚焦于应对真实世界通信信道(如编解码与传输条件)对检测系统鲁棒性的挑战。前沿方向包括利用自监督预训练模型(如wav2vec 2.0)捕捉音频伪影的细微差异,以及融合多模态特征(语音与文本内容)提升泛化能力。伴随深度伪造音频事件频发,该数据集在推动可部署级反欺骗系统评估中意义深远,其包含的18万余条样本与多样化攻击类型(A01-A19)为衡量模型在复杂噪声环境下的性能提供了关键验证平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务