遇见数据集

DECRO

收藏
Hugging Face2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

DECRO(eval)是DECRO(DEepfake CROss-lingual)数据集的评估分区,经过重新封装,可直接用于基准测试。该数据集是一个跨语言(英语和中文)的语音反欺骗或合成语音检测基准,源自WWW 2023会议论文《Transferring Audio Deepfake Detection Capability across Languages》。其核心设计是配对英语和中文子集,其中欺骗语音使用相同的合成算法生成,从而可以隔离语言对深度伪造检测的影响。数据集的任务是二分类:区分真实语音和欺骗语音(由TTS或语音转换系统生成的合成语音)。此版本包含了两个语言子集的评估集,合并为一个统一的测试集。数据总样本量为37,314条,其中真实语音10,415条,欺骗语音26,899条。具体而言,英语子集(en_eval)包含19,190条样本(4,306条真实,14,884条欺骗),中文子集(ch_eval)包含18,124条样本(6,109条真实,12,015条欺骗)。每个数据样本包含以下字段:path(唯一音频文件名,格式为<utterance_id>.flac)、audio(统一编码为16 kHz单声道FLAC格式的音频数据)、label(分类标签,bonafide表示真实,spoof表示欺骗)以及notes(一个JSON字符串,包含原始话语ID、语言、说话人ID和系统ID)。其中,系统ID标识了生成欺骗语音的具体算法(例如HiFiGAN、VITS)或真实语音的来源语料库。真实语音来源于ASVspoof2019 LA(英语)以及Aidatatang、Aishell等多个中文数据集;欺骗语音则来源于WaveFake、FAD以及多种TTS/VC系统(如Tacotron、FastSpeech2、StarGANv2-VC等)。数据集遵循Creative Commons Attribution 4.0 International (CC BY 4.0)许可协议。

DECRO (eval) is the evaluation partition of the DECRO (DEepfake CROss-lingual) dataset, repackaged for direct use in benchmarking. It serves as a cross-lingual (English and Chinese) speech anti-spoofing/synthetic speech detection benchmark, originating from the WWW 2023 conference paper Transferring Audio Deepfake Detection Capability across Languages. Its core design pairs English and Chinese subsets, where spoofed speech is generated using the same synthesis algorithms, enabling isolation of language impact on deepfake detection. The datasets task is binary classification: distinguishing between genuine (bonafide) and spoofed speech (synthetic speech generated by TTS/voice conversion systems). This version includes evaluation sets from both language subsets, merged into a unified test set. The total sample size is 37,314, with 10,415 bonafide and 26,899 spoofed samples. Specifically, the English subset (en_eval) contains 19,190 samples (4,306 bonafide, 14,884 spoofed), and the Chinese subset (ch_eval) contains 18,124 samples (6,109 bonafide, 12,015 spoofed). Each sample includes fields such as path (unique audio filename in <utterance_id>.flac format), audio (audio data uniformly encoded as 16 kHz mono FLAC), label (classification label, bonafide for genuine, spoof for spoofed), and notes (a JSON string containing original utterance ID, language, speaker ID, and system ID). The system ID identifies the specific algorithm used to generate spoofed speech (e.g., HiFiGAN, VITS) or the source corpus for bonafide speech. Bonafide speech is sourced from ASVspoof2019 LA (English) and multiple Chinese datasets like Aidatatang and Aishell; spoofed speech comes from WaveFake, FAD, and various TTS/VC systems (e.g., Tacotron, FastSpeech2, StarGANv2-VC). The dataset is licensed under the Creative Commons Attribution 4.0 International (CC BY 4.0) license.

创建时间:
2026-06-09
原始信息汇总

数据集简介

  • 名称:DECRO (eval)
  • 任务:音频分类(语音反欺骗/合成语音检测),二分类任务:真实语音(bonafide) vs 伪造语音(spoof)
  • 语言:英语 + 中文(跨语言)
  • 许可证:Creative Commons Attribution 4.0 International (CC BY 4.0)
  • 论文来源Transferring Audio Deepfake Detection Capability across Languages (TheWebConf / WWW 2023)
  • 原始数据仓库:https://github.com/petrichorwq/DECRO-dataset

数据规模与分布

统计项 数值
总样本数 37,314
真实语音(Bonafide) 10,415
伪造语音(Spoof) 26,899
英语子集(en_eval) 19,190(真实 4,306 / 伪造 14,884)
中文子集(ch_eval) 18,124(真实 6,109 / 伪造 12,015)

数据模式(Schema)

列名 类型 说明
path string <utterance_id>.flac,唯一标识
audio Audio(16000) 16 kHz 单声道 FLAC 格式
label ClassLabel "bonafide" (0) / "spoof" (1)
notes string JSON 格式,包含 utterance_id, language, speaker_id, system_id
  • 每条样本的 utterance_id 带有语言前缀(en_<stem>ch_<stem>),确保跨子集唯一。
  • system_id 表示伪造算法(如 hifigan, vits, baidu_en)或真实语音的来源语料库(如 asv19, aishell1)。

数据来源与处理

  • 真实语音来源
    • 英语:ASVspoof2019 LA
    • 中文:Aidatatang、Aishell、freeST、MagicData
  • 伪造语音来源:WaveFake、FAD 以及多种 TTS/VC 系统,包括 Tacotron、FastSpeech2、VITS、StarGANv2-VC、NVC-Net、HiFiGAN、MB-MelGAN、PWG、Baidu、Xunfei。
  • 音频处理:原始音频采样率不一(16 / 22.05 / 24 / 44.1 kHz),统一重编码为 16 kHz 单声道 FLAC。
  • 许可说明:基于原数据集 CC BY 4.0 许可重新分发,标签与评估协议未修改。

快速使用

python from datasets import load_dataset ds = load_dataset("SpeechAntiSpoofingBenchmarks/DECRO", split="test") print(ds[0])

评估与引用

  • 评估说明与提交格式:参见数据集中 submissions/README.md
  • 引用: bibtex @inproceedings{ba2023transferring, title = {Transferring Audio Deepfake Detection Capability across Languages}, author = {Ba, Zhongjie and Wen, Qing and Cheng, Peng and Wang, Yuwei and Lin, Feng and Lu, Li and Liu, Zhenguang}, booktitle = {Proceedings of the ACM Web Conference 2023 (WWW 23)}, year = {2023}, doi = {10.1145/3543507.3583222}, }

维护者

  • 联系邮箱:k.n.borodin@mtuci.ru
搜集汇总
数据集介绍
DECRO 数据集图片
构建方式
DECRO数据集源自WebConf 2023会议论文《Transferring Audio Deepfake Detection Capability across Languages》,旨在为跨语言语音反欺骗研究提供标准化基准。该数据集巧妙地将英语与中文子集配对,二者采用完全相同的合成算法生成欺骗语音,从而有效分离语言因素对深度伪造检测性能的影响。原始音频文件涵盖16kHz至44.1kHz多种采样率及FLOAT子类型WAV格式,为统一评估标准,本版本将所有音频解码并重新编码为规范的16kHz单声道FLAC格式。数据集的评估协议与标签保持不变,确保与原始研究完全兼容。
特点
DECRO数据集的核心特色在于其精心设计的跨语言对照结构,通过英语与中文子集共享同一套合成算法,使得研究者能够直接观察语言差异对检测模型泛化能力的影响。数据集共包含37,314个测试样本,其中真实语音10,415条,欺骗语音26,899条,英语与中文样本比例均衡。每个样本均提供音频路径、16kHz单声道FLAC音频、二分类标签(bonafide/spoof)以及包含详细元数据的JSON注释字段,涵盖语言标识、说话人ID和合成系统来源,为深入分析模型在不同条件下的表现提供了丰富信息。
使用方法
研究者可通过HuggingFace Datasets库便捷地加载DECRO数据集,仅需一行代码即可获取标准化测试分割:load_dataset('SpeechAntiSpoofingBenchmarks/DECRO', split='test')。数据集配备完整的评估协议与提交格式说明,存放于submissions目录下。值得注意的是,音频文件的关键标识符utterance_id已添加语言前缀(en_/ch_),以确保英语与中文子集中样本的唯一性,该前缀作为稳定的关联键。研究者可依据JSON注释中的system_id字段筛选特定合成系统的样本,或者根据language字段分别评估模型在英语与中文子集上的独立表现。
背景与挑战
背景概述
DECRO(DEepfake CROss-lingual)数据集由研究团队于2023年在ACM Web Conference(WWW 2023)上提出,旨在解决跨语言场景下音频深度伪造检测的泛化难题。该数据集由Zhongjie Ba、Qing Wen等研究人员构建,核心研究问题是探究语言差异对伪造语音检测性能的影响。通过精心设计,DECRO同时包含英语和中文两个子集,且两个子集中的伪造语音由完全相同的生成算法生成,从而在保持其他变量一致的前提下,孤立出语言这一关键因素。该数据集提供了完整的评估协议,包含37,314条测试样本,其中bonafide语音和spoof语音分别来自ASVspoof2019、Aidatatang等多个真实或合成语音库。DECRO的提出为音频深度伪造检测领域提供了一个标准化的跨语言基准,推动了模型在语言鲁棒性方面的评估与发展。
当前挑战
DECRO数据集主要应对两大挑战。首先是领域问题层面,音频深度伪造检测技术虽已取得显著进展,但现有方法常因训练数据与测试数据语言不匹配而导致检测性能严重下降;DECRO通过构建跨语言评估基准,专门检验模型在不同语言环境下的泛化能力,揭示了语言差异对检测瓶颈的深远影响。其次是构建过程中面临的数据标准化与版权合规挑战,原始音频来源多样,采样率从16 kHz至44.1 kHz不等,且部分为FLOAT子类型WAV文件,需统一重编码为16 kHz单声道FLAC格式以确保评估公平性;同时,数据需在遵守CC BY 4.0许可协议下重新分发,并保留上游数据集归属信息,这对数据清洗与再发布流程提出了严格的技术与法律要求。
常用场景
经典使用场景
DECRO数据集作为跨语种语音深度伪造检测的权威基准,经典使用场景聚焦于评估和对比不同音频伪造检测模型在英语与汉语上的泛化能力。该数据集通过将同一套语音合成算法(如HiFi-GAN、VITS等)生成的伪造语音分别应用于中英两种语言,巧妙分离了语言因素对检测性能的干扰。研究者常利用其统一的评估协议,在标准化的16kHz单声道音频格式下,训练二分类模型区分真实人声与伪造语音,从而检验模型能否在跨语言场景中保持稳定的检测精度。这一设计使其成为衡量音频反欺骗技术语言鲁棒性的首选测试平台。
实际应用
在实际应用中,DECRO数据集直接服务于多语种语音助手、跨国电信诈骗检测和数字媒体取证等场景。依托其提供的双语真实与伪造语音样本,安全厂商可训练出对语言不敏感的深度伪造检测模型,有效拦截利用不同语言生成的合成语音欺诈。例如,在跨国银行电话验证中,模型可同时防御英语和汉语的TTS攻击;在社交媒体平台,则能自动识别并标记使用不同语言配音的AI生成视频。这些应用显著提升了音频内容鉴伪的广度和可靠性,有力抵御了日益猖獗的跨语言语音伪造威胁。
衍生相关工作
基于DECRO数据集,衍生了一系列影响深远的经典工作。其中,原始论文(WWW 2023)首次系统论证了跨语言音频深度伪造检测的必要性,并提出了对抗性特征对齐方法以缓解语言差异。随后,研究者利用该数据集开发了语言自适应检测框架,通过域对抗训练或注意力机制强化语言不变表示学习。此外,DECRO还常被用于验证预训练语音模型(如Wav2Vec 2.0、HuBERT)在伪造检测任务上的跨语言迁移能力,催生了多项结合自监督学习与反欺骗技术的前沿探索。这些工作共同推动了音频防伪领域向更普适、更鲁棒的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务