CVoiceFake_small
收藏资源简介:
CVoiceFake (small) 是一个用于语音反欺骗和合成语音检测的多语言音频深度伪造数据集。该数据集基于 Mozilla CommonVoice 构建,通过对真实语音片段进行重新合成来生成匹配的伪造音频,形成一个二元分类基准:真实语音(bonafide)与伪造语音(spoof)。数据集包含德语、英语、法语、意大利语和中文五种语言。伪造音频部分由五种不同的合成系统生成,包括 Griffin-Lim、WORLD、Parallel WaveGAN、Multi-band MelGAN 和 Style MelGAN。数据集总计包含 138,136 个样本,其中真实样本 23,544 个,伪造样本 114,592 个,总时长约 218 小时。所有音频均为 16 kHz 单声道格式。数据集结构包含四个字段:音频文件路径、音频数据、二元分类标签以及包含语音ID、系统ID、语言和来源等信息的JSON格式备注。该数据集适用于音频分类任务,特别是音频深度伪造检测和反欺骗研究。
数据集概述:CVoiceFake (small)
CVoiceFake (small) 是一个多语言的音频深度伪造检测基准数据集,基于 Mozilla CommonVoice 构建,专门用于语音反欺骗(anti-spoofing)和合成语音检测任务。
核心信息
- 许可证: Creative Commons Attribution 4.0 International (CC BY 4.0)
- 语言: 德语 (de)、英语 (en)、法语 (fr)、意大利语 (it)、中文 (zh-CN)
- 任务类别: 音频分类(audio-classification)
- 数据集大小: 100,000 < n < 1,000,000 条样本
- 标签: 二分类(bonafide:真实语音;spoof:伪造语音)
- 引用论文: SafeEar: Content Privacy-Preserving Audio Deepfake Detection (arXiv 2409.09272)
数据构成
- 总样本数: 138,136 条
- 真实语音 (bonafide): 23,544 条
- 伪造语音 (spoof): 114,592 条
- 总时长: 约 218 小时
- 音频格式: 16 kHz 单声道 MP3
各语言数据分布
| 语言 | 真实语音 | 伪造语音 | 总计 |
|---|---|---|---|
| de | 7,251 | 36,064 | 43,315 |
| en | 4,315 | 21,438 | 25,753 |
| fr | 3,589 | 17,685 | 21,274 |
| it | 3,865 | 18,052 | 21,917 |
| zh-CN | 4,524 | 21,353 | 25,877 |
伪造语音来源
伪造语音由以下五种声码器(vocoder)对真实语音进行重新合成产生:
- Griffin-Lim(经典相位重建)
- WORLD(声码器)
- Parallel WaveGAN
- Multi-band MelGAN
- Style MelGAN
(注意:论文中提到的 DiffWave 系统不包含在此公开子集中。)
数据字段说明
| 字段 | 类型 | 描述 |
|---|---|---|
| path | string | 源相对路径,格式为 <语言>/<系统>/<文件>.mp3,唯一标识。 |
| audio | Audio(16kHz mono) | 嵌入的 MP3 音频字节,已转换为 16 kHz 单声道。 |
| label | ClassLabel[bonafide, spoof] | 标签:0 为真实语音,1 为伪造语音。 |
| notes | string (JSON) | 包含 utterance_id、system_id、language、source 的 JSON 信息。 |
数据来源
- 真实语音: Mozilla CommonVoice 项目中的语音片段。
- 伪造语音: 使用上述五种声码器对真实语音进行重新合成。
- 上游源: SafeEar 项目 Zenodo 记录 (11124319),项目页面:https://safeearweb.github.io/Project/
评测指标
主要评测指标为等错误率(EER, Equal Error Rate),覆盖全部 138,136 条样本。详见 eval.yaml 和 submissions/README.md。
快速加载
使用 Hugging Face Datasets 库即可加载:
python from datasets import load_dataset ds = load_dataset("SpeechAntiSpoofingBenchmarks/CVoiceFake_small", split="test")




