遇见数据集

CVoiceFake_small

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

CVoiceFake (small) 是一个用于语音反欺骗和合成语音检测的多语言音频深度伪造数据集。该数据集基于 Mozilla CommonVoice 构建,通过对真实语音片段进行重新合成来生成匹配的伪造音频,形成一个二元分类基准:真实语音(bonafide)与伪造语音(spoof)。数据集包含德语、英语、法语、意大利语和中文五种语言。伪造音频部分由五种不同的合成系统生成,包括 Griffin-Lim、WORLD、Parallel WaveGAN、Multi-band MelGAN 和 Style MelGAN。数据集总计包含 138,136 个样本,其中真实样本 23,544 个,伪造样本 114,592 个,总时长约 218 小时。所有音频均为 16 kHz 单声道格式。数据集结构包含四个字段:音频文件路径、音频数据、二元分类标签以及包含语音ID、系统ID、语言和来源等信息的JSON格式备注。该数据集适用于音频分类任务,特别是音频深度伪造检测和反欺骗研究。

创建时间:
2026-06-08
原始信息汇总

数据集概述:CVoiceFake (small)

CVoiceFake (small) 是一个多语言的音频深度伪造检测基准数据集,基于 Mozilla CommonVoice 构建,专门用于语音反欺骗(anti-spoofing)和合成语音检测任务。

核心信息

  • 许可证: Creative Commons Attribution 4.0 International (CC BY 4.0)
  • 语言: 德语 (de)、英语 (en)、法语 (fr)、意大利语 (it)、中文 (zh-CN)
  • 任务类别: 音频分类(audio-classification)
  • 数据集大小: 100,000 < n < 1,000,000 条样本
  • 标签: 二分类(bonafide:真实语音;spoof:伪造语音)
  • 引用论文: SafeEar: Content Privacy-Preserving Audio Deepfake Detection (arXiv 2409.09272)

数据构成

  • 总样本数: 138,136 条
  • 真实语音 (bonafide): 23,544 条
  • 伪造语音 (spoof): 114,592 条
  • 总时长: 约 218 小时
  • 音频格式: 16 kHz 单声道 MP3

各语言数据分布

语言 真实语音 伪造语音 总计
de 7,251 36,064 43,315
en 4,315 21,438 25,753
fr 3,589 17,685 21,274
it 3,865 18,052 21,917
zh-CN 4,524 21,353 25,877

伪造语音来源

伪造语音由以下五种声码器(vocoder)对真实语音进行重新合成产生:

  • Griffin-Lim(经典相位重建)
  • WORLD(声码器)
  • Parallel WaveGAN
  • Multi-band MelGAN
  • Style MelGAN

(注意:论文中提到的 DiffWave 系统不包含在此公开子集中。)

数据字段说明

字段 类型 描述
path string 源相对路径,格式为 <语言>/<系统>/<文件>.mp3,唯一标识。
audio Audio(16kHz mono) 嵌入的 MP3 音频字节,已转换为 16 kHz 单声道。
label ClassLabel[bonafide, spoof] 标签:0 为真实语音,1 为伪造语音。
notes string (JSON) 包含 utterance_idsystem_idlanguagesource 的 JSON 信息。

数据来源

  • 真实语音: Mozilla CommonVoice 项目中的语音片段。
  • 伪造语音: 使用上述五种声码器对真实语音进行重新合成。
  • 上游源: SafeEar 项目 Zenodo 记录 (11124319),项目页面:https://safeearweb.github.io/Project/

评测指标

主要评测指标为等错误率(EER, Equal Error Rate),覆盖全部 138,136 条样本。详见 eval.yamlsubmissions/README.md

快速加载

使用 Hugging Face Datasets 库即可加载:

python from datasets import load_dataset ds = load_dataset("SpeechAntiSpoofingBenchmarks/CVoiceFake_small", split="test")

搜集汇总
数据集介绍
CVoiceFake_small 数据集图片
构建方式
CVoiceFake_small数据集基于Mozilla CommonVoice语料库构建,通过将真实语音片段送入五种声码器进行重合成,生成对应的伪造音频。这五种系统包括Griffin-Lim、WORLD、Parallel WaveGAN、Multi-band MelGAN以及Style MelGAN,每种系统均作用于相同的真实语音样本,构成一一匹配的伪造样本对。该公开子集从完整数据集中随机抽取约10%的样本,涵盖德语、英语、法语、意大利语和中文五种语言,共计138,136条音频,其中真实样本23,544条,伪造样本114,592条,总时长约218小时。
特点
该数据集专为音频深度伪造检测与语音反欺骗任务设计,呈现为二元分类基准:真实语音与伪造语音。其独特之处在于,伪造样本由多种经典与现代声码器技术生成,覆盖面广且质量各异,为模型泛化能力评估提供了丰富挑战。数据集采用16kHz单声道格式,每条音频均附带详尽的元数据注释,包括话语ID、声码器系统、语言及来源信息,便于细粒度分析和系统级比较。此外,该子集已封装为HuggingFace标准格式,可直接用于基准测试与模型评估。
使用方法
用户可通过HuggingFace的`datasets`库轻松加载该数据集,仅需一行代码:`ds = load_dataset('SpeechAntiSpoofingBenchmarks/CVoiceFake_small', split='test')`。加载后的数据包含四个字段:`path`为音频文件路径,`audio`为16kHz单声道音频张量,`label`为类别标签(bonafide=0, spoof=1),`notes`为JSON格式的元数据。推荐使用等错误率作为主要评估指标,数据集配套提供了`eval.yaml`评估配置文件和提交指南,便于研究人员在不同系统间进行公平对比与复现实验。
背景与挑战
背景概述
CVoiceFake_small数据集由李新峰、李凯、郑一帆、严晨、纪晓宇和徐文远等研究人员于2024年提出,作为SafeEar项目的一部分,发表于ACM CCS 2024会议。该数据集专注于多语种音频深度伪造检测,基于Mozilla CommonVoice语料库,通过五种声码器(Griffin-Lim、WORLD、Parallel WaveGAN、Multi-band MelGAN和Style MelGAN)对真实语音进行重合成,构建了包含德语、英语、法语、意大利语和中文五种语言的二分类基准测试集。数据集共138,136个样本,其中真实语音23,544条,伪造语音114,592条,总时长约218小时。作为音频反欺骗领域的重要资源,CVoiceFake_small为多语种场景下的语音伪造检测研究提供了标准化的测试平台,推动了内容隐私保护型深度伪造检测技术的发展。
当前挑战
CVoiceFake_small数据集所应对的领域挑战在于音频深度伪造的精准检测,特别是跨语言场景下对合成语音的识别能力。当前生成式语音合成技术日益成熟,传统检测方法难以有效区分真实语音与声码器重合成音频,亟需更具鲁棒性的检测方案。数据集构建过程中面临的挑战包括:确保多语种语料的覆盖度与平衡性,各语言真实性样本数量从3,589到7,251不等,导致类别分布不均衡;伪造语音由五种声码器生成,每种系统引入不同的声学伪影,增加了特征提取的复杂度;此外,数据集仅公开了约10%的子集(138,136条),大规模全量数据的缺失限制了模型训练的充分性,且DiffWave声码器未包含在内,可能影响检测系统对多样化伪造手段的泛化能力。
常用场景
经典使用场景
CVoiceFake_small作为多语种音频深度伪造检测领域的标准化基准数据集,其经典使用场景聚焦于语音反欺骗与合成语音鉴别任务。研究者通过该数据集构建二分类模型,区分真实的人类语音(bonafide)与经由不同声码器重新合成的欺骗语音(spoof)。数据集涵盖德语、英语、法语、意大利语和中文五种语言,共包含138,136条音轨,其中欺骗样本占据主导地位,因为每条真实语音分别通过Griffin-Lim、WORLD、Parallel WaveGAN、Multi-band MelGAN和Style MelGAN五种系统重新合成。这种精心设计的结构使得模型能够经受多种合成攻击的检验,从而在跨语言和跨合成方法的泛化能力上实现可靠评估。通常采用等错误率(EER)作为主要评价指标,以全面衡量检测系统的性能表现。
实际应用
在现实世界中,音频深度伪造检测技术的应用场景与日俱增,从关键辩论的声纹鉴权到金融电话交易的身份核验,无不依赖对合成语音的敏锐辨识。CVoiceFake_small以其多语言、多合成方法的特性,为开发通用型音频防伪系统提供了坚实的数据支撑。企业安全团队可以利用该数据集训练并评估其声纹识别系统在遭遇语音合成攻击时的鲁棒性,从而在呼叫中心、智能音箱和远程会议等高频交互场景中筑起第一道防线。内容审核平台与媒体取证机构亦可借助该数据集验证其自动检测工具在鉴别深度伪造音频(如虚假选举演讲、伪造新闻播放)方面的可靠性,确保在跨语言传播情境下依然维持高检出率。此外,基于该数据集的评测结果可用于指导在线社交平台部署实时语音鉴伪模块,有效遏制以合成语音为手段的社会工程诈骗与虚假信息扩散。
衍生相关工作
CVoiceFake_small源自SafeEar项目(arXiv 2409.09272),该项目在ACM CCS 2024上提出了一种保护内容隐私的音频深度伪造检测框架,为后续研究奠定了坚实的基础。该数据集作为SafeEar的公开子集,直接关联了刘子轩等人的创新工作,并激发了多篇围绕跨语言泛化性、轻量级检测模型和对抗性鲁棒性的延伸研究。例如,部分学者基于此数据集进一步探讨了在域偏移条件下(如噪声环境或解码损失场景)检测器的退化规律;另有一些工作则将其与其他基准集(如ASVspoof系列)联合使用,构建复合评测体系,以探索伪造线索的互补性与聚合策略。此外,数据集中的多声码器欺骗样本池为研究逐系统习得特征(system-specific patterns)提供了理想的实验平台,有力推动了端到端检测架构与传统手工特征融合方法的交叉验证,彰显了该场景在反欺骗领域的学术辐射力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务