CFSDD
收藏资源简介:
CFSDD是一个针对电信诈骗场景的中文语音深度伪造基准数据集。与传统的语音深度伪造数据集不同,CFSDD从风险导向的角度设计,同时考虑声学真实性和语义意图。该数据集明确区分真实的良性语音和伪造的欺诈性语音,适用于研究真实电信诈骗条件下的语音深度伪造检测。数据集包含两类样本:真实的良性语音(来自MagicData-RAMC)和合成的欺诈性语音(文本来自TeleAntiFraud-28k)。数据集总时长为766小时,包含394,908条语音,663名说话人,平均每条语音时长为6.98秒,涉及10种TTS系统。数据集分为训练集、开发集和测试集,其中测试集进一步分为干净测试数据、噪声添加、噪声抑制和编解码处理四个子集,以模拟真实通话条件。
CFSDD is a Chinese speech deepfake benchmark dataset tailored for telecom fraud scenarios. Unlike traditional speech deepfake datasets, CFSDD is designed from a risk-oriented perspective, taking into account both acoustic authenticity and semantic intent. This dataset explicitly distinguishes between genuine benign speech and synthetic fraudulent speech, and is suitable for research on speech deepfake detection under realistic telecom fraud conditions. The dataset contains two categories of samples: genuine benign speech (from MagicData-RAMC) and synthetic fraudulent speech (with text sourced from TeleAntiFraud-28k). The total duration of the dataset is 766 hours, comprising 394,908 speech utterances from 663 speakers, with an average duration of 6.98 seconds per utterance, and covers 10 TTS systems. The dataset is partitioned into training, development, and test sets. Furthermore, the test set is further subdivided into four subsets: clean test data, noise addition, noise suppression, and codec processing, to simulate real-world telecommunication call conditions.
CFSDD数据集概述
数据集基本信息
- 数据集名称: CFSDD
- 许可证: Apache-2.0
- 主要语言: 中文 (zh)
- 标签: audio, text, speech-deepfake-detection, telecom-fraud
- 数据规模: 100K < n < 1M
数据集简介
CFSDD是一个面向电信诈骗场景的中文语音深度伪造检测基准数据集。与主要关注声学真实性的传统语音深度伪造数据集不同,CFSDD从风险导向的视角设计,同时考虑了声学真实性和语义意图。该基准明确区分了真实的良性语音和伪造的欺诈性语音,适用于研究真实电信诈骗条件下的语音深度伪造检测。
数据集包含两类样本:
- 真实良性语音: 具有良性语义内容的真实语音,源自MagicData-RAMC。
- 伪造欺诈语音: 具有欺诈内容的合成语音,其文本转录源自TeleAntiFraud-28k。
数据结构与组织
数据划分
数据集组织为三个划分:
train: 训练集dev: 开发集test: 测试集
test集聚合了四个评估子集:
test_clean: 干净测试数据test_noise: 噪声添加处理后的输出test_ns: 噪声抑制处理后的输出test_codec: 编解码处理后的输出
此组织遵循论文中描述的面向扰动的评估协议。干净的测试数据通过一个由噪声添加、噪声抑制和编解码处理组成的顺序流程进行扩展,以更好地逼近真实的语音通话条件。
模拟真实通话条件
为模拟真实通话条件,面向扰动的测试子集使用了以下外部资源:
噪声添加: Audioset, Freesound, RIR噪声抑制: DeepFilterNet编解码处理: Opus
数据集特征
数据文件格式
- 格式: Parquet
- 配置文件:
main
特征字段
key: 字符串类型,样本标识。audio: 音频类型,音频数据。text: 字符串类型,文本转录。file_path: 字符串类型,文件路径。speaker: 字符串类型,说话人标识。gender: 字符串类型,性别。method: 字符串类型,生成方法。label: 字符串类型,样本标签。
数据集统计信息
CFSDD总共包含766小时的语音,394,908条话语,663名说话人,平均话语时长为6.98秒,涉及10个TTS系统。训练集、开发集和测试集中的说话人严格不相交。有5个TTS系统出现在所有划分中,其余5个保留在测试集中,用于评估对未知生成器的泛化能力。
各划分详细统计
| 划分 | 时长 (小时) | 话语数量 | 说话人数量 | 系统数量 |
|---|---|---|---|---|
| Train | 139 | 74,737 | 300 | 5 |
| Dev | 49 | 25,893 | 100 | 5 |
| Test | 578 | 294,278 | 263 | 10 |
| Total | 766 | 394,908 | 663 | 10 |
分布信息
- 类别、性别和测试条件的分布情况。
- TTS系统和话语时长的分布情况。
使用示例
python from datasets import load_dataset ds = load_dataset("Izzyzlin/CFSDD", "main") train_ds = ds["train"] dev_ds = ds["dev"] test_ds = ds["test"]
致谢与引用
CFSDD建立在有价值的公共资源之上。如果使用此数据集,请考虑引用原始数据源以及用于构建伪造欺诈语音的TTS系统。
数据源
- MagicData-RAMC
- TeleAntiFraud-28k
TTS系统
- F5-TTS
- VoxCPM
- ZipVoice
- IndexTTS2
- Spark-TTS
- CosyVoice 3
- GLM-TTS
- Qwen3-TTS
- FireRedTTS-2
- Fish Audio S2




