遇见数据集

DeepFense/SpeechFake

收藏
Hugging Face2025-12-27 更新2026-03-29 收录
官方服务:

资源简介:

--- license: apache-2.0 --- # SpeechFake Dataset Please use the download scripts from https://github.com/XIAOYixuan/AUDDT/tree/yixuan-dev to download and process the dataset. ``` chmod +x download/get_speechfake.sh ./download/get_speechfake.sh ``` ## Label Distribution The dataset is organized into four experiment types: ### baseline - **train_all**: 704,862 samples (spoof: 629,154, bonafide: 75,708) - **train_en**: 428,266 samples (spoof: 389,866, bonafide: 38,400) - **train_zh**: 276,596 samples (spoof: 239,288, bonafide: 37,308) - **test_all**: 346,313 samples (spoof: 309,065, bonafide: 37,248) - **test_en**: 208,655 samples (spoof: 189,455, bonafide: 19,200) - **test_zh**: 137,658 samples (spoof: 119,610, bonafide: 18,048) - **dev_all**: 117,463 samples (spoof: 104,845, bonafide: 12,618) - **dev_en**: 71,370 samples (spoof: 64,970, bonafide: 6,400) - **dev_zh**: 46,093 samples (spoof: 39,875, bonafide: 6,218) ### cross_generator - **train_TTS**: 276,422 samples (all spoof) - **train_VC**: 192,210 samples (all spoof) - **train_NV**: 160,522 samples (all spoof) - **test_TTS**: 132,733 samples (all spoof) - **test_VC**: 96,059 samples (all spoof) - **test_NV**: 80,273 samples (all spoof) - **dev_TTS**: 46,065 samples (all spoof) - **dev_VC**: 32,031 samples (all spoof) - **dev_NV**: 26,749 samples (all spoof) ### cross_lingual - **train**: 263,399 samples (spoof: 203,399, bonafide: 60,000) - **test**: 133,707 samples (spoof: 103,707, bonafide: 30,000) - **test_ko**: 85,228 samples (spoof: 82,728, bonafide: 2,500) - **test_zh**: 63,283 samples (spoof: 48,283, bonafide: 15,000) - **test_en**: 70,424 samples (spoof: 55,424, bonafide: 15,000) - **test_it**: 44,989 samples (spoof: 39,989, bonafide: 5,000) - **test_hu**: 44,981 samples (spoof: 39,981, bonafide: 5,000) - **test_id**: 44,904 samples (spoof: 39,936, bonafide: 4,968) - **test_es**: 48,868 samples (spoof: 43,868, bonafide: 5,000) - **test_gl**: 44,838 samples (spoof: 39,838, bonafide: 5,000) - **test_lv**: 37,784 samples (spoof: 32,845, bonafide: 4,939) - **test_fi**: 36,578 samples (spoof: 31,619, bonafide: 4,959) - **test_et**: 33,350 samples (spoof: 28,392, bonafide: 4,958) - **test_he**: 21,210 samples (spoof: 20,605, bonafide: 605) - **test_is**: 13,388 samples (spoof: 13,373, bonafide: 15) - **dev**: 44,563 samples (spoof: 34,563, bonafide: 10,000) ### cross_speaker - **train**: 34,305 samples (spoof: 27,734, bonafide: 6,571) - **test_overlap2**: 18,976 samples (spoof: 12,377, bonafide: 6,599) - **test_same_spk**: 20,470 samples (spoof: 13,871, bonafide: 6,599) - **test_overlap1**: 19,428 samples (spoof: 13,871, bonafide: 5,557) - **test_diff_spk**: 17,934 samples (spoof: 12,377, bonafide: 5,557) ## Data Attributes ``` ID path label dataset_name 0 0 Real/LibriTTS/train-clean-100/1841/150351/1841_150351_000026_000002.wav bonafide SpeechFake 1 1 Real/LibriTTS/train-clean-100/1116/132851/1116_132851_000040_000002.wav bonafide SpeechFake 2 2 Real/LibriTTS/train-clean-100/83/9960/83_9960_000022_000000.wav bonafide SpeechFake ``` ## How to Import ```python import pandas as pd # Example: Load baseline train_all split df = pd.read_parquet("baseline/train_all.parquet") print(df.head()) ```

--- 许可证:Apache-2.0 --- # SpeechFake数据集 请通过https://github.com/XIAOYixuan/AUDDT/tree/yixuan-dev提供的下载脚本完成该数据集的下载与预处理工作。 chmod +x download/get_speechfake.sh ./download/get_speechfake.sh ## 标签分布 该数据集按照四类实验场景进行组织: ### 基准实验 - **train_all**:704,862 个样本(伪造(spoof)样本:629,154,真实(bonafide)样本:75,708) - **train_en**:428,266 个样本(伪造样本:389,866,真实样本:38,400) - **train_zh**:276,596 个样本(伪造样本:239,288,真实样本:37,308) - **test_all**:346,313 个样本(伪造样本:309,065,真实样本:37,248) - **test_en**:208,655 个样本(伪造样本:189,455,真实样本:19,200) - **test_zh**:137,658 个样本(伪造样本:119,610,真实样本:18,048) - **dev_all**:117,463 个样本(伪造样本:104,845,真实样本:12,618) - **dev_en**:71,370 个样本(伪造样本:64,970,真实样本:6,400) - **dev_zh**:46,093 个样本(伪造样本:39,875,真实样本:6,218) ### 跨生成器实验 - **train_TTS**:276,422 个样本(全为伪造样本) - **train_VC**:192,210 个样本(全为伪造样本) - **train_NV**:160,522 个样本(全为伪造样本) - **test_TTS**:132,733 个样本(全为伪造样本) - **test_VC**:96,059 个样本(全为伪造样本) - **test_NV**:80,273 个样本(全为伪造样本) - **dev_TTS**:46,065 个样本(全为伪造样本) - **dev_VC**:32,031 个样本(全为伪造样本) - **dev_NV**:26,749 个样本(全为伪造样本) ### 跨语言实验 - **train**:263,399 个样本(伪造样本:203,399,真实样本:60,000) - **test**:133,707 个样本(伪造样本:103,707,真实样本:30,000) - **test_ko**:85,228 个样本(伪造样本:82,728,真实样本:2,500) - **test_zh**:63,283 个样本(伪造样本:48,283,真实样本:15,000) - **test_en**:70,424 个样本(伪造样本:55,424,真实样本:15,000) - **test_it**:44,989 个样本(伪造样本:39,989,真实样本:5,000) - **test_hu**:44,981 个样本(伪造样本:39,981,真实样本:5,000) - **test_id**:44,904 个样本(伪造样本:39,936,真实样本:4,968) - **test_es**:48,868 个样本(伪造样本:43,868,真实样本:5,000) - **test_gl**:44,838 个样本(伪造样本:39,838,真实样本:5,000) - **test_lv**:37,784 个样本(伪造样本:32,845,真实样本:4,939) - **test_fi**:36,578 个样本(伪造样本:31,619,真实样本:4,959) - **test_et**:33,350 个样本(伪造样本:28,392,真实样本:4,958) - **test_he**:21,210 个样本(伪造样本:20,605,真实样本:605) - **test_is**:13,388 个样本(伪造样本:13,373,真实样本:15) - **dev**:44,563 个样本(伪造样本:34,563,真实样本:10,000) ### 跨说话人实验 - **train**:34,305 个样本(伪造样本:27,734,真实样本:6,571) - **test_overlap2**:18,976 个样本(伪造样本:12,377,真实样本:6,599) - **test_same_spk**:20,470 个样本(伪造样本:13,871,真实样本:6,599) - **test_overlap1**:19,428 个样本(伪造样本:13,871,真实样本:5,557) - **test_diff_spk**:17,934 个样本(伪造样本:12,377,真实样本:5,557) ## 数据属性 ID path label dataset_name 0 0 Real/LibriTTS/train-clean-100/1841/150351/1841_150351_000026_000002.wav bonafide SpeechFake 1 1 Real/LibriTTS/train-clean-100/1116/132851/1116_132851_000040_000002.wav bonafide SpeechFake 2 2 Real/LibriTTS/train-clean-100/83/9960/83_9960_000022_000000.wav bonafide SpeechFake ## 数据集导入方式 python import pandas as pd # 示例:加载基准实验的train_all划分 df = pd.read_parquet("baseline/train_all.parquet") print(df.head())

提供机构:
DeepFense
二维码
社区交流群
二维码
科研交流群
商业服务