PyAra
收藏资源简介:
PyAra是一个俄语音频深度伪造检测基准数据集,专门用于音频反欺骗任务。该数据集包含二元分类任务,旨在区分真实的俄语人类录音(bonafide)与合成或转换语音(spoof)。伪造语音部分由五种不同的生成算法(alg_1至alg_5)产生。数据集总规模为201,778个音频样本,其中真实样本73,583个,伪造样本128,195个。所有音频均为16kHz单声道WAV格式,保持原始编码无重编码。数据模式包含四个字段:path(源相对路径,作为唯一标识符)、audio(16kHz音频数据)、label(分类标签:bonafide或spoof)以及notes(一个JSON字符串,包含utterance_id、algorithm、gender、age、length等元数据,其中utterance_id对应源文件名主干,在整个数据集中具有唯一性)。该数据集适用于音频分类、深度伪造检测、语音安全等研究领域,特别针对俄语语音的防欺骗算法开发和基准测试。数据集采用Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International许可证,仅限非商业用途。
数据集概述:PyAra — Russian Audio Deepfake Detection
- 任务类型:音频二分类(真实语音 vs. 深度伪造语音)
- 语言:俄语
- 许可证:CC BY-NC-SA 4.0(非商业用途)
- 数据集大小:约 20 万条(100K < n < 1M)
数据组成
- 总样本数:201,778
- 真实语音(Bonafide):73,583 条
- 伪造语音(Spoof):128,195 条
- 由 5 种生成算法产生:
- alg_1:46,505 条
- alg_2:10,065 条
- alg_3:11,165 条
- alg_4:25,412 条
- alg_5:35,048 条
- 由 5 种生成算法产生:
数据格式
- 音频:16 kHz 单声道 WAV(原始编码,无损嵌入)
- 数据列:
列名 类型 说明 path字符串 源相对路径(唯一) audioAudio(16000) 16 kHz 单声道音频 labelClassLabel "bonafide"(0) 或"spoof"(1)notes字符串 JSON 格式的元数据(含 utterance_id、algorithm、gender、age、length)
来源与引用
-
原始来源:PyAra 数据集(Kaggle:https://www.kaggle.com/datasets/alep079/pyara)
-
无关联学术论文
-
引用格式:
PyAra — Russian Audio Deepfake Detection dataset. https://www.kaggle.com/datasets/alep079/pyara
快速使用
python from datasets import load_dataset
ds = load_dataset("SpeechAntiSpoofingBenchmarks/PyAra", split="test") print(ds[0])
维护者
- Kirill Borodin
- 邮箱:kborodin.research@gmail.com(旧邮箱已废弃)
- Telegram:@korallll_ai




