遇见数据集

PyAra

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

PyAra是一个俄语音频深度伪造检测基准数据集,专门用于音频反欺骗任务。该数据集包含二元分类任务,旨在区分真实的俄语人类录音(bonafide)与合成或转换语音(spoof)。伪造语音部分由五种不同的生成算法(alg_1至alg_5)产生。数据集总规模为201,778个音频样本,其中真实样本73,583个,伪造样本128,195个。所有音频均为16kHz单声道WAV格式,保持原始编码无重编码。数据模式包含四个字段:path(源相对路径,作为唯一标识符)、audio(16kHz音频数据)、label(分类标签:bonafide或spoof)以及notes(一个JSON字符串,包含utterance_id、algorithm、gender、age、length等元数据,其中utterance_id对应源文件名主干,在整个数据集中具有唯一性)。该数据集适用于音频分类、深度伪造检测、语音安全等研究领域,特别针对俄语语音的防欺骗算法开发和基准测试。数据集采用Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International许可证,仅限非商业用途。

创建时间:
2026-06-11
原始信息汇总

数据集概述:PyAra — Russian Audio Deepfake Detection

  • 任务类型:音频二分类(真实语音 vs. 深度伪造语音)
  • 语言:俄语
  • 许可证:CC BY-NC-SA 4.0(非商业用途)
  • 数据集大小:约 20 万条(100K < n < 1M)

数据组成

  • 总样本数:201,778
  • 真实语音(Bonafide):73,583 条
  • 伪造语音(Spoof):128,195 条
    • 由 5 种生成算法产生:
      • alg_1:46,505 条
      • alg_2:10,065 条
      • alg_3:11,165 条
      • alg_4:25,412 条
      • alg_5:35,048 条

数据格式

  • 音频:16 kHz 单声道 WAV(原始编码,无损嵌入)
  • 数据列
    列名 类型 说明
    path 字符串 源相对路径(唯一)
    audio Audio(16000) 16 kHz 单声道音频
    label ClassLabel "bonafide" (0) 或 "spoof" (1)
    notes 字符串 JSON 格式的元数据(含 utterance_id、algorithm、gender、age、length)

来源与引用

  • 原始来源:PyAra 数据集(Kaggle:https://www.kaggle.com/datasets/alep079/pyara)

  • 无关联学术论文

  • 引用格式

    PyAra — Russian Audio Deepfake Detection dataset. https://www.kaggle.com/datasets/alep079/pyara

快速使用

python from datasets import load_dataset

ds = load_dataset("SpeechAntiSpoofingBenchmarks/PyAra", split="test") print(ds[0])

维护者

  • Kirill Borodin
  • 邮箱:kborodin.research@gmail.com(旧邮箱已废弃)
  • Telegram:@korallll_ai
搜集汇总
数据集介绍
PyAra 数据集图片
构建方式
PyAra数据集专为俄语语音深度伪造检测而设计,其构建基于一个二分类任务框架,将真实人类录音(bonafide)与通过五种不同生成算法(alg_1至alg_5)合成的语音(spoof)进行区分。数据来源为Kaggle平台上的原始PyAra数据集,经整理后以16 kHz单声道WAV格式无损嵌入,确保了音频的位精确性。每个样本均包含源相对路径、16 kHz音频张量、二元标签(0表示真实,1表示伪造)以及以JSON字符串形式存储的元数据,包括话语ID、算法标识、性别、年龄段和音频时长。数据集最终以Parquet格式分片存储于测试集中,共计201,778条样本,其中真实样本73,583条,伪造样本128,195条。
特点
PyAra数据集的核心特点在于其专注于俄语语音的深度伪造检测,填补了这一领域在非英语语言上的空白。伪造算法覆盖五种不同的生成技术,样本数量分布不均,从alg_2的10,065条到alg_1的46,505条,反映了不同算法在实际应用中的使用频率差异。数据集提供了丰富的元数据字段,允许研究者探索语音特征与伪造算法、说话人属性(性别、年龄段)之间的关系。此外,数据采用标准化的16 kHz单声道格式,便于直接加载至深度学习框架,并遵照CC BY-NC-SA 4.0许可协议发布,支持非商业用途的重新分发与改编。
使用方法
使用PyAra数据集时,研究者可通过Hugging Face的`datasets`库便捷加载:调用`load_dataset('SpeechAntiSpoofingBenchmarks/PyAra', split='test')`即可获取测试集。数据集的`audio`列可直接用于模型输入,`label`列作为监督信号,而`notes`列中的JSON元数据可辅助进行细粒度分析,如按算法类型评估模型性能。由于数据集仅提供测试划分,用户可自行从Kaggle源头获取完整数据以构建训练集。评估流程的详细说明和提交格式可在`submissions/README.md`中找到,便于参与基准测试。
背景与挑战
背景概述
PyAra是一个专注于俄语音频深度伪造检测的数据集,由Kirill Borodin主导维护,并由SpeechAntiSpoofingBenchmarks组织于近年发布。该数据集旨在应对语音伪造技术快速演进带来的安全威胁,核心研究问题聚焦于区分真实人类俄语录音与由五种不同算法生成的合成或转换语音。作为首批面向俄语语境的音频反欺骗基准资源,PyAra填补了非英语语言在语音深度伪造检测领域的空白,为多语种反欺骗研究提供了重要参考。该数据集包含超过20万条样本,涵盖真实语音与伪造语音的二元分类任务,对推动俄语语音安全系统的研发具有里程碑意义。
当前挑战
PyAra所解决的领域核心挑战在于音频深度伪造检测,即如何精确识别由生成模型(如语音合成、转换系统)制造的虚假语音,以防范其在社交工程、身份冒充等场景中的滥用。构建过程中,数据集面临多重挑战:首先,需收集大规模、多样化的真实俄语录音并确保标注一致性;其次,综合五种不同伪造算法生成逼真语音,覆盖多变的攻击模式;此外,需验证音频质量与版权合规性,最终在CC-BY-NC-SA许可下开放,平衡学术可用性与数据保护。这些挑战使得PyAra成为评估泛化伪造检测模型的关键基准。
常用场景
经典使用场景
PyAra数据集专为俄语语音深度伪造检测任务而设计,其核心应用场景是对抗性语音鉴伪研究。该数据集包含超过20万条音频样本,涵盖真人语音与五种不同算法生成的合成语音,为训练和评估二分类鉴伪模型提供了大规模、多算法的基准测试平台。研究者可以利用该数据集探索前端声学特征提取、后端分类器设计以及域泛化等关键问题,从而推动俄语环境下语音反欺骗技术的发展。
衍生相关工作
基于PyAra数据集,研究者已开展了多项衍生工作,包括构建轻量化鉴伪模型以实现边缘端部署、探索对抗训练以增强模型对未知伪造算法的防御能力,以及融合多模态特征(如音频与文本转录)进行联合检测。此外,该数据集还被用作评测基线,在语音反欺骗挑战赛中验证新型前端特征(如LFCC、CQCC)和后端评分策略的有效性。这些工作共同推动了俄语语音安全领域从数据驱动到鲁棒泛化的技术演进。
数据集最近研究
最新研究方向
PyAra数据集专注于俄语音频深度伪造检测这一前沿领域,依托超过20万条样本的规模,涵盖五种不同生成算法的虚假语音片段,为研究者和工程师提供了真实与合成语音的二元分类基准。在全球范围内,深度伪造技术的泛滥对信息安全与社会信任构成严峻挑战,而多语种、多算法的检测数据集尤为稀缺。PyAra的发布不仅填补了俄语环境下反欺骗研究的空白,更推动了多模态伪造检测技术向非英语领域的扩展。通过开源非商业许可与标准化的HuggingFace封装,该数据集正逐步成为跨语言音频安全领域的重要评测基石,助力构建更鲁棒、更通用的防伪识别系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务