遇见数据集

EmoFake_test

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

EmoFake Test是一个专门用于语音反欺骗和音频深度伪造检测的基准测试数据集,专注于情感语音的深度伪造检测任务。该数据集包含真实的情感语音样本(bonafide)以及经过情感转换处理的欺骗性语音样本(spoof),旨在评估模型在区分真实情感表达与伪造情感语音方面的能力。数据集总规模为17,500个样本,其中真实样本3,500个,欺骗样本14,000个。每个样本包含四个字段:音频文件名(path)、16kHz单声道的音频波形数据(audio)、二分类标签(label,指示样本为真实或欺骗)以及JSON格式的详细元数据(notes),其中记录了话语ID、说话人ID、情感类别、生成方法和子集划分等信息。数据集采用CC BY 4.0许可证,基于相关研究论文(arXiv:2211.05363)构建,适用于语音反欺骗模型评估、音频深度伪造检测算法开发以及情感语音合成安全性研究等场景。

EmoFake Test is a purpose-built benchmark dataset for speech anti-spoofing and audio deepfake detection, with a core focus on the task of emotional speech deepfake detection. This dataset encompasses both bona fide emotional speech samples and spoofed speech samples generated via emotional conversion, designed to evaluate models' capability to differentiate between genuine emotional expressions and forged emotional speech. The total size of the dataset is 17,500 samples, consisting of 3,500 bona fide samples and 14,000 spoofed samples. Each sample includes four fields: audio file path (path), 16kHz monaural audio waveform data (audio), binary classification label (label, which indicates whether the sample is bona fide or spoofed), and detailed JSON-formatted metadata (notes) that records information such as utterance ID, speaker ID, emotion category, generation method, and subset partitioning. The dataset is licensed under CC BY 4.0, constructed based on the relevant research paper (arXiv:2211.05363), and is applicable to scenarios such as speech anti-spoofing model evaluation, audio deepfake detection algorithm development, and safety research on emotional speech synthesis.

创建时间:
2026-06-15
搜集汇总
数据集介绍
EmoFake_test 数据集图片
构建方式
EmoFake_test数据集源于对情感语音深度伪造检测的研究需求,其构建旨在弥补传统反欺骗基准中情感维度的缺失。该测试集基于EmoFake原始数据,精心筛选出包含真实情感语音(bonafide)与经过情感转换的伪造样本(spoof)的音频片段。数据以Parquet格式组织,并配备了完整的元数据字段,涵盖音频路径、16kHz单声道波形、二分类标签(真实或伪造)以及详细注释信息,如话语ID、说话人ID、情感类别、伪造方法及数据子集,从而为用户提供了标准化的评估基准。
特点
该数据集共计17500条测试样本,其中真实样本3500条,伪造样本14000条,呈现出典型的类别不均衡特点,模拟现实场景中伪造样本占多数的分布。其核心特色在于聚焦情感语音领域,注释中明确标注了惊讶、愤怒等多种情感类别,使得研究者能够深入考察情感因素对反欺骗模型性能的影响。此外,数据集的音频均统一为16kHz单声道格式,降低了预处理复杂度,并兼容HuggingFace Datasets库的标准接口,便于直接加载与集成到现有流水线中。
使用方法
用户可通过HuggingFace Datasets库便捷调用该数据集:首先安装datasets库,随后使用load_dataset函数指定仓库名称'SpeechAntiSpoofingBenchmarks/EmoFake_test'并设定分割为'test',即可获取完整的测试集。返回的每个样本是一个字典,包含音频数组、采样率、标签及注释JSON字段。基于此,研究者可快速构建或评估音频分类模型,尤其适用于针对情感语音的反欺骗任务。数据集的CC BY 4.0许可协议为学术和商业应用提供了灵活的授权保障。
背景与挑战
背景概述
语音深度伪造检测(Audio Deepfake Detection)是近年来音频安全领域的重要研究方向,随着语音合成与转换技术的飞速发展,恶意伪造语音对身份验证、司法取证等应用构成了严峻威胁。EmoFake_test数据集由研究者Kirill Borodin等人于2022年前后提出,并基于论文《EmoFake: Emotional Speech Deepfake Detection》构建,旨在专门评估情感语音深度伪造的检测能力。该数据集包含17500条测试样本,其中真实情感语音(bonafide)3500条,通过情感转换生成的伪造语音(spoof)14000条,覆盖了多种情感类别。作为语音反欺骗领域的重要基准,EmoFake_test填补了情感维度下语音伪造检测研究的空白,为评估模型在情感语音场景下的泛化与鲁棒性提供了标准化测试集合,推动了音频反欺骗技术向更精细、更真实的应用场景迈进。
当前挑战
EmoFake_test数据集所解决的领域问题核心在于情感语音深度伪造检测中面临的挑战:传统反欺骗方法多采用中性语音训练,难以泛化至情感丰富的语音场景,而情感转换技术(如基于GAN的语音转换)能生成高度逼真的伪造样本,进一步模糊真伪边界。在构建过程中,数据集面临的重要挑战包括:其一,如何确保伪造语音的情感表达自然且与真实情感难以区分,需精细控制转换算法的参数与训练数据的情感标签一致性;其二,样本均衡性设计,尽管总样本数为17500条,但伪造与真实样本比例高达4:1,且情感类别分布(如惊喜、悲伤等)不均,易导致模型对少数类过拟合;其三,数据来源的多样性不足,所有样本源自有限的情感语音数据库,可能限制模型对未见说话人或情感风格的泛化能力。
常用场景
经典使用场景
EmoFake_test数据集专为语音反欺骗领域的音频深度伪造检测而设计,其经典使用场景聚焦于评估和提升模型对带有情感信息的合成语音的识别能力。该数据集包含3500条真实情感语音样本与14000条经由情感转换生成的伪造样本,为研究者提供了在情感维度上检验深度伪造检测系统鲁棒性的标准化测试平台。通过统一采样率为16kHz的单声道音频格式和明确的真伪标签,研究人员能够系统性地分析模型在面对情感化伪造攻击时的表现,从而推动语音安全技术的精细化发展。
实际应用
在实际应用中,EmoFake_test数据集为语音安全系统在情感交互场景中的部署提供了不可或缺的验证工具。例如,在智能语音助手、电话银行身份认证以及情感计算领域,攻击者可能利用情感转换技术生成具有高度欺骗性的伪造语音绕过现有检测机制。借助该数据集的测试能力,安全厂商和研究人员能够评估其反欺骗系统在情感化攻击下的实际表现,从而优化算法以应对真实世界中的多模态欺骗手段,保障用户语音身份认证系统的可靠性。
衍生相关工作
EmoFake_test数据集的发布催生了多项具有影响力的衍生研究工作。基于其106页的研究论文(arXiv:2211.05363),学界开始探索情感感知型深度伪造检测架构,例如将情感识别模块与反欺骗分类器进行联合训练以提升对情感化伪造的敏感性。此外,该数据集已被纳入SpeechAntiSpoofingBenchmarks标准化评测体系,成为对比不同反欺骗算法在情感维度性能的基准测试集,推动了诸如注意力机制增强模型和自监督预训练方法在情感语音伪造检测领域的创新应用。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务