遇见数据集

InTheWild

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

In-the-Wild音频深度伪造数据集是一个专为语音反欺骗和合成语音检测任务设计的基准测试就绪数据集,由Müller等人在2022年的研究(arXiv:2203.16263)中提出,旨在评估音频深度伪造检测模型在真实世界条件下的跨域泛化能力。该数据集包含从公开来源收集的政治家和公众人物的真实语音(bonafide)与音频深度伪造(spoof)配对,用于二分类任务,总共有31,779个音频片段,其中19,963个为真实语音,11,816个为伪造语音。所有音频均为16 kHz单声道格式,以FLAC编码存储,并以规范的Parquet文件格式提供,包含四个字段:path(音频文件路径字符串)、audio(Audio(16000)对象)、label(分类标签,取值为bonafide或spoof)和notes(JSON字符串,包含唯一的utterance_id、speaker名称和源label字符串)。该数据集适用于音频分类任务,特别是作为跨域泛化基准,用于测试在实验室数据集(如ASVspoof)上训练的模型在真实场景中的性能。

The In-the-Wild Audio Deepfake Dataset is a benchmark-ready dataset designed for voice anti-spoofing and synthetic speech detection tasks. It was proposed by Müller et al. in 2022 (arXiv:2203.16263) to evaluate the cross-domain generalization capabilities of audio deepfake detection models under real-world conditions. The dataset contains bonafide (real) and spoof (audio deepfake) pairs collected from public sources of politicians and public figures for binary classification tasks, with a total of 31,779 audio clips, including 19,963 bonafide and 11,816 spoof clips. All audio is in 16 kHz mono format, encoded in FLAC, and provided in a standardized Parquet file format with four fields: path (audio file path string), audio (Audio(16000) object), label (classification label, with values bonafide or spoof), and notes (JSON string containing unique utterance_id, speaker name, and source label string). The dataset is suitable for audio classification tasks, particularly as a cross-domain generalization benchmark to test the performance of models trained on laboratory datasets (e.g., ASVspoof) in real-world scenarios.

创建时间:
2026-05-31
原始信息汇总

数据集概述

  • 数据集名称:In-the-Wild Audio Deepfake Dataset
  • 许可证:Apache License 2.0
  • 语言:英语
  • 任务类别:音频分类
  • 数据集规模:10K < n < 100K(共31,779个音频片段)
  • 相关论文:arXiv 2203.16263

数据集描述

In-the-Wild是一个用于语音反欺骗/合成语音检测的音频深度伪造数据集,旨在评估模型在跨域泛化场景下的性能。数据集包含政治家和公众人物的真实语音与音频深度伪造样本,所有样本均来自公开可用的来源。

任务与标签

  • 任务类型:二分类
    • bonafide(真实人类语音):19,963个片段
    • spoof(深度伪造语音):11,816个片段

数据格式

  • 音频格式:16 kHz单声道FLAC编码(16位PCM)
  • 数据文件:Parquet格式,包含4列:
    • path:字符串,音频文件路径
    • audioAudio(16000),音频数据
    • labelClassLabel[bonafide, spoof],类别标签
    • notes:JSON字符串,包含utterance_id(唯一标识)、speaker(说话人名称)、label(源标签字符串)

数据划分

数据集仅提供测试集(test split),数据文件路径为 data/test-*.parquet

引用

bibtex @inproceedings{muller2022does, title={Does Audio Deepfake Detection Generalize?}, author={M{"u}ller, Nicolas M and Czempin, Pavel and Dieckmann, Franziska and Froghyar, Adam and B{"o}ttinger, Konstantin}, booktitle={Interspeech}, year={2022} }

搜集汇总
数据集介绍
InTheWild 数据集图片
构建方式
In-the-Wild数据集旨在评估音频深度伪造检测模型的跨域泛化能力。研究者从公开渠道采集了政界与公众人物的真实语音及其对应的深度伪造音频,确保样本覆盖真实世界中的多样场景与未知攻击手段。数据构建过程中,所有音频被统一转换为16 kHz单声道FLAC格式(16-bit PCM),并配以规范的Parquet文件组织。每条记录包含音频路径、Audio对象、二分类标签(bonafide或spoof)以及含话语ID、说话者姓名和来源标签的JSON备注信息,为标准化评估奠定基础。该数据集共包含31,779个音频片段,其中真实语音19,963条,深度伪造音频11,816条。
特点
该数据集最显著的特点在于其真实世界异构性与跨域挑战性。样本全部源自现实环境中的公开媒体资源,而非实验室受控录制,因而包含背景噪声、录音质量差异以及多种未知伪造技术。这使得它成为验证模型对非训练域深度伪造音频检测能力的严苛基准。数据集以Apache 2.0许可证发布,便于学术研究,并已被用作语音反欺骗任务的权威排行榜测试集。此外,其简洁的Parquet格式与规范的Audio类型封装,大幅降低了数据加载与预处理门槛。
使用方法
该数据集已封装为可直接加载的HuggingFace数据集格式,用户可通过`load_dataset`快速读取其中的测试集(test-split)。模型需完成二分类任务:判定每个音频片段是否为深度伪造(spoof)或真实语音(bonafide)。推荐使用者首先加载数据并解析`audio`列获得波形与采样率(16 kHz),而后以`label`列为监督信号训练或评估分类网络。由于数据集专为跨域泛化测试设计,研究者宜在ASVspoof等实验室数据集上预训练模型,再在此数据上评测其真实场景鲁棒性,并依据分类准确率或等错误率(EER)进行性能对比。
背景与挑战
背景概述
InTheWild数据集由Nicolas M. Müller等研究者于2022年创建,旨在应对音频深度伪造检测领域中的跨域泛化挑战。该数据集聚焦于政治人物与公众人物的真实语音与深度伪造语音,涵盖31,779个16 kHz单声道音频片段,包括19,963个真实语音和11,816个伪造语音。作为新兴的基准测试资源,它填补了实验室数据集(如ASVspoof)与真实世界复杂场景之间的空白,推动了音频反欺骗技术从受控环境向开放场景的演进。数据集以Apache-2.0许可公开,为学术界和工业界提供了标准化的评估平台,其成果发表于Interspeech 2022,对音频安全领域产生了显著影响。
当前挑战
当前数据集面临的核心挑战在于跨域泛化能力的构建:实验室数据集训练出的模型在真实世界条件下表现不佳,亟需解决域偏移问题,例如环境噪声、录音设备差异及未知伪造算法的出现。构建过程中,数据收集面临伦理与法律挑战,公开来源的政治人物音频可能涉及隐私与授权问题;同时,需严格标注伪造类别与来源,确保样本多样性与平衡性,这要求人工审查与自动化验证相结合。此外,数据集规模相对有限(约3.2万样本),如何利用数据增强或迁移学习提升模型鲁棒性,仍是持续的研究难点。
常用场景
经典使用场景
In-the-Wild音频深度伪造数据集是语音反欺诈与合成语音检测领域的标杆性资源。该数据集聚焦于跨域泛化能力的评估,通过收集政界与公众人物的真实语音与深度伪造音频,构建了一个贴近真实世界的测试环境。研究人员通常将其作为基准测试集,用于评估模型在实验室条件之外、面对复杂真实场景时的鲁棒性。数据集的经典使用方式是将模型在ASVspoof等受控数据集上训练后,直接在该数据集上测试,以衡量其跨域迁移与泛化表现。
实际应用
在实际应用中,In-the-Wild数据集为音频深度伪造检测系统的落地提供了关键验证依据。该数据集模拟了真实社交媒体、新闻报道与公共演讲中的音频场景,从而帮助开发者评估和优化面向公众平台的反欺诈系统。政府部门、新闻机构与金融安全公司可基于该数据集测试其语音验证系统对伪造语音的识别能力,防范利用AI生成语音进行的诈骗、身份冒充与舆论操控。其应用场景覆盖了身份认证、语音助手安全、电话银行反欺诈及数字媒体可信度审查等多个领域,成为从实验室研究迈向现实部署的重要桥梁。
衍生相关工作
In-the-Wild数据集的发布催生了一系列经典后续工作。许多研究以此为评估基准,提出了多种提升跨域泛化能力的方案,如基于特征解耦、对抗训练与域自适应的方法。该数据集常与AASIST、RawNet等前端模型结合,形成新的性能标杆。此外,该数据集是Deepfake Detection Challenge系列与Speech Deepfake Detection竞赛的重要参考,推动了音频反欺诈领域的标准化评测。围绕该数据集的衍生工作还包括对语音合成与转换算法鲁棒性的系统研究,以及大规模预训练模型在音频fake检测中的微调策略探索,形成了一个活跃的学术社区。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务