遇见数据集

AT-ADD

收藏
arXiv2026-08-25 更新2026-08-26 收录
数据链接:
官方服务:

资源简介:

AT-ADD是由中国传媒大学、蚂蚁集团等机构联合构建的大规模全类型音频深度伪造检测基准,旨在评估鲁棒语音检测与跨类型泛化能力。该数据集包含两个子集:Track 1含245,655条语音片段,覆盖47种生成模型和96种语言,并引入真实信道变化与信号扰动;Track 2含467,223条音频片段,涵盖语音、环境声音、歌声和音乐四种类型,涉及68种生成模型。数据基于公开资源、自采集录音及多范式生成模型(如声码器、神经编解码器、扩散模型)构建,并严格划分训练/开发/评估集。该基准服务于ACM Multimedia 2026挑战赛,旨在推动面向现实场景的鲁棒与通用音频伪造检测方法研究。

AT-ADD is a large-scale comprehensive audio deepfake detection benchmark jointly constructed by Communication University of China, Ant Group and other institutions, aiming to evaluate robust speech detection and cross-type generalization capabilities. The dataset includes two subsets: Track 1 contains 245,655 speech segments, covering 47 generative models and 96 languages, with real channel variations and signal perturbations introduced; Track 2 contains 467,223 audio segments, covering four types: speech, environmental sounds, singing voices and music, involving 68 generative models. The dataset is built based on public resources, self-collected recordings and multi-paradigm generative models (such as vocoders, neural codecs and diffusion models), and strictly splits the training, development and evaluation sets. This benchmark serves the ACM Multimedia 2026 Challenge, aiming to promote research on robust and general-purpose audio forgery detection methods for real-world scenarios.

创建时间:
2026-08-25
原始信息汇总

AT-ADD Challenge 数据集详情总结

数据集名称:AT-ADD Challenge(All-Type Audio Deepfake Detection Challenge)

所属会议:ACM Multimedia 2026

核心目标:针对音频生成模型带来的安全挑战,推动开发鲁棒、可泛化的音频深度伪造检测方法,覆盖现实场景与新兴音频伪造类型。

挑战赛道

  • Track 1:鲁棒语音深度伪造检测(Robust Speech Deepfake Detection)——聚焦现实条件下的鲁棒性,包括域偏移、声学失真及未见过的SOTA伪造方法。
  • Track 2:全类型音频深度伪造检测(All-Type Audio Deepfake Detection)——扩展至语音、环境声、歌声和音乐等异构音频类型,强调跨类型泛化与类型无关建模。

参与者任务:开发能够检测多种条件下、未知生成方法和多种音频类型中的深度伪造音视频的通用检测方法。

重要日期

  • 4月8日:数据集、基线代码和论文发布;进度评估阶段开启
  • 6月8日:最终评估阶段开启
  • 6月15日:最终排行榜冻结
  • 6月17日:提交元数据与技术报告
  • 6月25日:参与者论文提交截止
  • 7月16日:论文录用通知
  • 8月6日:Camera-Ready论文提交截止

奖励:三篇优秀技术方案论文(Track 1第一名、Track 2第一名、最佳方案)将被推荐至ACM MM 2026主会议论文集。

联系方式

  • 组织咨询:Haonan Cheng(haonancheng@cuc.edu.cn)、Jiayi Zhou(zjy326112@antgroup.com)
  • 技术问题:Yuankun Xie(xieyuankun@cuc.edu.cn)、Tao Wang(mengyu.wt@antgroup.com)

补充信息:页面提供官方论文、基线代码、赛道注册入口及Codabench比赛平台链接,具体访问路径可参见原页面“Quick Access”部分。

搜集汇总
数据集介绍
AT-ADD 数据集图片
构建方式
AT-ADD数据集由两个子集构成,分别对应鲁棒语音伪造检测与全类型音频伪造检测。构筑过程严格遵循封闭设定,训练与开发数据均由组织者统一提供,禁止外部数据介入。语音子集覆盖96种语言、11,299位说话人,整合了多种公开语料与自采集录音,并施加以噪声、混响、重放、压缩、重采样及变速扰动等真实场景退化模拟。全类型子集则跨越语音、环境声、歌唱与音乐四类音域,广泛采纳各类生成模型产出虚假样本,并确保训练与评估阶段生成器与说话人身份互不重叠,以杜绝信息泄漏。
使用方法
该数据集为双轨挑战任务设计,支持两种评测范式。在Track 1中,参与者仅依托提供的语音样本训练判别模型,预测输入真伪,重点关注噪声、压缩及重放等现实失真下的鲁棒性。Track 2则要求模型在音频类型未知的条件下判断真假,涵盖语音、环境声、歌唱与音乐,考验类型无关的泛化能力。官方提供包含传统特征、自监督表示及音频大语言模型的多类基线,并设定统一的宏F1评测协议。参赛系统需遵循封闭规则,仅能利用发布数据,允许信号变换与模型融合,最终以类型加权与类别平衡的评估指标衡量性能,推动检测算法从理想化研究迈向实际多媒体取证领域。
背景与挑战
背景概述
音频深度伪造技术的迅猛发展,尤其是音频大语言模型(ALLMs)的出现,使得合成语音、环境声、歌声与音乐的真实性达到前所未有的高度,为多媒体内容安全带来严峻挑战。为弥合现有基准与真实部署场景之间的鸿沟,AT-ADD数据集由Yuankun Xie等来自中国传媒大学、蚂蚁集团、中国科学院及上海交通大学等机构的研究者于2026年构建,作为ACM Multimedia 2026大挑战赛的官方基准。该数据集创新性地设置双轨任务:Track 1聚焦鲁棒语音深度伪造检测,覆盖47种语音生成模型、11299位说话人与96种语言;Track 2拓展至全类型音频(语音、声音、歌声、音乐),涵盖68种生成模型,旨在推动通用且鲁棒的伪造音频检测技术发展。AT-ADD通过其规模、多类型覆盖与真实场景模拟,为音频取证领域树立了新的评测标杆。
当前挑战
AT-ADD所面临的核心挑战多维且交织。领域层面,现有检测方法高度依赖语音特定伪影,在面临未知生成器(如BigVGAN)、信道变化、噪声干扰、重放攻击及各类信号扰动时泛化能力严重不足;跨类型检测中,环境声、歌声与音乐的伪造特征差异显著,类型不可知场景下检测器难以捕捉共享的合成痕迹。基准构建过程中,大规模真实语音与合成音频的获取需协调多源数据(如AISHELL-3、LibriTTS-R)及数十种生成模型,确保说话人、语言与设备多样性并避免身份信息泄露;同时,模拟真实信道退化(如压缩、重采样、速度扰动)与重放效应的同时,需保持数据质量与标签一致性。评测结果揭示,尽管最优系统在Track 1与Track 2分别达到90.71%与96.10%的Macro-F1,但对BigVGAN等特定生成器的召回率仅约58%,语言资源稀缺性与重放场景下的鲁棒性仍为未解难题,凸显了面向实际部署的检测技术亟待突破的瓶颈。
常用场景
经典使用场景
AT-ADD数据集作为音频深度伪造检测领域的综合性基准,其经典使用场景聚焦于两大核心任务:鲁棒语音深度伪造检测与全类型音频深度伪造检测。在Track 1中,研究者利用该数据集评估检测模型在未知生成器、多样录音设备、复杂声学环境及信号扰动下的泛化能力,模拟真实世界域偏移条件。Track 2则要求模型在音频类型未知(语音、环境声、歌声、音乐)的情况下,实现类型无关的真伪判别。该数据集通过封闭式训练协议和统一的评估指标(宏F1)为不同方法论提供了公平比较的基础,成为检验检测系统稳健性与跨类型泛化能力的标准平台。
解决学术问题
AT-ADD数据集解决了现有音频深度伪造检测研究面临的三大关键学术问题:一是打破以语音为中心的单一检测范式,首次系统性覆盖语音、环境声、歌声与音乐四种异构音频类型,推动检测器从依赖语音特定伪影转向捕获跨类型的共性合成痕迹;二是弥补基准数据集与实际部署环境之间的鸿沟,通过引入多设备采集、信道退化、重放攻击等真实世界因素,促进模型超越浅层线索学习更具迁移性的取证表征;三是针对快速演进的生成范式(如音频大模型和神经编解码器驱动合成),提供包含47至68种生成器的评测集,有效评估检测器对未见生成技术的泛化能力。这些问题的解决显著推动了音频取证领域从理想化研究向实用化、强韧化方向转型,为后续算法设计提供了坚实的数据支撑和可复现的评估协议。
实际应用
AT-ADD数据集的实际应用场景广泛覆盖多媒体内容安全与司法取证领域。在内容审核平台中,检测系统需在语音、音乐、播客等多样化内容流中实时识别AI生成音频,该数据集的Track 2类型无关设计为构建通用音频鉴伪引擎提供了训练与验证基础。在社交媒体与新闻真实性核查中,Track 1的鲁棒性评估有效模拟了手机、车载系统等低质量录音条件,助力开发抗信道退化与重放攻击的取证工具,以应对虚假语音信息传播。此外,在智能语音助手与声纹认证系统中,AT-ADD的多样本生成器和多语言覆盖(96种语言)支持提升生物特征识别系统的安全防线,抵御语音克隆攻击。其封闭式协议和宏F1指标亦为工业级模型部署提供了性能基准,加速了从学术模型到可用产品的转化进程。
数据集最近研究
最新研究方向
前沿研究聚焦于构建面向真实场景的全类型音频深伪检测基准,以应对音频生成模型带来的安全挑战。AT-ADD数据集突破传统语音中心范式,覆盖语音、环境音、歌声与音乐四类音频,引入多设备、多语言、真实信道变化及未知生成器条件,推动检测模型从依赖特定伪影向学习本质性、跨类型可迁移的取证表征转变。近期研究以ACM Multimedia 2026挑战赛为落地场景,深入探究大尺度自监督表征、条件感知增强、多尺度推理及结构化融合在提升鲁棒性与跨类型泛化中的作用,并通过样本级分析揭示BigVGAN等生成器导致的性能瓶颈,为构建通用、稳健的音频取证系统提供了新的评估基准与优化方向。
相关研究论文
  • 1
    AT-ADD: A Benchmark and Challenge for Robust and All-Type Audio Deepfake Detection中国传媒大学; 蚂蚁集团; 中国科学院自动化研究所; 北京理工大学; 上海交通大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务