遇见数据集

VoxENES 2026

收藏
arXiv2026-07-13 更新2026-07-15 收录
官方服务:

资源简介:

VoxENES 2026是由南佛罗里达大学创建的现代双语语音欺骗检测基准数据集,旨在评估深度学习模型在LLM驱动的语音合成技术下的泛化能力。该数据集包含53,628个音频样本,涵盖英语和西班牙语,数据来源包括LibriSpeech和VoxPopuli的真实语音,以及10种当代TTS和VC系统生成的合成音频,并应用了10种标准化后处理增强以模拟真实传输条件。数据集的构建过程涉及真实语音标准化、多样化合成系统选择以及系统性后处理扰动。该数据集主要应用于音频深度伪造检测领域,旨在解决现有检测器因数据漂移问题而导致的泛化性能不足,为开发鲁棒的语音欺骗对抗措施提供实用测试平台。

VoxENES 2026 is a modern bilingual speech spoofing detection benchmark dataset developed by the University of South Florida, designed to evaluate the generalization capability of deep learning models against LLM-driven speech synthesis technologies. This dataset contains 53,628 audio samples encompassing English and Spanish, with data sources including authentic speech from LibriSpeech and VoxPopuli, as well as synthesized audio generated by 10 contemporary Text-to-Speech (TTS) and Voice Conversion (VC) systems. Ten standardized post-processing augmentations are applied to simulate real-world transmission conditions. The construction of this dataset involves authentic speech normalization, selection of diverse synthesis systems, and systematic post-processing perturbations. This dataset is primarily applied in the field of audio deepfake detection, aiming to address the insufficient generalization performance of existing detectors caused by data drift issues, and provide a practical testbed for developing robust anti-spoofing countermeasures against speech spoofing.

提供机构:
南佛罗里达大学
创建时间:
2026-07-13
原始信息汇总

数据集概述:VoxENES 2026

  • 名称:VoxENES 2026
  • 用途:用于评估针对现代LLM时代的文本转语音(TTS)和语音转换(VC)系统的音频深度伪造检测器。
  • 语言:双语(英语/西班牙语)
  • 规模:共 53,628 个音频样本
    • 真实语音(Bonafide):3,028 个样本
    • 原始合成样本:4,600 个样本(来自10种合成方法:7种TTS + 3种VC)
    • 增强变体:46,000 个样本(经过10种后处理条件下的增强)

数据结构

  • bonafide/english/ — 1,500个真实英语语音样本(来自LibriSpeech)
  • bonafide/spanish/ — 1,528个真实西班牙语语音样本(来自VoxPopuli)
  • tts/original/{method}/{language}/{fixed,random}/
  • tts/augmented/{method}/{language}/{fixed,random}/{augmentation}/
  • vc/original/{method}/{language}/
  • vc/augmented/{method}/{language}/{augmentation}/

合成系统

  • TTS(文本转语音):VoxCPM 1.5, Qwen3-TTS, GLM-TTS, FlashLabs Chroma, VibeVoice, CosyVoice 3, Chatterbox ML
  • VC(语音转换):Seed-VC, OpenVoice v2, RVC v2

增强处理

MP3 64k, AAC 128k, 白噪声(10/20 dB), 婴儿噪声(15 dB), 重采样(8k/16k), 速度扰动(0.9x/1.1x), 音量归一化

许可协议

  • 许可证类型:Attribution 4.0 International (CC BY 4.0)
  • 预期更新频率:未指定

其他信息

  • 标签:Audio, Linguistics, Audio Classification, Text-To-Speech, Speech Synthesis
  • 数据集 IDinterspeech_2712/voxenes-2026
  • 版本:Version 1(大小:23.33 GB,文件数:53.6k)
搜集汇总
数据集介绍
VoxENES 2026 数据集图片
构建方式
VoxENES 2026是一个面向LLM时代语音伪造检测的双语基准数据集,涵盖英语和西班牙语。其构建包含三大核心组件:真实语音、合成语音及后处理增强变体。真实语音从LibriSpeech和VoxPopuli语料库中分别抽取1,500条英语和1,528条西班牙语音频,统一标准化为16 kHz单声道WAV格式并裁剪或补零至4秒固定长度。合成语音由10种前沿LLM驱动方法生成,包括7种文本转语音系统(如VoxCPM 1.5、Qwen3-TTS、GLM-TTS等)和3种语音转换系统(Seed-VC、OpenVoice v2、RVC v2),涵盖自回归语言模型、流匹配、扩散模型及混合DiT等多种架构。每个原始合成样本进一步施加10种标准化后处理操作,包括MP3和AAC编解码压缩、白噪声和多人噪杂噪声添加、带宽下采样与恢复、播放速率变化以及响度归一化。最终数据集包含3,028条真实语音和50,600条合成语音(其中4,600条原始合成样本,46,000条增强样本),总计53,628条音频。
使用方法
VoxENES 2026可作为评估语音伪造检测器跨域泛化能力的标准化测试平台。研究者可直接下载数据集,采用推理模式加载已有预训练检测器权重,对包含真实与合成样本的音频进行二分类预测(真实或伪造),并计算等错误率和准确率作为性能指标。数据集已按固定4秒长度和16 kHz采样率标准化处理,无需额外预处理步骤。鉴于不同检测器的训练语料存在差异(如ASVspoof 2019、ASVspoof 2021、ASVspoof 5或VoxCeleb),EER值应解读为分布外泛化的相对指标而非严格单向对比。数据集官网提供了完整的样本划分和10种后处理类型的标注信息,便于研究者按需选择特定合成方法或扰动条件进行细粒度分析。该基准适用于开发面向数据漂移的鲁棒检测模型,并推动评估协议与快速演进的TTS和VC前沿保持同步。
背景与挑战
背景概述
在语音深度伪造检测领域,现有基准数据集大多基于2024年之前的语音合成系统构建,未能捕捉到以大型语言模型(LLM)驱动的现代文本转语音(TTS)与语音转换(VC)技术所产生的新型声学伪影。为弥合这一时间泛化鸿沟,南佛罗里达大学的Aastha Sharma与Guangjing Wang于2026年推出了VoxENES 2026数据集。该双语(英语和西班牙语)基准包含53,628条音频样本,覆盖10种当代语音合成方法,并系统模拟了10种标准后处理条件。其核心研究问题在于评估现有检测器面对LLM时代合成语音及现实传输扰动时的泛化能力。实验结果揭示了显著的性能降级,最佳模型仅达到28.98%的等错误率,表明该数据集为驱动鲁棒性语音欺骗对抗措施的研发提供了关键测试平台。
当前挑战
VoxENES 2026着力应对的核心挑战包括:1)领域问题层面,现有检测器过度依赖老旧基准中脆弱的合成伪影,而LLM驱动的TTS与VC系统产生的音频在声学特性上与前代截然不同,导致严重的数据漂移问题,使得许多预训练检测器在未微调的场景中表现近乎随机猜测;2)数据集构建层面,需从10种架构迥异的合成方法(涵盖自回归语言模型、流匹配、扩散模型及混合DiT)中生成双语音频,并协调不同系统的输出格式与说话人无关性,同时设计10种标准化后处理增强,以模拟编解码压缩、加性噪声、重采样及速度扰动等真实传输效应,从而确保基准能够可靠评估检测器在现实部署中的鲁棒性。
常用场景
经典使用场景
在语音防伪与深度伪造检测的学术疆域中,VoxENES 2026 被广泛用作衡量检测模型对现代大语言模型驱动的文本转语音与语音转换系统泛化能力的基准测试平台。经典使用场景包括对预训练检测器在不经微调的情况下进行零样本评估,模拟真实部署中遭遇未知生成器与多样化后处理扰动时的性能表现,从而揭示模型在时间分布偏移下的鲁棒性边际。
解决学术问题
该数据集精准回应了现有基准因依赖2024年前合成系统而产生的时态泛化缺口问题。传统检测模型在陈旧语料上表现优异,却在遭遇LLM时代的新颖生成管线与真实传输环境(如压缩编码、噪声混叠、重采样及速度扰动)时性能骤降。VoxENES 2026 系统性地揭示了检测器对脆弱人工痕迹的过度依赖,为研究数据漂移下模型失效机制及推动鲁棒防伪对策发展提供了关键的实验载体。
实际应用
在现实应用中,VoxENES 2026 为语音生物认证系统、声纹支付平台以及语音助手的欺诈防护模块提供了严苛的鲁棒性测试环境。通过模拟网络传输中的有损编解码、背景噪声干扰及变速播放等常见操作,该数据集帮助安全方案提供商评估并改进其检测系统在复杂信道条件下的实际防护能力,从而筑牢声音证据可信度与身份验证安全性的最后防线。
数据集最近研究
最新研究方向
随着大语言模型驱动的文本转语音(TTS)与语音转换(VC)技术的飞速迭代,传统语音伪造检测基准因生成器代际差异而面临严峻的时间泛化鸿沟。VoxENES 2026作为一项双语音频深度伪造检测基准,整合了十种2025年前后的先进合成方法及十种标准化后处理条件,系统揭示了现有检测器在应对真实世界分布偏移时的脆弱性。研究显示,即便性能最优的模型在整体等错误率上也仅达28.98%,多数检测器表现接近甚至低于随机水平,暴露出它们过度依赖过时合成伪影的固有缺陷。这一发现不仅深刻回应了语音认证与音频证据可信度在深度伪造威胁下的迫切需求,还为推动面向部署环境的鲁棒反欺骗技术演进提供了关键的评估平台与方向指引。
相关研究论文
  • 1
    VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion南佛罗里达大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务