WildASR
收藏资源简介:
WildASR是一个多语言(四种语言)诊断基准,用于在真实世界分布外(OOD)条件下系统、隔离地评估ASR的鲁棒性。所有源音频来自真实人类语音而非TTS生成数据。为了系统地隔离故障模式,我们将鲁棒性分解为三个维度:环境退化(where)、人口统计变化(who)和语言多样性(what)。我们观察到在部分/退化输入下存在大量、不均匀的鲁棒性失败和频繁的幻觉(未说出的)内容,对下游语音代理构成安全风险。
WildASR is a multilingual diagnostic benchmark dataset spanning four languages, designed to evaluate the robustness of Automatic Speech Recognition (ASR) under real-world out-of-distribution (OOD) conditions in a systematic and isolated manner. All source audio originates from real human speech, rather than data generated by Text-to-Speech (TTS) systems. To systematically isolate failure modes, we decompose robustness into three dimensions: environmental degradation (where), demographic variation (who), and linguistic diversity (what). We observe numerous and uneven robustness failures as well as frequent hallucinated (unspoken) content for partial or degraded inputs, which poses security risks to downstream speech agents.
WildASR 数据集概述
数据集简介
WildASR 是一个多语言(四种语言)的诊断性基准测试,旨在系统性地、通过因素隔离的方式评估自动语音识别(ASR)在真实世界分布外(OOD)条件下的鲁棒性。所有源音频均来自真实的人类语音,而非由TTS生成。为了系统地隔离故障模式,该基准将鲁棒性分解为三个维度:环境退化(何处)、人口统计偏移(何人)和语言多样性(内容)。研究观察到在部分/退化输入下存在巨大且不均衡的鲁棒性失败,以及频繁出现的幻觉(未说出)内容,这对下游语音代理构成了安全风险。
核心特性
- 数据来源:真实人类语音。
- 语言支持:四种语言。
- 评估维度:
- 环境退化:混响、远场、电话编解码器、噪声间隙、削波。
- 人口统计偏移:儿童、老年人、带口音的语音。
- 语言多样性:短话语、不完整音频、语码转换。
数据获取与格式
-
加载方式: python from datasets import load_dataset ds = load_dataset("bosonai/WildASR")
-
数据格式:使用与 HuggingFace 兼容的 Parquet 文件。
-
数据模式:
列名 类型 描述 audioAudio(sampling_rate=16000)WAV 音频字节 transcriptstring真实转录文本 audio_hash_idstring唯一样本标识符 durationfloat音频时长(秒) genderstring说话者性别 speaker_idstring说话者标识符 categorystringenvironment_degradation/demographic_shift/linguistic_diversitysubsetstring具体测试条件(如 fleurs_noise_gap)languagestring语言代码(如 en,zh,ja,ko)
评估框架
- 支持模型:涵盖本地部署与云端API模型,包括 Whisper、Qwen2-audio、Parakeet、GPT-4o Transcribe、Gemini、Deepgram、ElevenLabs Scribe、Qwen3-ASR-Flash 等。
- 评估流程:提供 Python 脚本和 Docker 容器两种方式进行评估。
- 输出结果:
- 每样本预测文件 (
*_results.jsonl):包含状态、唯一ID、真实文本、模型预测等。 - 聚合指标文件 (
*_metrics.json):包含整体评估指标。
- 每样本预测文件 (
- 核心指标:
- WER(词错误率):提供
qwen、cv17、seed_tts三种归一化方法。 - HER(幻觉错误率):使用 LLM 法官(默认 GPT-4o-mini)将预测分类为“幻觉错误”、“非幻觉错误”或“无错误”。
- WER(词错误率):提供
项目引用
bibtex @misc{wildasr2026, title = {Back to Basics: Revisiting ASR in the Age of Voice Agents}, author = {Geeyang Tay and Wentao Ma and Jaewon Lee and Yuzhi Tang and Daniel Lee and Weisu Yin and Dongming Shen and Yi Zhu and Mu Li and Alex Smola}, year = {2026}, note = {arXiv:TODO} }
许可协议
本项目采用 Apache License 2.0 许可。




