遇见数据集

Dengevoice

收藏
Hugging Face2026-09-13 更新2026-09-14 收录
官方服务:

资源简介:

DengeVoice ASR Benchmark 是一个用于评估代码混合语音识别(ASR)引擎性能的基准测试数据集。该数据集包含在四种尼日利亚语言(伊博语、约鲁巴语、豪萨语和尼日利亚皮钦语)与英语混合的语音片段上,对三个 ASR 引擎(Sahara、Meta MMS 以及 NCAIR1 的 Whisper 微调模型)的测试结果。数据来源于 AfriSwitch 数据集(54 小时真实对话代码混合语音),每个语言选取了 30 个音频片段。数据集提供两个配置:detailed_scores 包含每条音频的详细 WER 分数(包括替换、插入、删除错误统计),summaries 提供各语言的平均 WER 等摘要统计。该数据集适用于 ASR 引擎对比分析、代码混合语音识别研究以及多语言 ASR 系统评估。

DengeVoice ASR Benchmark is a benchmark dataset for evaluating the performance of code-mixed speech recognition (ASR) engines. The dataset contains test results of three ASR engines (Sahara, Meta MMS, and NCAIR1s fine-tuned Whisper model) on speech segments mixing four Nigerian languages (Igbo, Yoruba, Hausa, and Nigerian Pidgin) with English. The data comes from the AfriSwitch dataset (54 hours of real conversational code-mixed speech), with 30 audio clips selected per language. The dataset provides two configurations: detailed_scores includes detailed WER scores (substitution, insertion, deletion error statistics) for each audio, and summaries provides summary statistics such as average WER per language. This dataset is suitable for ASR engine comparison analysis, code-mixed speech recognition research, and multilingual ASR system evaluation.

创建时间:
2026-09-12
原始信息汇总

DengeVoice ASR Benchmark — Code-Switched Nigerian Languages

数据集基本信息

  • 数据集地址:https://huggingface.co/datasets/ukeje71/Dengevoice
  • 许可证:MIT
  • 语言:伊博语(ig)、约鲁巴语(yo)、豪萨语(ha)、尼日利亚皮钦语(pcm)、英语(en)
  • 标签:speech-recognition、code-switching、nigerian-languages、asr-benchmark、sahara-codeswitch-challenge
  • 配置
    • detailed_scores:数据文件路径为 results/wer_scores_*.csv,划分方式为 train
    • summaries:数据文件路径为 results/wer_summary_*.csv,划分方式为 train

执行摘要

DengeVoice 旨在让公民通过自然说话方式报告公民投诉——将英语与本地语言混合,即人们实际交谈的方式。选择正确的 ASR 引擎对此至关重要:它决定公民的投诉是能被正确捕获还是被悄无声息地扭曲。

本报告对三种 ASR 引擎进行了基准测试:

  • Sahara(Intron)
  • Meta MMSmms-1b-all
  • NCAIR1 的语言特定 Whisper 微调模型(此处称为 NATLAS)

测试针对 DengeVoice 的四种核心语言(伊博语、约鲁巴语、豪萨语和尼日利亚皮钦语),每种语言与英语混合,各使用 30 个语码转换音频片段。

主要结果:Sahara 在所有四种测试语言中均取得了最低的词错误率(WER),确认其是 DengeVoice 正确的生产 ASR 选择。

数据集与语码混合背景

测试音频直接来自 intronhealth/AfriSwitch——一个 54 小时的公共基准,包含多种非洲语言的真实、对话式、语码转换语音。从该池中,每种语言抽取了 30 个片段进行测试。

数据集统计:

语言 小时数 话语数 平均切换点 总切换事件 语码混合指数(CMI)
伊博语 5.00 1,848 4.10 7,575 27.64
约鲁巴语 5.00 1,877 5.33 10,002 22.93
豪萨语 5.00 1,515 4.00 6,053 13.09
皮钦语 4.56 1,801 4.29 7,719 30.15

数据解读

  • 皮钦语具有最高的语码混合指数(30.15),意味着其涉及最重、最平衡的双向混合。即使如此复杂,Sahara 在此取得了最低错误率(26.66% WER)。
  • 豪萨语具有最低的 CMI(13.09),更接近简单语音,仅偶尔混入英语词汇,Sahara 在此也表现良好(31.18% WER)。
  • 约鲁巴语在混合强度上居中,但具有最高的平均切换点(5.33),这与所有测试模型在此表现最困难相符。

分语言错误分析

伊博语

Sahara 的错误主要是替换(248 次)而非插入(18 次),表明它通常知道说话时间和词语位置,即使偶尔猜错词汇,也优于凭空生成文本。相比之下,NCAIR1/Igbo-ASR 在相同片段上累积了 298 次插入错误,显示在面对混乱对话时倾向于过度生成源音频中不存在的词语。

约鲁巴语

所有模型在此表现最差,替换计数大幅上升(405 至 578)。约鲁巴语的声调变音符号和快速切换对所有当前语音模型构成明显障碍,而非仅暴露单一系统的缺陷。这是未来微调的必要领域。

豪萨语

豪萨语为 Sahara 提供了最干净的运行之一,插入错误仅 53 次。NATLAS 在此相比其伊博语和约鲁巴语得分也显著回升,表明开放模型在训练数据更接近测试分布时表现更好。

皮钦语

这产生了 Sahara 最强的整体结果,WER 为 26.66%。由于尼日利亚皮钦语以英语为词汇基础,其他模型不得不依赖代理适配器而非专用架构。Sahara 在此的成功归因于开箱即用的原生语言模式支持。

可复现性

所有脚本位于 scripts/ 目录:

脚本 用途
prepare_data.py 从 AfriSwitch 拉取某语言的测试片段和真实标签
transcribe_sahara.py 调用 DengeVoice 使用的实时 Sahara API 端点
transcribe_natlas.py 本地运行 NCAIR1 的每语言 Whisper 微调模型
transcribe_mms.py 本地运行 Meta 的 mms-1b-all
score_wer.py 计算 WER、CER 及与真实标签的错误分解

运行任意语言测试: bash python scripts/prepare_data.py --language <language> --n 30 python scripts/transcribe_sahara.py --language <language> python scripts/transcribe_natlas.py --language <language> python scripts/transcribe_mms.py --language <language> python scripts/score_wer.py --language <language>

搜集汇总
数据集介绍
Dengevoice 数据集图片
构建方式
在非洲语言语音识别领域,代码转换现象普遍存在于日常对话中,为DengeVoice公民投诉系统选取合适的ASR引擎至关重要。该基准测试的构建直接取材于intronhealth/AfriSwitch这一包含54小时真实对话式代码转换语音的公开数据集,从伊博语、约鲁巴语、豪萨语和尼日利亚皮钦语四个核心语言中各抽取30条音频片段,每条音频均混合英语。测试同时对比了Sahara、Meta MMS和NCAIR1的Whisper微调模型(NATLAS)三种ASR引擎,并通过scripts目录下的prepare_data.py、transcribe_sahara.py、transcribe_natlas.py、transcribe_mms.py以及score_wer.py脚本实现数据准备、转写和评分全流程的可复现。
特点
该数据集的核心特点在于对代码转换语音的精细量化与多维度误差分析。数据集提供了各语言的切换点平均数、切换事件总数和代码混合指数(CMI),揭示了不同语言的混合复杂度差异:皮钦语CMI最高(30.15),豪萨语最低(13.09)。基准测试不仅报告词错误率(WER),还细分了替换和插入错误类型,从而反映模型在识别语音边界和词汇生成方面的行为倾向。结果显示Sahara在所有四种语言中均取得最低WER,尤其在皮钦语上表现最优(26.66%),而约鲁巴语因声调变音符号和快速切换对所有模型均构成显著挑战。
使用方法
使用该数据集时,研究者可通过scripts目录下的脚本进行完整复现。首先运行prepare_data.py指定语言和样本数量(例如--language ig --n 30)从AfriSwitch拉取测试音频和真值标注。随后可依次运行transcribe_sahara.py、transcribe_natlas.py和transcribe_mms.py分别调用Sahara API、本地NATLAS微调模型和Meta MMS模型进行转写。最终通过score_wer.py计算WER、字符错误率(CER)及错误分解,从而系统评估不同ASR引擎在代码转换尼日利亚语言上的性能。
背景与挑战
背景概述
在全球化与本土化交织的语境下,尼日利亚民众日常交流呈现英语与本土语言频繁穿插的语码转换现象,传统语音识别系统难以准确处理此类混合语音。DengeVoice ASR基准测试于2024年前后由相关研究人员依托Intron Health发布的AfriSwitch语料库构建,针对伊博语、约鲁巴语、豪萨语及尼日利亚皮钦语四种核心语言,采集每种语言30条真实对话片段,系统评估Sahara、Meta MMS与NCAIR1语言专属Whisper微调模型三类引擎的识别性能,旨在为公民投诉语音平台筛选最优ASR方案,对非洲多语言语音处理领域具有重要基准参考价值。
当前挑战
该数据集所面对的领域问题在于语码转换语音识别的鲁棒性,即模型须在母语与英语高频交替、音系与句法边界模糊的条件下准确转写,而约鲁巴语声调附加符号与快速切换更令所有参测模型错误率显著攀升,构成当前语音技术的一大难关。构建过程中,真实对话的采集与转写需应对口语不流畅、方言变异及切换点标注一致性等难题,同时各ASR引擎接口差异与本地部署环境不一,亦增加了标准化评测的复杂度。
常用场景
经典使用场景
在面向尼日利亚多语言社会的语音交互系统构建中,DengeVoice数据集扮演着基准测评的关键角色。其经典使用场景集中于语码转换语音识别任务的评估,即在伊博语、约鲁巴语、豪萨语及尼日利亚皮钦语与英语自然混用的口语表达条件下,系统性地比较Sahara、Meta MMS与NCAIR1的Whisper微调模型等不同ASR引擎的识别性能。研究者借助AfriSwitch语料库中每语言30条真实对话片段,以词错误率为核心指标,揭示各引擎在插入、替换与遗漏错误上的差异化表现,为多语言混合语音识别提供了可复现的评测范式。
解决学术问题
该数据集直击多语言语音识别研究中的核心难题,即语码转换现象对声学建模与语言建模构成的严峻挑战。传统ASR系统在单一语言假设下运行,难以处理同一话轮内频繁的语言切换与借词现象,而DengeVoice通过量化代码混合指数与切换事件频次,为模型鲁棒性分析提供了精细的标注维度。其意义在于,将伊博语的高替换错误、约鲁巴语的声调附加符号困境以及皮钦语的英语词汇化特性纳入统一比较框架,填补了西非语言语码转换基准测试的空白,推动了包容性语音技术研究的发展。
衍生相关工作
以DengeVoice为评测基准,一系列衍生工作围绕非洲语码转换语音识别展开。AfriSwitch作为其核心音频来源,提供了54小时真实对话语音的公开基准,成为后续研究的基石。NCAIR1开发的各语言Whisper微调模型即NATLAS,在约鲁巴语与伊博语上暴露出过度生成倾向,催生了针对低资源语言的适配器优化研究。Meta MMS的mms-1b-all模型虽为大规模多语言方案,却在皮钦语等英语词汇化语言中需依赖代理适配器,由此激发了专用架构的设计探索。这些工作共同构成了非洲语音技术生态中相互参照、迭代演进的学术脉络。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务