遇见数据集

amharic-asr-benchmark

收藏
Hugging Face2026-09-08 更新2026-09-09 收录
官方服务:

资源简介:

Amharic ASR Benchmark 是一个用于评估开放语音识别模型在阿姆哈拉语(Ethiopian)上表现的标准测试集。该数据集由 Dataset.ET 发布,包含 1,548 个音频片段,总时长为 4.72 小时。每个片段对应一个确定的标签(转录文本),这些标签由贡献者朗读句子时产生,确保了参考文本的准确性。数据集采用说话人独立的切分方式,确保同一说话人的声音不会出现在不同切分中。该测试集主要用于公正地比较不同 ASR 模型在低资源语言阿姆哈拉语上的性能,支持自动语音识别(ASR)任务的评估。数据集的规模为 1K 到 10K 样本之间,语言为阿姆哈拉语(am),采用 CC-BY-4.0 许可证。

The Amharic ASR Benchmark is a standard test set for evaluating open speech recognition models on the Amharic (Ethiopian) language. Released by Dataset.ET, it contains 1,548 audio clips totaling 4.72 hours. Each clip has a corresponding transcription label, generated from sentences read by contributors, ensuring accurate reference text. The dataset uses a speaker-independent split to ensure that the same speaker’s voice does not appear in different splits. It is primarily used for fair comparison of different ASR models on the low-resource language Amharic, supporting automatic speech recognition (ASR) evaluation. The dataset size ranges from 1K to 10K samples, the language is Amharic (am), and it is licensed under CC-BY-4.0.

创建时间:
2026-09-06
原始信息汇总

Amharic ASR Benchmark 数据集总结

基本概述

  • 数据集名称:Amharic ASR Benchmark
  • 许可证:CC-BY-4.0
  • 语言:阿姆哈拉语 (Amharic)
  • 任务类型:自动语音识别 (ASR)
  • 规模:1,000 至 10,000 条样本
  • 核心规模:1,548 条音频,总时长 4.72 小时
  • 发布机构:Dataset.ET (https://dataset.et)

数据特点

标签确定性

  • 标注者先看到句子再朗读录音,参考文本先于音频存在,标签可信度高
  • 与多数基于听写转录的基准不同,有效避免了转录本身的错误干扰

分割策略

  • 说话者不重叠分割(speaker-disjoint splits),同一说话者的语音不会出现在多个数据子集中

输出透明

  • 所有模型的原始转录结果均公开,覆盖全部 1,548 条音频
  • 支持用户独立验证和重新评估

评估范围与结论

该基准对 16 个开源语音识别模型进行了系统评估,结果分为三类:

1. 干净模型 (Clean):发布于测试集创建之前或确认未使用该数据训练。此类中表现最好的模型 CER 为 0.0924,WER 为 0.2873,且前两名在统计上无显著差异。

2. 使用本数据集训练的模型:合法披露训练数据来源,因测试集与其训练数据来自同一语料库,所以与干净模型不具可比性。此类表现最佳模型 WER 为 0.1852,相对干净模型最优结果降低了 35%。

3. 未披露训练数据的模型:发布于测试集之后且未完整列举训练数据,无法验证数据污染情况,因此不参与与其他类别的排名比较。

核心发现:架构并非当前阿姆哈拉语语音识别的瓶颈,数据质量与规模才是。

局限性说明

  • 评测集中于单一领域(朗读式语音),不适用于自发语音场景,自发语音上的模型间差异约为朗读语音的三倍
  • 测试集已公开,后续发布的模型可能已接触过测试数据
  • 解码方式为贪心解码,所有指标仅为下限估计

派生资源

数据集内附带预剪枝的阿姆哈拉语 5-gram 语言模型文件(kenlm/ 目录),可将最优模型的 WER 从 28.45% 降至约 24.83%,其中最小的 538 MB 剪枝版本与原始的 17 GB 未剪枝版本性能几乎一致。使用示例:

python from huggingface_hub import hf_hub_download from pyctcdecode import build_ctcdecoder

lm = hf_hub_download("snapwre/amharic-asr-benchmark", "kenlm/am-5gram-aggressive.bin", repo_type="dataset") decoder = build_ctcdecoder(labels, lm, alpha=0.3, beta=1.5)

引用信息

bibtex @misc{datasetet2026amharicasr, title = {Amharic ASR Benchmark: an evaluation of open speech models}, author = {Dataset.ET}, year = {2026}, url = {https://huggingface.co/datasets/snapwre/amharic-asr-benchmark} }

搜集汇总
数据集介绍
amharic-asr-benchmark 数据集图片
构建方式
本数据集专为低资源语言阿姆哈拉语构建,旨在公正评估开源语音识别模型。其构建基于一个包含1,548条音频片段、总时长4.72小时的测试集,每个片段均有确切的文本标签。构建过程严格遵循说话人互斥分割原则,确保测试集与训练集无重叠。为保障评估的纯净性,数据集将所有待评模型依据其训练数据的公开性划分为三组:在测试集发布前已存在或明确未使用该训练集的模型归为'干净'类;明确使用相关语料训练的模型单独归类;而训练数据不公开的模型则归为'未披露'类,以杜绝潜在的数据污染风险。
特点
该数据集的核心特点在于其严谨的统计方法和透明的评估流程。所有模型在同一批1,548条片段上评分,并提供95%置信区间,通过配对bootstrap检验(2,000次重采样)确保差异的显著性判断。此外,数据集发布了每个模型的完整逐句转录结果,任何人都可重新计算指标,实现可复现性。其标签设计尤为独特:参考文本在音频之前即存在,避免了转录者主观误差。同时,数据集附带了详细的失败日志和限制说明,并提供了经过剪枝的5-gram语言模型(最小为538MB),可供用户直接使用。
使用方法
本数据集主要用于离线基准测试,用户可克隆仓库后运行提供的脚本(如`bench_round2.py`)对模型进行评测,并通过`bootstrap_ci.py`计算置信区间。测试集与参考文本均公开,支持自定义重打分。此外,数据集内置了训练好的KenLM语言模型,可通过`huggingface_hub`下载并结合`pyctcdecode`在推理时使用,以降低词错误率。对于想要快速体验的用户,HuggingFace Space提供了在线演示无需安装即可测试。所有结果文件按轮次和运行ID组织,方便追溯和对比。
背景与挑战
背景概述
该数据集由Dataset.ET于2026年发布,旨在系统评估开源语音识别模型在阿姆哈拉语上的表现。阿姆哈拉语作为埃塞俄比亚的官方语言,属于低资源语言,其语音识别研究长期受限于数据匮乏与模型性能不均。该基准测试集包含1,548段音频,总计4.72小时,由志愿者朗读特定句子并公开全部假设输出,确保了标注的确定性。其核心研究问题在于客观比较16个模型的词错误率与字符错误率,并揭示架构、数据与训练策略对性能的影响。该数据集通过严格的去污染措施与配对自助法统计检验,为低资源语言ASR提供了可信的评估基准,其发布的影响力在于推动了对数据质量与领域适配的关注,尤其证实了额外训练数据对性能的显著提升。
当前挑战
该领域的核心挑战在于低资源语言的语音识别精确度不足,现有模型(包括Meta的多语言系统)在阿姆哈拉语上表现参差,部分模型甚至产生超过参考词数的错误。构建过程中,数据集的创建面临多重困难:确保测试集与训练数据的去污染,需对超过1,280万行文本进行精确与子串匹配以排除潜在污染;模型训练策略的透明度问题导致结果需按训练数据可见性分类,增加了评估的复杂性;此外,语言模型(n-gram)的整合虽能降低词错误率,却带来字符错误率上升的权衡,且大尺寸模型(17 GB)的部署成为实际应用障碍。统计上,需通过配对置信区间判别模型间差异,而部分模型的性能在复制实验中需保持一致,这对评估协议的严谨性提出了严苛要求。
常用场景
经典使用场景
Amharic ASR Benchmark 数据集专为评估低资源语言自动语音识别模型而设计,其核心应用场景在于对开放语音识别模型在阿姆哈拉语上的性能进行公正、可复现的基准测试。该数据集包含1,548个音频片段,总计4.72小时的语音数据,并附有精确的标签及详尽的统计信息。研究者可利用该数据集在统一条件下对多个模型进行横向对比,衡量其字符错误率(CER)与词错误率(WER),并辅以配对自助法(paired bootstrap)进行显著性检验,从而客观甄别模型间的真实性能差异。此基准框架尤其适用于验证新提出模型的泛化能力,或评估已有模型在跨领域数据上的鲁棒性。
衍生相关工作
该基准数据集催生了一系列后续研究。最为直接的是,数据集发布后出现的多款基于w2v-BERT 2.0架构的Ethio-ASR系列模型,它们利用snapwre/amharic-speech语料进行训练,并在该基准上取得了显著改进,其中结合语言模型后最佳WER从28.45%降至24.83%。此外,一个独立的佛罗里达大学技术报告(Boaz Tulu的研究)通过匹配步长与跨域实验,验证了将本数据集加入训练可带来超过10个百分点的WER相对降低,且该结果在本基准的独立复现中误差仅为0.04个百分点。这些工作不仅巩固了数据驱动的改进路径,还示范了跨团队结果复现的严谨流程。
数据集最近研究
最新研究方向
该数据集聚焦于评估开源语音识别模型在阿姆哈拉语这一低资源语言上的性能,揭示了当前模型在该语种识别上的瓶颈并非架构,而是训练数据的匮乏。最新研究通过发布包含1,548个音频片段、时长4.72小时的测试集,对16种模型进行了严格评估,并创新性地按训练数据是否重合将模型分为三类,以确保排行榜的可信度。研究结果凸显了数据增强对模型性能的显著提升,仅增加18.3小时数据便能将词错误率降低35%,同时指出下载量最高的XLSR-53模型实际效果与预期严重不符。此数据集亦附带肯尼语言模型,促使词错误率进一步下降,为阿姆哈拉语乃至非洲语言语音识别设立了透明、可复现的评测基准,推动了该领域向数据驱动、诚实评估的方向发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务