amharic-asr-benchmark
收藏资源简介:
Amharic ASR Benchmark 是一个用于评估开放语音识别模型在阿姆哈拉语(Ethiopian)上表现的标准测试集。该数据集由 Dataset.ET 发布,包含 1,548 个音频片段,总时长为 4.72 小时。每个片段对应一个确定的标签(转录文本),这些标签由贡献者朗读句子时产生,确保了参考文本的准确性。数据集采用说话人独立的切分方式,确保同一说话人的声音不会出现在不同切分中。该测试集主要用于公正地比较不同 ASR 模型在低资源语言阿姆哈拉语上的性能,支持自动语音识别(ASR)任务的评估。数据集的规模为 1K 到 10K 样本之间,语言为阿姆哈拉语(am),采用 CC-BY-4.0 许可证。
The Amharic ASR Benchmark is a standard test set for evaluating open speech recognition models on the Amharic (Ethiopian) language. Released by Dataset.ET, it contains 1,548 audio clips totaling 4.72 hours. Each clip has a corresponding transcription label, generated from sentences read by contributors, ensuring accurate reference text. The dataset uses a speaker-independent split to ensure that the same speaker’s voice does not appear in different splits. It is primarily used for fair comparison of different ASR models on the low-resource language Amharic, supporting automatic speech recognition (ASR) evaluation. The dataset size ranges from 1K to 10K samples, the language is Amharic (am), and it is licensed under CC-BY-4.0.
Amharic ASR Benchmark 数据集总结
基本概述
- 数据集名称:Amharic ASR Benchmark
- 许可证:CC-BY-4.0
- 语言:阿姆哈拉语 (Amharic)
- 任务类型:自动语音识别 (ASR)
- 规模:1,000 至 10,000 条样本
- 核心规模:1,548 条音频,总时长 4.72 小时
- 发布机构:Dataset.ET (https://dataset.et)
数据特点
标签确定性
- 标注者先看到句子再朗读录音,参考文本先于音频存在,标签可信度高
- 与多数基于听写转录的基准不同,有效避免了转录本身的错误干扰
分割策略
- 说话者不重叠分割(speaker-disjoint splits),同一说话者的语音不会出现在多个数据子集中
输出透明
- 所有模型的原始转录结果均公开,覆盖全部 1,548 条音频
- 支持用户独立验证和重新评估
评估范围与结论
该基准对 16 个开源语音识别模型进行了系统评估,结果分为三类:
1. 干净模型 (Clean):发布于测试集创建之前或确认未使用该数据训练。此类中表现最好的模型 CER 为 0.0924,WER 为 0.2873,且前两名在统计上无显著差异。
2. 使用本数据集训练的模型:合法披露训练数据来源,因测试集与其训练数据来自同一语料库,所以与干净模型不具可比性。此类表现最佳模型 WER 为 0.1852,相对干净模型最优结果降低了 35%。
3. 未披露训练数据的模型:发布于测试集之后且未完整列举训练数据,无法验证数据污染情况,因此不参与与其他类别的排名比较。
核心发现:架构并非当前阿姆哈拉语语音识别的瓶颈,数据质量与规模才是。
局限性说明
- 评测集中于单一领域(朗读式语音),不适用于自发语音场景,自发语音上的模型间差异约为朗读语音的三倍
- 测试集已公开,后续发布的模型可能已接触过测试数据
- 解码方式为贪心解码,所有指标仅为下限估计
派生资源
数据集内附带预剪枝的阿姆哈拉语 5-gram 语言模型文件(kenlm/ 目录),可将最优模型的 WER 从 28.45% 降至约 24.83%,其中最小的 538 MB 剪枝版本与原始的 17 GB 未剪枝版本性能几乎一致。使用示例:
python from huggingface_hub import hf_hub_download from pyctcdecode import build_ctcdecoder
lm = hf_hub_download("snapwre/amharic-asr-benchmark", "kenlm/am-5gram-aggressive.bin", repo_type="dataset") decoder = build_ctcdecoder(labels, lm, alpha=0.3, beta=1.5)
引用信息
bibtex @misc{datasetet2026amharicasr, title = {Amharic ASR Benchmark: an evaluation of open speech models}, author = {Dataset.ET}, year = {2026}, url = {https://huggingface.co/datasets/snapwre/amharic-asr-benchmark} }




