遇见数据集

waxal-ethiopian-asr-v5

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

Waxal 埃塞俄比亚ASR语料库 v5(平衡、审计版)是一个精选的训练索引,基于 Google/WaxalNLP 数据集,覆盖五种埃塞俄比亚语言:阿姆哈拉语(am)、奥罗莫语(om)、提格里尼亚语(ti)、锡达马语(sid)和沃莱塔语(wal)。该索引包含总计 195,363 个音频片段,总时长 940.35 小时,每种语言约 190 小时,实现自然平衡。数据集包含以下内容:一个合并清单(train_all.jsonl,195,363 行)、每个语言的单独清单(train_{lang}.jsonl)、语言统计报告(dataset_v5_report.json,含片段数、时长、标记数、说话人数)以及教师假设目录(teacher_hypotheses/),其中包含基于 Ethio-ASR-600M 和 w2v-bert-2.0-uf 模型对 WAXAL 验证集的假设,可用于知识蒸馏。每条记录包含 16 个字段:lang(语言)、source(来源,固定为waxal)、split(分割,固定为train)、parquet_file(Parquet 文件路径)、row_idx(行索引,用于定位音频)、duration(秒)、text(原始文本)、text_normalized(规范化文本)、speaker_id(说话人ID)、audio_fp(音频指纹)、text_hash(文本哈希)、char_count(字符数)、token_est(估计词元数)、token_rate(词元率)、char_per_sec(每秒字符数)、quality_score(质量分数)、flags(质量标志)、leakage(泄漏标记)、duplicate_in_train(训练集内重复标记)。数据集经过严格的审计流程:规范归一化(NFC、标签剥离、大小写折叠、分隔符处理);保留集泄漏检测(确保规范化文本、音频、说话人与验证集和测试集无重叠,有泄漏的行被删除);精确音频重复检测(基于原始字节MD5)和规范化文本碰撞检测(重复项被删除);质量标志(时长异常、错误脚本、高词元率、高字符率、文本过短/过长等,仅标记不删除,供后续人工审核)。说话人ID被保留用于说话人分离检查。音频来源为 WAXAL(google/WaxalNLP),采用 CC-BY-SA-4.0 / CC-BY-4.0 许可。本仓库仅为精选的索引/清单,不托管音频文件,用户需通过 parquet_file 和 row_idx 定位器从 google/WaxalNLP 获取音频并生成 16kHz 单声道 WAV 文件。该数据集适用于自动语音识别(ASR)模型的训练、评估和知识蒸馏。

Waxal Ethiopian ASR Corpus v5 (Balanced, Audited) is a curated training index based on the Google/WaxalNLP dataset, covering five Ethiopian languages: Amharic (am), Oromo (om), Tigrinya (ti), Sidama (sid), and Wolaytta (wal). The index contains a total of 195,363 audio clips with a total duration of 940.35 hours, approximately 190 hours per language, achieving natural balance. The dataset includes: a merged manifest (train_all.jsonl, 195,363 lines), per-language manifests (train_{lang}.jsonl), a language statistics report (dataset_v5_report.json with clip count, duration, token count, speaker count), and a teacher hypotheses directory (teacher_hypotheses/) containing hypotheses on the WAXAL validation set based on Ethio-ASR-600M and w2v-bert-2.0-uf models, which can be used for knowledge distillation. Each record has 16 fields: lang, source (fixed as waxal), split (fixed as train), parquet_file, row_idx, duration (seconds), text, text_normalized, speaker_id, audio_fp, text_hash, char_count, token_est, token_rate, char_per_sec, quality_score, flags, leakage, and duplicate_in_train. The dataset underwent a rigorous audit process: canonical normalization (NFC, tag stripping, case folding, separator handling); held-out set leakage detection (ensuring normalized text, audio, and speakers do not overlap with validation and test sets, with leaked rows removed); exact audio deduplication (based on raw byte MD5) and normalized text collision detection (duplicates removed); quality flags (duration anomalies, wrong scripts, high token rate, high character rate, text too short/long, etc., flagged but not removed for manual review). Speaker IDs are retained for speaker separation checks. Audio source is WAXAL (google/WaxalNLP), licensed under CC-BY-SA-4.0 / CC-BY-4.0. This repository only contains curated indices/manifests, not audio files; users must use parquet_file and row_idx locators to fetch audio from google/WaxalNLP and generate 16kHz mono WAV files. The dataset is suitable for training, evaluation, and knowledge distillation of automatic speech recognition (ASR) models.

创建时间:
2026-08-25
原始信息汇总

WAXAL Ethiopian ASR Corpus v5(平衡、审计版)

这是一个针对五种埃塞俄比亚语言的自动语音识别(ASR)训练数据索引集,基于google/WaxalNLP完整训练集进行策划与审计。

数据集规模

  • 总音频片段:195,363条
  • 总时长:940.35小时
  • 语言平衡性:五种语言各约190小时,天然均衡

覆盖语言

  • 阿姆哈拉语(am)
  • 奥罗莫语(om)
  • 提格里尼亚语(ti)
  • 锡达马语(sid)
  • 沃莱塔语(wal)

数据内容

  • train/train_all.jsonl:合并清单(195,363行)
  • train/train_{am-ET,om-ET,ti-ET,sid-ET,wal-ET}.jsonl:各语言独立清单
  • dataset_v5_report.json:各语言统计信息(片段数、时长、标记数、说话人数)
  • teacher_hypotheses/:Ethio-ASR-600M与w2v-bert-2.0-uf模型在验证集上的伪标签(用于蒸馏)

数据行字段格式

每条记录包含:语言、来源、分割、parquet文件定位符、行索引、时长(秒)、原始文本、规范化文本、说话人ID、音频文件路径、文本哈希、字符数、token估计数、token速率、每秒字符数、质量评分、质量标记、泄漏标记、训练集中重复标记。

审计流程

  • 规范化处理:执行NFC标准化、标签移除、大小写折叠、分隔符处理
  • 泄漏检测:与验证集+测试集进行规范化文本/音频/说话人完全零重叠,任何泄漏行均被删除
  • 重复检测:通过原始字节MD5检测精确音频重复,并检测规范化文本冲突(均删除)
  • 质量标记:标记时长异常、错误字符集、token速率过高、字符速率过高、文本过短/过长(仅标记不删除,供人工筛查)
  • 说话人ID保留:支持说话人不重叠检查

来源与许可

  • 音频来源于WAXAL(google/WaxalNLP),遵循CC-BY-SA-4.0 / CC-BY-4.0许可
  • 本仓库仅为策划索引/清单,不包含音频字节,需通过parquet_file + row_idx定位符从google/WaxalNLP获取音频,并转换为16kHz单声道WAV格式
搜集汇总
数据集介绍
waxal-ethiopian-asr-v5 数据集图片
构建方式
本数据集为埃塞俄比亚五种语言(阿姆哈拉语、奥罗莫语、提格里尼亚语、锡达马语和沃莱塔语)的语音识别训练集,构建于WAXAL语料库的基础上。通过系统化的数据清洗流程,对原始音频进行规范化处理,包括Unicode标准化、标签剥离和大小写转换,并利用MD5哈希技术剔除重复音频,同时执行严格的泄漏检测,确保训练集与验证集、测试集在文本、音频和说话人维度上均无重叠。数据集以索引清单形式呈现,提供parquet文件定位符和行索引,而非直接存储音频字节,便于用户按需获取原始数据。
特点
该数据集兼具规模性与平衡性,总计195,363条音频片段,时长约940.35小时,每种语言约190小时,实现自然均衡。每条记录包含丰富的元数据,如时长、标准化文本、说话人ID、质量评分及异常标记,为后续人工审核和模型训练提供便利。数据质量经过多维度审计,包括时长异常、脚本错误、语速过快等标记,但不删除数据,保留原始完整性。此外,数据集附带教师模型假设,支持知识蒸馏研究。
使用方法
使用该数据集时,用户应依据manifest中的语言标识进行按需筛选,利用parquet_file和row_idx从google/WaxalNLP中提取对应音频,并将其转换为16kHz单声道WAV格式。数据集的索引文件便于整合入主流语音识别框架,如HuggingFace的datasets库,用户可加载manifest后使用map函数处理音频。对于质量要求较高的场景,可依据flags字段过滤低质量样本。数据集还适用于多语言语音识别、说话人验证等任务的模型训练与评估。
背景与挑战
背景概述
WAXAL Ethiopian ASR corpus v5是由WAXAL团队构建的平衡语音识别数据集,覆盖阿姆哈拉语、奥罗莫语、提格里尼亚语、锡达莫语和沃莱塔语五种埃塞俄比亚语言,总计约940小时、195,363条音频片段。该数据集于2023年发布,旨在解决低资源语言语音识别数据稀缺的问题,为埃塞俄比亚地区的自动语音识别(ASR)研究提供大规模、多语言、说话人均衡的基准资源。其构建依托于Google的WAXAL项目,通过严格的清洗、去重、泄漏检测和质量标注流程,确保数据的可靠性与可用性。该数据集显著推动了多语言ASR模型在非洲语言上的性能提升,为跨语言迁移学习、语音蒸馏研究提供了重要支撑,成为该领域具有影响力的开源资源。
当前挑战
该数据集面临的挑战主要涵盖领域问题和构建过程两方面。领域层面,埃塞俄比亚语种属于低资源语言,语音识别面临音素复杂度高、拼写变体多、方言差异大等难题,加之标注数据稀缺,模型泛化能力受限。构建过程中,团队需应对多语言数据收集的不均衡性,通过平衡采样实现自然均衡;同时要解决文本标准化、脚本错误、重复音频与文本、训练与验证集泄漏等问题,确保数据质量。此外,数据规模庞大,需设计高效的去重算法和泄漏检测策略,并保留质量标注供人工后续筛选,这要求构建流程具备高度自动化与可扩展性,以平衡成本与数据纯净度。
常用场景
经典使用场景
在自动语音识别(ASR)领域,WAXAL埃塞俄比亚语音语料库v5(平衡审计版)是构建多语言语音识别系统的经典基石。该数据集涵盖了阿姆哈拉语、奥罗莫语、提格里尼亚语、锡达马语和沃莱塔语五种埃塞俄比亚语言,总计超过940小时的高质量语音,且每种语言语音量自然平衡。研究人员常以此为基准,用于训练端到端或混合语音识别模型,评估跨语言泛化能力。其精细的标注格式(如音素时长、发言人ID)也使其成为研究语音时间对齐、说话人自适应等任务的标准语料。
解决学术问题
该数据集有效解决了低资源语言语音识别研究中数据稀缺且分布不均的核心难题。通过提供平衡的多语言语料,它支持了跨语言迁移学习、多任务学习及语音识别鲁棒性的系统性探究。其严格的审计流程(如泄漏检测、重复剔除)保障了实验评估的可靠性,克服了以往数据集中因训练-测试重叠而导致性能虚高的问题。这为在数据匮乏环境下的语音模型设计、预训练-微调策略比较等学术研究提供了可信的数据基础,推动了多语言ASR理论的发展。
衍生相关工作
该数据集催生了多项衍生的经典工作。其一,基于其训练策略的教师模型假设(如Ethio-ASR-600M与w2v-bert-2.0-uf)被用于知识蒸馏研究,探索将大型预训练模型压缩为轻量级学生模型,以适配低资源环境。其二,其规范化的文本和音频指纹激发了关于语料库去噪、规范化的研究工作,成为数据质量审计的范例。其三,多语言平衡的设置促进了跨语言声学模型结构(如共享编码器)的探索,以及语言自适应模块的设计。这些工作共同丰富了多语言语音处理的研究体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务