WaxalNLP
收藏资源简介:
Waxal NLP Datasets是一个面向多种非洲语言的多语种语音数据集,主要支持自动语音识别(ASR)和文本到语音(TTS)两项任务。数据集覆盖了超过30种非洲语言,包括阿乔利语(ach)、阿坎语(aka)、阿姆哈拉语(amh)、巴乌莱语(bau)、达戈姆巴语(dag)、达加雷语(dga)、埃维语(ewe)、芳蒂语(fat)、富拉语(ful)、豪萨语(hau)、伊博语(ibo)、基库尤语(kik)、克波语(kpo)、林加拉语(lin)、卢干达语(lug)、卢奥语(luo)、马赛语(mas)、马达加斯加语(mlg)、尼扬科勒语(nyn)、奥罗莫语(orm)、尼日利亚皮钦语(pcm)、锡达莫语(sid)、绍纳语(sna)、索加语(sog)、斯瓦希里语(swa)、提格雷语(tir)、特威语(twi)、瓦拉莫语(wal)、约鲁巴语(yor)等。部分语言同时提供ASR和TTS子集,部分仅提供其一。数据来源包括已有的公开数据集(UGSpeechData、DigitalUmuganda/AfriVoice)以及原创收集的数据。数据集的许可证为CC-BY-SA-4.0或CC-BY-4.0。每个子集均按训练、验证、测试划分。ASR子集的每条记录包含样本ID、说话人ID、转录文本、语言标签、说话人性别以及音频文件;TTS子集的每条记录包含样本ID、说话人ID、文本内容、地区标签、说话人性别以及音频文件。该数据集适用于低资源非洲语言的语音识别与合成研究。
Waxal NLP Datasets is a multilingual speech dataset designed for diverse African languages, primarily supporting two core tasks: Automatic Speech Recognition (ASR) and Text-to-Speech (TTS). The dataset covers over 30 African languages, including Acholi (ach), Akan (aka), Amharic (amh), Baule (bau), Dagbani (dag), Dagare (dga), Ewe (ewe), Fante (fat), Fula (ful), Hausa (hau), Igbo (ibo), Kikuyu (kik), Kpelle (kpo), Lingala (lin), Luganda (lug), Luo (luo), Maasai (mas), Malagasy (mlg), Nyankole (nyn), Oromo (orm), Nigerian Pidgin (pcm), Sidamo (sid), Shona (sna), Soga (sog), Swahili (swa), Tigrinya (tir), Twi (twi), Wolaytta (wal), and Yoruba (yor). For some languages, both ASR and TTS subsets are provided, while others only have one of the two subsets. The data sources include existing public datasets (UGSpeechData, DigitalUmuganda/AfriVoice) as well as originally collected data. The dataset is licensed under CC-BY-SA-4.0 or CC-BY-4.0. Each subset is split into training, validation, and test sets. Each entry in the ASR subset contains sample ID, speaker ID, transcription text, language label, speaker gender, and audio file; each entry in the TTS subset contains sample ID, speaker ID, text content, regional label, speaker gender, and audio file. This dataset is suitable for research on speech recognition and synthesis for low-resource African languages.
Waxal NLP 数据集概述
基本信息
- 数据集名称:Waxal NLP Datasets
- 数据集地址:https://huggingface.co/datasets/isaacoluwafemiog/WaxalNLP
- 许可证:cc-by-sa-4.0、cc-by-4.0
- 多语言性:多语言(multilingual)
- 任务类别:自动语音识别(ASR)、文本转语音(TTS)
- 数据来源:UGSpeechData、DigitalUmuganda/AfriVoice、原始数据
- 标注方式:人工标注、众包标注
- 相关论文:arxiv: 2602.02734
语言覆盖
数据集覆盖以下语言(共30种,另含2种注释掉的语言):
- 阿乔利语(ach)
- 阿肯语(aka)
- 阿姆哈拉语(amh)
- 巴乌莱语(bau)
- 达格巴尼语(dag)
- 达加雷语(dga)
- 埃维语(ewe)
- 芳蒂语(fat)
- 富尔贝语(ful)
- 豪萨语(hau)
- 伊博语(ibo)
- 基库尤语(kik)
- 伊克波语(kpo)
- 林加拉语(lin)
- 卢干达语(lug)
- 卢奥语(luo)
- 马赛语(mas)
- 马尔加什语(mlg)
- 尼扬科勒语(nyn)
- 奥罗莫语(orm)
- 尼日利亚皮钦语(pcm)
- 锡达莫语(sid)
- 绍纳语(sna)
- 索加语(sog)
- 斯瓦希里语(swa)
- 提格里尼亚语(tir)
- 契维语(twi)
- 瓦拉莫语(wal)
- 约鲁巴语(yor)
另包含注释掉的语言:班巴拉语(bam)、富富尔德语(fuf)、沃洛夫语(wol)
数据集配置
数据集包含 ASR(自动语音识别) 和 TTS(文本转语音) 两种任务类型的配置,每个配置均包含 训练集(train)、验证集(validation)和测试集(test) 三个数据划分。
ASR 配置(共20个)
- ach_asr、aka_asr、amh_asr、dag_asr、dga_asr、ewe_asr、ful_asr、kpo_asr、lin_asr、lug_asr、mas_asr、mlg_asr、nyn_asr、orm_asr、sid_asr、sna_asr、sog_asr、tir_asr、wal_asr
TTS 配置(共18个)
- ach_tts、bau_tts、ewe_tts、fat_tts、ful_tts、hau_tts、ibo_tts、kik_tts、lug_tts、luo_tts、nyn_tts、pcm_tts、swa_tts、twi_tts、yor_tts
数据字段
ASR 任务字段
| 字段名 | 数据类型 |
|---|---|
| id | 字符串 |
| speaker_id | 字符串 |
| transcription | 字符串 |
| language | 字符串 |
| gender | 字符串 |
| audio | 音频 |
TTS 任务字段
| 字段名 | 数据类型 |
|---|---|
| id | 字符串 |
| speaker_id | 字符串 |
| text | 字符串 |
| locale | 字符串 |
| gender | 字符串 |
| audio | 音频 |
数据存储路径
数据按照 任务类型(ASR/TTS)/语言代码 的组织方式存储,每个语言的文件使用通配符模式,例如:
- ASR:
data/ASR/ach/ach-train-* - TTS:
data/TTS/ach/ach-train-*
数据特点
- 数据集专为非洲语言的语音识别与合成任务设计
- 音频数据包含说话人ID和性别信息,便于进行说话人相关的研究
- 每个语言配置独立管理,方便按需加载特定语言的子集




