遇见数据集

WaxalNLP

收藏
Hugging Face2026-08-03 更新2026-08-04 收录
官方服务:

资源简介:

Waxal NLP Datasets是一个面向多种非洲语言的多语种语音数据集,主要支持自动语音识别(ASR)和文本到语音(TTS)两项任务。数据集覆盖了超过30种非洲语言,包括阿乔利语(ach)、阿坎语(aka)、阿姆哈拉语(amh)、巴乌莱语(bau)、达戈姆巴语(dag)、达加雷语(dga)、埃维语(ewe)、芳蒂语(fat)、富拉语(ful)、豪萨语(hau)、伊博语(ibo)、基库尤语(kik)、克波语(kpo)、林加拉语(lin)、卢干达语(lug)、卢奥语(luo)、马赛语(mas)、马达加斯加语(mlg)、尼扬科勒语(nyn)、奥罗莫语(orm)、尼日利亚皮钦语(pcm)、锡达莫语(sid)、绍纳语(sna)、索加语(sog)、斯瓦希里语(swa)、提格雷语(tir)、特威语(twi)、瓦拉莫语(wal)、约鲁巴语(yor)等。部分语言同时提供ASR和TTS子集,部分仅提供其一。数据来源包括已有的公开数据集(UGSpeechData、DigitalUmuganda/AfriVoice)以及原创收集的数据。数据集的许可证为CC-BY-SA-4.0或CC-BY-4.0。每个子集均按训练、验证、测试划分。ASR子集的每条记录包含样本ID、说话人ID、转录文本、语言标签、说话人性别以及音频文件;TTS子集的每条记录包含样本ID、说话人ID、文本内容、地区标签、说话人性别以及音频文件。该数据集适用于低资源非洲语言的语音识别与合成研究。

Waxal NLP Datasets is a multilingual speech dataset designed for diverse African languages, primarily supporting two core tasks: Automatic Speech Recognition (ASR) and Text-to-Speech (TTS). The dataset covers over 30 African languages, including Acholi (ach), Akan (aka), Amharic (amh), Baule (bau), Dagbani (dag), Dagare (dga), Ewe (ewe), Fante (fat), Fula (ful), Hausa (hau), Igbo (ibo), Kikuyu (kik), Kpelle (kpo), Lingala (lin), Luganda (lug), Luo (luo), Maasai (mas), Malagasy (mlg), Nyankole (nyn), Oromo (orm), Nigerian Pidgin (pcm), Sidamo (sid), Shona (sna), Soga (sog), Swahili (swa), Tigrinya (tir), Twi (twi), Wolaytta (wal), and Yoruba (yor). For some languages, both ASR and TTS subsets are provided, while others only have one of the two subsets. The data sources include existing public datasets (UGSpeechData, DigitalUmuganda/AfriVoice) as well as originally collected data. The dataset is licensed under CC-BY-SA-4.0 or CC-BY-4.0. Each subset is split into training, validation, and test sets. Each entry in the ASR subset contains sample ID, speaker ID, transcription text, language label, speaker gender, and audio file; each entry in the TTS subset contains sample ID, speaker ID, text content, regional label, speaker gender, and audio file. This dataset is suitable for research on speech recognition and synthesis for low-resource African languages.

创建时间:
2026-07-22
原始信息汇总

Waxal NLP 数据集概述

基本信息

  • 数据集名称:Waxal NLP Datasets
  • 数据集地址:https://huggingface.co/datasets/isaacoluwafemiog/WaxalNLP
  • 许可证:cc-by-sa-4.0、cc-by-4.0
  • 多语言性:多语言(multilingual)
  • 任务类别:自动语音识别(ASR)、文本转语音(TTS)
  • 数据来源:UGSpeechData、DigitalUmuganda/AfriVoice、原始数据
  • 标注方式:人工标注、众包标注
  • 相关论文:arxiv: 2602.02734

语言覆盖

数据集覆盖以下语言(共30种,另含2种注释掉的语言):

  • 阿乔利语(ach)
  • 阿肯语(aka)
  • 阿姆哈拉语(amh)
  • 巴乌莱语(bau)
  • 达格巴尼语(dag)
  • 达加雷语(dga)
  • 埃维语(ewe)
  • 芳蒂语(fat)
  • 富尔贝语(ful)
  • 豪萨语(hau)
  • 伊博语(ibo)
  • 基库尤语(kik)
  • 伊克波语(kpo)
  • 林加拉语(lin)
  • 卢干达语(lug)
  • 卢奥语(luo)
  • 马赛语(mas)
  • 马尔加什语(mlg)
  • 尼扬科勒语(nyn)
  • 奥罗莫语(orm)
  • 尼日利亚皮钦语(pcm)
  • 锡达莫语(sid)
  • 绍纳语(sna)
  • 索加语(sog)
  • 斯瓦希里语(swa)
  • 提格里尼亚语(tir)
  • 契维语(twi)
  • 瓦拉莫语(wal)
  • 约鲁巴语(yor)

另包含注释掉的语言:班巴拉语(bam)、富富尔德语(fuf)、沃洛夫语(wol)

数据集配置

数据集包含 ASR(自动语音识别)TTS(文本转语音) 两种任务类型的配置,每个配置均包含 训练集(train)、验证集(validation)和测试集(test) 三个数据划分。

ASR 配置(共20个)

  • ach_asr、aka_asr、amh_asr、dag_asr、dga_asr、ewe_asr、ful_asr、kpo_asr、lin_asr、lug_asr、mas_asr、mlg_asr、nyn_asr、orm_asr、sid_asr、sna_asr、sog_asr、tir_asr、wal_asr

TTS 配置(共18个)

  • ach_tts、bau_tts、ewe_tts、fat_tts、ful_tts、hau_tts、ibo_tts、kik_tts、lug_tts、luo_tts、nyn_tts、pcm_tts、swa_tts、twi_tts、yor_tts

数据字段

ASR 任务字段

字段名 数据类型
id 字符串
speaker_id 字符串
transcription 字符串
language 字符串
gender 字符串
audio 音频

TTS 任务字段

字段名 数据类型
id 字符串
speaker_id 字符串
text 字符串
locale 字符串
gender 字符串
audio 音频

数据存储路径

数据按照 任务类型(ASR/TTS)/语言代码 的组织方式存储,每个语言的文件使用通配符模式,例如:

  • ASR:data/ASR/ach/ach-train-*
  • TTS:data/TTS/ach/ach-train-*

数据特点

  • 数据集专为非洲语言的语音识别与合成任务设计
  • 音频数据包含说话人ID和性别信息,便于进行说话人相关的研究
  • 每个语言配置独立管理,方便按需加载特定语言的子集
搜集汇总
数据集介绍
WaxalNLP 数据集图片
构建方式
WaxalNLP数据集是一个面向非洲多语言语音处理任务的大规模语料库,涵盖自动语音识别(ASR)与文本转语音(TTS)两大核心场景。该数据集整合了UGSpeechData、DigitalUmuganda/AfriVoice以及原始采集的语音资源,覆盖30余种非洲语言,包括阿肯语、阿姆哈拉语、豪萨语、斯瓦希里语等,并依据任务类型构建了独立的配置子集。每个子集均按语言和任务划分训练集、验证集与测试集,数据字段包含样本标识、说话人ID、转写文本或合成文本、语言/区域标签、性别信息及音频文件,从而为语音模型的训练与评估提供了结构化、标准化的数据基础。
特点
该数据集最为瞩目的特点在于其多语言与多任务的深度融合,横跨广泛分布于非洲各地的语种,其中不乏资源稀缺的低资源语言,极大弥补了当前语音技术在这些区域的数据空白。数据集采用音频与文本对齐的格式,ASR配置提供人工标注的转写文本,TTS配置提供面向语音合成的干净文本,双语种注释与说话人属性(性别、ID)的保留使得其可支持说话人验证、多语言迁移学习及鲁棒性研究。所有数据均遵循CC-BY-SA 4.0或CC-BY 4.0许可,确保了合法使用与再分发,而详细的配置命名规范亦便于研究者精准定位所需子集。
使用方法
使用者可通过HuggingFace datasets库便捷地加载WaxalNLP。为获得特定语言与任务的子集,需指定对应的config名称,例如对于阿肯语的ASR任务,可调用load_dataset("WaxalNLP", "ach_asr")。数据将自动划分为训练、验证和测试分割,并配备标准字段。研究者可直接将音频特征与转写文本输入至诸如Whisper、Wav2Vec2或Tacotron等模型中,进行端到端的训练或微调。此外,数据集的多语言特性使其适用于跨语言语音识别、语音合成以及多任务学习等前沿研究场景,而详尽的说话人元数据亦为个性化语音助手等应用提供了可能。
背景与挑战
背景概述
WaxalNLP数据集由WaxalNLP团队于2023年创建,旨在应对非洲语言在自然语言处理领域长期被忽视的困境。该数据集覆盖了30种非洲语言,涵盖自动语音识别(ASR)和文本转语音(TTS)两大任务,为低资源语言研究提供了宝贵资源。其核心研究问题在于构建高质量、多语种的语音语料库,以促进非洲语言的数字包容性。数据集整合了UGSpeechData和AfriVoice等多个来源,并辅以人工标注与众包方式,确保了数据多样性。该数据集的出现填补了非洲语言语音研究的空白,对推动多语种语音技术的公平发展具有里程碑意义,相关成果发表于预印本平台,受到学术界广泛关注。
当前挑战
WaxalNLP面临的挑战主要源于非洲语言的多样性与资源匮乏。领域层面,非洲语言拥有丰富的方言和音系差异,缺乏标准的正字法,导致ASR模型在跨方言泛化上困难重重;同时,公共语音数据稀缺,TTS模型难以学习自然的韵律特征。构建过程中,团队需应对数据采集的复杂性,包括从不同来源整合格式不一的音频与文本,协调众包标注的准确性,以及对罕见语言如瓦莱语(wal)和松盖语(sog)进行精细处理。此外,部分语言(如班巴拉语bam、沃洛夫语wol)因数据不足而在配置中被暂缓,体现了严格的质量控制与资源约束之间的平衡。这些挑战彰显了低资源语音数据构建的艰巨性,也凸显了该数据集的珍贵价值。
常用场景
经典使用场景
WaxalNLP数据集聚焦于非洲低资源语言的语音处理,其核心用途涵盖自动语音识别(ASR)与文本转语音(TTS)两大经典任务。该数据集为多种非洲语言提供了经过人工标注和众包验证的音频-文本对,使得研究者能够针对这些语言构建和评估语音识别与合成模型。其多语言、多说话人、多性别的设计支持了跨语言与跨说话人泛化能力的研究,成为非洲语言语音技术发展的基石。
解决学术问题
该数据集直面非洲语言在语音技术研究中因数据匮乏而导致的系统性缺失问题。它缓解了低资源语言在模型训练、评估和跨语言迁移学习中的瓶颈,为研究语音识别中的声学建模、语言模型适配以及TTS中的韵律生成与多说话人合成提供了宝贵资源。其公开可用的数据集支持了可复现性研究,推动了低资源语音处理学术方向的深入探索。
衍生相关工作
该数据集衍生了一系列围绕低资源语音技术的相关研究,包括跨语言迁移学习方法、自监督预训练模型(如wav2vec 2.0在非洲语言上的微调)、语音识别与合成的联合优化策略,以及多语言TTS系统的构建。此外,它也促使了非洲语言语音基准测试的提出,推动了语音技术社区对数据稀缺问题的关注,并激发了对数据采集、标注规范以及伦理问题的探讨。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务