遇见数据集

african-languages-speech

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

该数据集是WAXAL非洲语言语音数据集的过滤版本(第一波),包含豪萨语(hau_tts)、约鲁巴语(yor_tts)和伊博语(ibo_tts)三种语言的音频与转录配对样本。数据以tar归档文件形式组织,每个归档包含一个音频文件和一个JSON记录,JSON记录中包含转录文本、语言标签、说话人标识、来源ID和来源信息。数据集来源于Google的WaxalNLP数据集,经过流式逐行处理,移除了空文本、明显垃圾文本以及缺失音频的样本,确保了转录与音频的对齐,并使用随机水塘采样进行保留。每个配置均包含一个audit.json文件,用于记录数量统计、丢弃原因、校验和以及样本信息。该数据集适用于自动语音识别(ASR)和文本转语音(TTS)等语音任务,遵循CC-BY-4.0许可证。

This dataset is a filtered version (first wave) of the WAXAL African Language Speech Dataset, containing audio-transcription paired samples for three languages: Hausa (hau_tts), Yoruba (yor_tts), and Igbo (ibo_tts). The data is organized as tar archive files, each containing an audio file and a JSON record. The JSON record includes the transcription text, language tag, speaker identifier, source ID, and source information. The dataset originates from Googles WaxalNLP dataset and has been processed via streaming, removing empty texts, obvious garbage texts, and samples with missing audio, ensuring alignment between transcription and audio, and retained using random reservoir sampling. Each configuration includes an audit.json file that records quantity statistics, discard reasons, checksums, and sample information. This dataset is suitable for speech tasks such as automatic speech recognition (ASR) and text-to-speech (TTS), and is licensed under CC-BY-4.0.

创建时间:
2026-08-22
原始信息汇总

数据集概述:WAXAL 非洲语言语音(过滤后第一批)

基本信息

  • 数据集名称:WAXAL African-language speech — filtered wave 1
  • 许可证:CC-BY-4.0
  • 发布机构:VelkroLM

内容简介

该数据集包含经过筛选和限制的 WAXAL 音频与转录文本配对数据,涵盖三种非洲语言:

  • 豪萨语(Hausa):配置标识为 hau_tts
  • 约鲁巴语(Yoruba):配置标识为 yor_tts
  • 伊博语(Igbo):配置标识为 ibo_tts

每个语言的配置均被分割为多个 tar 压缩包,每个压缩包包含一个音频文件及对应的 JSON 记录。JSON 记录中收录了转录文本、语言、说话人、来源 ID 和数据出处信息。

数据来源

  • 上游数据集google/WaxalNLP
  • 相关论文arXiv:2602.02734
  • 该数据集为上游数据的衍生版本,不授予超出上游条款的任何权利。用户需查阅上游数据集卡片以了解具体的组件许可和署名要求。

处理流程

数据收集者采用逐行流式处理方式,主要步骤包括:

  1. 删除空文本、明显的垃圾信息文本及缺失的音频
  2. 保持转录文本与音频的对齐
  3. 使用带种子的随机水库采样方法进行抽样
  4. 在成功验证后删除原始暂存数据

每个配置均包含一份 audit.json 审计文件,记录数据计数、丢弃原因、校验和及样本信息。

后续计划

其余的 WAXAL 配置将按分批节奏逐步添加,而不会复制到第二个本地副本中。

搜集汇总
数据集介绍
african-languages-speech 数据集图片
构建方式
该数据集源自谷歌WAXAL项目,专注于非洲三大语言——豪萨语、约鲁巴语和伊博语——的语音与文本配对数据。构建过程中,采集者逐行流式处理上游数据源,剔除空文本、明显垃圾信息及缺失音频,确保转录与音频的严格对齐。随后采用基于种子的随机水库抽样方法进行筛选,以保持数据代表性。每个配置均附有审计文件,记录数据量、剔除原因、校验和及样本信息,确保数据质量与可追溯性。原始暂存数据在成功验证后即被删除,保证了数据处理的洁净与高效。
特点
该数据集具有高度的针对性与实用性,专门面向非洲低资源语言,为语音识别与语音合成研究提供了宝贵资源。每个音频文件与包含转录、语言、说话人、来源ID及出处信息的JSON记录捆绑存储,便于研究者理解数据上下文。数据经严格过滤,去除噪声与无效内容,保证了转录与音频的高质量对齐。此外,数据集的分布式波次发布策略,避免了重复拷贝,节约存储空间,同时通过审计机制增强了数据的可信度与透明度。
使用方法
使用此数据集时,研究者需解压tar归档文件,获取音频与对应的JSON元数据。可直接将其用于训练自动语音识别(ASR)或文本到语音(TTS)模型,针对豪萨语、约鲁巴语和伊博语进行语言模型微调。由于数据采用标准格式,易于集成到主流深度学习框架(如HuggingFace的datasets库)中。使用者应遵循CC-BY-4.0许可,并参考上游WAXAL数据集的完整许可条款,合理合规地使用数据。此数据集尤其适合低资源语言语音技术的研究与开发。
背景与挑战
背景概述
该数据集由WAXAL项目于近期创建,旨在推动非洲语言语音识别与合成研究。核心研究问题在于解决豪萨语、约鲁巴语和伊博语等低资源非洲语言的语音数据稀缺问题,构建高质量、对齐的语音-文本对。该数据集作为WAXAL项目的一部分,由Google研究团队主导,其影响力在于为非洲语言的自然语言处理提供基准资源,促进相关技术发展。
当前挑战
该领域面临的挑战包括低资源语言的数据稀缺、语音多样性与方言差异、以及缺乏标准化标注。在构建过程中,需克服数据采集的噪声、文本-音频对齐误差、过滤无效样本、保持数据分布代表性等难题。此外,还需确保数据来源合规,并处理跨语言的一致性,以满足科研与工程应用的严格要求。
常用场景
经典使用场景
在语音技术研究领域,african-languages-speech数据集凭借其精心筛选的豪萨语、约鲁巴语和伊博语音频-文本对,成为构建和评估自动语音识别(ASR)系统的基础资源。研究者常以此数据集训练端到端语音识别模型,探究非洲语言特有的音韵学特征与形态学结构对识别性能的影响。该数据集亦被用于多语言迁移学习研究,通过跨语言预训练与微调策略,验证低资源语言间的知识共享潜力。其严格的过滤流程保证了音频与文本的对齐精度,为韵律建模、方言变体识别等精细任务提供了可靠数据支撑。
实际应用
在产业实践中,该数据集可直接用于开发面向西非用户的语音助手、语音输入法及实时翻译服务。例如,基于此数据训练的ASR模型可集成至移动应用中,帮助教育、医疗和金融等领域的本地语音交互落地。此外,它在语音数据的质量控制流程中发挥示范作用,其过滤与审计机制可被借鉴,用于构建其他低资源语言的数据管道。数据集的CC-BY-4.0许可亦降低了商业应用的法律门槛,加速了非洲本土语音产品的孵化与迭代。
衍生相关工作
该数据集的发布催生了一系列相关研究,如基于WaxalNLP的语音合成(TTS)工作,利用其成对数据训练高自然度的非洲语言语音合成器。亦有不少工作聚焦于多语言语音处理的去偏与公平性,以该数据集为基准测试不同说话人条件下的模型性能。此外,其过滤方法论被“数据集蒸馏”等研究引用,用于构建更紧凑、高质量的训练子集。而在语音翻译领域,该数据集的跨语言对成为验证非标注语音翻译模型的测试平台,推动了低资源语音到文本翻译的进展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务