遇见数据集

naija_african_voices

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

WaZoBiaSpeech 是一个大规模、高质量、完全转录的尼日利亚皮钦语(pcm)语音数据集。该数据集旨在加速非洲语境下的语音技术发展,促进语言多样性,并支持低资源机器学习研究。数据包含脚本化(scripted)和非脚本化(unscripted)录音,通过符合伦理的社区驱动流程收集,涵盖广泛的人口统计信息。数据集共包含 390,767 个音频片段,总时长约 1017 小时,来自 1119 位说话人。每个样本提供以下字段:音频唯一标识符(audio_id)、伪匿名说话人代码(speaker_id)、48 kHz 单声道 WAV 音频文件路径(audio_path)、人工精标转录文本(transcript)、音频时长(duration_seconds,单位秒)、性别(gender,男/女)、年龄段(age_group,15–29, 30–45, 46–60, 60+)、教育水平(education,初级/中级/高级)、内容领域(domain,如 EV, HE, AG, BU 等)、录音类型(type,脚本/非脚本)、数据划分(split,train/dev/dev_test,说话人无重叠)、语言代码(language,pcm)。数据集划分为训练集(335,288 个样本)、开发集(17,737 个样本)和开发测试集(17,324 个样本)。该数据集主要适用于自动语音识别(ASR)训练、低资源非洲语言自然语言处理、跨语言学习与迁移学习研究、多语言 ASR 系统评估以及语言学研究。为保护说话人隐私并防止语音滥用,数据集严格禁止用于语音克隆、声纹识别、监控或任何涉及识别或模仿个体的商业应用。数据集采用 Creative Commons Attribution 4.0 (CC BY 4.0) 许可证发布。

WaZoBiaSpeech is a large-scale, high-quality, fully transcribed Nigerian Pidgin (pcm) speech dataset. It aims to accelerate speech technology development in the African context, promote linguistic diversity, and support low-resource machine learning research. The data includes scripted and unscripted recordings, collected through an ethical community-driven process, covering a wide range of demographic information. The dataset contains a total of 390,767 audio clips, approximately 1,017 hours in duration, from 1,119 speakers. Each sample provides the following fields: audio unique identifier (audio_id), pseudonymized speaker code (speaker_id), 48 kHz mono WAV audio file path (audio_path), manually refined transcription text (transcript), audio duration in seconds (duration_seconds), gender (gender, male/female), age group (age_group, 15–29, 30–45, 46–60, 60+), education level (education, primary/secondary/tertiary), content domain (domain, e.g., EV, HE, AG, BU), recording type (type, scripted/unscripted), data split (split, train/dev/dev_test with non-overlapping speakers), and language code (language, pcm). The dataset is split into training set (335,288 samples), development set (17,737 samples), and development test set (17,324 samples). This dataset is mainly suitable for automatic speech recognition (ASR) training, low-resource African language NLP, cross-lingual and transfer learning research, multilingual ASR system evaluation, and linguistic research. To protect speaker privacy and prevent voice misuse, the dataset is strictly prohibited from being used for voice cloning, speaker recognition, surveillance, or any commercial application involving identification or impersonation of individuals. The dataset is released under the Creative Commons Attribution 4.0 (CC BY 4.0) license.

创建时间:
2026-09-29
原始信息汇总

数据集概述

基本信息

  • 数据集名称:WaZoBiaSpeech: 1,000+ Hour Nigerian Pidgin (pcm) Corpus
  • 数据集地址:https://huggingface.co/datasets/Africanvoice/naija_african_voices
  • 版本:30 Nov 2025
  • 许可证:Creative Commons Attribution 4.0 (CC BY 4.0)
  • 任务类别:自动语音识别(automatic-speech-recognition)
  • 维护方:Data Science Nigeria / EqualyzAI
  • 最后更新:2025年11月30日

数据集简介

WaZoBiaSpeech 是一个面向尼日利亚皮钦语(Nigerian Pidgin, pcm) 的大规模、高质量、全转写语音数据集,旨在推动非洲语境下语音技术的发展,促进语言多样性并支持低资源机器学习研究。数据包含脚本化(scripted) 和非脚本化(unscripted) 录音,通过符合伦理、以社区为中心的方式采集,具有广泛的人口统计覆盖。

语言覆盖

语言 总片段数 总时长 说话人数
Nigerian Pidgin 390,767 1017.04 h 1119

数据集结构与特征

字段 类型 描述
audio_id string 唯一音频标识符
speaker_id string 匿名化说话人代码
audio_path Audio 48 kHz 单声道 WAV 音频文件
transcript string 干净的人工转写
duration_seconds float64 音频片段时长(秒)
gender string 性别(Male / Female)
age_group string 年龄段(15–29、30–45、46–60、60+)
education string 教育程度(Primary、Secondary、Tertiary)
domain string 内容语境(EV、HE、AG、BU)
type string 类型(Scripted / Unscripted)
split string 数据划分(train / dev / dev_test,按说话人分离)
language string 语言代码(如 pcm)

数据划分

划分 字节数 样本数
train 419,304,709,289 335,288
dev_test 22,685,260,305 17,324
dev 19,624,690,744 17,737
  • 下载大小:461,614,832,663 字节
  • 数据集大小:461,614,660,338 字节

加载方式

推荐环境

bash pip install --upgrade datasets[audio] pip install --upgrade ffmpeg ffmpeg-python

标准加载

python from datasets import load_dataset

加载完整训练集

ds_train = load_dataset("Africanvoice/naija_african_voices", "default", split="train")

加载特定划分(如开发集)

ds_dev = load_dataset("Africanvoice/naija_african_voices", "default", split="dev")

流式模式(内存高效)

python from datasets import load_dataset

以流式模式加载 dev_test 划分

ds_stream = load_dataset( "Africanvoice/African_voices_yoruba", "default", split="dev_test", streaming=True )

预期用途与应用

  • 自动语音识别(ASR)训练
  • 低资源非洲语言的自然语言处理(NLP)
  • 跨语言学习与迁移学习研究
  • 多语言 ASR 系统评估
  • 语言学研究和口音/方言建模

使用限制与局限

严格禁止的用途

  • 语音克隆或适配(文本转语音/TTS)
  • 声纹识别、说话人识别或模仿
  • 监控、画像,或任何依赖识别或模仿个人的商业应用

局限

  • 区域口音变体虽覆盖广泛,但并非完全详尽
  • 自发性(非脚本化)语音片段可能包含自然的低水平背景噪声
  • 不适用于生物识别或取证用途

引用信息

bibtex @dataset{wazobiaspeech-2025, title = {WaZoBiaSpeech: A 2,500-Hour Multilingual Speech Corpus for Hausa, Igbo, Nigerian Pidgin, and Yoruba}, author = {EqualyzAI and African Voices Team}, year = {2025}, url = {https://huggingface.co/datasets/Africanvoice/African_voices_yoruba}, note = {Niaja subset (pcm) version}, type = {dataset} }

联系方式

如有问题、疑问或合作意向,请在仓库中提交 issue 或直接联系维护者。

搜集汇总
数据集介绍
naija_african_voices 数据集图片
构建方式
该数据集依托社区驱动与伦理采集框架构建,涵盖尼日利亚皮钦语(pcm)的脚本化与即兴语音样本,录音以48 kHz单声道WAV格式存储并经人工精转写。数据划分遵循说话人无重叠原则,划分为训练集335,288条、开发集17,737条及开发测试集17,324条,总时长约1,017小时,涉及1,119名说话人。采集过程注重人口统计学多样性,涵盖不同性别、年龄段、教育背景及领域来源,以确保语料在声学与语言层面的代表性。
特点
语料库以大规模、高质量转写与丰富的元数据标注为核心特征,提供音频标识、假名化说话人编码、转写文本、时长、性别、年龄组、教育程度、领域类型及脚本化属性等字段。音频采样率为48 kHz,总数据量约461 GB,全部数据以说话人独立方式切分,有效规避数据泄漏风险。该数据集面向低资源非洲语言语音技术研究,兼具脚本化与自然即兴语音,能够反映真实语境下的语音变异与口音多样性。
使用方法
该数据集可通过Hugging Face datasets库便捷加载,推荐安装datasets[audio]及ffmpeg依赖后,使用load_dataset函数指定配置名称与split参数获取训练、开发或开发测试子集;对于内存受限场景,可启用streaming模式进行流式读取。数据适用于自动语音识别训练、低资源非洲语言自然语言处理、跨语言迁移学习及多语种ASR系统评测等任务。使用须遵守CC BY 4.0许可,严禁用于语音克隆、声纹识别、监视或任何可识别与模仿个体的商业应用。
背景与挑战
背景概述
尼日利亚皮钦语作为西非地区广泛使用的克里奥尔语,长期缺乏大规模、高质量的语音数据资源,制约了语音识别技术在该语言社区的应用拓展。WaZoBiaSpeech语料库由Data Science Nigeria与EqualyzAI团队于2025年联合构建,涵盖逾一千小时的全转录语音数据,旨在填补低资源非洲语言在语音技术研发中的数据空白。该数据集以社区参与式伦理采集为原则,覆盖多元人口统计特征,为自动语音识别、跨语言迁移学习及语言学研究提供了关键基础设施,对推动非洲语言技术生态建设具有里程碑意义。
当前挑战
该数据集所应对的核心领域难题在于尼日利亚皮钦语自动语音识别长期受限于标注数据稀缺、发音变体丰富及口音多样性显著等困境。构建过程中面临多重挑战:脚本化与非脚本化语音的平衡采集需兼顾自然度与转写质量;说话人伪匿名化处理须在隐私保护与数据效用间取得平衡;区域口音覆盖虽力求广泛却难以穷尽全部变体;非脚本化片段常夹杂低强度环境噪声,对转写准确性构成干扰;此外,语音克隆与生物特征识别等滥用风险的防范亦对数据治理提出严格要求。
常用场景
经典使用场景
在低资源语言语音技术研究的浪潮中,WaZoBiaSpeech数据集凭借逾千小时尼日利亚皮钦语(pcm)的高质量转写语音,成为自动语音识别(ASR)模型训练的经典语料。其包含脚本化与非脚本化录音,覆盖多样化的说话人人口统计特征,并采用说话人分离的训练、开发与测试划分,为构建鲁棒声学模型提供了标准化基准。研究者常以此数据集开展端到端ASR系统的训练与评估,探索在非洲语境下的语音识别性能边界。
实际应用
在实际应用中,该数据集赋能了面向尼日利亚及西非地区的语音交互系统开发,例如智能语音助手、呼叫中心自动转录和语音搜索等。其非脚本化语音样本贴近真实对话场景,有助于提升ASR系统在噪声环境与自然口语下的鲁棒性。同时,该数据集支持跨语言迁移学习,为多语言语音产品的快速部署提供了数据支撑,尤其在教育、医疗和公共服务等普惠技术领域具有广阔前景。
衍生相关工作
基于该数据集,研究者已衍生出一系列经典工作,包括尼日利亚皮钦语基线ASR模型的建立、多语言语音识别系统的迁移学习实验,以及针对非洲口音的声学模型自适应研究。这些工作不仅验证了数据集在低资源场景下的有效性,还催生了若干公开的预训练模型与基准评测榜单,进一步推动了非洲语言语音技术的发展。此外,该数据集还激发了针对说话人属性建模与语音隐私保护的相关探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务