遇见数据集

yoruba_african_voices

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

WaZoBiaSpeech 是一个大规模、高质量、完全转录的约鲁巴语语音数据集,总时长超过500小时(509.56小时),包含171,651个音频片段,由714位说话人录制。数据集旨在加速非洲语境下的语音技术发展,促进语言多样性,支持低资源机器学习研究。数据通过道德、社区中心的方式收集,涵盖脚本化和非脚本化录音,并具有广泛的人口统计学覆盖。每个样本包含音频ID、说话人ID、48 kHz单声道WAV音频路径、干净的转录文本、音频时长(秒)、性别(男/女)、年龄组(15-29、30-45、46-60、60+)、教育水平(小学、中学、大学)、领域(如EV, HE, AG, BU)、录音类型(脚本化/非脚本化)、分割标签(train/dev/dev_test)和语言代码。数据集已按说话人独立分割:训练集147,686条,开发集7,717条,开发测试集8,882条。性别分布均衡(50.3%男性,49.7%女性)。该数据集适用于自动语音识别(ASR)训练、低资源非洲语言NLP、跨语言学习与迁移学习研究,以及多语言ASR系统评估。使用限制包括:严禁用于语音克隆、说话人识别、监视或任何依赖于识别或模仿个体的商业应用;区域口音变化可能不全面,非脚本化片段可能包含自然背景噪声。数据集采用Creative Commons Attribution 4.0 (CC BY 4.0)许可。

WaZoBiaSpeech is a large-scale, high-quality, fully transcribed Yoruba speech dataset with a total duration of over 500 hours (509.56 hours), containing 171,651 audio clips recorded by 714 speakers. The dataset aims to accelerate speech technology development in African contexts, promote linguistic diversity, and support low-resource machine learning research. Data is collected in an ethical, community-centered manner, covering scripted and unscripted recordings with broad demographic coverage. Each sample includes audio ID, speaker ID, 48 kHz mono WAV audio path, clean transcription text, audio duration (seconds), gender (male/female), age group (15-29, 30-45, 46-60, 60+), education level (primary, secondary, university), domain (e.g., EV, HE, AG, BU), recording type (scripted/unscripted), split label (train/dev/dev_test), and language code. The dataset is split independently by speaker: 147,686 in training set, 7,717 in development set, and 8,882 in development test set. Gender distribution is balanced (50.3% male, 49.7% female). This dataset is suitable for automatic speech recognition (ASR) training, low-resource African language NLP, cross-lingual and transfer learning research, and multilingual ASR system evaluation. Usage restrictions include: strictly prohibited for voice cloning, speaker identification, surveillance, or any commercial applications relying on identifying or mimicking individuals; regional accent variations may not be comprehensive, and unscripted clips may contain natural background noise. The dataset is licensed under Creative Commons Attribution 4.0 (CC BY 4.0).

创建时间:
2026-09-29
原始信息汇总

WaZoBiaSpeech: 500+ Hour Yoruba (yor) Corpus 数据集概述

基本信息

  • 数据集名称:WaZoBiaSpeech: 500+ Hour Yoruba (yor) Corpus
  • 版本:30 Nov 2025
  • 语言:约鲁巴语(Yoruba,语言代码 yor)
  • 数据集地址:https://huggingface.co/datasets/Africanvoice/yoruba_african_voices
  • 维护者:Data Science Nigeria / EqualyzAI
  • 最后更新:2025年11月30日
  • 备注:该数据集会定期进行更新、修正和扩展

数据集概况

WaZoBiaSpeech 是一个大规模、高质量、完全转录的约鲁巴语(Yoruba)语音数据集。该语料库旨在加速非洲语境下语音技术的发展,促进语言多样性,并支持低资源机器学习研究。

数据包含**脚本化(scripted)和非脚本化(unscripted)**录音,通过符合伦理、以社区为中心的方式采集,具有广泛的人口统计覆盖。

语言覆盖情况

语言 总片段数 总时长 说话人数
Yoruba 171,651 509.56 小时 714

数据集结构与特征

数据集包含以下特征字段:

字段 类型 描述
audio_id string 唯一音频标识符
speaker_id string 匿名化说话人代码
audio_path Audio 48 kHz 单声道 WAV 音频文件
transcript string 干净的人工转录文本
duration_seconds float64 音频片段时长(秒)
gender string 性别(Male / Female)
age_group string 年龄段(15–29、30–45、46–60、60+)
education string 教育程度(Primary、Secondary、Tertiary)
domain string 内容背景(EV、HE、AG、BU)
type string 脚本化 / 非脚本化(Scripted / Unscripted)
split string train / dev / dev_test(说话人不重叠)
language string 语言代码(例如 pcm)

数据划分详情

划分 样本数 字节数
train 147,686 203,997,133,341
dev 7,717 12,001,168,011
dev_test 8,882 12,547,665,326
  • 下载大小:228,546,719,647 字节
  • 数据集大小:228,545,966,678 字节

约鲁巴语汇总统计

  • 总片段数:171,651
  • 总时长:509.56 小时
  • 性别比例:50.3% 男性 / 49.7% 女性

加载数据集

数据集已配置好,可方便加载约鲁巴语(yor)子集。

推荐环境

bash pip install --upgrade datasets[audio] pip install --upgrade ffmpeg ffmpeg-python

标准加载

python from datasets import load_dataset

Load the full training split

ds = load_dataset("Africanvoice/African_voices_yoruba", "hau", split="train")

Load a specific split (e.g., development)

ds_dev = load_dataset("Africanvoice/African_voices_yoruba", "hau", split="dev")

流式模式(用于内存优化)

python from datasets import load_dataset

Load the dev_test split in streaming mode

ds_stream = load_dataset( "Data-Science-Nigeria/African_voices_yoruba", "default", split="dev_test", streaming=True )

预期用途与应用

该数据集专为以下用途设计:

  • 自动语音识别(ASR)训练
  • 低资源非洲语言的自然语言处理(NLP)
  • 跨语言学习与迁移学习研究
  • 多语言 ASR 系统的评估
  • 语言学研究和口音/方言建模

使用限制与局限

严格禁止的用途

  • 声音克隆或适配(文本转语音/TTS)
  • 声纹识别、说话人识别或模仿
  • 监控、画像,或任何依赖识别或模仿个人的商业应用

局限性

  • 区域口音变体虽然广泛,但并非完全详尽
  • 自发性(非脚本化)语音片段可能包含自然的低水平背景噪声
  • 不适用于生物识别或法证用途

许可与引用

许可

该数据集在 知识共享署名 4.0(CC BY 4.0) 许可下发布。

引用

bibtex @dataset{wazobiaspeech-2025, title = {WaZoBiaSpeech: A 2,500-Hour Multilingual Speech Corpus for Hausa, Igbo, Nigerian Pidgin, and Yoruba}, author = {EqualyzAI and African Voices Team}, year = {2025}, url = {https://huggingface.co/datasets/Data-Science-Nigeria/African_voices_yoruba}, note = {Yoruba subset (yor) version}, type = {dataset} }

联系与支持

如有问题、疑问或合作咨询,请在仓库中提交 issue 或直接联系维护者。

搜集汇总
数据集介绍
yoruba_african_voices 数据集图片
构建方式
在非洲语言资源匮乏的背景下,该数据集通过伦理化、社区参与式的录音流程构建而成。录制内容涵盖脚本化朗读与非脚本化自然对话两种形式,广泛采集714名约鲁巴语使用者的语音样本,覆盖不同性别、年龄段与教育层次。录音以48 kHz单声道WAV格式保存,经人工转写与质量校验,所有说话人身份均经匿名化处理,并以说话人独立划分的方式划为训练、验证与测试集。
特点
该语料库规模达509.56小时、171,651条音频,具有显著的时长与样本优势。数据精细标注了说话人性别、年龄、教育背景、录制场景与语句类型等元信息,性别分布趋于均衡。音频采样率高,转写文本经过人工清理,兼顾语言真实性与标注质量,适用于低资源条件下的语音识别与跨语言迁移研究,且严格限制声音克隆、生物识别等滥用场景。
使用方法
研究者和开发者可通过Hugging Face的datasets库便捷加载该数据集,安装音频支持依赖后调用load_dataset接口指定约鲁巴语配置及训练、验证或测试划分即可。对内存敏感的场景可采用流式加载模式,仅按需读取音频与文本数据。该数据集主要用于自动语音识别模型的训练与评估、非洲低资源语言的跨语言学习以及口音与方言的语言学研究。
背景与挑战
背景概述
在非洲语言语音技术长期滞后、低资源语种数据稀缺的背景下,WaZoBiaSpeech约鲁巴语子集(yoruba_african_voices)于2025年由Data Science Nigeria与EqualyzAI及African Voices团队联合构建并发布。该数据集以约714名说话者贡献的509.56小时、171,651条经人工转写的语音样本,覆盖脚本化与非脚本化场景,旨在回应约鲁巴语自动语音识别(ASR)资源匮乏的核心问题。其基于社区参与式的伦理采集流程与广泛的人口统计覆盖,为非洲低资源语言的多语言迁移学习与语音技术研究提供了重要基准,对推动语言多样性保护与包容性语音系统开发具有显著影响力。
当前挑战
该数据集所面对的领域问题,是在约鲁巴语作为典型低资源语言、语音标注与说话者元数据极度匮乏的条件下,构建足以支撑鲁棒自动语音识别系统的大规模语料。构建过程中的挑战集中于多个维度:在广阔地理范围内招募并均衡覆盖不同性别、年龄、教育背景的说话者,以抑制人口统计偏差;在非脚本化自发语音中控制自然背景噪声对转写质量的影响;确保说话者级别的数据划分严格不相交,避免训练与评测间的信息泄漏;以及在保护说话者隐私与禁止语音克隆、声纹识别等滥用风险之间取得平衡,同时兼顾区域口音变异未能完全穷尽的现实局限。
常用场景
经典使用场景
在低资源语言语音处理领域,约鲁巴语等非洲语言长期面临标注语料匮乏的困境,WaZoBiaSpeech约鲁巴语子集以逾五百小时的全程转写语音数据,为自动语音识别系统的训练与评测提供了坚实的资源基础。该数据集最经典的使用场景在于构建端到端的约鲁巴语ASR模型,研究者可借助其涵盖脚本化与非脚本化两种类型的丰富录音,训练声学模型与语言模型,进而系统评估模型在真实语境下的识别鲁棒性。其性别均衡的说话人分布与多年龄段、多教育背景的覆盖,使得模型能够学习到更为广泛的语音变异特征,从而提升泛化能力。
衍生相关工作
WaZoBiaSpeech的发布催生了一系列围绕非洲低资源语言语音技术的衍生研究。基于该数据集,研究者相继开展了约鲁巴语ASR基线系统的构建与优化工作,探索了自监督预训练模型在约鲁巴语上的微调策略,并进行了豪萨语、伊博语及尼日利亚皮钦语之间的跨语言迁移实验。部分工作进一步利用其丰富的说话人属性标签,开展口音识别与说话人特征分析研究,为语音多样性建模提供了新的视角。这些衍生工作不仅拓展了约鲁巴语语音处理的深度与广度,也为其他非洲语言的资源建设与技术发展树立了可资借鉴的范式。
数据集最近研究
最新研究方向
在非洲低资源语言语音技术亟待突破的背景下,WaZoBiaSpeech约鲁巴语子集凭借逾五百小时、涵盖714名说话人的大规模转写语料,正推动自动语音识别研究向多方言鲁棒建模与跨语言迁移学习纵深发展。当前前沿聚焦于利用其丰富的说话人元数据(性别、年龄段、教育程度)开展公平性分析与口音自适应建模,同时以自监督预训练范式缓解标注稀缺困境。该数据集严格禁止语音克隆与生物识别滥用,为伦理化语音研究树立规范,对缩小非洲语言数字鸿沟、促进语言多样性保护具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务