遇见数据集

unified-hausa-speech

收藏
Hugging Face2026-08-15 更新2026-08-16 收录
官方服务:

资源简介:

Unified Hausa Speech Dataset v5是一个大规模、经过清洗、去重和质量过滤的豪萨语语音数据集,由6个开源语音集合(WaxalNLP、NaijaVoices、BibleTTS、TWB Voice、AfricanVoices和Common Voice)统一编译而成。豪萨语(ISO 639-1: ha)是乍得语系语言,由西非和中非超过8000万人使用,主要分布在尼日利亚和尼日尔,并作为萨赫勒地区的贸易语言。尽管使用人口众多,但与全球语言相比,高质量的豪萨语语音数据仍然稀缺。该数据集通过整合、清洗和标准化多个现有豪萨语语音集合,创建了一个可直接用于训练的资源,旨在支持文本到语音(TTS)和自动语音识别(ASR)研究。数据集包含约791,124个音频片段,总时长约706.8小时,其中训练集782,297个片段(697.84小时),测试集8,827个片段(8.96小时)。共有2,110个独特说话人(训练集2,059个,测试集51个)。每个样本包含以下特征:音频(16 kHz单声道FLAC格式,经过静音修剪和响度标准化至-20 dBFS)、文本(NFC标准化的豪萨语转录)、说话人ID(整数,跨来源唯一)、性别(“male”、“female”或“other”)、时长(秒)。数据集按说话人ID排序,便于说话人自适应TTS和说话人嵌入提取。质量过滤包括剔除时长小于1秒或大于30秒、过度削波(>1%)等不合格片段,共拒绝14,592个片段。去重基于音频哈希和文本哈希跨来源进行。音频处理流程包括重采样至16kHz、降噪、静音修剪、响度标准化、质量检查和FLAC编码。该数据集适用于TTS、ASR、说话人自适应微调、说话人嵌入提取、说话人日记化评估等任务。已知限制包括性别元数据可能不准确、同一说话人可能在不同来源中出现多次、方言变体混合、录音条件差异大、转录文本未经独立验证、无强制对齐等。所有数据均来自公开许可的源数据集,说话人标识符已匿名化。

Unified Hausa Speech Dataset v5 is a large-scale, cleaned, deduplicated, and quality-filtered Hausa speech dataset compiled from six open-source speech collections (WaxalNLP, NaijaVoices, BibleTTS, TWB Voice, AfricanVoices, and Common Voice). Hausa (ISO 639-1: ha) is a Chadic language spoken by over 80 million people in West and Central Africa, primarily in Nigeria and Niger, and serves as a trade language in the Sahel region. Despite its large number of speakers, high-quality Hausa speech data remains scarce compared to global languages. This dataset integrates, cleans, and standardizes multiple existing Hausa speech collections to create a resource ready for training, aiming to support text-to-speech (TTS) and automatic speech recognition (ASR) research. The dataset contains approximately 791,124 audio clips with a total duration of about 706.8 hours, including 782,297 clips (697.84 hours) for training and 8,827 clips (8.96 hours) for testing. There are 2,110 unique speakers (2,059 in training, 51 in testing). Each sample includes: audio (16 kHz mono FLAC format, silence trimmed and loudness normalized to -20 dBFS), text (NFC-normalized Hausa transcription), speaker ID (integer, unique across sources), gender (male, female, or other), and duration (seconds). The dataset is sorted by speaker ID to facilitate speaker-adaptive TTS and speaker embedding extraction. Quality filtering removed clips shorter than 1 second or longer than 30 seconds, with excessive clipping (>1%), resulting in 14,592 rejected clips. Deduplication was performed based on audio hashes and text hashes across sources. Audio processing includes resampling to 16 kHz, noise reduction, silence trimming, loudness normalization, quality check, and FLAC encoding. The dataset is suitable for TTS, ASR, speaker-adaptive fine-tuning, speaker embedding extraction, and speaker diarization evaluation. Known limitations include potentially inaccurate gender metadata, possible reappearance of the same speaker across sources, mixed dialect variations, diverse recording conditions, unverified transcriptions, and lack of forced alignment. All data comes from publicly licensed source datasets, and speaker identifiers have been anonymized.

创建时间:
2026-08-13
原始信息汇总

Unified Hausa Speech Dataset v5 数据集详情

数据集概述

Unified Hausa Speech Dataset v5 是一个大型、清理过、去重且经过质量过滤的豪萨语(Hausa)语音数据集,由 6 个开源语音集合整合而成。该数据集专为豪萨语的文本到语音(TTS)自动语音识别(ASR) 研究设计,旨在弥补豪萨语(全球使用者超过8000万)高质量语音数据稀缺的问题。

基本信息

属性 详情
语言 豪萨语(ha)
许可证 Apache 2.0
任务类别 文本到语音(TTS)、自动语音识别(ASR)
数据规模 100K < n < 1M
标签 hausa, speech, tts, asr, africa, nlp, low-resource, multi-speaker

关键特性

  • 音频格式:16 kHz 单声道 FLAC,已进行静音剪裁,响度标准化至 −20 dBFS
  • 文本:NFC 标准化处理的豪萨语转写文本
  • 说话人:顺序整数 ID,在不同处理流水线运行间保持稳定
  • 排序:同一说话人的所有音频片段连续排列,有利于说话人自适应 TTS 和说话人嵌入提取
  • 去重:通过音频哈希和转写文本进行跨来源去重
  • 质量过滤:对时长、削波和空音频进行了过滤

数据规模统计

指标 训练集 测试集 总计
音频片段总数 782,297 8,827 791,124
总时长 697.84 小时 8.96 小时 706.8 小时
唯一说话人数 2,059 51 2,110
平均片段时长 3.211 秒 3.654 秒

数据字段结构

字段 类型 描述
audio Audio(16 kHz) 单声道 FLAC 音频,静音剪裁,响度标准化至 −20 dBFS
text string NFC 标准化豪萨语转写文本
speaker_id int64 唯一的顺序说话人标识符
gender string "male""female""other"
duration float32 音频片段时长(秒,处理后)

数据划分

  • 训练集:来自 WaxalNLP、NaijaVoices(3 批次)、BibleTTS 训练集、TWB Voice 训练集、AfricanVoices(6 批次)、Common Voice 训练集
  • 测试集:来自 BibleTTS 测试集 + 开发集、TWB Voice 开发集 + 测试集、Common Voice 开发集 + 测试集(持出评估数据,不混入训练集)

数据来源

来源 仓库 保留片段数 输出划分
WaxalNLP google/WaxalNLP 1,435 训练集
NaijaVoices naijavoices/naijavoices-dataset 308,100 训练集
BibleTTS vpetukhov/bible_tts_hausa 22,057 训练集 + 测试集
TWB Voice CLEAR-Global/TWB-Voice-1.0 7,032 训练集 + 测试集
AfricanVoices https://africanvoices.io 30,237 训练集
Common Voice Mozilla Common Voice 26.0 3,219 训练集 + 测试集

时长分布(训练集)

时长范围 片段数 百分比
< 2 秒 210,276 26.9%
2 — 5 秒 473,249 60.5%
5 — 10 秒 86,453 11.1%
10 — 20 秒 11,367 1.5%
20 — 30 秒 952 0.1%

性别分布

按说话人数量:

性别 训练集说话人数 测试集说话人数
男性 1,111 18
女性 947 13
其他/未知 1 20

按音频片段数量:

性别 训练集片段数 测试集片段数
男性 412,849 3,115
女性 367,645 4,296
其他/未知 1,803 1,416

音频处理流水线

  1. 重采样至 16 kHz 单声道
  2. 通过谱门控进行降噪
  3. 基于能量检测的静音剪裁(25 dB 阈值)
  4. 响度标准化至 −20 dBFS
  5. 质量检查:时长边界、削波比率、空音频检测
  6. FLAC 编码(16-bit PCM)

质量过滤统计

过滤原因 拒绝片段数
无说话人 ID 0
过短(< 1.0 秒) 4,294
过长(> 30.0 秒) 9,995
削波过多(> 1%) 303
处理后为空 0
处理错误 0
总计拒绝 14,592

已知局限

  1. 性别元数据质量:许多来源将性别视为可选或自我报告字段
  2. 跨来源说话人重叠:同一物理说话人可能出现在多个来源数据集中,但未进行跨来源说话人关联
  3. 方言差异:豪萨语有多种方言变体,本数据集混合了方言变体
  4. 录音条件:音频质量因来源不同差异较大
  5. 转写准确性:转写文本直接取自各来源,未进行独立验证或纠正
  6. 无强制对齐:未在词级别验证音频-文本对齐

使用方式

可通过 Hugging Face datasets 库加载:

python from datasets import load_dataset

ds = load_dataset("suleiman2003/unified-hausa-speech") train = load_dataset("suleiman2003/unified-hausa-speech", split="train") test = load_dataset("suleiman2003/unified-hausa-speech", split="test")

也支持流式加载、按说话人/性别过滤,以及与 Transformers 库(如 Whisper)配合进行 ASR 微调。

许可证

Apache 2.0 — 需同时遵守各原始来源的附加许可条款。

搜集汇总
数据集介绍
unified-hausa-speech 数据集图片
构建方式
该数据集是针对非洲广泛使用的豪萨语所构建的大规模、多说话人语音资源,其构建过程严谨而系统。研究者从WaxalNLP、NaijaVoices、BibleTTS、TWB Voice、AfricanVoices及Common Voice等六个公开来源中汇聚原始语料,历经统一的重采样至16kHz单声道、基于谱门控的降噪处理、能量检测的静音裁剪,以及峰值响度归一化至−20 dBFS等一系列音频预处理步骤。随后,通过音频哈希和文本哈希进行跨来源去重,并依据持续时间、削波比例及空音频等多重标准实施质量过滤,确保最终语料的纯净度。说话人ID采用顺序整数编码,跨来源命名空间隔离,避免了身份冲突。最终,数据集被划分为训练集与测试集,其中测试集由独立来源的保留数据构成,确保了评估的客观性。
使用方法
该数据集的设计充分考虑了易用性与灵活性。用户可通过HuggingFace datasets库便捷加载,支持整体加载或流式读取,以适应不同内存环境。数据接口清晰,每个样本包含音频数组、采样率、豪萨语文本、说话人ID、性别及时长,便于直接集成到TTS或ASR流程中。凭借其结构化元数据,研究者能够轻松按说话人或性别进行过滤,以构建定制化子集。与Transformers库的兼容性良好,示例代码展示了如何使用Whisper处理器进行ASR微调的数据预处理。此外,数据集的排序特性支持按说话人构建批次,为说话人自适应训练和评估提供了便利。
背景与挑战
背景概述
统一豪萨语音数据集(Unified Hausa Speech Dataset v5)由Suleiman Ismail于2025年创建,旨在解决非洲主要语言之一——豪萨语(Hausa)语音资源稀缺的问题。豪萨语作为乍得语系语言,使用者超过8000万,广泛分布于西非和中非地区,但高质量语音数据长期匮乏。该数据集整合了六个开源语音语料库,包括WaxalNLP、NaijaVoices、BibleTTS、TWB Voice、AfricanVoices和Common Voice,经过统一的清洗、去重和质量过滤流程,最终形成包含约70.68万小时音频、2110位说话人的大规模语料库,适用于文本转语音(TTS)和自动语音识别(ASR)研究。该数据集填补了豪萨语语音技术研究的空白,为低资源语言语音处理领域提供了重要基础资源,对推动非洲语言技术发展具有里程碑意义。
当前挑战
该数据集面临多重挑战。在领域问题层面,豪萨语作为低资源语言,其语音识别与合成研究长期受限于数据匮乏,且存在方言差异(如Kananci、Zazzaganci等)未标注、转录文本准确性未经核实、音频质量参差不齐(从录音室到移动设备)等问题,直接影响模型训练效果。在构建过程中,挑战包括跨源说话人身份不一致(同一人可能以不同ID出现在多个语料库中)、元数据缺失(性别等字段不完整)、音频处理复杂(需统一采样率、降噪、静音修剪等),以及去重策略的权衡(音频哈希与文本哈希可能造成误删或保留冗余数据)。这些挑战要求持续的数据治理与质量控制,以确保数据集的实用性和可靠性。
常用场景
经典使用场景
该数据集作为大规模清洗后的豪萨语语音资源,为低资源语言语音技术研究提供了坚实的基石。其经典使用场景聚焦于文本到语音合成(TTS)与自动语音识别(ASR)两大核心任务。研究者可凭借其多说话人、多来源、统一格式的特性,训练稳健的声学模型与语言模型,亦可作为预训练语料,微调至特定领域或说话人。数据集的精心排序与去重策略,尤为适宜说话人自适应TTS及语音嵌入提取等前沿探索。
解决学术问题
该数据集直面豪萨语作为非洲主要语言却长期缺乏高质量语音数据的学术困境。通过整合六个开源语料库,历经噪声抑制、静音切除、响度归一化及多重质量筛选,有效解决了数据碎片化、格式不统一与质量参差不齐等难题。其去重机制与稳定的说话人标识,保障了实验的可重复性与模型评估的公正性,为跨语料库泛化研究、多方言建模及低资源语音识别性能提升提供了前所未有的数据支撑。
实际应用
在现实世界应用中,该数据集极大推动了非洲本土语言技术的落地进程。其语音数据可赋能教育领域的语言学习工具,开发豪萨语智能辅导系统;在公共服务层面,助力构建语音交互式信息查询平台,改善医疗、农业等领域的知识传播;对于人机交互技术,为智能音箱、手机助手等设备提供豪萨语语音控制能力,弥合数字鸿沟,促进信息无障碍获取。
数据集最近研究
最新研究方向
在当前低资源语言语音技术迅猛发展的浪潮中,Unified Hausa Speech Dataset v5的推出无疑为非洲语言自然语言处理注入了强劲动力。该数据集汇聚了WaxalNLP、NaijaVoices等六大开源语料,经清洗、去重与标准化处理后,形成逾70万条、总时长超700小时的语音-文本对,覆盖2,110位说话者,极大缓解了豪萨语语音资源匮乏的困境。其研究前沿聚焦于多说话者语音合成与鲁棒性语音识别,尤以跨方言泛化与噪声环境下的性能提升为核心关切。通过按说话者ID排序的流式架构,该数据集不仅为说话人自适应TTS(如VITS、StyleTTS2)提供理想训练条件,亦为说话人嵌入提取及声纹分割评估开辟了标准化基准。结合Apache 2.0开源许可与严格的音频处理流程,此资源有望推动低资源语言语音技术从实验室走向真实场景,弥合全球语言技术鸿沟。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务