遇见数据集

nnh-tts-dataset

收藏
Hugging Face2026-06-16 更新2026-06-17 收录
官方服务:

资源简介:

Mimba NNH TTS 数据集是一个干净、多说话人的合成语音语料库,专门用于 Ngiemboon (NNH) 语言。NNH 是喀麦隆西部的一种草原班图语。该数据集旨在为这种低资源语言训练和微调小型、设备端文本转语音模型。数据集中的每个样本都包含一个经过清理的 NNH 句子和由机器生成的语音音频。音频数据是合成的,由 TTS 模型生成,并非录制自真人说话人。数据集包含约 44,000 个清理过的 NNH 句子片段,使用 6 个不同的参考声音(4 个男性标签,2 个女性标签)为每个句子生成语音,从而产生约 264,000 个总样本,形成了跨声音的平行数据,适用于多说话人训练和语音克隆。音频为单声道,采样率为 24,000 Hz,以 WAV 字节形式嵌入 Parquet 文件中。源文本来自 `mimba/text2text` 数据集的 `nnh_fra` 分片,该文本源自《圣经》翻译和其他 NNH 资料。文本经过清理,保留了音调变音符号和修饰撇号,移除了编辑标点和数字等。音频使用 OmniVoice 多语言零样本 TTS 模型在克隆参考模式下合成。数据集包含以下字段:唯一样本 ID、说话人 ID、性别标签、清理后的 NNH 文本、音频字节字典、采样率、音频时长以及用于追溯的源文本索引。需要注意的是,所有音频均为模型生成,可能存在 TTS 伪影;性别标签可能不一致;源文本主要来自宗教领域,存在领域偏见;音素覆盖取决于源句子;且未对每个样本进行人工验证。在商业使用或重新分发前,用户需核实源文本和生成音频的许可条款。该数据集主要用于为 NNH 语言微调小型、设备端的 TTS 模型,以支持离线移动 TTS 应用,也可作为后续添加表达性或非语言标签的基础。

The Mimba NNH TTS Dataset is a clean, multi-speaker synthetic speech corpus specifically designed for the Ngiemboon (NNH) language. NNH is a Grassfields Bantu language spoken in western Cameroon. This dataset is intended for training and fine-tuning small, on-device text-to-speech (TTS) models for this low-resource language. Each sample in the dataset consists of a cleaned NNH sentence and machine-generated speech audio. The audio data is synthetic, produced by TTS models rather than recorded from human speakers. The dataset contains approximately 44,000 cleaned NNH sentence segments. Six distinct reference voices (4 male-labeled and 2 female-labeled) are used to generate speech for each sentence, resulting in roughly 264,000 total samples, forming cross-voice parallel data suitable for multi-speaker training and voice cloning. The audio is mono-channel with a sampling rate of 24,000 Hz, stored as WAV bytes embedded within Parquet files. The source text is sourced from the `nnh_fra` split of the `mimba/text2text` dataset, which originates from Bible translations and other NNH language materials. The text has been cleaned: tonal diacritics and modifying apostrophes are preserved, while editorial punctuation and numerals are removed. The audio was synthesized using the OmniVoice multilingual zero-shot TTS model in cloning reference mode. The dataset includes the following fields: unique sample ID, speaker ID, gender label, cleaned NNH text, audio byte dictionary, sampling rate, audio duration, and source text index for traceability. Notably, all audio is model-generated and may contain TTS artifacts; gender labels may be inconsistent; the source text is primarily sourced from religious domains, introducing domain bias; phoneme coverage is dependent on the source sentences; and no manual validation has been performed for individual samples. Users are required to verify the license terms for the source text and generated audio prior to commercial use or redistribution. This dataset is primarily used for fine-tuning small, on-device TTS models for the NNH language to support offline mobile TTS applications, and can also serve as a foundation for subsequent addition of expressive or non-linguistic labels.

创建时间:
2026-06-14
原始信息汇总

数据集概述:Mimba NNH TTS Dataset (Ngiemboon Synthetic Speech)

基本信息

  • 语言:Ngiemboon(nnh),喀麦隆西部草场班图语。
  • 许可证:cc-by-nc-sa-4.0(非商业性使用-相同方式共享4.0)。
  • 任务类别:文本到语音(Text-to-Speech)。
  • 数据集规模:100,000 至 1,000,000 条样本。
  • 配置:默认配置,包含训练集,数据文件为 data/*.parquet

数据集摘要

  • 音频:单声道,24,000 Hz 采样率,WAV 格式字节嵌入在 Parquet 文件中。
  • 说话人:6 个参考声音(4 男 2 女)。
  • 句子:约 44,000 个清洗后的 NNH 句子片段。
  • 总样本数:约 264,000 条(每个句子 × 每个说话人)。
  • 来源文本:源自 mimba/text2text 数据集的 nnh_fra 分割。
  • 生成模型:OmniVoice(k2-fsa),零样本克隆方式。

数据字段

字段 类型 描述
id string 唯一样本ID,例如 spk_m2_001234
speaker_id string 参考声音ID(spk_m1spk_f2
gender string 说话人性别标签(M 或 F)
text string 清洗后的 NNH 句子(口语文本)
audio dict 包含 {"bytes": <24kHz单声道WAV字节>, "path": None}
sampling_rate int 固定值 24000
duration float 音频时长(秒)
src_idx int 在源数据集 mimba/text2text 中的行索引

说话人信息

说话人ID 性别标签
spk_m1 M
spk_m2 M
spk_m3 M
spk_m4 M
spk_f1 F
spk_f2 F

注意:性别标签来自生成配置,未经过声学重新验证,使用时需确认。

数据生成方式

  • 文本:来自 mimba/text2text 数据集的 nnh_fra 分割,源于圣经翻译及其他 NNH 来源。
  • 清洗与分割:保留声调变音符号和修饰性撇号 ʼ(U+02BC);删除编辑性标点、非断行空格、包含数字及过短片段;根据标点分割长句。
  • 音频生成:使用 OmniVoice 零样本 TTS 模型,以 NNH 为语言 ID,每个句子用所有参考声音生成。
  • 输出格式:浮点32位单声道 24,000 Hz,WAV 编码嵌入为字节,存储于 Parquet 分片中。

局限性

  • 合成音频:所有音频由模型生成,可能带有 TTS 伪影,不完全等同于真人发音。
  • 性别标签:至少一个说话人的性别标签可能不准确。
  • 文本偏差:文本主要来自宗教来源,词汇和领域偏向圣经,不反映日常对话。
  • 音素覆盖:受来源句子影响,稀有音素可能覆盖不足。
  • 无人工验证:每条样本未经人工审核,大规模使用前需抽样检查。

预期用途

  • 微调小规模、设备端文本到语音模型,使其能够发音 Ngiemboon 并进行声音克隆。
  • 作为后续添加表达性/非语言标签微调阶段的基础数据集。

引用信息

  • 项目:Mimba 项目及 OmniVoice(k2-fsa)作为语音生成器。

  • BibTeX 引用: bibtex @misc{ title={nnh-tts-dataset: Small Out-of-domain resource for various africain languages}, author={Mimba Ngouana Fofou}, year={2026}, }

  • 联系方式:可通过仓库的“社区”标签页提问,或联系邮箱 baounabaouna@gmail.com。

搜集汇总
数据集介绍
nnh-tts-dataset 数据集图片
构建方式
该数据集以Ngiemboon(NNH)低资源语言为对象,从mimba/text2text语料库中提取文本,历经清洗、分割与标点优化(保留声调符号'ˇ^等、移除无关标点与数字),最终形成约44,000句完整语句。语音部分借助OmniVoice零样本TTS模型,针对六位参考说话人(含四男两女)以确定性配置(温度0、步长32)逐句合成音频,输出为24000 Hz单声道WAV字节流,嵌入Parquet分片文件中存储,实现了多说话人并行数据覆盖。
使用方法
推荐使用HuggingFace datasets库加载,通过cast_column('audio', Audio(sampling_rate=24000))自动解码获取numpy数组与采样率。亦可利用soundfile从字节流手动读取,便于与NeuCodec等神经编解码器集成。支持流式模式处理大规模数据,按speaker_id或gender过滤样本。适用于微调端侧TTS模型或语音克隆任务,尤其适合与OmniVoice等零样本模型结合进行低资源语言的发音优化。
背景与挑战
背景概述
在低资源语言语音合成领域,尤其是非洲格拉斯菲尔德班图语支语言,常受限于缺乏大规模、高质量且多说话人的语音数据。nnh-tts-dataset(Mimba NNH TTS Dataset)由Mimba项目团队于2026年创建,旨在构建一种干净、多说话人的合成语音语料库,专门服务于喀麦隆西部Ngiemboon语(NNH)的文本到语音(TTS)研究。该数据集包含约264,000个音频样本,覆盖6个参考说话人,其核心研究问题在于探索利用零样本语音克隆技术为极端低资源语言生成可用于训练和微调的小型、设备端TTS模型的可行性。基于OmniVoice合成模型和mimba/text2text源文本,该数据集不仅填补了NNH语言语音资源的空白,还为非洲低资源语言语音技术的落地提供了可复现的范例。
当前挑战
数据集面临的核心挑战在于其构建与应用的双重维度。在领域问题层面,NNH语言属于低资源语言,日常会话文本稀缺,源文本主要来自圣经译本,导致语料在词汇、语域和领域上存在偏见,不能全面代表日常交流;同时,合成语音虽由OmniVoice生成,但可能包含模型伪影,且发音与韵律未必完全符合母语者习惯,从而对模型训练的鲁棒性构成潜在风险。在构建过程层面,合成立体声数据缺乏逐样本的人类验证,性别标签未经过声学重新确认,可能导致部分样本标注不一致;此外,源文本中的罕见音素覆盖率不足,以及商用与再分发时涉及的源文本版权和OmniVoice音频许可的模糊性,均增加了数据集的可用性门槛。
常用场景
经典使用场景
在低资源语言语音合成研究中,Ngiemboon语(NNH)作为喀麦隆西部草原班图语的一支,长期面临标注语料匮乏的困境。nnh-tts-dataset以约44,000条清洁文本与六位参考说话人的合成语音构建了约264,000对平行数据,为多说话人文本转语音(TTS)模型的训练与微调提供了关键资源。该数据集最经典的使用场景是驱动小规模、端侧部署的TTS系统,如在移动设备上实现零样本语音克隆与跨说话人语音生成。研究人员可通过Parquet格式内嵌的24kHz WAV音频与对应文本,直接加载至神经音频编解码器(如NeuCodec、SNAC)的令牌化流程,从而高效迭代低资源语言的高保真度语音合成模型。
解决学术问题
该数据集直面低资源语言TTS研究中数据稀缺与领域偏见的双重挑战。传统方法依赖数小时人工录音,而对于使用人口有限的Ngiemboon语而言,实地采集成本高昂且难以规模化。nnh-tts-dataset通过合成语音技术突破了数据瓶颈,使学术界首次能够系统性地探索零样本克隆在多说话人、低资源场景下的泛化能力。该语料库的关键学术意义在于提供了平行语料结构(同一句子由所有说话人朗读),这为解耦说话人身份与语言内容的研究(如说话人自适应、语音表征学习)铺平了道路。此外,数据集明确标注的源文本宗教领域偏向,可促使社区关注域外迁移学习与文本多样性的影响,推动更稳健的低资源TTS评估框架建立。
实际应用
在实际应用中,nnh-tts-dataset的核心价值在于赋能离线移动端TTS系统,使Ngiemboon语用户在无网络环境下也能获得流畅的语音交互体验。例如,社区信息播报、教育类应用程序可将圣经文本等书面内容转化为口语化音频,辅助识字教学与语言传承。同时,六位参考说话人(含男声与女声)为语音助手或导航系统提供了可定制的声音角色,用户可根据偏好选择不同音色。该数据集还支持按说话人或性别进行筛选,便于开发者针对特定使用场景(如女性导向的育儿内容)快速构建专属语音模型。由于音频采用紧凑的WAV字节嵌入Parquet格式,结合流式加载策略,即便是存储受限的设备也能高效处理大规模数据,从而降低了低资源语言TTS技术的部署门槛。
数据集最近研究
最新研究方向
当前,针对低资源语言(如喀麦隆的恩根博恩语NNH)的语音合成研究正聚焦于利用零样本语音克隆与合成数据生成技术,以突破数据匮乏的瓶颈。该数据集通过OmniVoice模型将约4.4万条经过清洗的恩根博恩语文本与6位参考说话人的声学特征结合,构建了包含26.4万条平行合成语音的大规模多说话人TTS语料库,为训练轻量化、可离线部署的语音合成模型提供了关键支撑。其研究意义在于:一方面,探索了从圣经文本等有限资源中挖掘语言覆盖度的路径,同时揭示了合成语音在音素覆盖、韵律自然度及声纹标签一致性等方面的固有局限;另一方面,推动了面向非洲低资源语言的边缘端语音克隆技术发展,并引发了对宗教领域语料偏差与合成数据版权合规性的深入讨论。这一工作为后续融入非言语标记、增强表现力合成及多语言迁移学习奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务