遇见数据集

OpenBibleTTS

收藏
arXiv2026-06-08 更新2026-06-10 收录
数据链接:
官方服务:

资源简介:

OpenBibleTTS是一个面向低资源语言的语音合成大规模基准数据集,由多个研究机构联合创建,旨在解决全球语言资源分布不均的问题。该数据集涵盖37种代表性不足的语言,包含总计约112万条语音-文本对齐数据,总时长超过3,469小时,数据来源于开放授权的圣经语音平台。其构建过程通过系统化的文本解析、音频分割和经文级对齐技术,将原始资源转化为可直接用于训练和评估的标准化语料。该数据集主要应用于低资源语音合成研究领域,为评估不同TTS架构和大规模语音生成模型在跨语言场景下的性能提供了重要基准,推动更具包容性的全球语音技术发展。

OpenBibleTTS is a large-scale benchmark dataset for speech synthesis in low-resource languages, jointly developed by multiple research institutions to address the global inequity in language resource distribution. This dataset encompasses 37 underrepresented languages, totaling approximately 1.12 million speech-text aligned pairs with a combined duration of over 3,469 hours. The data is sourced from open-licensed Bible speech platforms. During its construction, original resources are converted into standardized corpora directly applicable for training and evaluation via systematic text parsing, audio segmentation, and verse-level alignment techniques. Primarily utilized in low-resource speech synthesis research, this dataset provides a critical benchmark for evaluating the performance of diverse TTS architectures and large-scale speech generation models in cross-lingual scenarios, thereby advancing the development of more inclusive global speech technologies.

创建时间:
2026-06-08
搜集汇总
数据集介绍
OpenBibleTTS 数据集图片
构建方式
OpenBibleTTS的构建依托于CC BY-SA授权的Open Bible平台,该平台汇集了由专业圣经翻译组织制作的多语言经文资源。研究团队首先解析USFM/USX格式的结构化文本,提取规范化的节级经文内容。对于具备时间元数据的28种语言,利用JSON中的词级时间戳将章级MP3录音精确切割为节级WAV片段;对于缺乏时间戳的9种语言,则采用零样本ReadAlong Studio强制对齐工具,基于文本转音素与CTC动态规划生成词级边界,并辅以最小文本归一化处理以适配通用音素映射。随后,利用pyannote说话人识别流水线对每语言内不同朗读者进行标注,最终经过四项质量过滤(时长上限、字符下限、CTC可行性、音文比例离群值)筛选出约3,469小时、包含112万余条对齐语音-文本对的语料库,覆盖37种低资源语言。
使用方法
OpenBibleTTS专为低资源文本转语音系统训练与评估而设计,提供标准化的训练/测试分割,每语言包含约2.5–3万条训练样本与500条测试样本。使用者可直接加载已对齐的24kHz单声道WAV音频及对应文本,用于训练从零开始的单语言TTS模型(如FastSpeech 2、VITS、F5-TTS),亦可利用其多说话人标注信息训练具有说话人适应能力的系统。数据集还支持域外泛化评估:研究者可结合FLEURS(维基百科域)与BOUQuET(对话域)的文本,检验模型对非圣经内容的表现。所有经处理的音频、对齐文件和训练模型均已开源,配合EveryVoice、Coqui TTS等标准工具链即可快速复现论文中的实验设置。
背景与挑战
背景概述
OpenBibleTTS是由McGill大学、Mila研究所及萨兰大学等机构的研究团队于2025年推出的大规模低资源语音合成基准数据集。该数据集覆盖37种代表性不足的语言,横跨非洲、南亚、中东、东南亚及加勒比地区,涵盖九大语系和七种书写系统。研究团队通过系统处理CC BY-SA许可的公开圣经语音与文本资源,结合时间戳对齐与强制对齐技术,构建了总计3469小时、超过112万条语段的语音-文本对齐数据。该数据集的出现填补了低资源语言语音合成研究中真实场景数据的空白,为评估从零训练的神经网络语音合成系统与大规模生成式模型提供了统一而严苛的测试平台,显著推动了全球语音技术的包容性发展。
当前挑战
该数据集所应对的核心挑战在于:其一,现有语音合成模型高度集中于英语、中文等少数高资源语言,而全球7000余种语言中绝大多数缺乏足够的语音-文本配对数据、预处理工具及开源流水线,导致低资源语言合成研究长期依赖对高资源语料人工降采样模拟,无法反映真实场景中的正字法变异与有限音素覆盖问题。其二,在数据集构建过程中,研究者面临多说话人混合录音的语音分离、缺乏时间元数据语言的精准对齐、质量筛选标准的制定,以及保证许可证兼容性与文化内容合规性等实操难题,尤其在9种无时间戳语言中需借助零样本强制对齐流水线,并设计多级过滤机制剔除异常片段,最终形成高质量的多语言语音合成基准。
常用场景
经典使用场景
在低资源语言语音合成研究中,OpenBibleTTS作为大规模跨语料库基准,为37种代表性不足的语言提供了对齐的圣经朗读语音与文本数据。研究者利用该数据集对FastSpeech 2、VITS、F5-TTS、OmniVoice及Gemini-TTS等五种主流语音合成架构进行系统性横向对比,涵盖从传统级联模型到大规模预训练语音生成模型不同范式。通过统一的训练与评估协议,该数据集能够有效衡量各模型在同一语言上的语音自然度与可懂度,并揭示模型性能随语言语系、书写系统及资源丰度变化的内在规律。
解决学术问题
OpenBibleTTS解决了低资源语言语音合成研究中长期存在的两大瓶颈:缺乏公开可用的高质量配对语音-文本数据,以及现有研究过度依赖人工降采样高资源语言语料库的模拟设定。该数据集基于CC BY-SA许可的开源圣经语料,经系统文本解析、音频分割与精对齐处理及质量筛选,最终产出3469小时对齐语音及超过112万条语句。它使得研究者能够摆脱模拟条件下的理想化假设,在真实的低资源语言场景下评估不同架构对正字法差异、音系覆盖率不足及对齐噪声等现实挑战的鲁棒性,为构建真正包容的语音合成技术奠定了可复现的实验基石。
实际应用
OpenBibleTTS最直接的实际应用场景是赋能低资源语言的文本到语音合成系统开发,服务于教育、语言复兴及无障碍信息获取领域。基于该数据集训练的EveryVoice模型在多个非洲语言中表现出最优的可懂度,表明其可用于为社区语言教学制作有声教材或辅助视障人士获取书面信息。此外,该数据集所释放的开源模型与管道也可被非营利组织或翻译机构快速部署,将圣经及类似风格的长篇朗读文本转化为语音产品,从而有效降低低资源语言语音技术的入门壁垒。
数据集最近研究
最新研究方向
OpenBibleTTS的发布标志着低资源语音合成领域迈入了一个以真实稀缺语言为基准的新阶段。当前前沿研究聚焦于系统评估多种TTS范式在37种真正低资源语言上的表现,揭示了从零训练的轻量模型EveryVoice在可懂度上以16.95%的词错误率显著超越大规模多语言预训练系统,而Gemini-TTS在受支持语言中获最高主观评分。这一对比凸显了多语言覆盖与可靠合成质量之间的持久张力,尤其是在非洲语言中因声调对比和正字法变异导致的性能鸿沟。研究进一步指出,在域外泛化场景下,预训练系统展现出更强的鲁棒性,而自动评测指标与人类判断的弱相关性则催生了对更贴合低资源语言特性的评估方法的迫切需求。该数据集的开源发布为全球语言技术包容性发展提供了关键资源与实验平台。
相关研究论文
  • 1
    OpenBibleTTS: Large-Scale Speech Resources and TTS Models for Low-Resource Languages麦吉尔大学; 米拉魁北克人工智能研究所; AIMS研究与创新中心; NM-AIST; 萨尔大学; 加拿大CIFAR人工智能主席 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务