遇见数据集

HUI-Audio-Corpus-German

收藏
arXiv2021-06-11 更新2024-06-21 收录
官方服务:

资源简介:

HUI-Audio-Corpus-German是由霍夫应用科技大学创建的一个高质量的德语TTS数据集,包含超过326小时的音频片段及其匹配的转录文本。数据集主要从librivox.org收集,并通过精细的加工流程处理,以确保音频与转录文本之间的高质量对齐。该数据集包含五个主要发言者和117个额外发言者的音频,旨在为单发言者和多发言者TTS模型提供多样性。数据集的创建过程中,采用了自动化下载、精确的音频文件与转录文本对齐、音频/文本标准化等技术。该数据集主要应用于德语的文本到语音转换领域,旨在解决现有德语TTS数据集质量不一和数量有限的问题。

HUI-Audio-Corpus-German is a high-quality German text-to-speech (TTS) dataset developed by Hof University of Applied Sciences. It contains over 326 hours of audio clips paired with their corresponding transcriptions. The dataset is primarily sourced from librivox.org, and undergoes a rigorous processing workflow to ensure high-quality alignment between audio content and their matched transcriptions. It includes audio data from 5 primary speakers and 117 additional speakers, with the goal of providing sufficient diversity for both single-speaker and multi-speaker TTS models. During the dataset construction process, technologies including automated downloading, precise alignment between audio files and their transcriptions, as well as audio and text normalization were utilized. This dataset is mainly applied in the German text-to-speech domain, and is designed to address the issues of inconsistent quality and limited quantity of existing German TTS datasets.

创建时间:
2021-06-11
搜集汇总
数据集介绍
HUI-Audio-Corpus-German 数据集图片
构建方式
HUI-Audio-Corpus-German的构建依托于一条精细化的预处理流水线,旨在从LibriVox平台获取高质量德语语音数据。首先,通过API自动下载采样率为44.1 kHz的音频文件,并利用深度神经网络进行精确的文本与音频对齐。随后,对音频进行分割,保留时长在5至40秒之间的片段,并以-20 dB为基准进行响度归一化。文本方面,从古腾堡项目自动获取原始文本,经过数字、缩写、注释等复杂规则的规范化处理,最终通过改进的Levenshtein距离算法完成转录与原始文本的精准匹配,筛选出距离低于0.2的高质量音频-文本对。
特点
该数据集涵盖122位朗读者,总计326小时音频,其中五位主要朗读者每人贡献30至97小时,另有117位朗读者提供96小时多样本数据,充分满足单人与多人TTS模型训练需求。所有音频以44.1 kHz高采样率保存,并额外提供“干净”子集,通过最低音量低于-50 dB且静音比例在10%至45%之间的严格阈值过滤,显著降低背景噪声与录音质量差异。文本规范化完整保留了标点符号与大小写,确保语音合成的自然韵律与语义准确性,词汇多样性高达105,000个独特词,远超同类德语数据集。
使用方法
该数据集以CC0许可开源发布,可直接用于训练端到端TTS模型,如Tacotron 2配合Multi-band MelGAN声码器。用户可根据需求选择完整版或干净版子集,其中干净版在验证损失与生成音频质量上表现更优,尤其适用于对背景噪声敏感的应用场景。数据集按朗读者分设独立子集,便于构建单一声线模型,同时“其他”子集支持多说话人训练。音频片段平均时长9至9.5秒,符合主流TTS模型输入规范,建议在22.05 kHz采样率下训练以平衡效率与保真度。
背景与挑战
背景概述
随着深度神经网络在文本转语音(TTS)领域的广泛应用,高质量、大规模的训练数据集成为提升合成语音自然度与准确性的关键基石。然而,非英语语言(如德语)的高品质TTS数据集长期匮乏,现有资源常受限于采样率低、文本未归一化、音频与转录对齐粗糙等问题。为填补这一空白,来自德国霍夫应用科学大学的Pascal Puchtler、Johannes Wirth和René Peinl于2021年创建了HUI-Audio-Corpus-German数据集。该数据集依托LibriVox平台,通过精细化的预处理流水线,从122位朗读者中提取了超过326小时的音频及对应转录文本,其中包含五位主要朗读者的单说话人子集和117位额外朗读者构成的多说话人子集,采样率高达44.1kHz,并额外提供了经过信噪比筛选的“干净”版本。该数据集以CC0协议开源发布,旨在为德语TTS研究提供媲美LJ Speech质量的资源,对推动德语语音合成技术的发展具有重要影响力。
当前挑战
该数据集所解决的领域问题核心在于德语TTS训练数据的高质量与多样性挑战。具体而言,现有德语数据集如M-AILABS(采样率仅16kHz)和MLS-German(文本中数字完全缺失)难以满足现代神经网络对高保真音频与精确文本归一化的需求,导致模型在朗读数字、缩写及复杂句式时表现不佳。构建过程中亦面临多重技术挑战:首先,从LibriVox原始音频中分割出5-40秒的合适片段,需动态调整静音阈值以应对不同录音的噪声差异;其次,德语文本归一化极为复杂,涉及序数词的性数格变化、缩写歧义(如“St.”可映射为“Sankt”或“Straße”)、历史审查符号(如“***”需转换为“Punkt Punkt Punkt”)以及脚注与评论的不同朗读方式,这些均需大量人工比对;最后,利用DeepSpeech模型生成的转录与原始文本的对齐需通过改进的Levenshtein距离精确匹配,并设置0.2的阈值剔除低质量片段,以确保音频-文本对的准确性,但这也导致部分数据被丢弃,增加了构建成本。
常用场景
经典使用场景
在语音合成领域,HUI-Audio-Corpus-German最经典的使用场景是作为端到端文本转语音(TTS)模型的训练与评估基准。该数据集提供了超过326小时的高质量德语语音片段及其精准对齐的文本转录,涵盖五位主要朗读者(每人32至97小时)及117位额外说话人,支持单说话人与多说话人TTS模型的构建。其44.1kHz的高采样率、精细的文本归一化处理(如数字、缩写、标点符号的规范化)以及音频响度标准化,使其成为训练Tacotron 2、WaveNet等深度神经网络架构的理想数据源。研究者常利用其“干净子集”(clean subset)来降低背景噪声干扰,从而提升合成语音的自然度和清晰度,尤其适合德语这一资源稀缺语言的TTS系统开发。
衍生相关工作
该数据集衍生了一系列推动德语语音技术发展的经典工作。研究者基于其高质量对齐特性,优化了TTS系统中的声码器组件,如利用Multi-band MelGAN实现更快的波形生成;同时,其文本归一化策略被借鉴用于改进其他低资源语言的TTS数据预处理流程。此外,该数据集促进了TTS与自动语音识别(ASR)的协同研究——通过TTS生成的合成语音被用于增强ASR训练集中稀有词汇(如人名、数字)的覆盖,反之ASR模型也辅助了TTS数据的自动标注。这些衍生工作不仅提升了德语语音系统的整体性能,也为跨语言语音技术研究提供了可复现的范式。
数据集最近研究
最新研究方向
在语音合成领域,高质量、多语种的训练数据集始终是推动文本到语音(TTS)技术突破的关键瓶颈。HUI-Audio-Corpus-German的发布,为德语TTS研究注入了新的活力,其前沿研究方向聚焦于通过精细化的数据处理流水线,解决非英语语种数据集普遍存在的采样率低、文本归一化不足及音频与转录对齐精度差等核心痛点。该数据集以超过326小时的高保真音频、44.1kHz的采样率以及包含122位说话者的丰富多样性,显著提升了深度神经网络在德语语音合成中的表现。尤为值得关注的是,该研究引入的“干净”子集与Tacotron 2模型的联合评估,揭示了数据质量相较于数据量在模型收敛与输出稳定性上的决定性影响,这一发现与当前业界对高质量、低噪声训练数据的迫切需求高度契合。该数据集的开源特性,不仅为德语语音助手、智能汽车交互等热点应用提供了坚实的数据基石,更推动了多语种TTS研究从“可用”向“卓越”的跨越,其影响力正逐步辐射至自动语音识别等关联领域。
相关研究论文
  • 1
    HUI-Audio-Corpus-German: A high quality TTS dataset霍夫应用科技大学 · 2021年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务