Marylux-648-TTS-Corpus
收藏资源简介:
Marylux-648-TTS-Corpus是一个多语言(卢森堡语、法语、德语)的语音数据库,用于MaryTTS项目。该数据集包含648个样本,经过优化处理,包括音频格式转换、静音移除、音量标准化等,以适应深度机器学习系统的训练。
The Marylux-648-TTS-Corpus is a multilingual (Luxembourgish, French, German) speech database designed for the MaryTTS project. This dataset comprises 648 samples that have been optimized through processes such as audio format conversion, silence removal, and volume normalization to facilitate training in deep machine learning systems.
数据集概述
数据集名称
Marylux-648-TTS-Corpus
数据集描述
该数据集由Judith Manzoni于2014年在萨尔兰大学录制,包含卢森堡语、法语和德语的多语言语音数据库,用于MaryTTS项目。音频数据以单个FLAC文件提供,采样频率为48 kHz,每样本16位。转录数据以单个YAML文件提供。数据集根据Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License授权。
数据集内容
数据集包含以下转录音频片段:
- Nordwand an dSonn: 12
- 卢森堡语Wikipedia语句: 584
- 卢森堡语单词: 52
- 德语Wikipedia语句: 198
- 法语Wikipedia语句: 255
数据集优化
数据集经过优化,以创建卢森堡语合成语音,通过训练基于神经网络的深度机器学习系统。优化步骤包括:
- 移除12个北风样本用于推理测试
- 音频采样率从48000 Hz降至22050 Hz,格式从FLAC转换为WAV
- 移除音频片段开始和结束的静音
- 音频片段的响度设置为-25 dB
- 将超过10秒的音频片段通过分割和重命名进行缩减
- 将单个单词的片段组合成每个包含4个单词的样本,单词间用逗号分隔
- 移除带有噪音或错误发音的片段
- 手动检查并修正所有剩余片段的转录
- 在最终质量检查后,移除音频和文本长度标准差大于0.8的样本
数据集结果
优化后的数据集包含648个样本,称为Marylux-648-TTS-Corpus。
数据集转换步骤
- 采样率和格式转换:使用基于librosa的
resample.py脚本进行转换。 - 静音移除:使用
sox工具移除音频片段的静音部分。 - 响度设置:使用
loudness.py脚本将音频片段的响度标准化至-25 dB。 - 音频分割:手动在Audacity中进行音频分割。
- 单词组合:手动在Audacity和文本编辑器中组合单词片段。
- 噪音移除:使用Audacity的噪音减少插件手动移除噪音。
- 文本校正:使用Audacity和文本编辑器检查并修正文本。
- 质量检查:使用
AnalyzeDataset.ipynb笔记本进行自动质量检查。
数据集语音学处理
- 国际音标:使用Peter Gilles开发的自动音标转录工具进行音标转录。
- 卢森堡语音标器:eSpeak-NG和Rhasspy-Gruut集成卢森堡语支持。
数据集文本格式
文本样本以metadata.csv文件格式存储,每行包含三个字段,使用管道符号|分隔。




