遇见数据集

ArmanTTS

收藏
arXiv2023-04-07 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

ArmanTTS是一个专为波斯语设计的单说话人TTS数据集,由伊朗科技大学计算机工程学院创建。该数据集包含8449个样本,总时长9小时12分钟14秒,采用22.05 kHz采样率,单声道录音,平均信噪比为25dB。数据集的创建过程包括使用OpenSubtitles获取波斯语文本,将文本映射到音素,并在专业录音室环境下录制语音。ArmanTTS主要应用于波斯语的文本到语音转换,旨在解决波斯语TTS领域数据稀缺的问题。

ArmanTTS is a single-speaker TTS dataset specifically designed for the Persian language, created by the School of Computer Engineering, Iran University of Science and Technology. This dataset includes 8449 samples, with a total duration of 9 hours, 12 minutes and 14 seconds, a sampling rate of 22.05 kHz, monophonic recording, and an average signal-to-noise ratio of 25 dB. The dataset creation process involves obtaining Persian text from OpenSubtitles, mapping the text to phonemes, and recording the speech in a professional studio environment. ArmanTTS is primarily utilized for Persian text-to-speech conversion, aiming to address the issue of data scarcity in the Persian TTS field.

创建时间:
2023-04-07
搜集汇总
数据集介绍
构建方式
在波斯语文本到语音转换领域,高质量数据集的匮乏严重制约了相关研究的发展。为填补这一空白,ArmanTTS数据集应运而生。该数据集的构建始于从OpenSubtitles语料库中提取波斯语句子,随后在录音棚环境中由单一男性发音人进行录制,采样率为22.05 kHz,总时长达9小时12分钟14秒。录音完成后,每个句子被切分为独立的音频文件,并利用音素映射表将波斯文本转换为对应的音素序列,作为模型的输入。数据集被划分为训练集(8419个样本)和测试集(30个样本),确保了模型训练与评估的独立性。
特点
ArmanTTS数据集以其高保真度和专业性在波斯语TTS领域独树一帜。其核心特点包括:单说话人录音消除了多说话人带来的音色差异,保证了语音风格的一致性;录音棚环境录制确保了背景噪声极低,平均信噪比达到25 dB;22.05 kHz的采样率在语音质量与数据量之间取得了良好平衡。此外,数据集提供了从波斯文本到音素的精确映射,包含29个音素(6个元音和23个辅音),覆盖了波斯语的主要发音单元。音频样本时长多集中于2.5秒左右,句子长度以10词以内为主,体现了自然语言的分布规律。
使用方法
ArmanTTS数据集专为端到端文本到语音转换模型设计,其典型使用流程分为两步:首先,将待合成的波斯语句子通过预定义的音素映射表转换为音素序列;然后,将该音素序列输入至TTS模型,如结合Tacotron 2声学模型与HiFi-GAN声码器的架构,生成对应的语音波形。研究者可直接使用数据集提供的训练集与测试集划分,通过计算平均意见得分(MOS)评估合成语音的自然度与清晰度。该数据集在实验中取得了4.0的原始语音MOS、3.87的声码器预测MOS和2.98的TTS模型合成MOS,验证了其作为波斯语TTS基准数据集的实用价值。
背景与挑战
背景概述
文本到语音(TTS)转换是深度学习领域的一项重要任务,其目标是将书面文本自动生成为自然流畅的语音。然而,这一过程高度依赖于高质量、大规模的数据集,尤其对于低资源语言而言,数据匮乏成为制约技术发展的关键瓶颈。在此背景下,伊朗科技大学与阿米尔卡比尔理工大学的研究团队于2022年共同推出了ArmanTTS数据集,旨在填补波斯语单说话人TTS数据集的空白。该数据集由Mohammd Hasan Shamgholi等人主导构建,包含8449个由一名男性说话人在录音棚中录制的波斯语音频样本,总时长约9小时12分钟,采样率为22.05kHz,平均信噪比达25dB。与当时波斯语领域唯一的公开数据集(Persian-text-to-speech,30小时)相比,ArmanTTS以更短的时长实现了更高的信噪比和精细的标注,为波斯语TTS模型的训练提供了标准化基准。研究团队通过结合Tacotron 2声学模型与HiFi-GAN声码器,在30个测试样本上获得了2.98的MOS评分,验证了该数据集在合成语音自然度方面的潜力,推动了低资源语言语音合成的研究进展。
当前挑战
ArmanTTS数据集的构建与应用面临多重挑战。首先,在领域问题层面,波斯语TTS面临的核心挑战是数据稀缺与语言特异性。波斯语包含29个音素(6个元音与23个辅音),其书写系统存在复杂的连写与变体形式,且缺乏像英语那样丰富的开源语音资源。现有单说话人数据集(如LJSpeech)多面向英语,而波斯语仅有Persian-text-to-speech一个公开集,其30小时时长对覆盖音素分布与韵律变化仍显不足。ArmanTTS尽管在信噪比上表现优异(平均25dB),但9小时的总时长限制了模型对长尾音素组合与自然停顿的建模能力。其次,在构建过程中,数据采集面临文本来源与标注精度的权衡。团队从OpenSubtitles获取波斯语文本,但该来源的句子长度分布不均(多数样本词数低于10个),导致短句占比过高,可能削弱模型对复杂句法结构的泛化能力。此外,音素映射需手动处理波斯语中字母与音素的非一一对应关系(如“ت”与“ط”均映射为/t/),这一过程依赖语言学专家知识,增加了标注成本。而录音棚环境虽保证了高信噪比,却无法覆盖真实场景中的噪声与口音变化,使得模型在域外数据上的鲁棒性存疑。
常用场景
经典使用场景
在语音合成研究领域,ArmanTTS数据集被广泛用于构建和评估针对波斯语的单说话人文本到语音(TTS)系统。其经典使用场景是作为声学模型与声码器联合训练的基准数据,例如结合Tacotron 2与HiFi-GAN模型,以音素为输入生成高质量波形。该数据集包含9小时12分钟的录音室录制语音,采样率为22.05 kHz,信噪比均值达25 dB,为模型学习波斯语音素到声学特征的映射提供了干净且一致的语料基础。研究者常利用其8449个样本中的训练集(8419个)进行端到端语音合成建模,并在30个测试样本上通过平均意见得分(MOS)评估合成语音的自然度与可懂度。
实际应用
在实际应用中,ArmanTTS数据集主要服务于波斯语语音助手、有声读物生成及无障碍通信系统的开发。例如,基于该数据集训练的TTS模型可集成到智能家居设备或移动应用中,实现波斯语文本到自然语音的实时转换,帮助视觉障碍用户获取信息。此外,在波斯语教育领域,该数据集可用于生成标准发音的教学音频,辅助语言学习者掌握正确读音。其高信噪比和单说话人特性也使其适合作为语音克隆系统的训练素材,用于个性化语音定制,如为波斯语社交媒体平台提供用户专属语音输出功能。这些应用场景均受益于数据集在录音室环境中采集的纯净语音,确保了合成输出的高保真度。
衍生相关工作
ArmanTTS数据集的发布催生了多项衍生研究工作。首先,研究者基于该数据集改进声学模型架构,如探索端到端Transformer或FastSpeech在波斯语上的适配性,以提升合成速度与韵律表现。其次,针对声码器部分,相关工作尝试将Mel-GAN或WaveGan与ArmanTTS结合,对比不同生成策略对波斯语音素细节的还原能力。此外,该数据集推动了跨语言迁移学习研究,例如利用预训练的英语TTS模型在ArmanTTS上进行微调,以缓解低资源语言的训练瓶颈。最后,数据增强方法(如加噪、变速)被引入以扩充ArmanTTS的规模,进而研究模型对噪声鲁棒性与时长泛化能力,这些工作共同丰富了波斯语语音合成的技术路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务