KazEmoTTS
收藏资源简介:
KazEmoTTS数据集是一个用于哈萨克语情感文本到语音(TTS)的新资源。它包含54,760个音频-文本对,总计74.85小时的语音数据。数据由三位叙述者(一位女性,两位男性)录制,表达了六种情感:中性、愤怒、快乐、悲伤、害怕和惊讶。基于此数据集训练的TTS模型在客观和主观评估中表现出可接受的合成质量。数据集、训练模型和代码都是公开的,以鼓励哈萨克语TTS的进一步研究和开发。
The KazEmoTTS dataset is a novel resource for Kazakh emotional text-to-speech (TTS). It comprises 54,760 audio-text pairs, with a total of 74.85 hours of speech data. The data was recorded by three narrators (one female and two males) expressing six emotions: neutral, anger, happiness, sadness, fear, and surprise. TTS models trained on this dataset have demonstrated acceptable synthesis quality in both objective and subjective evaluations. The dataset, the trained models, and the accompanying code are publicly available to foster further research and development of Kazakh TTS.
KazEmoTTS: 哈萨克语情感文本到语音数据集
数据集概述
KazEmoTTS 是一个用于哈萨克语情感文本到语音(TTS)的新资源。该数据集包含 54,760 个音频-文本对,总计 74.85 小时的语音数据。数据由三位讲述者(一位女性,两位男性)录制,表达了六种情感:中性、愤怒、快乐、悲伤、害怕和惊讶。基于该数据集训练的 TTS 模型在客观和主观评估中表现良好,平均字符距离(MCD)得分在 6.02 到 7.67 之间,平均意见得分(MOS)在 3.51 到 3.57 之间。
数据集统计
| 统计项 | 值 |
|---|---|
| 样本数量 | 54,760 |
| 总时长 | 74.85 小时 |
| 女性讲述者时长 | 34.23 小时 |
| 男性讲述者时长 | 40.62 小时 |
| 情感数量 | 6 |
| 情感类型 | 中性、愤怒、快乐、悲伤、害怕、惊讶 |
| MCD 得分 | 6.02 - 7.67 |
| MOS 得分 | 3.51 - 3.57 |
语言
- 哈萨克语
许可证
- 许可证信息未提供。
引用
- 引用信息未提供。
备注
- 提供的 GitHub 仓库链接返回 404 错误,无法包含直接链接和 README 中的进一步详细信息。一旦仓库可访问,应更新此信息。




