WSYue-TTS-eval
收藏资源简介:
WSYue-TTS-eval是一个专门为零样本粤语TTS评估设计的基准数据集,旨在对TTS模型在现实世界数据分布上的性能进行严格评估,并测试其在多样化和复杂的粤语场景下的一般化和鲁棒性。该数据集包含两个子集:Base和Coverage。Base子集包含来自CommonVoice的1000个日常对话风格的提示-文本对。Coverage子集结合了手动策划和LLM生成的文本,覆盖了日常生活、新闻、娱乐、诗歌等多个领域,以及多音字、声调变调、代码切换、专有名词和数字等粤语语言学现象。
WSYue-TTS-eval is a benchmark dataset specifically designed for zero-shot Cantonese Text-to-Speech (TTS) evaluation, aiming to rigorously evaluate the performance of TTS models on real-world data distributions and test their generalization and robustness in diverse and complex Cantonese scenarios. This dataset includes two subsets: Base and Coverage. The Base subset contains 1,000 daily conversation-style prompt-text pairs sourced from CommonVoice. The Coverage subset combines manually curated and LLM-generated texts, covering multiple domains such as daily life, news, entertainment, poetry, as well as various Cantonese linguistic phenomena including polyphonic characters, tone sandhi, code-switching, proper nouns and numerals.
WSYue-TTS-eval: 粤语TTS基准数据集
概述
WSYue-TTS-eval是一个专门为零样本粤语语音合成评估设计的基准数据集,旨在解决粤语在语音合成中的独特语言特征问题。该数据集支持对模型在不同领域和具有挑战性的语言现象中的泛化能力和鲁棒性进行严格评估。
子集
Base
- 包含1,000个从CommonVoice采样的提示文本对
- 评估模型在真实世界数据分布上的性能
- 主要为日常对话风格
Coverage
- 结合手动整理和LLM生成的文本
- 覆盖多个领域:日常生活、新闻、娱乐、诗歌
- 涵盖多样化的粤语语言现象:
- 多音字
- 变调
- 语码转换
- 专有名词和数字
- 其他具有挑战性的语言案例
特点
- 专为TTS系统的严格评估设计
- 测试模型在多样化和复杂粤语场景中的泛化能力和鲁棒性
许可证
Apache-2.0




