zuhri025/Urdu-Munch-Curriculum-hard
收藏官方服务:
资源简介:
Urdu Munch Curriculum Hard 是一个专门用于文本到语音(TTS)训练的数据集,专注于乌尔都语的长形式和复杂话语,旨在提高TTS系统的鲁棒性。该数据集从zuhri025/Urdu-Munch-Processed-s-merged中过滤而来,筛选规则基于音频标记长度(audio_token_len)大于等于223,以确保包含足够长和复杂的语音样本。数据集包含269981行训练数据,适用于训练需要处理复杂语言结构的TTS模型。
Urdu Munch Curriculum Hard is a dataset for long-form and complex utterances in Urdu, designed for robust text-to-speech (TTS) training. It is filtered from `zuhri025/Urdu-Munch-Processed-s-merged` based on the curriculum rule that audio_token_len >= 223, and includes 269981 rows in the train split for challenging TTS model development.
提供机构:
zuhri025


