遇见数据集

zuhri025/Urdu-Munch-Curriculum-hard

收藏
Hugging Face2026-05-07 更新2026-05-31 收录
官方服务:

资源简介:

Urdu Munch Curriculum Hard 是一个专门用于文本到语音(TTS)训练的数据集,专注于乌尔都语的长形式和复杂话语,旨在提高TTS系统的鲁棒性。该数据集从zuhri025/Urdu-Munch-Processed-s-merged中过滤而来,筛选规则基于音频标记长度(audio_token_len)大于等于223,以确保包含足够长和复杂的语音样本。数据集包含269981行训练数据,适用于训练需要处理复杂语言结构的TTS模型。

Urdu Munch Curriculum Hard is a dataset for long-form and complex utterances in Urdu, designed for robust text-to-speech (TTS) training. It is filtered from `zuhri025/Urdu-Munch-Processed-s-merged` based on the curriculum rule that audio_token_len >= 223, and includes 269981 rows in the train split for challenging TTS model development.

提供机构:
zuhri025
二维码
社区交流群
二维码
科研交流群
商业服务