--- pretty_name: TTS General Benchmark language: - en - hi - bn - ta - te - kn - ml - mr - gu - od - pa license: other task_categories: - text-to-speech size_categories: - 1K<n<10K tags: - tts - bench
本研究创建了名为‘Aesthetics Text Corpus’的印度语数据集,包含约1000篇跨越百年的虚构与非虚构文本。此外,还构建了一个包含超过200,000个词根的全面停止词根列表。数据集的创建旨在解决自然语言处理中非英语语言资源的不足,并强调使用停止词根而非停止词的重要性,因为词根在不同来源中更为一致。该数据集适用于语言模型创建、文本分类和信息检索等NLP任务,旨在推动印度语在NLP领域