遇见数据集

mugezhang/xlsum_unseen_phonemized_romanized

收藏
Hugging Face2026-05-15 更新2026-05-31 收录
官方服务:

资源简介:

该数据集是一个多语言文本数据集,包含阿拉伯语、孟加拉语、简体中文和法语四种语言的配置。每个配置提供文本数据(包括标题、摘要和正文)及其语言学标注,如音素表示、国际音标(IPA)剥离版本和罗马化版本。数据集划分为训练集、验证集和测试集,适用于自然语言处理(NLP)和语音处理任务,例如文本到语音(TTS)或语音识别。特征包括id、url、title、summary、text以及对应的音素、IPA剥离和罗马化字段,支持多语言研究和模型训练。

This dataset is a multilingual text dataset containing configurations for Arabic, Bengali, Simplified Chinese, and French. Each configuration provides text data (including title, summary, and text) along with linguistic annotations such as phoneme representations, International Phonetic Alphabet (IPA) stripped versions, and romanized versions. The dataset is split into training, validation, and test sets, making it suitable for natural language processing (NLP) and speech processing tasks, such as text-to-speech (TTS) or speech recognition. Features include id, url, title, summary, text, and corresponding phoneme, IPA stripped, and romanized fields, supporting multilingual research and model training.

提供机构:
mugezhang
二维码
社区交流群
二维码
科研交流群
商业服务