DeepPavlov/clinc150_es
收藏资源简介:
该数据集是一个多语言文本数据集,包含英语和西班牙语的utterance(话语)文本,每个样本对应一个浮点型label(标签),可能用于分类或回归任务。数据集分为训练集(15,200个样本)、测试集(5,500个样本)和验证集(3,100个样本),总大小约2.57 MB。特征包括utterance(原始话语)、label(目标值)和utterance_es(西班牙语翻译或对应话语),适用于自然语言处理任务,如情感分析、文本分类或多语言模型训练。
This dataset is a multilingual text dataset containing utterances in English and Spanish, with each sample associated with a float-type label, likely for classification or regression tasks. It is divided into train (15,200 examples), test (5,500 examples), and validation (3,100 examples) splits, with a total size of approximately 2.57 MB. Features include utterance (original text), label (target value), and utterance_es (Spanish translation or corresponding utterance), making it suitable for natural language processing tasks such as sentiment analysis, text classification, or multilingual model training.




