MR, SST-1, SST-2, Subj, TREC, CR
收藏资源简介:
MR: 电影评论,每篇评论包含一个句子,任务是检测正面/负面评论。SST-1: 斯坦福情感树库,是MR的扩展,提供训练/开发/测试分割和精细标签。SST-2: 与SST-1相同,但移除了中性评论并使用二元标签。Subj: 主观性数据集,任务是分类句子为主观或客观。TREC: TREC问题数据集,任务是将问题分类为6种问题类型。CR: 客户对各种产品的评论,任务是预测正面/负面评论。
MR: Movie Reviews, each review consists of a single sentence, and the task is to detect positive/negative reviews. SST-1: Stanford Sentiment Treebank, an extension of MR, providing train/dev/test splits and fine-grained labels. SST-2: Same as SST-1 but with neutral reviews removed and using binary labels. Subj: Subjectivity dataset, the task is to classify sentences as subjective or objective. TREC: TREC question dataset, the task is to classify questions into 6 question types. CR: Customer reviews of various products, the task is to predict positive/negative reviews.
数据集概述
数据集列表及特征
| 数据集 | 类别数 | 平均句子长度 | 数据集大小 | 词汇量 | 出现在word2vec中的单词数 | 测试集大小 |
|---|---|---|---|---|---|---|
| MR | 2 | 20 | 10662 | 18765 | 16448 | CV |
| SST1 | 5 | 18 | 11855 | 17836 | 16262 | 2210 |
| SST2 | 2 | 19 | 9613 | 16185 | 14838 | 1821 |
| Subj | 2 | 23 | 10000 | 21323 | 17913 | CV |
| TREC | 6 | 10 | 5952 | 9592 | 9125 | 500 |
| CR | 2 | 19 | 3775 | 5340 | 5046 | CV |
| MPQA | 2 | 3 | 10606 | 6246 | 6083 | CV |
数据集详细描述
- MR: 电影评论数据集,每条评论包含一个句子,任务是检测评论的正负性。
- SST-1: 斯坦福情感树库,是MR的扩展,提供训练/开发/测试分割和细粒度标签。
- SST-2: 与SST-1相同,但移除了中性评论,仅保留二元标签。
- Subj: 主观性数据集,任务是分类句子为主观或客观。
- TREC: 问题分类数据集,任务是将问题分类为6种类型。
- CR: 客户对各种产品的评论数据集,任务是预测评论的正负性。




