MR, SST1, SST2, Subj, TREC, CR, MPQA
收藏资源简介:
MR: 电影评论,每条评论包含一句话。分类任务是检测正面/负面评论。SST-1: 斯坦福情感树库,是MR的扩展,提供训练/开发/测试分割和细粒度标签。SST-2: 与SST-1相同,但移除了中性评论并使用二元标签。Subj: 主观性数据集,任务是分类句子为主观或客观。TREC: TREC问题数据集,任务是将问题分类为6种问题类型。CR: 客户对各种产品的评论,任务是预测正面/负面评论。MPQA: 主观意见分析的多视角问答数据集。
MR: Movie Reviews, each review consists of a single sentence. The classification task is to detect positive/negative reviews. SST-1: Stanford Sentiment Treebank, an extension of MR, provides train/dev/test splits and fine-grained labels. SST-2: Same as SST-1, but with neutral reviews removed and binary labels used. Subj: Subjectivity dataset, the task is to classify sentences as subjective or objective. TREC: TREC Question Dataset, the task is to classify questions into 6 question types. CR: Customer reviews of various products, the task is to predict positive/negative reviews. MPQA: Multi-Perspective Question Answering dataset for subjective opinion analysis.
数据集概述
数据集列表
| 数据集 | 类别数 | 平均句子长度 | 数据集大小 | 词汇量 | 在word2vec中出现的单词数 | 测试集大小 |
|---|---|---|---|---|---|---|
| MR | 2 | 20 | 10662 | 18765 | 16448 | CV |
| SST1 | 5 | 18 | 11855 | 17836 | 16262 | 2210 |
| SST2 | 2 | 19 | 9613 | 16185 | 14838 | 1821 |
| Subj | 2 | 23 | 10000 | 21323 | 17913 | CV |
| TREC | 6 | 10 | 5952 | 9592 | 9125 | 500 |
| CR | 2 | 19 | 3775 | 5340 | 5046 | CV |
| MPQA | 2 | 3 | 10606 | 6246 | 6083 | CV |
数据集详细信息
- MR: 电影评论数据集,每条评论包含一个句子,任务是检测评论的正负面情绪。
- SST-1: 斯坦福情感树库,是MR的扩展,提供训练/开发/测试分割和细粒度标签。
- SST-2: 与SST-1相同,但移除了中性评论,仅保留二元标签。
- Subj: 主观性数据集,任务是分类句子为主观或客观。
- TREC: 问题分类数据集,任务是将问题分类为6种类型。
- CR: 客户对各种产品的评论数据集,任务是预测评论的正负面情绪。
- MPQA: 多视角问答数据集,任务是分类句子的主观性。




