jeffnyman/rotten_tomatoes_reviews
收藏资源简介:
--- license: cc-by-sa-4.0 task_categories: - text-classification task_ids: - sentiment-classification --- # Dataset Card for "rotten_tomatoes_reviews" ## Table of Contents - [Dataset Description](#dataset-description) - [Dataset Summary](#dataset-summary) - [Dataset Structure](#dataset-structure) - [Data Fields](#data-fields) - [Data Splits](#data-splits) - [Additional Information](#additional-information) - [Citation Information](#citation-information) ## Dataset Description - **Homepage:** [http://www.cs.cornell.edu/people/pabo/movie-review-data/](http://www.cs.cornell.edu/people/pabo/movie-review-data/) - **Paper:** [https://arxiv.org/abs/cs/0506075](https://arxiv.org/abs/cs/0506075) ### Dataset Summary Movie Review Dataset. This is a dataset containing 4,265 positive and 4,265 negative processed sentences from Rotten Tomatoes movie reviews. ## Dataset Structure ### Data Fields The data fields are the same among all splits. #### default - `text`: a `string` feature. - `label`: a classification label, with possible values including `neg` (0), `pos` (1). ### Data Splits | name |train|validation|test| |-------|----:|---------:|---:| |default| 8530| 1066|1066| ## Additional Information ### Citation Information ``` @InProceedings{Pang+Lee:05a, author = {Bo Pang and Lillian Lee}, title = {Seeing stars: Exploiting class relationships for sentiment categorization with respect to rating scales}, booktitle = {Proceedings of the ACL}, year = 2005 } ```
license: 知识共享署名-相同方式共享4.0(CC BY-SA 4.0) task_categories: - 文本分类(text-classification) task_ids: - 情感分类(sentiment-classification) --- # 《烂番茄影评》数据集卡片 ## 目录 - [数据集描述](#dataset-description) - [数据集摘要](#dataset-summary) - [数据集结构](#dataset-structure) - [数据字段](#data-fields) - [数据拆分](#data-splits) - [附加信息](#additional-information) - [引用信息](#citation-information) ## 数据集描述 - **主页**:[http://www.cs.cornell.edu/people/pabo/movie-review-data/](http://www.cs.cornell.edu/people/pabo/movie-review-data/) - **相关论文**:[https://arxiv.org/abs/cs/0506075](https://arxiv.org/abs/cs/0506075) ### 数据集摘要 电影评论数据集。 本数据集包含来自烂番茄影评的4265条经过预处理的正向语句与4265条经过预处理的负向语句,总计8530条样本。 ## 数据集结构 ### 数据字段 所有数据拆分下的字段格式均保持统一。 #### 默认拆分 - `text`:字符串(string)类型特征,存储影评文本内容。 - `label`:分类标签,可选取值包括`neg`(对应0,负向情感)与`pos`(对应1,正向情感)。 ### 数据拆分 | 拆分名称 | 训练集 | 验证集 | 测试集 | |---------|-------:|-------:|-------:| | default | 8530 | 1066 | 1066 | ## 附加信息 ### 引用信息 @InProceedings{Pang+Lee:05a, author = {Bo Pang and Lillian Lee}, title = {《星级洞察:基于评分尺度的情感分类中的类别关系利用》}, booktitle = {《计算语言学协会年会论文集》}, year = 2005 }
数据集概述
数据集描述
数据集总结
- 名称: Rotten Tomatoes电影评论数据集
- 内容: 包含4,265条正面和4,265条负面的电影评论句子。
- 用途: 用于情感分类任务。
数据集结构
数据字段
text: 字符串类型,代表评论文本。label: 分类标签,可能的值为neg(0,表示负面)和pos(1,表示正面)。
数据分割
- 训练集: 8530条
- 验证集: 1066条
- 测试集: 1066条
许可信息
- 许可证: CC-BY-SA-4.0
引用信息
@InProceedings{Pang+Lee:05a, author = {Bo Pang and Lillian Lee}, title = {Seeing stars: Exploiting class relationships for sentiment categorization with respect to rating scales}, booktitle = {Proceedings of the ACL}, year = 2005 }




