GGLADZ/imdb
收藏资源简介:
大型电影评论数据集。这是一个用于二元情感分类的数据集,包含的数据量比先前的基准数据集要多得多。我们提供了一组25,000条高度极化的电影评论用于训练,以及25,000条用于测试。此外,还有额外的未标记数据可供使用。
### 数据集元信息 annotations_creators: 注释生成方式为专家生成 language_creators: 语言生成方式为专家生成 language: 语言为英语(en) license: 许可证类型为其他 multilinguality: 多语言属性为单语言 size_categories: 数据规模处于10K<n<100K区间 source_datasets: 源数据集为原创数据集 task_categories: 任务类别为文本分类 task_ids: 任务子类别为情感分类(sentiment-classification) paperswithcode_id: imdb-movie-reviews pretty_name: 数据集简称:IMDB dataset_info: config_name: plain_text(纯文本配置) features: - name: 文本,数据类型为字符串 - name: 标签,数据类型为类别标签,可选值为0对应neg(负面)、1对应pos(正面) splits: - name: 训练集,字节大小为33432823,样本数量25000 - name: 测试集,字节大小为32650685,样本数量25000 - name: 无监督集,字节大小为67106794,样本数量50000 download_size: 下载总大小为83446840字节(约84.13 MB) dataset_size: 数据集总大小为133190302字节(约133.23 MB) configs: - config_name: plain_text(纯文本配置) data_files: - split: 训练集,路径为plain_text/train-* - split: 测试集,路径为plain_text/test-* - split: 无监督集,路径为plain_text/unsupervised-* default: 该配置为默认配置 train-eval-index: - config: plain_text(纯文本配置) task: 文本分类 task_id: 二分类 splits: train_split: 训练集 eval_split: 测试集 col_mapping: 文本列映射为text,标签列映射为target metrics: - 类型:准确率,名称:准确率 - 类型:F1值,名称:宏平均F1值,参数:平均方式为宏平均 - 类型:F1值,名称:微平均F1值,参数:平均方式为微平均 - 类型:F1值,名称:加权平均F1值,参数:平均方式为加权平均 - 类型:精确率,名称:宏平均精确率,参数:平均方式为宏平均 - 类型:精确率,名称:微平均精确率,参数:平均方式为微平均 - 类型:精确率,名称:加权平均精确率,参数:平均方式为加权平均 - 类型:召回率,名称:宏平均召回率,参数:平均方式为宏平均 - 类型:召回率,名称:微平均召回率,参数:平均方式为微平均 - 类型:召回率,名称:加权平均召回率,参数:平均方式为加权平均 # "IMDB"数据集卡片 ## 目录 - [数据集描述](#dataset-description) - [数据集概述](#dataset-summary) - [支持任务与排行榜](#supported-tasks-and-leaderboards) - [使用语言](#languages) - [数据集结构](#dataset-structure) - [数据实例](#data-instances) - [数据字段](#data-fields) - [数据拆分](#data-splits) - [数据集构建](#dataset-creation) - [构建初衷](#curation-rationale) - [源数据](#source-data) - [注释标注](#annotations) - [个人与敏感信息](#personal-and-sensitive-information) - [数据集使用注意事项](#considerations-for-using-the-data) - [数据集的社会影响](#social-impact-of-dataset) - [偏差讨论](#discussion-of-biases) - [其他已知局限性](#other-known-limitations) - [附加信息](#additional-information) - [数据集管理者](#dataset-curators) - [许可证信息](#licensing-information) - [引用信息](#citation-information) - [贡献者](#contributions) ## 数据集描述 本数据集为大型电影评论数据集,用于二分类情感分析任务,相较于此前的同类基准数据集,其数据规模更为庞大。我们提供25000条带有强情感倾向的电影评论用于训练,25000条用于测试,同时附带额外的无标签数据供研究使用。 数据集主页:[http://ai.stanford.edu/~amaas/data/sentiment/](http://ai.stanford.edu/~amaas/data/sentiment/) 代码仓库:[更多信息待补充](https://github.com/huggingface/datasets/blob/master/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards) 相关论文:[更多信息待补充](https://github.com/huggingface/datasets/blob/master/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards) 联系人:[更多信息待补充](https://github.com/huggingface/datasets/blob/master/CONTRIBUTING.md#how-to-contribute-to-the-dataset-cards) 下载数据集文件大小:84.13 MB 生成后数据集大小:133.23 MB 总磁盘占用量:217.35 MB ## 数据实例 纯文本(plain_text)配置下的训练集示例如下: { "label": 0, "text": "Goodbye world2 " } ## 数据字段 所有拆分集的数据字段保持一致: - `text`:字符串类型特征,存储电影评论文本 - `label`:分类标签,可选值包括`neg`(对应0,负面情感)与`pos`(对应1,正面情感) ## 数据拆分 | 拆分名称 | 训练集 | 无监督集 | 测试集 | |:---------|------:|--------:|------:| | 纯文本配置 | 25000 | 50000 | 25000 | ## 数据集构建 [更多信息待补充] ## 贡献者 感谢[@ghazi-f](https://github.com/ghazi-f)、[@patrickvonplaten](https://github.com/patrickvonplaten)、[@lhoestq](https://github.com/lhoestq)、[@thomwolf](https://github.com/thomwolf) 为本数据集的收录提供的贡献。



