frankier/multiscale_rotten_tomatoes_critic_reviews
收藏官方服务:
资源简介:
该数据集是烂番茄电影评论数据集的清理版本,专注于电影评论和评分。数据来源于2020年10月31日之前的公开网站,经过处理,仅保留了包含评论和评分的条目,并将评分标准化为几个整数顺序尺度。该数据集适用于文本分类任务,特别是文本评分和情感评分,数据量在10万到100万之间。
语言: - 英语 语言创建方式:公开采集 许可证:CC0 1.0 多语言属性:单语言 数据规模:10万 < 样本数 < 100万 标签: - 影评 - 评分 - 有序分类 - 文本 任务类别: - 文本分类 任务子项: - 文本评分 - 情感评分 本数据集为烂番茄(Rotten Tomatoes)影评人评论数据集的清洗版本。原始数据集源自Kaggle平台,地址为:https://www.kaggle.com/datasets/stefanoleone992/rotten-tomatoes-movies-and-critic-reviews-dataset 本数据集的数据采集自公开网站https://www.rottentomatoes.com,采集截止日期为2020年10月31日。 清洗流程会剔除同时缺失影评与评分的条目,并将评分标准化为若干整数型有序分类尺度。 使用本数据集需安装`kaggle`库,并通过环境变量或`~/.kaggle/kaggle.json`文件配置Kaggle API密钥,详情可参考[Kaggle官方文档](https://www.kaggle.com/docs/api#authentication)。 已完成处理的数据集版本可通过以下链接获取:https://huggingface.co/datasets/frankier/processed_multiscale_rt_critics
提供机构:
frankier原始信息汇总
数据集概述
基本信息
- 语言: 英语
- 语言创建者: found
- 许可证: CC0-1.0
- 多语言性: 单语种
- 大小类别: 100K<n<1M
标签
- 评论
- 评分
- 序数
- 文本
任务类别
- 文本分类
任务ID
- 文本评分
- 情感评分
数据来源与处理
- 数据集是基于Kaggle上的“rotten-tomatoes-movies-and-critic-reviews-dataset”进行清理的版本。
- 数据从公开网站https://www.rottentomatoes.com 抓取,截至2020-10-31。
- 清理过程包括删除没有评论和评分的数据,并将评分标准化为几个整数序数尺度。
数据集链接
- 原始数据集: Kaggle链接
- 处理后的数据集: Hugging Face链接
搜集汇总
数据集介绍

构建方式
该数据集源自Kaggle上公开的Rotten Tomatoes影评人评论数据集,原始数据于2020年10月31日从Rotten Tomatoes官方网站爬取。在构建过程中,研究者对所有条目进行了严格的清洗,剔除了缺乏评论或评分的记录,并将评分标准化为多个整数序数尺度,以确保数据的一致性和可比性。最终形成的数据集包含约10万至100万条样本,适用于文本分类和情感评分任务。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,但需预先安装kaggle库并配置Kaggle API密钥(通过环境变量或~/.kaggle/kaggle.json文件)。加载后,数据以文本和评分对的形式呈现,可直接用于训练文本分类或情感评分模型。为简化使用流程,研究者还提供了一个经过预处理的数据集版本,位于HuggingFace上的frankier/processed_multiscale_rt_critics,用户可跳过本地配置步骤直接调用。
背景与挑战
背景概述
在自然语言处理与情感分析领域,电影评论数据集是衡量文本分类与情感评分模型性能的重要基准。frankier/multiscale_rotten_tomatoes_critic_reviews数据集由研究者Frankie Robertson于2020年10月31日从公开影评网站Rotten Tomatoes爬取并清洗构建,原始数据源自Kaggle平台。该数据集聚焦于影评文本与对应评分的多尺度序数分类任务,旨在解决情感评分预测中的细粒度标注问题。其核心研究价值在于提供标准化、多尺度的评论-评分对齐数据,推动序数回归与情感强度建模的发展。作为Rotten Tomatoes影评数据的改进版本,该数据集在学术界和工业界被广泛用于情感分析基准测试,对提升模型对主观文本的量化理解能力具有显著影响力。
当前挑战
该数据集所解决的领域问题在于情感评分预测中传统二分类或三分类方法无法捕捉评论的细微情感差异,而多尺度序数标签的引入增加了模型对情感强度连续性的建模难度。构建过程中面临的核心挑战包括:原始数据中大量缺失评论或评分的条目需被剔除,以确保数据完整性;不同来源的评分格式(如星级、百分制)需统一映射到整数序数标度,这一标准化过程需避免信息扭曲;爬取数据的时间戳限制(2020年10月31日)导致数据时效性不足,可能无法反映近年影评趋势。此外,数据清洗需平衡样本量与标注一致性,最终仅保留同时包含文本与评分的条目,可能引入选择偏差。
常用场景
经典使用场景
该数据集整合了来自烂番茄影评人的电影评论与评分,经过清洗后将评分标准化为多个整数序数尺度,从而为文本情感分析及序数回归任务提供了高质量的标注数据。研究者可借此构建模型,对影评文本进行细粒度的情感倾向预测,例如将评论映射至从负面到正面的多层次评分区间,从而超越传统的二分类或三分类情感分析范式。
解决学术问题
该数据集有效解决了影评情感分析中评分粒度不足与标注不一致的学术难题。通过提供多个序数尺度上的标准化评分,它使得研究者能够探索文本特征与细粒度情感强度之间的映射关系,推动了序数回归模型在自然语言处理领域的发展。其意义在于为情感分析从粗粒度分类向精细量化评估的转型提供了基准资源,促进了更准确的情感理解研究。
实际应用
在实际应用中,该数据集可用于构建电影评论情感监测系统,帮助制片方和发行商实时分析公众对电影的口碑走向。同时,它也能赋能推荐算法,通过理解用户评论中的情感强度来优化个性化电影推荐。此外,影评平台的自动评分生成工具可基于该数据集训练,实现从文本到评分的智能映射,提升用户体验。
数据集最近研究
最新研究方向
在自然语言处理与情感分析领域,多尺度影评评分数据集正成为细粒度情感分类与序数回归研究的前沿阵地。frankier/multiscale_rotten_tomatoes_critic_reviews 数据集通过标准化多级序数评分,为模型从文本中捕捉细微情感差异提供了高质量基准。当前研究热点聚焦于利用该数据集训练能够区分不同批评强度的深度学习架构,例如改进的Transformer变体与对比学习策略,以提升在影评情绪梯度上的预测精度。该数据集的出现呼应了业界对可解释性情感分析的需求,其多尺度特性有助于探索评分粒度对下游任务的影响,推动情感分析从二元分类向更细腻的序数推理演进,对完善推荐系统与用户反馈建模具有重要实践意义。
以上内容由遇见数据集搜集并总结生成



