遇见数据集

contemmcm/rotten_tomatoes

收藏
Hugging Face2024-04-24 更新2024-06-11 收录
官方服务:

资源简介:

--- language: - en task_categories: - text-classification dataset_info: - config_name: original features: - name: id dtype: string - name: reviewId dtype: string - name: creationDate dtype: string - name: criticName dtype: string - name: isTopCritic dtype: bool - name: originalScore dtype: string - name: reviewState dtype: class_label: names: '0': 'rotten' '1': 'fresh' - name: publicatioName dtype: string - name: reviewText dtype: string - name: scoreSentiment dtype: class_label: names: '0': Negative '1': Positive - name: reviewUrl dtype: string - config_name: balanced features: - name: id dtype: string - name: reviewId dtype: string - name: creationDate dtype: string - name: criticName dtype: string - name: isTopCritic dtype: bool - name: originalScore dtype: string - name: reviewState dtype: class_label: names: '0': 'rotten' '1': 'fresh' - name: publicatioName dtype: string - name: reviewText dtype: string - name: scoreSentiment dtype: class_label: names: '0': Negative '1': Positive - name: reviewUrl dtype: string configs: - config_name: original data_files: - split: complete path: "original.csv" default: true - config_name: balanced data_files: - split: complete path: "balanced.csv" ---

语言: - 英语 任务类别: - 文本分类 数据集信息: - 配置名称:原始(original) 特征: - 特征名:id,数据类型:字符串型 - 特征名:reviewId,数据类型:字符串型 - 特征名:creationDate,数据类型:字符串型 - 特征名:criticName,数据类型:字符串型 - 特征名:isTopCritic,数据类型:布尔型 - 特征名:originalScore,数据类型:字符串型 - 特征名:reviewState,数据类型:类别标签,类别映射: '0': 坏评(rotten) '1': 鲜评(fresh) - 特征名:publicatioName,数据类型:字符串型 - 特征名:reviewText,数据类型:字符串型 - 特征名:scoreSentiment,数据类型:类别标签,类别映射: '0': 负向情感(Negative) '1': 正向情感(Positive) - 特征名:reviewUrl,数据类型:字符串型 - 配置名称:均衡(balanced) 特征: - 特征名:id,数据类型:字符串型 - 特征名:reviewId,数据类型:字符串型 - 特征名:creationDate,数据类型:字符串型 - 特征名:criticName,数据类型:字符串型 - 特征名:isTopCritic,数据类型:布尔型 - 特征名:originalScore,数据类型:字符串型 - 特征名:reviewState,数据类型:类别标签,类别映射: '0': 坏评(rotten) '1': 鲜评(fresh) - 特征名:publicatioName,数据类型:字符串型 - 特征名:reviewText,数据类型:字符串型 - 特征名:scoreSentiment,数据类型:类别标签,类别映射: '0': 负向情感(Negative) '1': 正向情感(Positive) - 特征名:reviewUrl,数据类型:字符串型 配置项: - 配置名称:原始(original) 数据文件: - 划分:完整集(complete),路径:"original.csv" 设为默认配置 - 配置名称:均衡(balanced) 数据文件: - 划分:完整集,路径:"balanced.csv"

提供机构:
contemmcm
原始信息汇总

数据集概述

配置信息

  1. 原始配置(original)

    • 数据文件:
      • 完整数据集路径:"original.csv"
    • 默认配置:是
  2. 平衡配置(balanced)

    • 数据文件:
      • 完整数据集路径:"balanced.csv"

特征描述

  • 通用特征

    • id:字符串类型
    • reviewId:字符串类型
    • creationDate:字符串类型
    • criticName:字符串类型
    • isTopCritic:布尔类型
    • originalScore:字符串类型
    • publicatioName:字符串类型
    • reviewText:字符串类型
    • reviewUrl:字符串类型
  • 分类特征

    • reviewState:
      • 类别标签:
        • 0: rotten
        • 1: fresh
    • scoreSentiment:
      • 类别标签:
        • 0: Negative
        • 1: Positive
搜集汇总
数据集介绍
contemmcm/rotten_tomatoes 数据集图片
构建方式
在电影评论领域,情感分析是自然语言处理的重要任务之一。contemmcm/rotten_tomatoes数据集源于知名影评聚合平台Rotten Tomatoes,旨在为文本情感分类提供高质量标注资源。该数据集通过系统爬取专业影评人的评论内容,并整合平台原有的二元评价标签(rotten与fresh),构建了包含影评文本、评分情感、评论者属性等多维字段的结构化数据。数据以CSV格式存储,提供original与balanced两个配置版本,其中balanced版本通过采样策略确保正负样本均衡,以支持不同研究需求。
特点
该数据集的核心特色在于其丰富的元信息与权威的标注来源。每条样本不仅包含影评全文(reviewText),还附带了评论者姓名、是否为顶级评论者、原始评分、发布日期等属性,为多维度分析提供了可能。标签设计采用双重分类体系:reviewState反映影评人对电影的整体评价(rotten或fresh),而scoreSentiment则直接对应情感极性(Negative或Positive),两者结合可支持细粒度情感研究。此外,数据集的规模适中且类别平衡,适合作为情感分类模型的基准测试集。
使用方法
使用该数据集进行文本分类任务时,可直接通过Hugging Face Datasets库加载,指定配置名称(original或balanced)并选择完整数据分片。研究者可将reviewText作为输入特征,以reviewState或scoreSentiment作为分类目标,构建监督学习模型。数据预处理阶段需注意文本清洗与标签编码,例如将类别标签转换为数值形式。该数据集适用于训练二分类情感分析模型,也可用于评估预训练语言模型在电影评论领域的情感理解能力,是验证模型泛化性能的理想选择。
背景与挑战
背景概述
在自然语言处理与情感分析领域,电影评论的情感极性判别一直是文本分类任务中的经典命题。Rotten Tomatoes数据集由知名影评聚合平台Rotten Tomatoes于近年整理发布,汇聚了来自多位专业影评人的影评文本及其对应的二元情感标签(“新鲜”或“腐烂”),旨在为细粒度情感分析研究提供高质量、标注一致的语料资源。该数据集的核心研究问题聚焦于如何从文本中准确捕捉评论者对电影的主观态度,其影响力在于为情感分类模型的训练与评估提供了跨领域的基准测试平台。此外,数据集中还包含了评论日期、评论者身份、是否为顶级评论家等元信息,为探索评论者权威性对情感表达的影响及时间动态的情感演化研究开辟了新的方向。
当前挑战
该数据集所面临的挑战首先体现在情感标签的二元划分与真实世界评论复杂性的矛盾上,许多影评的情感倾向并非绝对积极或消极,存在模棱两可或混合情感,这给模型带来了语义歧义处理的难题。其次,数据构建过程中,评论来源的多样性导致了文本风格与长度的显著差异,从短评到长篇分析不等,增加了特征提取与标准化的难度。此外,原始数据中类别分布可能存在不平衡问题,尽管提供了平衡版本,但如何在不失真的前提下构建代表性样本仍是挑战。最后,评论中蕴含的讽刺、文化隐喻及上下文依赖等语言现象,要求模型具备更深层的语用理解能力,这对当前基于统计或浅层语义的模型构成了持续考验。
常用场景
经典使用场景
在自然语言处理领域,情感分析是一项基础而重要的任务,旨在从文本中自动识别作者的情感倾向。Rotten Tomatoes数据集为这一研究提供了丰富的影评文本,每条评论附有“新鲜”或“腐烂”的二元标签,以及更细粒度的正面与负面情感标注。该数据集最经典的使用场景是作为情感二分类任务的基准,研究者通常利用其平衡子集训练和评估模型,如BERT、RoBERTa等预训练语言模型在微调后,通过准确率、F1分数等指标衡量性能。其简洁的标签设计和充足的样本量,使之成为验证文本分类算法鲁棒性与泛化能力的理想平台。
衍生相关工作
基于Rotten Tomatoes数据集,衍生出多项影响深远的经典工作。在模型层面,Zhang等人提出的Character-level Convolutional Networks将其作为主要评测集,论证了字符级特征在文本分类中的有效性。预训练模型时代,BERT论文使用该数据集进行微调,验证了双向Transformer在情感分析上的优越性。在方法创新上,注意力机制与对抗训练的研究常以此数据集为实验平台,如Yin等人提出的注意力池化网络。此外,该数据集催生了多模态情感分析研究,例如结合影评文本与视频帧的联合建模工作。这些衍生工作不仅提升了分类性能,更推动了自然语言处理从浅层特征到深层语义理解的演进。
数据集最近研究
最新研究方向
在自然语言处理与情感分析领域,Rotten Tomatoes影评数据集正成为微调与评估文本分类模型的重要基准。随着大规模预训练语言模型(如BERT、RoBERTa)的兴起,该数据集被广泛用于探索细粒度情感判别与评论质量建模。前沿研究方向聚焦于利用其双标签体系(腐烂/新鲜)与平衡子集,开展对抗性训练、少样本学习及跨域迁移能力测试。结合影评社区对算法偏见与公平性的关注,该数据集在揭示模型对特定文体或批判性语言的敏感度方面具有深远意义,推动了更鲁棒、可解释的文本分析工具的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务