遇见数据集

Multilingual-Perspectivist-NLU/EPIC

收藏
Hugging Face2024-05-31 更新2024-03-04 收录
官方服务:

资源简介:

EPIC(English Perspectivist Irony Corpus)是一个用于讽刺检测的英语语料库,包含来自Twitter和Reddit的3000对短对话(帖子-回复),以及每个注释者的人口统计信息(如年龄、国籍、性别等)。数据集支持使用软标签(即注释的分布)或硬标签(即聚合标签)进行讽刺分类任务。数据集的创建过程、注释者信息、数据字段和结构、以及使用该数据集时需要考虑的社会影响和偏见问题也在README中进行了详细说明。

EPIC(English Perspectivist Irony Corpus)是一个用于讽刺检测的英语语料库,包含来自Twitter和Reddit的3000对短对话(帖子-回复),以及每个注释者的人口统计信息(如年龄、国籍、性别等)。数据集支持使用软标签(即注释的分布)或硬标签(即聚合标签)进行讽刺分类任务。数据集的创建过程、注释者信息、数据字段和结构、以及使用该数据集时需要考虑的社会影响和偏见问题也在README中进行了详细说明。

原始信息汇总

数据集概述

名称: EPIC (English Perspectivist Irony Corpus)

语言: 英语(包含英国、美国、爱尔兰、澳大利亚和印度等不同变体)

任务类别: 文本分类(特别是讽刺检测)

许可: cc-by-nc-sa-4.0

数据集大小: 10K<n<100K

数据集详细信息

数据集摘要

EPIC是一个用于讽刺检测的英语语料库,包含3,000对来自Twitter和Reddit的简短对话(帖子-回复),以及每位标注者的年龄、国籍、性别等人口统计信息。

支持的任务和排行榜

支持的任务包括使用软标签(即标注分布)或硬标签(即聚合标签)进行讽刺分类。

数据集结构

  • 数据实例: 总共有14,172个实例,数据集文件大小为6.48 MB。
  • 数据字段: 数据集结构包括行中的每个标注者(通过“用户”ID标识)的标注,以及列中的目标文本信息(id_original, parent_text, language_instance, language_variety)和标注者元数据(年龄、性别、种族等)。
  • 数据分割: 数据集未分割为训练集和验证/测试集。

数据集创建

  • 源数据: 数据来源于Reddit和Twitter用户。
  • 标注过程: 标注工作在Prolific平台上进行,标注者为来自英国、美国、澳大利亚、印度和爱尔兰的英语使用者。
  • 个人和敏感信息: 标注者的个人信息由Prolific平台提供,并获得其同意。Reddit和Twitter用户的元数据在语料库中不可用。

使用数据时的考虑

  • 社会影响: 鼓励社区开发更具包容性的人工智能技术。
  • 偏见讨论: 分析表明,使用多数投票策略聚合标签可能引入偏见,但数据集以分散形式发布,并考虑了不同社会人口统计特征的标注者。
  • 其他已知限制: 尽管尝试在标注者的人口统计特征上保持平衡,但仅限于五种英语变体和五个国家,未包括其他潜在地点或更细致的语言变体区分。性别信息仅以二元形式提供。

数据集管理者和贡献

  • 数据集管理者: 都灵大学计算机科学系
  • 资金支持: 部分由Multilingual Perspective-Aware NLU项目与Amazon Alexa合作资助。
搜集汇总
数据集介绍
Multilingual-Perspectivist-NLU/EPIC 数据集图片
构建方式
EPIC(English Perspectivist Irony Corpus)是一个面向讽刺检测的解聚式英文语料库,其构建过程严谨而富有创新性。数据源来自Twitter和Reddit平台,精选3,000对短对话(帖子与回复),确保内容的多样性与真实性。标注工作依托Prolific众包平台,招募了来自英国、美国、澳大利亚、印度和爱尔兰的74名英语母语者作为标注员。每位标注员不仅对文本的讽刺性进行独立判断,还提供了年龄、性别、国籍等人口统计学信息,从而形成了以标注员ID为行、文本特征与元数据为列的独特数据结构。这种设计旨在保留标注过程中的个体视角差异,避免传统聚合标注可能引入的偏差。
特点
EPIC数据集的核心特点在于其解聚式(disaggregated)标注范式,彻底摒弃了传统的多数投票聚合策略,转而呈现每位标注员的原始判断与背景信息。这一特性使得研究者能够深入探究社会文化因素(如语言变体、性别、年龄)如何影响讽刺的感知与解读。数据集涵盖五种英语变体(英式、美式、爱尔兰、澳大利亚和印度英语),共计14,172条标注实例,规模适中但视角丰富。此外,EPIC明确区分硬标签(聚合结果)与软标签(标注分布),为模型训练提供了灵活的选择,同时鼓励开发更具包容性与多视角的AI系统。
使用方法
EPIC数据集主要用于讽刺文本分类任务,支持两种标签使用方式:硬标签(如多数投票后的单一类别)或软标签(即标注分布,作为连续值或概率输入)。由于数据集未预设训练/验证/测试划分,用户可根据研究需求自行分割数据,例如按标注员、文本来源或语言变体进行分层采样。典型应用包括训练多视角感知模型、分析标注者偏见对分类性能的影响,或探索人口统计学特征与讽刺识别之间的关联。数据以CSV格式提供,可直接加载至Python的pandas库进行预处理,并适配HuggingFace的transformers库进行模型微调与评估。
背景与挑战
背景概述
EPIC(English Perspectivist Irony Corpus)是由意大利都灵大学计算机科学系的研究团队于2023年构建的多视角讽刺语料库,相关成果发表在ACL 2023会议上。该数据集的核心研究问题在于突破传统讽刺检测任务中单一标注聚合的局限,通过收集来自Twitter和Reddit的3000对短对话及其74位标注者的社会人口学信息(如年龄、国籍、性别等),首次以解聚形式呈现标注结果。EPIC的提出推动了自然语言处理领域向更包容、多元的视角主义方向发展,其影响力体现在为讽刺检测任务提供了软标签与硬标签两种标注方案,并鼓励学界重新审视标注者个体差异对模型偏见的影响。数据集包含英式、美式、爱尔兰、澳大利亚和印度五种英语变体,共计14172条标注实例,为跨文化语言现象研究奠定了重要基础。
当前挑战
EPIC数据集面临的挑战首先体现在领域问题层面:讽刺检测本身具有高度主观性,传统多数投票聚合策略易引入系统性偏见,而解聚标注虽保留了多样性,却增加了模型训练与评估的复杂性。在构建过程中,研究团队面临多重困难:标注者招募虽通过Prolific平台筛选了来自五个英语国家的母语者,但性别信息仅以二元形式收集,未能涵盖更广泛的性别光谱;语言变体局限于五个国家,排除了新西兰、尼日利亚等潜在地区,且未细化同一国家内的方言差异。此外,尽管采用了注意力测试题进行质量控制,但完全依赖众包标注者的主观判断,仍可能残留未被检测的随机噪声,这对数据集的可靠性与一致性构成潜在威胁。
常用场景
经典使用场景
EPIC(English Perspectivist Irony Corpus)作为反讽检测领域的标杆性数据集,其最经典的使用场景在于构建和评估基于软标签(即标注分布)或硬标签(即聚合标签)的反讽分类模型。该数据集包含3000对源自Twitter和Reddit的简短对话(帖子-回复),并附有每位标注者的详细人口统计学信息(如年龄、国籍、性别等),使得研究者能够在模型训练中融入视角主义理念,从而捕捉反讽表达中固有的主观性与歧义性。这种细粒度的标注结构为自然语言处理领域提供了前所未有的实验平台,尤其适用于探索标注者间一致性、群体偏差对模型性能的影响,以及跨语言变体(如英式、美式、爱尔兰式、澳大利亚式和印度式英语)下的反讽识别任务。
实际应用
在实际应用中,EPIC数据集赋能了多款社交媒体监控与内容审核系统的开发,特别是在识别网络讽刺、挖苦和隐性敌意方面表现突出。其标注者的多元化背景(涵盖英国、美国、澳大利亚、印度和爱尔兰)使得模型能够适应不同英语变体的文化语境,提升跨地域反讽检测的准确性。此外,该数据集还被用于设计个性化人机交互界面,例如通过分析用户反讽倾向的分布特征,智能助手可调整回应风格以避免误解。在舆情分析领域,基于EPIC训练的模型能够更精细地捕捉公众情绪中的微妙讽刺成分,为品牌声誉管理和政治话语分析提供可靠工具。
衍生相关工作
EPIC数据集催生了多项具有影响力的衍生研究,包括基于对比学习的反讽感知表示方法、融合标注者元数据的多任务学习框架,以及针对低资源语言的反讽检测跨语言迁移模型。其中,ACL 2023发表的原始论文本身即建立了视角主义NLU的基准,后续工作如利用EPIC的软标签分布训练不确定性感知分类器,或通过分析标注者群体分歧来设计更公平的评估指标。此外,该数据集还启发了其他视角主义语料库的构建(如情感分析、仇恨言论检测领域),推动了NLP社区从单一真实标注向多元视角标注范式的转变,并催生了关于标注者人口统计学属性与语言理解偏差之间关系的系统性研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务