遇见数据集

ea_justification

收藏
Hugging Face2026-08-20 更新2026-08-21 收录
官方服务:

资源简介:

该数据集是情感诉求(Emotional Appeal)论证注释数据集,包含1176个样本,每个样本由5名注释者从多个维度进行评分。数据来源包括英国议会辩论记录(Hansard)和问答材料(QAM)。参数文本既有真实来源,也有通过模型生成的合成版本;上下文文本同样包含原始版本和经过扰动(调整情感方面和强度)的版本。每一行数据记录了:数据集来源、条目ID、采样顺序、注释批次;主题与参数文本、原始参数、参数生成状态(真实或合成);情感诉求注入模型、来源情感诉求类型及强度;上下文文本、原始上下文及扰动状态;扰动模型、方面(如magnitude, probability等)及目标级别;原始/扰动上下文配对信息。注释者层面包含:5个匿名注释者ID、对参数-上下文支持度的评分(-3到3)、主要情感诉求类型(9种标签)、情感诉求强度(1-5)、情感类型与参数的拟合度(1-5或不可用)、证据比例性评分(1-5或不可用)及其理由、规范性可接受性评分(1-5或不可用)、整体合理性评分(1-5或不可用)。此外,数据集还提供了基于所有5个注释者的多数投票聚合标签,以及论文分析中选定的前3位注释者的多数投票聚合标签。该数据集适用于论证挖掘、情感分析、计算社会科学中的情感诉求合理性评估任务。

This dataset is an Emotional Appeal argument annotation dataset containing 1,176 samples, each rated by 5 annotators across multiple dimensions. Data sources include the UK parliamentary debate records (Hansard) and question-answer materials (QAM). The argument texts include both real sources and synthetic versions generated by models; the context texts also include original versions and perturbed versions (with adjusted emotional aspects and intensities). Each row records: dataset source, entry ID, sampling order, annotation batch; topic and argument text, original argument, argument generation status (real or synthetic); emotional appeal injection model, source emotional appeal type and intensity; context text, original context, and perturbation status; perturbation model, aspect (e.g., magnitude, probability) and target level; original/perturbed context pairing information. The annotator level includes: 5 anonymous annotator IDs, argument-context support rating (-3 to 3), primary emotional appeal type (9 labels), emotional appeal intensity (1-5), fit of emotion type to argument (1-5 or N/A), evidence proportionality rating (1-5 or N/A) with rationale, normative acceptability rating (1-5 or N/A), and overall plausibility rating (1-5 or N/A). Additionally, the dataset provides majority-vote aggregated labels based on all 5 annotators, as well as majority-vote aggregated labels from the top 3 annotators selected in the paper analysis. This dataset is suitable for tasks such as argument mining, sentiment analysis, and evaluation of emotional appeal plausibility in computational social science.

创建时间:
2026-08-20
原始信息汇总

数据集概述:nllg/ea_justification

这是一个用于论证质量评估的标注数据集,包含情感诉求(Emotional Appeal)与论证合理性判断的人工标注数据。

基本信息

  • 许可证:CC-BY-4.0
  • 数据规模:共 1,176 行数据,83 个数据列
  • 文件ea_justification_annotations.csv

数据内容与结构

数据列按功能分为以下几组:

列组 数量 说明
来源标识 4 包括数据集来源(hansardqam)、条目 ID、采样排序及标注批次
论证文本 4 主题、论证文本、原始论证,以及生成状态(真实或合成)
情感诉求生成信息 3 生成模型、情感诉求类型(共 7 种)、诉求强度(范围 2–5)
上下文信息 3 呈现的上下文、原始上下文及扰动状态(真实或合成)
上下文扰动设置 3 扰动模型、扰动方面(mag/prob/ris/sprox/tprox)、目标水平(低/中/高)
上下文配对 2 原始/扰动上下文的配对关系与角色
标注者ID 5 每位标注者的匿名化标识
上下文支持度 5 论据与上下文匹配程度(范围 −3 至 3)
情感诉求类型 5 标注者识别的主要情感诉求(共 9 种标签)
情感诉求强度 5 情感诉求强度(范围 1–5)
情感类型契合度 5 论证与识别情感类型的匹配程度(1–5 或不可用)
证据相称性 5 诉求与其证据/上下文的相称程度(1–5 或不可用)
证据相称性原因 5 以管道符分隔的相称性评级原因(从 9 个原因标签中选择)
规范可接受性 5 规范层面的可接受度评分(1–5 或不可用)
整体论证合理性 5 整体合理性评分(1–5 或不可用)
论文分析标注者 3 每批次选取用于论文分析的标注者 ID
多数聚合结果 16 对所有标注者(8 列)及论文所选前三名标注者(8 列)的多数投票聚合结果,覆盖上述 8 个评分维度

数据特点

  • 数据来源于两套语料:hansard(议会辩论记录)和 qam(问答匹配数据)
  • 论证文本和上下文均包含真实与合成两类,合成数据由模型生成
  • 每条数据由 5 位标注者独立标注,覆盖情感诉求识别、强度判断、证据相称性、规范可接受性及整体合理性等多个维度
  • 提供两种粒度的多数投票聚合结果,便于后续分析使用
搜集汇总
数据集介绍
ea_justification 数据集图片
构建方式
该数据集源于对论证质量的多维评估需求,通过系统化的采样与扰动策略构建。数据源自Hansard辩论记录与QAM问答平台,经人工与模型协同生成论证及上下文扰动,形成1,176条样本。每条样本包含原始或合成论证、经过上下文扰动(涉及概率、风险等五个维度,强度分低中高三档)的配对语境,以及五位标注者针对情感诉求、证据比例性、规范可接受性等八个维度的独立评分与多数聚合结果,确保了标注的多样性与统计稳健性。
使用方法
适用性广泛,可直接用于论证质量评估模型的训练与基准测试,尤其聚焦情感诉求识别与证据比例性判断。研究人员可借助上下文配对设计(原始/扰动)考察语境变化对论证说服力的影响,或利用合成数据探究模型生成论证的弱点。多数聚合标签支持稳健的监督学习,而标注者个体评分可分析主观性。数据集附带完整的列描述与背景,便于快速集成至现有自然语言处理流程,服务于计算论辩学、情感分析与可解释人工智能等前沿领域。
背景与挑战
背景概述
在论证挖掘与计算论辩学领域,论证的正当性(justification)评估是衡量论证质量的核心维度,其涉及情感诉求、证据比例性、规范性可接受性等多重复杂因素。然而,现有数据集多聚焦于论证结构或情感分类,缺乏对论证与上下文匹配度及多维质量指标的细粒度标注。为填补这一空白,ea_justification数据集于近年由一支跨学科研究团队构建,依托英国议会议事录(hansard)与问答匹配(qam)语料,系统性地引入了情感诉求注入模型与上下文扰动模型,生成包含真实与合成样本的1,176条标注实例。该数据集的核心研究问题在于如何量化论证在具体语境下的情感恰当性与整体正当性,其发布为论证质量自动评估、可解释AI及计算社会心理学提供了宝贵的基准资源,对推动论证质量的机器评价研究具有重要影响。
当前挑战
该数据集应对的核心挑战在于论证质量评估的多维性与语境依赖性。传统论证质量研究往往忽略情感诉求与上下文交互的微妙关系,而该数据集通过设计arg-context支持度、情感诉求类型与强度、情感类型契合度、证据比例性、规范性可接受性及整体正当性等八个维度,力图捕捉论证在特定上下文中的合理性,这要求标注者具备高度的认知判断力,且不同标注者间可能存在显著主观差异,构成标注一致性的挑战。此外,构建过程中,合成样本的生成需依赖大型语言模型注入可控的情感诉求,同时确保文本自然性与语义保真度,而上下文扰动则需在保持主题连贯的前提下精确调整概率、风险、幅度等属性,难度极高。最终,多轮标注与多数表决聚合策略的设计亦需平衡标注成本与信度,这些均是该数据集面临的主要瓶颈。
常用场景
经典使用场景
在计算论辩与自然语言处理交叉领域,ea_justification数据集被广泛用于细粒度的论证质量评估与情感诉求分析。该数据集汇聚了1176条来自英联邦议会辩论(hansard)和问答社区(qam)的论证文本,每条论证均附带由五位标注者独立完成的多元标注,涵盖语境支持度、情感诉求类型、情感强度、证据相称性、规范可接受性及整体论证合理性等维度。研究者可借助这些标注信息,深入剖析论证的微观结构,并在此基础上训练和测评自动化的论证质量预测模型。尤为珍贵的是,数据集引入了对上下文扰动和合成论证的设计,使得因果推断与鲁棒性分析成为可能。
解决学术问题
该数据集直面论证挖掘领域中长期存在的论证质量评价主观性强、多维度交织难以量化等难题。通过提供多标注者、多维度的细粒度标注,ea_justification有效支撑了论证说服力建模、情感诉求识别与论证策略分析等核心研究议题。其创新之处在于系统性地引入了上下文扰动和合成论证生成机制,使得研究者能够控制变量,考察论证文本与语境之间的相互作用对评价结果的影响,从而为构建可解释、可泛化的论证质量评估框架提供了坚实的实验基础。这一设计极大地推动了从静态分类向动态、情境化理解的范式转变。
实际应用
在实际应用中,ea_justification所蕴含的丰富标注信息可直接服务于多个社会与商业场景。例如,在公共话语分析领域,它可辅助监测政治辩论或新闻报道中的情感操控与证据失衡现象,提升公共沟通的理性水平。在智能写作辅助、辩论机器人及在线教育平台中,该数据集能为系统提供实时论证质量反馈,帮助用户优化论点和增强说服力。此外,借助其上下文扰动设计,该数据集还可用于开发模型鲁棒性测试工具,评估自动论证评价系统在遭遇语境变化、对抗性输入时的表现,从而保障AI系统在高风险决策中的可靠性。
数据集最近研究
最新研究方向
在论证挖掘与情感计算交叉领域,ea_justification数据集的问世为可解释性论证质量评估开辟了新范式。该数据集通过精细标注论证-语境支持度、情感诉求类型与强度、证据相称性及规范可接受性等多维特征,构建了1176条人机协同生成样本的黄金标准。当前前沿研究聚焦于利用该语料训练多任务学习模型,以自动预测论证的合理性等级并解析其情感操纵机制,同时探索情境扰动(如概率、风险、时间邻近性)对论证说服力的影响。这一资源尤其服务于构建具备伦理感知的AI辩论系统,助力虚假信息治理与公共话语质量提升,其细粒度标注体系亦为可解释AI提供了新的评测基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务