anab/ACORN
收藏官方服务:
资源简介:
ACORN数据集包含3500条人类编写和LLM生成的解释,每条解释都有由人类给出的质量评分。数据集的主要字段包括问题、选择、标签、解释、投票评分和工人评分。解释质量评价包括一般评分和细粒度评分,假设理想的解释是流畅、充分、最小化和对比性的。数据集的来源包括ECQA、CoS-E、COPA-SSE等多个来源,每个来源有500个样本,总计3500个样本。
ACORN数据集包含3500条人类编写和LLM生成的解释,每条解释都有由人类给出的质量评分。数据集的主要字段包括问题、选择、标签、解释、投票评分和工人评分。解释质量评价包括一般评分和细粒度评分,假设理想的解释是流畅、充分、最小化和对比性的。数据集的来源包括ECQA、CoS-E、COPA-SSE等多个来源,每个来源有500个样本,总计3500个样本。
提供机构:
anab原始信息汇总
ACORN 数据集概述
基本信息
- 许可证: MIT
- 语言: 英语
- 标签: 解释评估, 解释评级, 常识推理
- 大小类别: 1K<n<10K
- 任务类别: 文本分类, 文本生成
- 美观名称: ACORN
- 配置:
- 配置名称: data
- 数据文件: ACORN.jsonl
数据集描述
- 内容: 包含3,500个人类编写和LLM生成的解释,每个解释都有人类给出的方面质量评级。
- 文件: 数据集文件为
ACORN.jsonl,每行包含解释文本、相关信息、聚合评级和所有工人的评级。 - 基本字段:
question: 问题文本choices: 答案选项列表label: 正确答案索引explanation: 解释文本voted_ratings: 多数投票评级worker_ratings: 所有工人评级,以字典形式存储(工人ID → 评级字典)
质量方面
- 评级标准: 包括一般评级和细粒度的解释质量方面,追求流畅、充分、最小和对比的解释。
数据来源
- 来源: 数据集包含来自多个来源的解释,包括ECQA、CoS-E、COPA-SSE、Commonsense QA的生成解释、Balanced COPA的生成解释、新收集的Balanced COPA解释以及GPT-3.5编辑的CoS-E和COPA-SSE版本。
额外字段
id: 测试样本IDq_id: 原始问题IDe_id: 原始解释IDq_source: 问题来源(Commonsense QA或Balanced COPA)e_source: 解释来源triples: 三元组形式的解释(仅COPA-SSE)postivies,negatives: 正负陈述(仅ECQA)
引用信息
@article{brassard2024acorn, title = {ACORN: Aspect-wise Commonsense Reasoning Explanation Evaluation}, author = {Ana Brassard and Benjamin Heinzerling and Keito Kudo and Keisuke Sakaguchi and Kentaro Inui}, year = {2024}, journal = {arXiv preprint arXiv: 2405.04818} }
搜集汇总
数据集介绍

构建方式
ACORN数据集源于对常识推理中解释质量评估的深入探索,旨在系统性地捕获解释的多维度特征。其构建过程融合了人类智慧与机器生成:从ECQA、CoS-E、COPA-SSE等基准中抽取既有解释,并利用GPT-3.5对部分样本进行改写,同时针对Balanced COPA问题收集全新解释。最终汇集了3,500条涵盖人工编写与大型语言模型生成的解释样本。每一条解释均经过五名人类评估者从流畅性、充分性、最小性和对比性四个细粒度方面进行评分,并通过多数投票机制聚合为最终质量标签,从而形成结构化的标注数据。
特点
该数据集的核心亮点在于其细粒度、多维度的解释质量评价体系。不同于传统二元或单一维度的评估,ACORN引入了四个方面(流畅、充分、最小、对比)的独立评分,能够更精确地刻画解释在不同品质上的表现。数据来源丰富多样,涵盖多种常识推理问答场景(Commonsense QA与Balanced COPA)及多种解释生成方式(人工、模型、编辑),增强了泛化性。此外,数据集不仅提供聚合后的多数投票评分,还保留了每位评估者的原始评分记录,为研究评分者间一致性及主观偏差提供了宝贵的微观数据。
使用方法
ACORN适用于文本分类与文本生成两类任务。在文本分类场景中,可将解释文本作为输入,以聚合后的细粒度评分或多个评分维度作为标签,训练模型自动评估解释质量。在文本生成任务中,可将其作为微调数据,引导模型生成符合高质量标准的解释。使用时,可直接加载JSONL格式文件,利用'question'、'explanation'、'voted_ratings'等字段构建训练样本。研究者还可利用'worker_ratings'字段分析评分分布,或依据'q_source'与'e_source'字段按来源筛选子集进行针对性实验。
背景与挑战
背景概述
在自然语言处理领域,可解释性已成为评估模型推理能力的关键维度,尤其是对于常识推理任务,其解释质量直接关系到模型的可信度与实用性。ACORN数据集由Ana Brassard、Benjamin Heinzerling等研究人员于2024年提出,旨在系统化地评估常识推理解释的文本质量。该数据集汇集了3,500条由人类和大型语言模型生成的解释,并针对流畅性、充分性、简洁性和对比性四个细粒度方面进行了人工评分。其核心研究问题在于如何构建一个可靠的多维度评价体系,以量化解释性文本的质量,从而推动可解释人工智能的发展。ACORN的发布为常识推理领域提供了首个面向方面的解释评估基准,对后续研究具有重要的方法论参考价值。
当前挑战
ACORN数据集面临的挑战首先体现在领域问题的复杂性上:常识推理解释的质量评估缺乏统一标准,不同应用场景对解释的侧重点各异,使得定义普适性的评价维度极为困难。其次,在构建过程中,研究人员需整合来自ECQA、CoS-E、COPA-SSE等多个来源的解释样本,这些解释在格式、长度和推理深度上存在显著差异,导致数据标注的一致性难以保障。此外,人工评分的主观性也是一大挑战,五名评分员对同一解释的评判可能产生分歧,需要通过多数投票机制进行聚合,但这仍无法完全消除个体偏见。最后,数据集规模相对有限(3,500条),可能不足以支撑对复杂模型解释能力的全面泛化分析。
常用场景
经典使用场景
ACORN(Aspect-wise Commonsense Reasoning Explanation Evaluation)数据集专为评估常识推理任务中解释质量而设计,其经典使用场景聚焦于对自然语言解释进行多维度细粒度评价。该数据集汇集了3,500条由人类与大型语言模型生成的解释,每一条均经由人工标注者从流畅性、充分性、最小性与对比性四个关键方面进行质量评级。研究者可借助ACORN对各类解释生成模型进行系统性评测,从而深入理解模型在常识推理任务中提供可解释性输出的能力,并推动解释生成与评估方法的发展。
解决学术问题
ACORN有效解决了常识推理领域解释质量评估缺乏标准化标注与多维度评价体系的学术难题。传统研究往往依赖单一的整体评分或简单的二元判断,难以捕捉解释在逻辑完备性、信息冗余度及对比性等不同维度上的细微差异。该数据集通过引入人工标注的细粒度评分,为评估解释的全面性、简洁性与针对性提供了可靠基准,进而支持研究者探究不同来源(如ECQA、CoS-E、COPA-SSE等)解释的质量差异,并为解释生成模型的优化提供实证依据,对提升AI系统的可解释性与可信度具有重要意义。
衍生相关工作
ACORN的发布催生了一系列相关研究工作,包括基于其多维度评分标准改进的解释生成模型、解释质量预测器以及跨数据集解释一致性分析。例如,研究者利用ACORN的标注数据训练自动评估模型,以替代昂贵的人工评价流程;同时,该数据集被用作基准,比较不同提示策略下大语言模型生成解释的质量差异。此外,ACORN的细粒度标签为探索解释质量与模型推理准确性之间的相关性提供了数据基础,推动了可解释自然语言处理领域从单一指标向多维评价范式的转变。
以上内容由遇见数据集搜集并总结生成



