遇见数据集

CAP-Correctness

收藏
arXiv2026-09-01 更新2026-09-03 收录
官方服务:

资源简介:

CAP-Correctness是一个用于开放域问答语义正确性评估的基准数据集,由索非亚大学等机构联合构建。该数据集包含8827个四元组,每个样本由问题、标准答案、候选答案和语义正确性标签组成,数据源自OpenBookQA、ARC和MMLU等广泛使用的问答集,覆盖从小学至本科水平的多元领域。数据集通过大语言模型辅助的标注管道生成,并经过人工验证(Cohen's κ=0.779),确保标签可靠性。其核心应用在于评估开放域问答生成答案的语义正确性,旨在区分部分正确、过度包含、矛盾等细粒度错误类型,为自动评估提供更精确的基准。

CAP-Correctness is a benchmark dataset for semantic correctness evaluation of open-domain question answering, jointly constructed by Sofia University and other institutions. This dataset contains 8,827 quadruples, with each sample consisting of a question, a reference answer, a candidate answer, and a semantic correctness label. The data is sourced from widely adopted question answering datasets including OpenBookQA, ARC, and MMLU, spanning diverse academic domains ranging from primary school to undergraduate levels. The dataset is generated via an annotation pipeline assisted by Large Language Models (LLMs), and validated through human annotation with a Cohen's κ of 0.779 to ensure label reliability. Its core application lies in evaluating the semantic correctness of generated answers for open-domain question answering, aiming to distinguish fine-grained error categories such as partially correct, over-inclusive, and contradictory responses, thus providing a more precise benchmark for automatic evaluation.

创建时间:
2026-09-01
原始信息汇总

数据集概述

该数据集与论文《EMNLP 2026 — How Correct Is Your Answer?》相关联,用于支持 CAP(一种基于自然语言推理(NLI)的指标)的研究,该指标用于评判问答(QA)答案的正确性。

研究背景

CAP 指标被用于与标准自然语言生成(NLG)评估指标(如 BLEU、ROUGE-L、METEOR、BERTScore、COMET)进行对比基准测试。测试所依据的问题来源于三个知名的问答基准数据集:ARC-EasyOpenBookQAMMLU

数据文件

仓库的 data/ 目录下包含两个主要的数据文件:

  1. CAP-Correctness.csv

    • 包含 8,827 行 数据。
    • 每一行对应一个(问题、标准答案、候选答案)三元组。
    • 包含人工标注的语义正确性标签,标签类别有:exactequivalentalternative_correctoverinclusive_validpartialoverinclusive_invalidinvalidcontradictory
    • 包含为基于 NLI 评分而生成的 premise(前提)和 hypothesis(假设)语句对。
  2. CAP-Statements.csv

    • 包含 11,000 条 带标签的(问题、答案、陈述)示例。
    • 该文件主要用于训练“问题+答案 → 陈述句”的生成模型。

处理流程

该数据集配套了完整的代码处理管线,主要步骤如下:

  1. 语句生成模型微调:使用 CAP-Statements.csv 文件,通过 qa_statement_generation.py 脚本微调语句生成模型。
  2. 推断语句生成:通过 qa_inference_generation.py 脚本,为新的问答数据生成 premise/hypothesis 语句对。
  3. CAP 指标计算:通过 cap.py 脚本计算 CAP 分数,并评估其与人工正确性标签的相关性。
  4. 指标基准测试:通过 eval_metrics.pyeval_comet.py 脚本,将 CAP 指标与 BLEU、ROUGE-L、METEOR、BERTScore 及 COMET 等指标进行对比基准测试。

使用说明

  • 环境配置:在仓库根目录下运行 pip install -r requirements.txt 安装依赖。
  • 代码运行注意:部分脚本是从 notebooks 中提取的,包含占位符路径变量(如 CSV_PATH = "")。在运行前,需要手动将这些变量设置为 data/ 目录下相应的文件路径。

许可信息

  • 代码许可:代码部分遵循 MIT License
  • 数据许可:数据许可信息及对底层基准数据集(ARC-Easy、OpenBookQA、MMLU)的第三方归属说明,详见仓库中的 DATA_LICENSES.md 文件。
搜集汇总
数据集介绍
CAP-Correctness 数据集图片
构建方式
开放域问答的自动评估长期受制于二元正确性判定的粗粒度,难以捕捉自由文本答案中蕴含的语义丰富性与错误类型的多样性。CAP-Correctness数据集的构建,正是基于对上述局限的深刻反思,旨在为语义正确性的细粒度诊断提供标准化基准。该数据集从OpenBookQA、ARC及MMLU三个广泛使用的问答资源中系统采样,经过严格的噪声过滤,去除包含“Which of the following”等选项特定表述及“上述所有”类答案的题目,最终形成涵盖小学至大学水平的8827条[问题,参考答案,候选答案,正确性标签]四元组。候选答案及标签通过精心设计的大语言模型辅助流程生成,该流程对每个语义类别采用特定提示词,以约8.4倍的过采样策略保证了八类标签在语料中的近似均衡分布,从而避免了评价结果对单一类别的过度偏倚。为验证合成标签的可靠性,研究团队进一步从数据集中抽取18.56%的样本交由人工标注员依据同一套八分类体系重新标注,人工与模型标签间的一致性达到Cohen's κ = 0.779(二次加权κ = 0.879),证实了合成流程对真实语义判断的忠实反映。
特点
CAP-Correctness的核心价值在于其开创性地提出了一个八级有序的语义正确性分类体系,超出了简单的对/错二分,细致区分了精确、等价、替代正确、部分、过包含有效、过包含无效、无效及矛盾等语义关系,特别为现代LLM输出中常见的“携带幻觉内容的正确回答”设立了独立类别。该数据集依据专家定义的正确性层级(例如精确≈等价≈替代正确 > 过包含有效 > 部分 > 过包含无效 > 无效≥矛盾)构建了25对严格的序对,为评估指标提供了清晰、可验证的单调性基准。数据集的类别分布经过精心控制,每类占比不超过13%,确保了评估的公平性。基于此,研究者提出了单调性诊断协议,通过检查指标分数是否随类别正确性等级的下降而单调递减,系统性地揭示了现有词法、嵌入及学习型评估器在捕捉语义梯度上的系统性失效模式。这一设计使CAP-Correctness不仅是一个标注语料库,更是一个可复用的基准,支持对任意语义正确性指标进行严格的能力检验,并促进了诊断性评估范式在开放问答领域的建立。
使用方法
CAP-Correctness的设计意图是与配套的CAP(上下文感知精确率)指标及CAP-Statements数据集联合应用于问答评估。使用流程首先将问题、参考答案与预测答案分别转化为条件性陈述句(通过微调mT5模型实现),随后利用双向自然语言推理(NLI)对这两个陈述进行蕴含关系打分,计算融合语义兼容性与完整性的连续分数。研究人员可直接将该指标在CAP-Correctness上运行,依循其单调性协议,通过计算Spearman ρ、Kendall τ、成对排序准确率及单调性违反计数,度量指标分数与数据集中八级语义标签有序性的一致性。该数据集亦可作为训练或校准基准,供未来的语义正确性指标在其上比较自身性能;其阈值校准后还能使CAP作为无标签分类器,输出分数与类别标签。对于研究LLM的答案风格,也可将人类标注的LLM回答按类别分组统计均值,使数据集成为诊断模型生成行为的工具。总之,CAP-Correctness为开放问答的语义评估提供了严谨的实验平台,确保了结果的可复现性与可比性。
背景与挑战
背景概述
CAP-Correctness数据集由索非亚大学、苏黎世联邦理工学院及穆罕默德·本·扎耶德人工智能大学的研究团队于2026年创建,旨在解决开放域问答(Open QA)中生成式答案语义正确性评估的难题。该研究团队针对现有评估指标将答案简单二分或过度依赖表面相似性的局限,创新性地提出八级语义正确性分类体系,并构建包含8,827个示例的基准数据集,覆盖OpenBookQA、ARC及MMLU等广泛问答资源。此数据集不仅细粒度区分了答案的等价性、部分正确、过度包含与矛盾等复杂语义关系,还提出了基于双向自然语言推理(NLI)的CAP评分指标,为大型语言模型生成内容提供了可复现且诊断性强的评估框架,对推动问答系统评估方法向深层语义理解发展具有重要影响。
当前挑战
面对开放域问答中自然语言表达的多样性,精确度量答案语义正确性是该领域的核心挑战。真实模型输出常包含部分回答、过度延伸与幻觉内容等混合形态,传统二值判定或文本重叠指标无法有效区分这些本质不同的失败模式,而依赖大型语言模型作为评判者又面临成本高昂、可复现性差及位置偏差等问题。在数据集构建过程中,为保证覆盖各类语义关系并维持类间平衡,需设计特定条件生成管道来产生不同类别的候选答案,但合成标签与人类判断是否一致成为关键难题,须经人工验证且需处理注释者间差异。此外将问答案对转化为陈述句的自然语言推理预训练步骤,对于多句长上下文问题,压缩为单一语义完整的陈述尤为困难,极易因改写错误而影响下游评分精度。
常用场景
经典使用场景
CAP-Correctness作为一项专门用于开放式问答(Open QA)评估的语义正确性基准,其经典使用场景在于对大型语言模型生成的自由文本答案进行细粒度的正确性判定。不同于传统的二元正确/错误标注,该数据集通过八级有序语义分类体系,涵盖精确、等价、替代正确、部分正确、过度包容有效、过度包容无效、无效及矛盾等类别,为评估者提供了诊断性的视角。研究者可借助该数据集验证自动评估指标是否遵循预期的语义排序,从而在受控条件下检验模型答案的语义忠实度与完整性。其应用典型地体现在对问答系统输出质量的系统化剖析中,以揭示模型在生成过程中的潜在缺陷。
衍生相关工作
CAP-Correctness的提出激发了多项衍生研究工作。首要的是其配套的CAP-Statements数据集,专注于将问答对转化为陈述性语句,以便利用自然语言推理(NLI)进行更深入的语义评估,这一资源本身即为语句生成领域的研究提供了宝贵的训练与测试语料。其次,该数据集所倡导的单调性评估协议已被后续工作采纳为评估自动评价指标性能的标准范式。此外,基于CAP框架的评分方法,研究者正在探索将其拓展为无标签分类器,通过校准阈值直接输出连续分数及语义类别标签。更为深远的是,该工作促进了针对替代正确答案与过度包容无效等特定类别的专项研究,推动了NLI模型在细粒度语义区分上的能力提升。
数据集最近研究
最新研究方向
在开放域问答评估领域,针对大语言模型生成性答案的语义正确性度量正成为研究前沿。CAP-Correctness数据集的构建,基于八级有序的语义正确性分类体系,旨在细粒度区分答案的等价性、不完整性、过度生成、幻觉污染及矛盾性等不同错误模式。该研究方向摒弃了传统二元正确性标签和单纯相似度匹配的局限,引入双向自然语言推理的连续评分机制,以捕捉答案与参考答案间微妙的语义蕴含关系。此数据集不仅为评估指标提供标准测试平台,其单调性检验协议更促进了对现有评估方法缺陷的系统性诊断,对提升大语言模型在事实性问答任务中的可靠性与可解释性具有重要意义。
相关研究论文
  • 1
    How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation索非亚大学; 苏黎世联邦理工学院; 苏黎世大学; 穆罕默德·本·扎耶德人工智能大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务