CAP-Correctness
收藏资源简介:
CAP-Correctness是一个用于开放域问答语义正确性评估的基准数据集,由索非亚大学等机构联合构建。该数据集包含8827个四元组,每个样本由问题、标准答案、候选答案和语义正确性标签组成,数据源自OpenBookQA、ARC和MMLU等广泛使用的问答集,覆盖从小学至本科水平的多元领域。数据集通过大语言模型辅助的标注管道生成,并经过人工验证(Cohen's κ=0.779),确保标签可靠性。其核心应用在于评估开放域问答生成答案的语义正确性,旨在区分部分正确、过度包含、矛盾等细粒度错误类型,为自动评估提供更精确的基准。
CAP-Correctness is a benchmark dataset for semantic correctness evaluation of open-domain question answering, jointly constructed by Sofia University and other institutions. This dataset contains 8,827 quadruples, with each sample consisting of a question, a reference answer, a candidate answer, and a semantic correctness label. The data is sourced from widely adopted question answering datasets including OpenBookQA, ARC, and MMLU, spanning diverse academic domains ranging from primary school to undergraduate levels. The dataset is generated via an annotation pipeline assisted by Large Language Models (LLMs), and validated through human annotation with a Cohen's κ of 0.779 to ensure label reliability. Its core application lies in evaluating the semantic correctness of generated answers for open-domain question answering, aiming to distinguish fine-grained error categories such as partially correct, over-inclusive, and contradictory responses, thus providing a more precise benchmark for automatic evaluation.
数据集概述
该数据集与论文《EMNLP 2026 — How Correct Is Your Answer?》相关联,用于支持 CAP(一种基于自然语言推理(NLI)的指标)的研究,该指标用于评判问答(QA)答案的正确性。
研究背景
CAP 指标被用于与标准自然语言生成(NLG)评估指标(如 BLEU、ROUGE-L、METEOR、BERTScore、COMET)进行对比基准测试。测试所依据的问题来源于三个知名的问答基准数据集:ARC-Easy、OpenBookQA 和 MMLU。
数据文件
仓库的 data/ 目录下包含两个主要的数据文件:
-
CAP-Correctness.csv:
- 包含 8,827 行 数据。
- 每一行对应一个(问题、标准答案、候选答案)三元组。
- 包含人工标注的语义正确性标签,标签类别有:
exact、equivalent、alternative_correct、overinclusive_valid、partial、overinclusive_invalid、invalid、contradictory。 - 包含为基于 NLI 评分而生成的
premise(前提)和hypothesis(假设)语句对。
-
CAP-Statements.csv:
- 包含 11,000 条 带标签的(问题、答案、陈述)示例。
- 该文件主要用于训练“问题+答案 → 陈述句”的生成模型。
处理流程
该数据集配套了完整的代码处理管线,主要步骤如下:
- 语句生成模型微调:使用
CAP-Statements.csv文件,通过qa_statement_generation.py脚本微调语句生成模型。 - 推断语句生成:通过
qa_inference_generation.py脚本,为新的问答数据生成premise/hypothesis语句对。 - CAP 指标计算:通过
cap.py脚本计算 CAP 分数,并评估其与人工正确性标签的相关性。 - 指标基准测试:通过
eval_metrics.py和eval_comet.py脚本,将 CAP 指标与 BLEU、ROUGE-L、METEOR、BERTScore 及 COMET 等指标进行对比基准测试。
使用说明
- 环境配置:在仓库根目录下运行
pip install -r requirements.txt安装依赖。 - 代码运行注意:部分脚本是从 notebooks 中提取的,包含占位符路径变量(如
CSV_PATH = "")。在运行前,需要手动将这些变量设置为data/目录下相应的文件路径。
许可信息
- 代码许可:代码部分遵循 MIT License。
- 数据许可:数据许可信息及对底层基准数据集(ARC-Easy、OpenBookQA、MMLU)的第三方归属说明,详见仓库中的
DATA_LICENSES.md文件。

- 1How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation索非亚大学; 苏黎世联邦理工学院; 苏黎世大学; 穆罕默德·本·扎耶德人工智能大学 · 2026年



