遇见数据集

ArgKP-X

收藏
arXiv2026-08-26 更新2026-08-28 收录
官方服务:

资源简介:

ArgKP-X是由伦敦国王学院构建的结构感知基准数据集,旨在弥补现有关键点分析(KPA)基准在语义分组、覆盖率及流行度估计上的缺陷。该数据集基于ArgKP21进行重构,通过人机协同的重新标注流程,为每个主题创建多个论点子集作为独立KPA实例,确保语义分组连贯、关键点代表性强且覆盖全面。数据集包含高质量的关键点与论点映射,支持结构化预测评估,主要应用于论点挖掘、意见总结及大规模调查分析,致力于解决现有基准中存在的天花板违规和选择失败问题。

ArgKP-X is a structure-aware benchmark dataset constructed by King's College London, aiming to address the limitations of existing Key Point Analysis (KPA) benchmarks in terms of semantic grouping, coverage, and popularity estimation. Reconstructed based on ArgKP21, it adopts a human-machine collaborative re-annotation pipeline to create multiple argument subsets for each topic as independent KPA instances, ensuring coherent semantic grouping, highly representative key points, and comprehensive coverage. The dataset includes high-quality key point-to-argument mappings, which supports structured prediction evaluation. Its main applications cover argument mining, opinion summarization, and large-scale survey analysis, and it is dedicated to solving the issues of ceiling effect violations and selection failures existing in current benchmarks.

提供机构:
伦敦国王学院
创建时间:
2026-08-26
原始信息汇总

ArgKP-X 数据集概述

ArgKP-X 是一个由人类验证的重新标注基准数据集,用于支持关键点分析(KPA)研究。该数据集将 KPA 重新定义为结构恢复任务:系统需从给定论证集合中识别连贯的语义论证分组、生成代表性关键点、捕捉论证中的主要主题并反映这些主题的普遍性。

核心基准

主基准文件为 kpa_test_set_reannotations_with_ids.json,每个基准实例包含一个完整的 KPA 结构,具体字段包括:

  • index:实例的唯一标识符
  • topic_index:原始 ArgKP21 测试集主题标识符
  • topic:辩论主题
  • arguments:用于 KPA 分析的论证集合
  • key_points:重新标注的关键点集合,代表论证中的主要语义主题
  • argument_groups:语义论证分组,包含代表性关键点及属于该组的论证
  • unmatched_arguments:无法分配到任何语义组或关键点的论证

附加资源

除主基准外,数据集还包含在基准构建和验证过程中产生的多个资源:

  • 语义组验证标注semantic_group_verification.json):包含关键点质量评估、论证归属选择和标注者书面理由,支持语义分组、聚类和可解释 KPA 研究
  • 未匹配论证重新分配标注unmatched_arguments_reassignment.json):包含将未匹配论证分配到现有关键点的决策及理由,支持论证-关键点匹配和覆盖分析研究
  • 人类评估标注human_evaluation.json):包含对替代 KPA 结构的维度级评分、总体偏好和自由文本解释,评估维度包括语义分组、关键点质量、覆盖率和总体偏好
  • 双重标注资源double_annotation_subset_0.jsondouble_annotation_subset_1.json):独立标注的人类评估子集,用于分析标注者间一致性和可靠性
  • LLM 评估标注llm_eval_glm_release.jsonllm_eval_deepseek_release.json):包含 GLM 和 DeepSeek 等 LLM 评判者对替代 KPA 结构的评估结果,支持人机一致性研究

设计用途

ArgKP-X 主要用于支持以下研究领域:

  • 关键点分析(KPA)及结构感知 KPA
  • 语义分组与论证聚类
  • 论证摘要
  • 覆盖率和普遍性估计
  • 可解释论证挖掘
  • KPA 评估方法和 LLM-as-a-judge 方法论

许可信息

ArgKP-X 及其所有附带标注资源采用 Apache License 2.0 许可。基准源自同样基于 Apache License 2.0 的 ArgKP21 数据集,使用时需保留对 ArgKP21 和 ArgKP-X 的适当署名。

搜集汇总
数据集介绍
ArgKP-X 数据集图片
构建方式
ArgKP-X数据集基于ArgKP21测试集,通过人机协同的循环标注流程构建。研究者首先从每个主题中随机抽取5个参数子集(每子集30-50个论点),每个子集作为独立的KPA实例。之后,利用大型语言模型生成初始的关键点结构,再由人类标注者分两阶段优化:第一阶段验证并修正语义分组的精度,第二阶段重新分配未匹配的论点,并收集标注者的解释性理由。最终,所有分配与新增关键点经合并审查,剔除无支撑的关键点,形成结构感知、分布敏感的新基准。
特点
ArgKP-X的核心特点在于其结构感知与分布敏感性。它严格对齐真实KPA的四个要求:语义分组、关键点生成、覆盖率和流行度估计,克服了现有数据集中的分组不一致、冗余和覆盖不全等问题。每个主题的多个子集揭示了论点分布对KPA结构的影响,使评估更贴近实际场景。同时,数据集附带人类与LLM的评估注释,支持可解释性和LLM评判方法的研究。
使用方法
ArgKP-X主要用于评估KPA系统的结构化预测能力。使用时,将待测模型生成的KPA结构(含分组、关键点和偏好)与基准结构对比,可从语义分组、关键点质量、覆盖率和流行度四个维度进行评价。基准提供了15个独立实例,支持分布敏感性分析。此外,伴随的注释资源可用于参数-关键点匹配、覆盖分析及LLM评判等研究,但基准未设计为训练集,不宜用于监督学习。
背景与挑战
背景概述
ArgKP-X 数据集由伦敦国王学院信息学系的 Zhiqiang Shi 与 Oana Cocarascu 于 2026 年创建,旨在推动关键点分析(Key Point Analysis, KPA)研究的范式革新。该数据集基于 ArgKP21 进行结构感知与分布敏感的重标注,通过人机协同的注释流程,将 KPA 重新定义为结构化预测问题,涵盖语义分组、关键点生成、覆盖度和普遍性估计四个核心维度。ArgKP-X 的发布为 KPA 领域提供了更高质量的基准,挑战了传统基于参考的评估方法,并为后续研究提供了丰富的注释资源,对论证挖掘与意见挖掘领域产生了深远影响。
当前挑战
ArgKP-X 的构建面临多重挑战。领域层面,现有 KPA 基准(如 ArgKP21)存在语义分组不连贯、关键点冗余、覆盖不全以及论证-关键点映射不精确等问题,导致参考标注并非最优,引发天花板效应与选择失败,使得基于相似度的评估无法真正衡量系统性能。构建层面,重新标注需要大量人工参与,并通过多阶段人机协作流程确保语义分组的精确性与关键点质量;同时,多子集采样引入了分布敏感性,需保证不同子集间的结构差异被正确捕获,且评估需兼顾人类与 LLM 的判断一致性。
常用场景
经典使用场景
ArgKP-X数据集的核心应用场景在于对论点集合进行结构化摘要分析,即关键点分析。该数据集通过重新注释,为每个主题构建了多个论点子集,使得研究者能够在不同论点分布下评估关键点的生成、语义分组、覆盖度及流行度估计。其设计旨在揭示论点空间的内在组织,推动从简单的关键点匹配向结构恢复的转变,为论点挖掘和自动摘要领域提供了更严谨的基准。
衍生相关工作
ArgKP-X的发布催生了多项衍生研究工作,包括基于其注释资源的论据-关键点匹配算法、覆盖度评估新指标、可解释性KPA系统以及利用大型语言模型作为裁判的自动化评估方法。这些工作进一步探索了结构恢复在KPA中的核心作用,推动了论点聚类、抽象摘要和模型偏好预测等领域的发展,为构建更透明、更可靠的论点分析工具奠定了基础。
数据集最近研究
最新研究方向
当前,关键点分析(KPA)领域正经历从传统标注范式向结构感知与分布敏感型基准的深刻转型。最新研究揭示,现有数据集在语义分组一致性、摘要覆盖度及流行度估计可靠性上存在系统性缺陷,导致基于相似度的评估出现天花板效应与选择失效。在此背景下,ArgKP-X基准的提出标志着研究重心转向结构化预测问题,强调恢复论证语料的潜在语义组织。该基准通过人类参与的循环再标注流程,构建了支持分组质量、要点生成、覆盖度及流行度多维评估的严谨框架,并配套发布评估、匹配及可解释性研究资源,为KPA技术的鲁棒评测与可解释人工智能发展奠定了新基石,推动了该领域向更可靠、更贴近真实语料分布的方向演进。
相关研究论文
  • 1
    Key Point Analysis Needs Structure Recovery: Task Definition, Dataset Diagnosis, and a Structure-Aware Benchmark伦敦国王学院 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务