遇见数据集

HoVer

收藏
arXiv2025-09-30 收录
数据链接:
官方服务:

资源简介:

该数据集名为HOVER,包含了需要整合和推理多个维基百科文章的声明,并根据所需的“跳跃”次数被划分为不同的子集。验证集进一步根据推理深度(跳跃次数)被分为三个子集。具体来说,验证集中包含1126个需要两跳推理的声明,1835个需要三跳推理的声明,以及1039个需要四跳推理的声明。该数据集的任务是对复杂声明进行事实核查。

The dataset is named HOVER. It comprises claims that require integrating and reasoning across multiple Wikipedia articles, and is divided into different subsets based on the required number of "hops". The validation set is further subdivided into three subsets according to inference depth, which refers to the number of hops. Specifically, the validation set contains 1126 claims requiring two-hop reasoning, 1835 requiring three-hop reasoning, and 1039 requiring four-hop reasoning. The core task of this dataset is fact-checking complex claims.

搜集汇总
数据集介绍
构建方式
在数字信息泛滥的时代,事实核查任务面临多跳推理的挑战。HoVER数据集的构建始于对HOTPOTQA中问答对的改写,由经过培训的标注员将其转化为需要两篇维基百科文章支撑的声明。随后,通过替换声明中的实体为另一篇维基百科文章的描述性信息,将声明扩展至三跳乃至四跳,形成多样化的推理图结构。第二阶段通过人工编辑与自动词替换(如BERT掩码预测)生成不支持的声明。最终,标注员将声明分类为SUPPORTED或NOT-SUPPORTED,合并了REFUTED与NOTENOUGHINFO类别以消除歧义。
特点
HoVER数据集的核心特点在于其多跳推理的复杂性与自然性。声明需从最多四篇维基百科文章中提取证据,且三跳与四跳声明多由多个句子构成,通过指代关系连接,增加了长距离依赖理解的难度。推理图呈现链状、星状等多样形态,避免了词匹配捷径——三跳与四跳声明中,支持文档与声明间的语义重叠显著减少。数据集包含超过2.6万条声明,其中四跳声明的平均长度达31.6个词,远超以往数据集,迫使模型进行真正的多跳推理而非浅层匹配。
使用方法
HoVER的使用遵循事实提取与验证的流水线范式。首先,基于TF-IDF的文档检索从维基百科中召回候选文档,随后BERT模型进行神经文档重排序与句子选择,最终由NLI模型对声明进行二分类验证。评估指标包括文档与句子检索的精确匹配与F1分数,以及声明验证准确率。完整的HoVER评分要求模型同时检索所有支持文档并正确分类。基线实验表明,现有模型在四跳声明上的表现急剧下降,最佳流水线仅能在14.9%的开发集样本上完成完整任务,凸显了多跳推理的迫切需求。
背景与挑战
背景概述
在社交媒体与数字内容迅猛发展的时代,虚假信息与蓄意误导的泛滥催生了人们对自动事实核查系统的迫切需求。然而,现有的数据集如FEVER虽为开放域事实提取与验证奠定了基石,却因超过87%的样本仅依赖单一维基百科文章而局限于单跳推理场景。即便在HOTPOTQA等开创性多跳问答数据集中,模型仍可通过浅层语义匹配或单跳捷径取得可观表现,暴露出多跳推理能力的不足。为填补这一空白,北卡罗来纳大学教堂山分校与Verisk Analytics的研究人员于2020年联合构建了HOVER(HOppy VERification)数据集,旨在挑战模型从多达四篇维基百科文章中提取证据并验证声明真实性的能力。该数据集包含超过2.6万条人工撰写的声明,其推理图结构多样,且多数三跳与四跳声明以多句形式呈现,融入了指代消解等长距离依赖关系,对现有模型构成了严峻考验。
当前挑战
HOVER数据集所解决的领域问题核心在于多跳事实提取与验证的复杂性:模型需跨越多个文档进行证据链的推理与整合,而传统单跳或浅层多跳方法在此场景下表现急剧下降。构建过程中面临的挑战同样显著:首先,为生成自然且无推理捷径的多跳声明,研究人员设计了从HOTPOTQA问答对出发、通过替换实体为描述性从句逐步增加跳数的流水线,这一过程需人工标注者具备高度语言驾驭能力,以保证声明可读性与推理图多样性。其次,在声明变异阶段,需通过人工编辑与自动词替换生成不支持原声明的样本,同时避免引入外部知识或位置实体替换带来的偏差。最后,在标注环节,三跳与四跳声明中REFUTED与NOTENOUGHINFO的界限模糊,迫使团队将二者合并为NOT-SUPPORTED类别,以缓解标注歧义并确保数据质量。
常用场景
经典使用场景
在信息爆炸与虚假新闻泛滥的时代背景下,HoVer数据集应运而生,旨在推动多跳事实抽取与声明验证的研究。其经典使用场景是要求模型从多达四篇英文维基百科文章中检索相关证据,并判断声明是否被支持。与传统单跳或浅层多跳数据集不同,HoVer的声明设计精巧,通过替换实体为描述性短语,迫使模型进行跨文档的深层推理,而非依赖简单的词汇匹配。例如,一个四跳声明可能涉及“福特Fusion”的推出年份与某位赛车手的职业生涯,模型需依次串联多个文档中的信息才能完成验证。这一场景不仅考验检索的精确性,更挑战模型在长距离依赖与共指消解上的推理能力,为多跳自然语言处理树立了新的标杆。
解决学术问题
HoVer数据集精准解决了现有事实验证与问答数据集中推理深度不足与捷径学习的学术难题。在FEVER等数据集中,超过87%的声明仅需单篇文档即可验证,而HotpotQA等虽涉及多文档,但研究表明单跳模型仍可通过词汇重叠取得不错成绩。HoVer通过引入3至4跳推理,并大幅降低声明与部分支持文档之间的语义重叠,有效抑制了词匹配的捷径。实验表明,基线模型的检索召回率从2跳的80%骤降至4跳的15%,验证准确率也显著下滑,这凸显了多跳推理的必要性。该数据集的意义在于,它迫使学界重新审视现有模型的推理局限性,并激励研究者开发真正具备复杂逻辑链理解能力的系统,从而推动信息验证从浅层匹配向深层认知的跨越。
衍生相关工作
HoVer数据集催生了一系列经典工作,尤其在多跳推理与检索增强生成领域。受其挑战启发,研究者提出了基于图神经网络的推理路径检索模型,如利用维基百科超链接构建文档图,并通过注意力机制动态选择证据链。此外,针对HoVer中长声明与共指消解的难点,出现了融合预训练语言模型与结构化推理框架的混合系统,例如将BERT与显式推理图结合,以提升多跳场景下的证据召回率。在声明验证方面,衍生工作探索了对抗训练与去偏方法,通过遮蔽词匹配信号迫使模型关注深层逻辑。这些工作不仅推动了HoVer基准性能的提升,其方法论也被迁移至其他多跳任务,如复杂问答与事实验证,进一步扩展了多跳推理的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务