遇见数据集

alabnii/morehopqa

收藏
Hugging Face2024-06-21 更新2024-06-22 收录
官方服务:

资源简介:

MoreHopQA是一个新的多跳推理数据集,旨在从提取式答案转向生成式答案。该数据集通过半自动化过程创建,包含1118个经过人工验证的样本。数据集基于三个现有的多跳推理数据集(HotpotQA、2Wiki-MultihopQA和MuSiQue),并增加了额外的推理层。每个样本包含多个字段,如问题、答案、上下文、前一个问题、前一个答案、问题分解、最后一跳问题、答案类型、前一个答案类型、跳数和推理类型。数据集主要用于分析和改进模型的多跳推理能力。

MoreHopQA是一个新的多跳推理数据集,旨在从提取式答案转向生成式答案。该数据集通过半自动化过程创建,包含1118个经过人工验证的样本。数据集基于三个现有的多跳推理数据集(HotpotQA、2Wiki-MultihopQA和MuSiQue),并增加了额外的推理层。每个样本包含多个字段,如问题、答案、上下文、前一个问题、前一个答案、问题分解、最后一跳问题、答案类型、前一个答案类型、跳数和推理类型。数据集主要用于分析和改进模型的多跳推理能力。

提供机构:
alabnii
原始信息汇总

MoreHopQA 数据集概述

数据集描述

MoreHopQA 是一个新的多跳问答数据集,从提取式答案转向生成式答案。该数据集通过利用三个现有的多跳问答数据集:HotpotQA、2Wiki-MultihopQA 和 MuSiQue,增强了现有的多跳问题,增加了另一层提问。数据集包含 1118 个经过人工验证的样本,推荐主要使用人工验证版本。

数据集结构

配置

  • verified: 包含经过人工验证的数据文件,默认配置。
    • 数据文件:
      • split: test
      • path: verified/test-*
  • unverified: 包含未经人工验证的数据文件。
    • 数据文件: data/without_human_verification.json

特征

每个样本包含以下字段:

  • question: 字符串类型,新的多跳问题。
  • context: 序列类型,包含标题和段落。
    • title: 字符串类型。
    • paragraphs: 序列类型,字符串。
  • answer: 字符串类型,最终答案。
  • previous_question: 字符串类型,前一个两跳问题。
  • previous_answer: 字符串类型,前一个两跳问题的答案。
  • question_decomposition: 序列类型,包含子问题分解。
    • sub_id: 字符串类型,链中的位置。
    • question: 字符串类型,子问题。
    • answer: 字符串类型,子问题的答案。
    • paragraph_support_title: 字符串类型,相关上下文段落。
  • question_on_last_hop: 字符串类型,最后一跳的问题。
  • answer_type: 字符串类型,预期答案的类型。
  • previous_answer_type: 字符串类型,前一个两跳问题答案的类型。
  • no_of_hops: 整数类型,回答额外推理问题所需的跳数。
  • reasoning_type: 字符串类型,可能包含 "Symbolic"、"Arithmetic"、"Commonsense",取决于所需的推理类型。

分割

  • test: 包含 1118 个样本,总字节数为 839113。

数据集大小

  • 下载大小: 201825 字节
  • 数据集大小: 839113 字节

许可证

数据集遵循 CC BY 4.0 许可证。

搜集汇总
数据集介绍
alabnii/morehopqa 数据集图片
构建方式
MoreHopQA数据集采用半自动化的构建流程,基于三个现有的多跳问答数据集——HotpotQA、2Wiki-MultihopQA和MuSiQue——进行扩展。研究者并非仅依赖事实推理,而是在原有复杂问题基础上增添了一层新的推理需求,从而将回答形式从抽取式转变为生成式。该过程通过自动生成问题并辅以人工验证,最终产出了1118个经过人类核查的高质量样本,同时提供了一个规模更大但未经人工验证的版本以供参考。
特点
该数据集的核心特点在于其设计的深度与多样性。每个样本不仅包含新增的多跳问题及其答案,还保留了原始问题、完整的子问题链以及从第二实体到最终答案的复合问题,共计六种评估场景。此外,数据集标注了推理类型(如符号推理、算术推理、常识推理)和跳数,能全面衡量模型在复杂推理任务中的能力。人工验证版本确保了数据可靠性,使其成为分析多跳推理机制的理想基准。
使用方法
用户可通过HuggingFace平台便捷加载该数据集,默认使用经过人工验证的'verified'配置。数据集以JSON格式提供,包含'question'、'context'、'answer'等字段,以及'question_decomposition'字段详细记录推理链的每一步。研究人员可将其用于训练和评估生成式问答模型,尤其适用于测试模型在多源信息合成与深层逻辑推理上的表现。推荐优先使用验证版本以保证实验结果的稳健性。
背景与挑战
背景概述
在自然语言处理领域,多跳问答任务要求模型从多个分散的文本片段中提取并整合信息以回答复杂问题,这被视为检验机器推理能力的关键基准。2024年,日本国立信息学研究所(NII)Aizawa实验室的研究团队,包括Julian Schnitzler、Xanh Ho等人,提出了MoreHopQA数据集,旨在突破现有数据集仅依赖事实性推理的局限。该数据集通过半自动化流程,在HotpotQA、2Wiki-MultihopQA和MuSiQue这三个经典多跳数据集的基础上,为每个原始问题额外添加一层推理,从而将答案形式从抽取式转变为生成式。数据集包含1118个人工验证样本,并提供了未验证的扩展版本,为评估和推动模型的复杂推理能力提供了新的标准化测试平台。
当前挑战
MoreHopQA数据集所解决的领域挑战在于,传统多跳问答任务往往局限于事实层面的信息拼接,缺乏对符号推理、算术计算和常识推理等多样化认知能力的综合考察,导致模型在应对需要更深层理解与生成式回答的问题时表现不佳。在构建过程中,团队面临的主要挑战包括:如何在不引入人工偏差的前提下,通过自动化方法为既有问题设计出合理且多样的额外推理层;如何确保新增的推理步骤与原始上下文保持逻辑一致性;以及如何在人工验证环节高效筛选出高质量样本,以平衡数据集的规模与可靠性。这些挑战共同塑造了MoreHopQA作为多跳推理评估基准的独特价值。
常用场景
经典使用场景
MoreHopQA数据集的核心经典使用场景在于评估和提升大语言模型在复杂多跳推理任务中的表现。该数据集通过将HotpotQA、2Wiki-MultihopQA和MuSiQue中的原始多跳问题叠加额外推理层,构建了需要从多个信息源中综合提取知识并生成答案的挑战性查询。研究者常利用其经过人工验证的1118个样本,系统性地测试模型在符号推理、算术运算及常识推理等多维度上的能力,从而推动从简单的抽取式回答向更深层次的生成式理解范式转变。
实际应用
在实际应用中,MoreHopQA所代表的复杂多跳推理能力是构建高级问答系统、智能知识助手和对话式搜索引擎的关键基石。例如,在医疗诊断辅助中,系统需要整合患者的病史、检查结果和药物信息等多源数据,进行跨越多个知识片段的逻辑推理,方能给出精准建议。同样,在金融风险分析或法律条文查询等场景下,该数据集所训练的模型能够更好地处理需要综合多份文档、执行复杂逻辑运算的查询,显著提升信息检索与决策支持系统的智能化水平。
衍生相关工作
MoreHopQA的发布催生了一系列旨在提升多跳推理能力的经典后续工作。研究者们基于其提出的额外推理层架构,探索了多种增强模型推理链构建的方法,例如利用思维链提示、神经符号推理框架以及检索增强生成技术来应对更复杂的查询。该数据集也常被用作基准,来验证新型预训练语言模型在推理任务上的泛化能力,并推动了关于模型是否真正理解逻辑关系还是仅依赖表面模式匹配的深入探讨,从而促进了可解释人工智能领域的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务