遇见数据集

sage-retrieval

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

该数据集包含两种配置,旨在支持学术论文引用或问答相关任务。第一种配置为open_ended,包含600个训练样本,每个样本具有以下字段:问题(question)、生成计划(generation_plan)、源论文ID(source_paper_id)、被引论文ID(cited_paper_id)、源论文标题(source_paper_title)、被引论文标题(cited_paper_title)、真实标签(ground_truth,包含最相关和相关论文列表,每篇论文包含ID、标题、摘要、语料库ID、arXiv ID和DOI)、领域(domain)、查询类型(query_type)和查询ID(query_id)。第二种配置为short_form,包含599个训练样本,每个样本具有以下字段:论文ID(paper_id)、论文标题(paper_title)、完整查询(complete_query)、真实标签(ground_truth,包含单篇论文的ID、标题、摘要、语料库ID、arXiv ID和DOI)、领域(domain)、查询类型(query_type)和查询ID(query_id)。数据集适用于引文推荐、学术问答生成、查询扩展或相关自然语言处理研究,数据规模较小,侧重于结构化学术信息。

This dataset includes two configurations designed to support academic paper citation or question-answering related tasks. The first configuration is open_ended, containing 600 training samples, each with the following fields: question, generation_plan, source_paper_id, cited_paper_id, source_paper_title, cited_paper_title, ground_truth (including lists of most relevant and relevant papers, each paper containing ID, title, abstract, corpus ID, arXiv ID, and DOI), domain, query_type, and query_id. The second configuration is short_form, containing 599 training samples, each with the following fields: paper_id, paper_title, complete_query, ground_truth (including a single papers ID, title, abstract, corpus ID, arXiv ID, and DOI), domain, query_type, and query_id. The dataset is suitable for citation recommendation, academic question answering generation, query expansion, or related natural language processing research, with a small data scale focusing on structured academic information.

提供机构:
Allen Institute for AI
创建时间:
2026-07-03
原始信息汇总

数据集概述:allenai/sage-retrieval

该数据集专注于学术论文检索任务,包含 open_endedshort_form 两个配置。

配置一:open_ended(开放型)

  • 样本数量:训练集 600 条
  • 数据字段
    • question:问题描述(字符串)
    • generation_plan:生成计划(字符串)
    • source_paper_idcited_paper_id:源论文与被引论文ID(字符串)
    • source_paper_titlecited_paper_title:源论文与被引论文标题(字符串)
    • ground_truth:答案结构,包含:
      • most_relevant:最相关论文列表(含 paperId、title、abstract、corpus_id、arxiv_id、doi)
      • relevant:相关论文列表(字段同 most_relevant)
    • domain:领域(字符串)
    • query_type:查询类型(字符串)
    • query_id:查询ID(字符串)
  • 文件大小:约 6.35 MB(下载大小约 5.70 MB)

配置二:short_form(短格式)

  • 样本数量:训练集 599 条
  • 数据字段
    • paper_idpaper_title:论文ID与标题(字符串)
    • complete_query:完整查询(字符串)
    • ground_truth:答案结构(包含 paperId、title、abstract、corpus_id、arxiv_id、doi)
    • domain:领域(字符串)
    • query_type:查询类型(字符串)
    • query_id:查询ID(字符串)
  • 文件大小:约 1.78 MB(下载大小约 1.42 MB)

数据格式

数据集以 Hugging Face Datasets 格式存储,文件路径为:

  • open_ended/train-*(open_ended 配置)
  • short_form/train-*(short_form 配置)
搜集汇总
数据集介绍
sage-retrieval 数据集图片
构建方式
sage-retrieval数据集专为学术文献检索任务而设计,其构建过程精细且严谨。该数据集包含两种配置:open_ended与short_form。open_ended配置以开放性问题为起点,每条数据均包含问题文本、生成计划、源论文与被引论文的元数据,以及由专家标注的相关文献列表,其中区分了“最相关”与“相关”两个层级。short_form配置则聚焦于简短的查询,每条数据记录了一篇目标论文的信息及对应的标准查询文本,并同样提供专家标注的准确文献作为标准答案。两种配置均涵盖了丰富的领域标签和查询类型,确保了任务的多样性与挑战性。
使用方法
使用sage-retrieval数据集时,用户可根据需求选择open_ended或short_form配置。两种配置均通过HuggingFace Datasets库直接加载,调用load_dataset('sage-retrieval', 'open_ended')或'short_form'即可获取。模型可基于问题或查询文本进行检索,输出候选文献列表,并与ground_truth中的标准答案进行比对,利用MRR、Recall@k等指标评估性能。由于所有数据均含有领域与查询类型标签,研究者还可对不同子集进行分面分析,深入探究模型在不同学术场景下的检索能力。数据集仅提供训练集,适合用于模型训练与内部验证。
背景与挑战
背景概述
在科学文献检索领域,准确引用相关论文是学术研究的基础。然而,传统检索方法往往难以捕捉复杂的研究意图,导致引用遗漏或错误。为此,sage-retrieval数据集于近期由相关研究团队创建,旨在为科学文献检索中的生成式引用推荐提供标准化的评估基准。该数据集通过模拟研究人员在撰写论文时的真实引用需求,聚焦于如何从海量论文库中精准定位既切题又具高相关性的文献。这一贡献对推动自然语言处理与信息检索的交叉研究具有重要意义,尤其在提升大型语言模型的语义理解与检索能力方面展现出广阔的应用前景。
当前挑战
sage-retrieval数据集所解决的领域核心挑战在于科学文献检索中引用意图的模糊性与多样性。传统检索模型常依赖于关键词匹配,难以处理诸如“某方法在异质图上的应用”这类开放式的引用需求,导致检索结果相关性不足。此外,数据集构建过程中面临标注一致性难题:如何确保人工标注的“最相关”与“相关”论文判定标准统一,避免主观偏差。同时,领域覆盖的广泛性与查询类型的差异性(如开放式与短格式)也增加了数据平衡的复杂性,为模型泛化能力提出了更高要求。
常用场景
经典使用场景
在学术信息检索与引文分析领域,sage-retrieval数据集专为评估和提升学术文献检索模型的精准度而设计。该数据集包含开放问答与短格式两种配置,涵盖了从自然语言问题到结构化引文检索的多样任务。经典使用场景包括基于研究问题的论文召回、引文推荐以及学术搜索引擎的验证,研究者可借助其细粒度的相关论文标注(最相关与相关)来训练和测试模型对学术语境中语义匹配的捕捉能力。
解决学术问题
该数据集有效解决了学术文献检索中缺乏高质量、多粒度相关标注基准的难题。传统数据集往往仅提供二元相关性判断,而sage-retrieval通过区分“最相关”与“相关”论文,支持更细致的相关性建模,有助于研究者在引文推荐、论文摘要匹配等任务中探索语义层级与排序算法。其意义在于推动学术信息检索从粗粒度匹配向精细化理解迈进,为跨领域查询与引文网络分析提供了标准化评估平台,进而提升科研效率与知识发现质量。
实际应用
在实际应用中,sage-retrieval数据集可被集成于学术搜索引擎、文献管理工具及智能研究助手系统中。例如,当研究者提出一个开放式的科学问题时,系统能够基于该数据集训练的模型快速定位最相关的论文集合,并区分高相关性与一般相关性的文献。此外,在论文推荐系统中,短格式配置可辅助生成基于引文意图的精准推荐列表,帮助学者追踪前沿动态、避免重复研究,从而加速科学探索进程。
数据集最近研究
最新研究方向
SAGE-Retrieval数据集聚焦于学术文献检索领域的前沿探索,特别是在大语言模型驱动的生成式检索场景中,该数据集通过精心设计的开放性与短格式查询配置,为评估和优化文献检索系统提供了弥足珍贵的基准。当前研究热点围绕如何利用该数据集提升检索模型对复杂科研问题的理解能力,衔接生成式规划与多源文献的精确匹配,尤其关注跨领域知识融合与查询意图解析等深层次挑战。该数据集的发布与学术圈对人工智能辅助科研效率的迫切需求不谋而合,其蕴含的细粒度标注(如相关性分级与摘要关联)正推动检索系统从关键词匹配向语义理解跃迁,对加速知识发现与推动可重复研究具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务