遇见数据集

ScholarQuest

收藏
arXiv2026-06-18 更新2026-06-20 收录
官方服务:

资源简介:

ScholarQuest是由中国科学技术大学认知智能国家重点实验室构建的大规模、分类学引导的学术论文搜索基准数据集。该数据集覆盖超过1000个计算机科学主题,包含1111个高质量查询,涵盖方法导向、设置锚定、比较基础和范围控制四种研究意图类型,旨在为智能代理在开放文献环境中的学术搜索提供系统性评估。其数据来源于对arXiv数据库的整合与扩展,通过结合初始检索、引文网络扩展和多阶段相关性过滤的自动化流程构建高质量答案集,并配套了百万级规模的标准化检索后端ScholarBase。该数据集主要应用于评估基于大语言模型的智能学术搜索代理的性能,旨在解决现有基准在查询多样性、答案集可扩展性以及可复现评估环境方面的不足,推动更高效、精准的文献探索工具的发展。

ScholarQuest is a large-scale, taxonomy-guided academic paper search benchmark dataset developed by the State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China. It covers over 1000 computer science topics and includes 1111 high-quality queries, which fall into four research intent categories: method-oriented, setup-anchored, comparison-based, and scope-constrained. This dataset aims to provide systematic evaluation for academic search conducted by AI Agents in open literature environments. The dataset is constructed based on the integration and expansion of the arXiv database, with high-quality answer sets built through an automated workflow combining initial retrieval, citation network expansion, and multi-stage relevance filtering. It is also equipped with a million-scale standardized search backend named ScholarBase. This benchmark is primarily used to evaluate the performance of academic search AI Agents powered by Large Language Models (LLMs). It addresses the limitations of existing benchmarks in terms of query diversity, answer set scalability, and reproducible evaluation environments, and seeks to advance the development of more efficient and precise literature exploration tools.

创建时间:
2026-06-18
原始信息汇总

数据集概述

ScholarQuest 是一个用于评估论文搜索智能体的基准测试数据集。该基准要求系统根据真实的学术搜索查询检索出相关的 arXiv 论文集合,而非回答单一的事实性问题。

数据集文件

datasets/ScholarQuest.jsonl

  • 内容:最终的基准测试数据集,包含 1111 个基准查询。
  • 格式:每行是一个评估实例。
  • 主要字段
    • query_id:稳定的查询标识符(例如 BQ_000001)。
    • final_query:面向用户的论文搜索查询。
    • answer_arxiv_ids:相关 arXiv ID 列表。
    • final_answer_count:相关答案的数量。
    • source_dir:最终答案集的来源。
  • 约束:仅保留最终答案数量在 5 到 200 之间的查询。

datasets/query_metadata.jsonl

  • 内容:最终答案过滤前的查询元数据池,包含 13097 条生成并去重后的查询记录。
  • 主要字段
    • query_id
    • final_query
    • topic_seed
    • domain
    • category
    • constraint_kind
    • constraint_value
    • rationale
    • risk_flags
    • 生成元数据(如 llm_model、token 计数、源批次信息)。
  • 查询类别(共四类):
    • method_capability
    • setting_anchor
    • claim_comparison
    • scope_control

基准构建流程

所有构建代码位于 BenchmarkConstruction/ 目录下,整体流程如下:

  1. 种子生成

    • 路径:BenchmarkConstruction/SeedGeneration/
    • 方法:从 ACM/arXiv 分类资源构建主题种子。
  2. 查询生成

    • 路径:BenchmarkConstruction/QueryGeneration/
    • 方法:将主题种子扩展为 ScholarQuest 风格的论文检索查询,使用四种受控类别并存储元数据。
  3. 答案查找

    • 路径:BenchmarkConstruction/AnswerFinding/BenchmarkConstruction/AnswerFinding_v2/
    • 方法:使用论文搜索工具和 Lewen API 为每个查询收集候选相关论文。
  4. 答案过滤

    • 路径:BenchmarkConstruction/AnswerFilters/
    • 方法:应用更严格的跨模型过滤以生成更干净的答案集。
  5. 基准选择与分析

    • 路径:BenchmarkConstruction/benchmark/
    • 内容:存储基准快照及用于查询级分析的脚本。

可复用的管道代码位于 BenchmarkConstruction/src/paperbench/,一些关键的入口点包括:

  • python scripts/run_pipeline.py
  • python QueryGeneration/generate_pasa_queries.py
  • python QueryGeneration/validate_pasa_queries.py
  • python AnswerFinding/run_pasa_answer_finding.py
  • python AnswerFilters/run_strict_cross_filter.py

Lewen API

Lewen-API/ 是构建流程所使用的学术论文搜索后端。它提供以下功能:

  • 语义论文搜索
  • 标题和元数据查找
  • 论文详情检索
  • 引用和参考文献查询

该 API 在本地部署中覆盖了约 300 万 篇 arXiv 论文。示例端点:

  • http://<host>:4000/paper/search?query=transformer+attention&limit=5
  • http://<host>:4000/paper/2309.06180?fields=*
  • http://<host>:4000/paper/1706.03762/citations?limit=10

详细 API 信息请参见 Lewen-API/README.mdLewen-API/docs/

推荐阅读顺序

为快速了解该仓库,建议按以下顺序阅读:

  1. datasets/ScholarQuest.jsonl
  2. datasets/query_metadata.jsonl
  3. BenchmarkConstruction/QueryGeneration/README_pasa_generation.md
  4. BenchmarkConstruction/AnswerFilters/README.md
  5. Lewen-API/README.md

注意事项

  • 本仓库专注于基准构建和已发布数据,不涉及模型推理。
  • 生成的缓存、大型原始语料库和中间输出目录已被有意省略或最小化。
  • JSONL 文件是行分隔的 JSON:每个非空行即为一条记录。
搜集汇总
数据集介绍
ScholarQuest 数据集图片
构建方式
在学术文献检索领域,现有基准测试存在查询覆盖有限、答案构建成本高昂及评估环境不统一等局限。为此,ScholarQuest 提出一种基于分类学引导的大规模学术论文搜索基准构建方案。首先,从ACM计算分类系统中收集超过1600个主题,通过大语言模型将其映射至arXiv计算机科学类别,筛选出1000余个种子主题。随后,针对每个主题生成四种研究意图的查询:方法导向、设定锚定、比较基准与范围控制,并经过去重与质量控制得到1111个高质量查询。答案构建采用自动化流水线,融合多源检索、引文图扩展、多阶段相关性过滤与质量验证,最终通过人工审计确认严格匹配精确率达86%。
使用方法
ScholarQuest 的使用遵循系统化评估流程。研究人员可基于ScholarBase后端,将各类学术搜索系统接入统一检索接口,涵盖BM25稀疏检索、BGE-M3密集检索及RRF混合检索。对于智能体式搜索方法,ScholarBase提供论文搜索、元数据查询、引文/参考文献遍历等RESTful API,支持多轮交互式探索。评估指标包括Recall@25、Recall@100与Recall@All,并辅以搜索效率(工具调用次数、候选论文数、每百候选论文召回率)及鲁棒性分析。实验表明,智能体方法显著优于单次检索基线,但当前最佳智能体仅达0.314 Recall@100,揭示约束敏感搜索与搜索效率方面仍存巨大改进空间。
背景与挑战
背景概述
学术论文检索是科学研究中的核心环节,然而传统的基于关键词或语义匹配的方法在面对细粒度、条件性的复杂查询时仍显力不从心。为应对这一挑战,由来自中国科学技术大学认知智能全国重点实验室的潘庭岳、程明月、王道宇等研究人员于2026年提出的ScholarQuest数据集,旨在系统性地评估基于大语言模型的智能体在开放文献环境中的学术论文检索能力。该基准覆盖了超过1000个计算机科学主题,并设计了四种代表性的研究意图查询类型,包括方法导向、设置锚定、比较基准与范围控制。其核心研究问题在于如何通过可扩展的自动化答案构建与标准化的文献环境,实现对智能体搜索过程、效率及鲁棒性的多维度评测。ScholarQuest的提出为推进学术搜索智能体的可信进化提供了重要的评测平台与方向指引。
当前挑战
ScholarQuest所应对的核心挑战在于现有基准在查询覆盖面、答案可扩展性与评估环境标准化方面的不足。具体而言,在查询层面,传统基准多依赖人工构建或论文衍生的查询,易引入标注者偏见且难以覆盖多样化的研究意图;在答案层面,构建高质量的相关论文集合成本高昂且难以规模化,相关论文常分散于不同术语与子领域;在评估环境层面,现有基准缺乏公开且标准化的评测环境,导致工具调用结果难以复现。此外,该数据集的构建过程亦面临挑战,例如如何从超大规模的文献集合中通过多源检索、引文扩展与多阶段相关性判定以自动构建高精度的答案集,同时通过人工审计保证标注质量。实验结果表明,当前最佳智能体在Recall@100和Recall@All上仅分别达到0.314和0.355,揭示了在搜索效率、意图鲁棒性与约束感知能力方面的显著提升空间。
常用场景
经典使用场景
ScholarQuest作为面向学术论文智能搜索的大规模基准测试集,其最经典的使用场景在于评估和比较基于大语言模型的智能搜索代理在开放文献环境中的多轮检索能力。研究者和开发者可以利用该数据集系统性地测试搜索代理在面对方法导向、场景锚定、比较型以及范围受限这四类典型学术查询意图时的表现,从而深入理解模型在复杂查询条件下的检索覆盖率与决策效率。
解决学术问题
该数据集解决了当前学术搜索评估中面临的关键挑战,包括查询样本覆盖度有限、人工标注成本高昂以及评估环境难以复现等问题。通过构建涵盖超过1000个计算机科学主题的细粒度查询集合,ScholarQuest为学术社区提供了一个标准化的诊断平台,能够揭示现有搜索代理在意图保持、约束感知和证据级推理等方面的共性短板,推动了可复现、可比较的学术搜索研究范式的发展。
实际应用
在实际应用中,ScholarQuest所模拟的搜索场景与科研工作者的日常文献调研流程高度吻合,可直接指导新型学术搜索引擎和智能文献助手的开发与优化。无论是构建面向特定方法的技术调研工具,还是开发能够自动识别比较性主张的证据挖掘系统,该数据集所定义的查询类型和评估指标都能为实际系统的性能调优提供明确的方向标,助力打造更高效、更精准的学术知识发现平台。
数据集最近研究
最新研究方向
大型语言模型驱动的学术论文检索代理正成为知识发现的前沿范式,而ScholarQuest作为首个面向开放文献环境的大规模、分类学引导的基准,为系统性评估这类代理在复杂科研意图下的多轮检索能力提供了关键支撑。该基准覆盖计算机科学领域千余个主题,定义了方法导向、设置锚定、对比型与范围控制四类查询意图,揭示了当前最强代理仅达到0.314的召回率@100,尤其在范围控制型查询上表现薄弱。研究进一步诊断出失败根源在于探索方向偏移而非努力不足,这一发现推动了未来工作向更强意图保持、约束感知过滤及证据级推理方向演进,对构建更可靠的科研搜索代理具有里程碑意义。
相关研究论文
  • 1
    ScholarQuest: A Taxonomy-Guided Benchmark for Agentic Academic Paper Search in Open Literature Environments中国科学技术大学·认知智能国家重点实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务