PaperAsk
收藏资源简介:
PaperAsk是一个用于评估大型语言模型(LLMs)在学术任务中可靠性的基准数据集,由德克萨大学和复旦大学的研究团队创建。数据集包含840个测试案例,涵盖了四个核心学术操作:引用检索、内容提取、论文发现和声明验证。数据集旨在模拟真实使用条件,通过网页接口进行评估,从而揭示LLMs在实际应用中的可靠性问题。
PaperAsk is a benchmark dataset for evaluating the reliability of Large Language Models (LLMs) in academic tasks, created by research teams from the University of Texas and Fudan University. The dataset contains 840 test cases covering four core academic operations: citation retrieval, content extraction, paper discovery, and claim verification. It is designed to simulate real-world usage conditions and conduct evaluations via web interfaces, thereby revealing the reliability issues of LLMs in practical applications.
PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
基本信息
- 标题: PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
- arXiv ID: arXiv:2510.22242v1
- 提交日期: 2025年10月25日
- 学科分类: Computer Science - Information Retrieval (cs.IR); Artificial Intelligence (cs.AI); Computation and Language (cs.CL)
- DOI: https://doi.org/10.48550/arXiv.2510.22242
作者
Yutao Wu, Xiao Liu, Yunhao Feng, Jiale Ding, Xingjun Ma
摘要
大型语言模型(LLMs)越来越多地作为研究助手使用,但它们在学术任务中的可靠性仍未得到充分评估。本文介绍了PaperAsk,一个系统评估LLMs在四个关键研究任务中的表现的基准:引文检索、内容提取、论文发现和声明验证。我们在实际使用条件下(通过用户无法看到搜索操作的网络界面)评估了GPT-4o、GPT-5和Gemini-2.5-Flash。通过受控实验,我们发现了一致的可靠性失败:在多引用查询中,引文检索失败率为48-98%;特定章节内容提取失败率为72-91%;主题论文发现的F1分数低于0.32,遗漏超过60%的相关文献。进一步的人工分析将这些失败归因于检索上下文的不可控扩展以及LLMs倾向于优先考虑语义相关文本而非任务指令。在基本任务中,不同LLMs表现出不同的失败行为:ChatGPT经常拒绝回答而不是冒险出错,而Gemini则产生流畅但捏造的答案。为了解决这些问题,我们基于PaperAsk数据训练了轻量级可靠性分类器,以识别不可靠的输出。PaperAsk为推进基于LLM的学术辅助系统的可靠性评估提供了一个可重复和诊断性的框架。
相关链接
- PDF链接: http://arxiv.org/pdf/2510.22242v1
- TeX源码: http://arxiv.org/tex/2510.22242v1




