PreScience
收藏资源简介:
PreScience是一个基准测试数据集,用于预测科学贡献。它分解了研究过程为四个相互依赖的生成任务,并评估模型在一个包含98,000篇AI相关arXiv论文(2023年10月至2025年10月)的精选数据集上的表现。该数据集包含消歧的作者身份、时间对齐的学术元数据以及502,000篇论文的结构化图。
PreScience is a benchmark dataset for scientific contribution prediction. It decomposes the research process into four interdependent generative tasks, and evaluates model performance on a curated dataset comprising 98,000 AI-related arXiv papers (October 2023 to October 2025). This dataset includes disambiguated author identities, temporally aligned academic metadata, and a structured graph of 502,000 academic papers.
PreScience 数据集概述
数据集简介
PreScience 是一个用于预测科学贡献的基准测试。它将研究过程分解为四个相互依赖的生成任务,并基于一个精心策划的数据集对模型进行评估。
核心任务
该基准包含以下四个预测任务:
| 任务 | 描述 | 评估指标 |
|---|---|---|
| 合作者预测 | 给定一位种子作者,预测未来论文的其余作者 | nDCG, R-Precision |
| 先前工作选择 | 给定未来论文的作者,预测其关键参考文献 | nDCG, R-Precision |
| 贡献生成 | 给定论文的作者和关键参考文献,生成论文的标题和摘要 | LACERScore, ROUGE-L, BERTScore |
| 影响力预测 | 预测论文的12个月累计引用次数 | MAE, Pearson, Spearman |
数据集详情
- 数据来源:包含 98,000 篇与人工智能相关的 arXiv 论文(时间范围:2023年10月 至 2025年10月)。
- 数据特点:包含消歧后的作者身份、时间对齐的学术元数据,以及一个包含 502,000 篇论文的结构化图。
- 数据划分:包含训练集(2023年10月–2024年)和测试集(2024年10月–2025年)。
- 伴随数据:包含 400,000+ 篇伴随论文(参考文献和作者发表历史)。
- 数据获取:数据集托管于 HuggingFace:https://huggingface.co/datasets/allenai/prescience
基准测试与复现
基准测试脚本涵盖四个核心任务,并提供了从运行基线到评估的完整流程。论文中的主要结果(如表2、表3、表4和图4)可通过运行指定的脚本和配置进行复现。
多轮模拟
支持将合作者预测、先前工作选择和贡献生成组合成一个管道,在指定的时间范围内逐日生成合成语料库,用于分析作者多样性、关键参考文献多样性、LACER 多样性、新颖性和主题分布等。
数据集构建
提供了从零开始构建数据集的完整七阶段流程说明,涉及从 arXiv 快照和 Semantic Scholar API 下载数据、添加关键参考文献和作者信息、作者消歧、添加引用元数据等步骤。由于公共 API 速率限制,此过程可能非常耗时。



