SciJudgeBench
收藏资源简介:
SciJudgeBench是一个大规模基准数据集,包含696,758个领域和时间匹配的论文对,源自210万篇arXiv论文,用于科学品味学习的偏好建模和对齐问题。
SciJudgeBench is a large-scale benchmark dataset containing 696,758 domain and temporally matched paper pairs derived from 2.1 million arXiv papers, targeted at preference modeling and alignment tasks for scientific taste learning.
AI Can Learn Scientific Taste 数据集概述
数据集简介
该数据集旨在研究“科学品味”,即判断和提出具有高潜在影响力研究想法的能力。数据集伴随论文《AI Can Learn Scientific Taste》构建,提出了一种利用大规模社区信号作为监督的训练范式——基于社区反馈的强化学习,并将科学品味学习构建为一个偏好建模和对齐问题。
核心构成
SciJudgeBench 基准数据集
- 数据规模:包含 696,758 个经过领域和时间匹配的论文对,源自截至2024年发布的约 2.1M 篇arXiv论文,涉及约 1.4M 篇独特论文。
- 覆盖领域:涵盖计算机科学、数学、物理学及其他科学领域。
- 评估设置:包含领域内、时间分布外(未来年份论文)、指标分布外(ICLR同行评审)和领域分布外(bioRxiv生物学论文)四种评估场景。
模型组件
-
Scientific Judge(科学评判模型)
- 基于论文标题、摘要和发表日期的成对比较进行训练。
- 学习识别哪篇论文具有更高的潜在影响力。
- 功能:既可作为新生论文的评估器,也可作为构思训练的奖励模型。
-
Scientific Thinker(科学思考者模型)
- 以Scientific Judge作为奖励模型进行训练的科学构思策略模型。
- 功能:给定一篇种子论文,提出具有高潜在影响力的后续研究想法。
- 训练方法:使用基于比较的GRPO进行优化,以进行开放式想法生成。
方法概述(RLCF范式)
基于社区反馈的强化学习包含三个阶段:
- 构建社区偏好:通过匹配同一领域和发表时期的论文,将引用转化为成对偏好信号。
- 使用Scientific Judge进行偏好建模:使用GRPO训练一个生成式奖励模型,以判断两篇论文中哪篇更可能获得更强的社区认可。
- 使用Scientific Thinker进行偏好对齐:以Scientific Judge作为奖励模型,并使用基于比较的GRPO优化策略模型,以生成更高影响力的研究想法。
关键结果
论文表明科学品味可以被学习和迁移:
- 科学判断能力随数据规模和模型规模扩大而提升。
- 习得的判断能力能够跨时间、跨领域泛化,并能从引用偏好迁移到同行评审偏好。
- Scientific Thinker提升了构思质量,在成对比较中超越了强基线模型。
引用信息
bibtex @misc{tong2026aicanlearnscientifictaste, title={AI Can Learn Scientific Taste}, author={Tong, Jingqi and Li, Mingzhe and Li, Hangcheng and Yang, Yongzhuo and Mou, Yurong and others}, year={2026} }
许可信息
本项目采用MIT许可证。




