遇见数据集

Prabhjotschugh/firstpass-peer-review

收藏
Hugging Face2026-05-30 更新2026-05-31 收录
官方服务:

资源简介:

FirstPass是一个多领域、多轮次的科学同行评审数据集,基于《自然通讯》的透明同行评审文件构建。它包含来自五个科学领域的3668个完整的同行评审对话,并带有从实际修订周期结果中推导出的编辑结果标签。该数据集涵盖生物学、化学、神经科学、物理学和地球科学领域,数据来源于《自然通讯》期刊(ISSN 2041-1723),时间范围为2023年1月至2025年12月。数据集包含三种配置:用于结果预测的分类分割(cls)、用于生成任务(如评论生成和评审员更新)的监督微调分割(sft),以及包含完整解析记录(如论文内容、所有评审轮次和元数据)的全结构化记录(records)。数据经过严格的质量过滤和完整性审核,适用于文本分类、文本生成和问答等NLP任务,特别是同行评审相关的应用。

FirstPass is a multi-domain, multi-turn scientific peer review dataset constructed based on the transparent peer review documents of *Nature Communications*. It contains 3668 complete peer review conversations across five scientific disciplines, paired with editorial outcome labels derived from the results of actual review cycles. This dataset covers the fields of biology, chemistry, neuroscience, physics, and earth science, with data sourced from the journal *Nature Communications* (ISSN 2041-1723), spanning from January 2023 to December 2025. The dataset includes three configurations: the classification split (cls) for outcome prediction, the supervised fine-tuning split (sft) for generation tasks such as comment generation and reviewer updating, and the fully structured record set (records) that contains complete parsed records such as paper content, all review rounds, and metadata. The data has undergone rigorous quality filtering and integrity audits, making it suitable for NLP tasks including text classification, text generation, and question answering, especially for peer review-related applications.

提供机构:
Prabhjotschugh
搜集汇总
数据集介绍
Prabhjotschugh/firstpass-peer-review 数据集图片
构建方式
FirstPass数据集源自《自然·通讯》期刊在2023至2025年间发表的同行评议记录,覆盖生物学、化学、神经科学、物理学与地球科学五大领域。数据采集首先通过Springer Nature开放接口筛选文章,随后从期刊官网获取论文PDF与强制公开的透明评议PDF,并借助Gemini-3.1-flash-lite-preview模型结合六层JSON恢复管线对两种文档进行结构化提取。经提取后,仅保留论文四个章节均超20词、至少完整两轮评议且评议总词数不低于150条的记录。最终对全部3668条数据执行自动化完整性审计,确认无空壳文件,并采用按领域与标签分层的80/10/10比例进行划分。
使用方法
数据集提供cls、sft与records三种配置,分别对应不同的下游任务。利用Hugging Face datasets库可便捷加载:cls配置用于修订周期预测,其样本包含论文与多轮评议拼接后的输入文本及STANDARD或EXTENDED两类标签;sft配置用于监督微调,涵盖从论文生成首轮评议以及结合作者回复更新第二轮评议两项生成任务;records配置则返回每篇论文的完整结构化记录,包含所有元数据、章节内容与预构建的训练样本。推荐基于Qwen2.5-7B-Instruct模型结合LoRA进行微调,并启用仅对响应部分计算损失的掩码策略,在分类任务上已实现80.5%的准确率与78.2%的宏F1分数。
背景与挑战
背景概述
FirstPass数据集由Prabhjot Singh等人于2026年构建,源自《Nature Communications》期刊2023至2025年间发布的透明同行评审文件,涵盖生物学、化学、神经科学、物理学和地球科学五个科学领域,共计3668个完整的同行评审对话。该数据集旨在利用真实的多轮修订结果,推动科学同行评审过程的自动化研究,包括评审生成、评审者更新以及修订周期结果预测等核心任务。其伴随的微调模型在修订周期预测任务上达到了80.5%的准确率,成果被ICML 2026的AI科学家研讨会录用,对科学人工智能领域具有重要影响。
当前挑战
该数据集主要解决科学同行评审领域的自动化难题,包括从手稿生成专家级评审意见、根据作者回复更新评审内容以及预测手稿所需的修订轮次。在构建过程中,数据集面临多重挑战:首先,从Nature官网获取论文PDF和透明同行评审PDF后,需通过大语言模型结合强设计的提取提示和六层JSON恢复管道,解析并结构化多轮评审、作者回复和决定信函;其次,质量过滤要求严格,仅保留所有论文章节超过20词、至少两轮完整评审且总评阅字数不低于150的记录;最后,还需通过自动化审计确保3668条记录无一空洞,实现100%的内容完整性。
常用场景
经典使用场景
在科学出版与学术评价的研究领域中,FirstPass数据集以其跨学科、多轮次的同行评议对话为核心特色,成为探索科研论文评审过程自动化的重要资源。其最经典的使用场景包括:基于论文全文与评审对话的二分类任务,预测稿件是否经历标准(两轮)或延长(三轮及以上)修订周期;以及生成式任务,即根据论文内容生成第一轮审稿意见,或结合作者答复生成第二轮审稿意见。这一数据集为构建能理解复杂学术交流、模拟专家评审行为的语言模型提供了坚实的数据基础。
解决学术问题
FirstPass数据集直面学术出版中的两大关键问题:一是如何量化并预测同行评议的复杂性与周期,二是如何生成具有专业深度的自动化审稿意见。通过提供来自Nature Communications的真实、多领域、多轮次评审记录,该数据集使研究者能够训练模型识别评审对话中未解决的关切信号,从而提前预判稿件修订的繁琐程度。这为解决学术评审效率低下、周期漫长等长期困扰学术界的难题提供了数据驱动的解决方案,推动了科学出版智能化的进程。
实际应用
在实际应用中,FirstPass数据集可赋能多个学术出版与科研管理场景。例如,学术期刊编辑可借助基于该数据集训练的模型,在稿件分配阶段初步评估其修订复杂度,优化审稿流程;科研人员可在投稿前利用审稿生成模型获得模拟反馈,提前修正论文缺陷,提升录用概率。此外,该数据集还可服务于学术写作辅助工具的开发,为研究者提供针对性的方法论与论述建议,从而在宏观层面加速科学知识的传播与交流。
数据集最近研究
最新研究方向
在科研人工智能的浪潮中,同行评议的自动化与智能化成为前沿热点。FirstPass数据集基于《自然·通讯》2023至2025年间涵盖生物学、化学、神经科学、物理学及地球科学的3668篇完整同行评议对话,构建了多轮次、多学科的学术评审语料库。该研究聚焦于修订周期预测、评审生成及评审者意见更新三大核心任务,揭示了响应损失掩码对模型性能的关键作用,并采用Qwen2.5-7B-Instruct与LoRA微调策略,在修订结果预测上实现了80.5%的准确率与78.2%的F1宏平均值,展现了跨领域泛化能力。这一工作不仅为提升审稿效率提供了数据基础,更推动了AI在科学出版决策辅助中的实际应用,对加速学术交流与减少审稿偏见具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务