遇见数据集

Nature 系列期刊透明同行评审语料库

收藏
github2026-07-06 更新2026-07-21 收录
官方服务:

资源简介:

从 Nature Portfolio 的 Transparent Peer Review (TPR) 功能中采集的真实审稿意见、作者回复和编辑决定,经 PDF 解析、结构化提取和规则标注后形成的多维研究语料库。包含 28,238 条训练样本,覆盖 10 种 Nature 系列期刊,涉及材料科学、化学、大气科学等多个领域。

This multi-dimensional research corpus is constructed from real reviewer comments, author responses and editorial decisions collected through the Transparent Peer Review (TPR) feature of Nature Portfolio, after undergoing PDF parsing, structured extraction and rule-based annotation. It includes 28,238 training samples, covering 10 Nature Portfolio journals, and encompasses multiple disciplines such as materials science, chemistry, atmospheric science and other relevant fields.

创建时间:
2026-07-06
原始信息汇总

数据集概述

Nature 系列期刊透明同行评审语料库 是一个从 Nature Portfolio 的 Transparent Peer Review (TPR) 功能中采集的多维研究语料库,包含结构化的审稿意见、作者回复和编辑决定,并进行了规则标注。

数据规模

  • 原始 PRF PDF: 244 个(1,019 MB),解析后得到 254 个结构化 JSON
  • 全量评论单元(行级): 215,642 条(69 MB)
  • 审稿人评论段落: 2,492 条
  • 作者回复段落: 484 条
  • 审稿-回复配对(松耦合): 1,766 组
  • 四维完整标注配对: 553 组
  • 训练样本: 28,238 条(指令格式和对话格式各 28,238 条)
  • 总文本量: 约 318 万词
  • 唯一 DOI: 211 个
  • 覆盖期刊: 10 种 Nature 系列期刊

来源期刊分布

  • Nature Communications: 159 篇(多学科:材料、化学、大气、水文等)
  • Nature: 60 篇(各学科旗舰)
  • Humanities and Social Sciences Communications: 8 篇(人文社科)
  • Communications Engineering: 4 篇(工程)
  • Nature Chemistry: 4 篇(化学)
  • Nature Reviews Neuroscience: 2 篇(神经科学)
  • Nature Computational Science: 2 篇(计算科学)
  • Nature Sustainability: 2 篇(可持续性)
  • Nature Climate Change: 2 篇(气候变化)
  • Nature Geoscience: 1 篇(地球科学)

技能领域分布

  • materials-science: 83 个 PDF,76,298 条评论单元
  • hydrology: 80 个 PDF,98,526 条评论单元
  • chemistry: 40 个 PDF,26,512 条评论单元
  • atmospheric-science: 35 个 PDF,6,112 条评论单元
  • climate-ecology: 6 个 PDF,8,194 条评论单元

标注体系

基于 Nature RebuttalLens Taxonomy 的四维标注框架:concern_type + tacit_concern(审稿侧)→ response_strategy + evidence_action(回复侧)。

审稿关注类型 (Concern Types) — 10 类:

  • reproducibility_reporting: 732 次(29.4%),要求更清晰的数据、代码、参数、协议或可用性信息
  • clarity_presentation: 671 次(26.9%),要求更清晰的措辞、图表、图注、组织结构
  • experimental_design: 511 次(20.5%),质疑实验、对照、验证或研究设计
  • ablation_mechanism: 406 次(16.3%),要求消融实验、机制分析或方法原理解释
  • novelty_positioning: 82 次(3.3%),质疑原创性、贡献或与相关工作的定位
  • baseline_comparison: 41 次(1.6%),质疑是否与前人方法进行了适当比较
  • generalization_scope: 24 次(1.0%),质疑论断是否在报告设置之外成立
  • theoretical_validity: 13 次(0.5%),质疑假设、形式有效性或理论合理性
  • statistics_significance: 12 次(0.5%),质疑统计检验、不确定性或显著性
  • dataset_bias_ethics_safety: 4 次(0.2%),提出偏差、公平性、伦理或安全问题

隐性关切 (Tacit Concerns) — 10 类:

  • methodological_maturity: 1,158 次(46.5%),质疑方法是否足够成熟、稳健或有据可依
  • community_standard_fit: 810 次(32.5%),引用预期基线、基准、报告规范或领域标准
  • novelty_positioning: 192 次(7.7%),质疑贡献是否真正新颖或定位是否恰当
  • presentation_as_epistemic_signal: 177 次(7.1%),将呈现清晰度视为证据可靠性的信号
  • evidence_chain_stability: 125 次(5.0%),质疑图表、统计、方法和论断是否形成稳定证据链
  • scope_and_claim_boundary: 30 次(1.2%),质疑论断是否超越证据或上下文范围

作者回复策略 (Response Strategies) — 10 类:

  • acknowledge_and_fix: 380 次(68.7%),接受意见并报告具体修改
  • editorial_only_change: 90 次(16.3%),以编辑/格式化/图注更新作答
  • clarify_existing_evidence: 32 次(5.8%),解释已有证据,未做新工作
  • justify_method_choice: 23 次(4.2%),为设计/数据集/指标/模型选择辩护
  • reframe_contribution: 22 次(4.0%),改变贡献框架或强调不同价值主张
  • contest_reviewer_premise: 6 次(1.1%),礼貌地不同意审稿人前提

证据动作 (Evidence Actions) — 14 类:

  • figure_table_revision: 249 次(45.0%),修改图表、图注或视觉呈现
  • code_data_availability: 145 次(26.2%),提供代码、数据、权重、协议或可用性详情
  • no_new_evidence_explanation_only: 78 次(14.1%),仅解释现有证据,未做新工作
  • supplementary_material_revision: 41 次(7.4%),将证据移至或添加至补充材料
  • method_clarification: 22 次(4.0%),澄清方法、假设或实现
  • new_analysis: 10 次(1.8%),报告新分析、基准、稳健性检查
  • claim_narrowing: 4 次(0.7%),缩小论断或减少过度声明
  • literature_repositioning: 4 次(0.7%),更新相关工作或贡献定位

目录结构

nature-reviewer-corpus/ ├── README.md ├── LICENSE ├── CITATION.bib ├── DATA.md ├── QUICKSTART.md ├── data/ │ ├── raw/ # 原始数据(PRF PDF、解析 JSON、条目索引等) │ ├── processed/ # 标注语料(7 个文件, 64 MB) │ ├── datasets/ # 训练数据集(19 个文件, 606 MB) │ └── indices/ # CSV 索引文件(23 个文件, 85 MB) ├── taxonomy/ # 标注体系定义(10 个 JSON Schema 文件) ├── scripts/ # 处理脚本(9 个) ├── paper/ # 论文与文档 ├── nature-rebuttal-lens/ # 相关项目:多智能体 rebuttal 分析系统 ├── openreviewer/ # 相关项目:审稿模型微调代码 └── figpad/ # 相关项目:Nature 风格学术写作润色 Skill

许可与引用

  • 数据许可: Creative Commons Attribution-NonCommercial-ShareAlike 4.0
  • 代码许可: MIT License(见子仓库)
  • 引用格式: 参见 CITATION.bib 文件
搜集汇总
数据集介绍
Nature 系列期刊透明同行评审语料库 数据集图片
构建方式
该语料库源自Nature Portfolio期刊群中启用了透明同行评审(TPR)功能的244份审稿流程文件(PRF PDF),共计1,019 MB。通过自动化PDF解析流水线,成功提取出254个结构化JSON文件,进而对其中包含的215,642条行级评论单元进行系统化处理。在审稿人侧与作者回复侧分别获得了2,492条和484条段落级标注,并构建了1,766组松耦合的审稿-回复配对。基于Nature RebuttalLens分类体系,引入四维标注框架,涵盖审稿关注类型、隐性关切、作者回复策略与证据动作,最终筛选出553组四维完整标注的配对。在此基础上,通过规则模板与数据增强技术,生成了总计28,238条指令格式与对话格式的训练样本,覆盖多种下游任务。
特点
本数据集的核心特色在于其四维标注框架与多任务覆盖能力。审稿关注类型涵盖可重复性与报告清晰度、实验设计、新颖性等10个细分类别,隐性关切进一步揭示了方法论成熟度与社群标准契合度等深层维度。作者回复侧则囊括了承认修正、策略辩护、贡献重构等10种回复策略,并细分为14类证据动作,如图表修订、数据代码开放等。这一结构化标注体系使得从审稿人的显性批评到隐性期待、从作者的直接应对到证据补强的完整逻辑链条得以被精确捕捉。语料库覆盖Nature Communications、Nature等10种期刊,横跨材料科学、水文学、化学、大气科学等多个关键领域,样本总词量约为318万词。
使用方法
使用者可直接加载位于data/datasets/目录下的训练集文件,如ds_combined_chat_v4_train.jsonl,该文件采用对话格式,包含审稿分类、隐性关切识别、多标签分类、回复策略与证据动作预测等八类任务,每类任务均有对应的样本与标签。通过Python标准库json即可便捷解析每条样本中的messages字段与task_type信息。除训练集外,data/processed/目录提供原始标注语料与配对数据,便于进行定制化分析或微调。taxonomy/目录下的JSON Schema文件完整定义了各类标签体系,支持用户根据研究需求灵活调用或扩展。更多详细使用示例与数据格式说明可参阅QUICKSTART.md与DATA.md文档。
背景与挑战
背景概述
Nature系列期刊透明同行评审语料库由Nature Reviewer Corpus团队于2026年创建,依托Nature Portfolio的透明同行评审功能,从10种Nature系列期刊中收集了244份同行评审PDF文件,涵盖材料科学、水文学、化学、大气科学及气候生态等多元学科领域。该语料库通过对真实审稿意见、作者回复及编辑决定进行PDF解析与结构化提取,构建了包含215,642条行级评论单元的丰富数据集,共计约318万词。其核心研究问题在于系统性地建模学术同行评审中的结构化交流模式,为计算语言学与学术出版领域提供了前所未有的标注资源,对推动自动化审稿分析、作者回复生成以及科研质量评估等研究方向具有里程碑式的影响力。
当前挑战
该数据集所解决的领域挑战在于应对同行评审文本的非结构化与高维度语义复杂性,传统方法难以精准捕捉审稿意见中的关注类型、隐性关切、作者回复策略及证据动作等多维语义关系。构建过程中面临的挑战尤为严峻:首先,PDF解析需处理Nature系列期刊各异的多栏排版、图表边界及公式符号,原始解析成功率为254个结构化JSON(来自244份PDF),表明文档多样性带来的解析困难;其次,四维标注体系的建立要求交叉验证10类审稿关注类型与14类证据动作之间的语义衔接,且隐性关切类别(如methodological_maturity占比46.5%)的高度不平衡性增加了标注一致性维护的难度;此外,从215,642条评论单元中筛选出553组四维完整标注配对,凸显了跨文档审稿-回复对齐的复杂性,需应对作者选择性回复与审稿人多轮对话的松散耦合关系。
常用场景
经典使用场景
该语料库的核心应用场景在于推动学术同行评审的智能化研究。研究者可利用其包含的28,238条指令格式与对话格式训练样本,构建能够理解并模拟审稿意见的深度学习模型。具体而言,语料库中结构化的审稿评论单元与四维标注体系(关注类型、隐性关切、回复策略、证据动作)为训练审稿意见自动分类、作者回复生成与编辑决策预测等任务提供了高质量的监督信号,是开发可解释性审稿辅助系统的理想基准数据集。
解决学术问题
该数据集系统性解决了学术评审研究中长期存在的两大瓶颈:一是缺乏大规模、多领域标注的同行评审语料库,二是审稿与回复之间的语义对应关系难以建模。通过提供覆盖材料科学、水文学、化学等10种Nature系列期刊、超过21万条行级评论单元的标准化数据,并结合细粒度四维标注框架,它使得学术界能够定量分析审稿关注类型(如可重复性报告、实验设计)与作者回应模式(如承认并修正、重构贡献)之间的转化规律,为理解学术质量评估的隐性标准提供了实证基础。
衍生相关工作
该语料库已衍生出多项开创性研究工作,包括多智能体 rebuttal 分析系统(nature-rebuttal-lens)、基于 OpenReview 语料的审稿模型微调框架(openreviewer)以及 Nature 风格学术写作润色技能(figpad)。这些衍生项目分别从审稿-回复交互的因果推理、跨语料库迁移学习与学术写作规范化三个维度拓展了数据集的应用边界,形成了从审稿理解到写作优化的完整研究链条,对自动化科学评价系统的构建具有重要范式引领意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务