遇见数据集

prometheus-eval/peerreview-bench

收藏
Hugging Face2026-05-27 更新2026-05-10 收录
官方服务:

资源简介:

PeerReview Bench是一个用于评估AI在科学论文同行评审中应用的数据集,包含多个配置以支持不同的评估任务。数据集基于专家标注的评审项,涵盖科学论文的评审过程,所有数据仅用于评估而非训练。主要配置包括:1) reviewer:用于评估AI审稿人,每行代表一篇论文,包含论文ID、标题、内容及文件引用,通过重构论文文件并生成评审与专家标注进行对比。2) meta_reviewer:用于评估AI元审稿人,每行代表一个(论文、审稿人、评审项)组合,包含主次标注者的标签(如正确性、重要性、证据)以及一个10类别的标签,编码级联结果和每项指标的一致性。3) expert_annotation:用于统计分析和人类与AI评审相似性测量,每行包含一个标注者来源(主或次)的评审项,应用有效性规则过滤不完整数据。4) similarity_check:用于基准测试自动化相似性度量,包含164个评审项对,每个对具有二元标签(相似或不相似)和细粒度标签,用于评估评审项之间的相似性。5) submitted_papers:去重存储每篇论文的预印本文件,通过SHA256哈希引用。数据集支持多种使用场景,如AI审稿人生成评审、AI元审稿人标注、相似性度量等,并遵循CC-BY-4.0许可。数据规模包括数千个示例,例如expert_annotation配置有3881个示例。

PeerReview Bench is a dataset for evaluating AI applications in scientific paper peer review, containing multiple configurations for different evaluation tasks. The dataset is based on expert-annotated review items from scientific papers, organized for complementary evaluation purposes, with all data intended for evaluation, not training. Key configurations include: 1) reviewer: For evaluating AI reviewers, with one row per paper, including paper ID, title, content, and file references, used to reconstruct paper files and compare generated reviews to ground-truth expert annotations. 2) meta_reviewer: For evaluating AI meta-reviewers, with one row per (paper, reviewer, review_item) combination, including per-annotator labels (e.g., correctness, significance, evidence) and a collapsed label of 10 classes that encodes cascade outcomes and metric agreement. 3) expert_annotation: For statistical analysis and human-vs-AI review similarity measurement, with one row per (paper, reviewer, review_item, annotator_source), applying validity rules to filter incomplete data. 4) similarity_check: For benchmarking automated similarity metrics, containing 164 (paper, review item A, review item B) tuples with binary and fine-grained labels to assess similarity between review items. 5) submitted_papers: Deduplicated blob storage for preprint files, referenced via SHA256 content hashes. The dataset supports various use cases such as AI reviewer generation, AI meta-reviewer labeling, and similarity measurement, under the CC-BY-4.0 license. Data scales include thousands of examples, e.g., expert_annotation has 3881 examples.

提供机构:
prometheus-eval
搜集汇总
数据集介绍
prometheus-eval/peerreview-bench 数据集图片
构建方式
PeerReview Bench是一个专为评估同行评审环节中AI模型表现而设计的基准数据集,其构建依托于对大量科学论文的真实评审数据进行的系统化整理与专家标注。该数据集的核心构建方式在于,它从Nature系列期刊等高质量学术来源中收集了论文及其对应的评审意见,并邀请了45位领域专家对评审条目进行详尽标注。标注过程遵循严格的级联规则:首先判断评审内容的正确性,仅在认定为正确时才进一步评估其重要性,最后在达到至少边际显著的重要性水平时,才对证据充分性进行判定。所有不符合级联逻辑的数据均被剔除或进行空值处理,从而确保了标注结果的严谨性与一致性。最终,数据集被组织为五个专门的配置,包括用于评估AI审稿人、AI元审稿人以及用于专家统计分析等不同任务,每个配置均通过统一的数据哈希索引与去重的论文文件存储库相关联,极大地方便了多任务协同使用。
特点
该数据集最为显著的特点在于其多维度、多粒度的评估架构和经过严格质量审核的标注体系。首先,它提供了三个互补的评估任务——AI审稿人、AI元审稿人以及评审相似性检测,使得研究者能够从生成、评估和比较等多个层面系统衡量AI模型的性能。其次,元审稿人配置引入了10个精细的级联合并标签,不仅捕捉了评审条目的正确性、重要性和证据充分性,还特别反映了专家之间对于每一指标的一致程度,为衡量AI对评审质量的深层理解提供了前所未有的视角。此外,相似性检测子集经过了一轮严格的后验质量审核,剔除了超过三成初始标注中存在歧义或错误的配对,确保了基础事实的可靠性。该数据集还包含了丰富的去重文件存储、多模态文件引用以及详尽的专家评论,为构建和评估复杂的、能够浏览论文附件的智能体系统提供了坚实基础。
使用方法
使用PeerReview Bench进行模型评估时,研究者可以借助HuggingFace datasets库轻松加载。对于评估AI审稿人,应加载reviewer配置和submitted_papers配置,通过文件哈希将论文内容与附件文件整合后提交给模型生成评审,再与expert_annotation中的真实标注进行对比。评估AI元审稿人则直接加载meta_reviewer配置,模型需根据输入的评审条目文本,预测其所属的10个级联标签之一。对于评审相似性评估,可利用similarity_check配置,该配置已内联了论文正文,可直接将论文内容与两条待比较的评审文本喂给模型,并以binary_label和finegrained_label作为真值。expert_annotation配置则广泛应用于统计分析,研究者可轻松筛选特定标注来源的数据,进行人机评审相似度计算或跨论文的统计建模。所有配置均只提供eval分片,明确用于基准测试而非训练,确保了评估的公平性。
背景与挑战
背景概述
PeerReview Bench 数据集由韩国科学技术院(KAIST)的 Seungone Kim 等研究人员于 2026 年创建,旨在系统评估人工智能在科学同行评审中的能力。该数据集的核心研究问题是:AI 评审员和元评审员能否准确生成或评估科研论文的评审意见,其表现与人类专家相比如何?数据集涵盖 3881 条专家标注的评审条目,来自 78 篇科学论文,涉及 Nature 系列期刊。通过提供 reviewer、meta_reviewer、expert_annotation 和 similarity_check 四个配置,PeerReview Bench 为 AI 评审系统的生成、分类和相似性检测任务设立了标准化基准,推动了 AI 辅助科学评审领域的实证研究。
当前挑战
该数据集面临的挑战首先在于同行评审本身的领域复杂性:评审意见涉及正确性、重要性和证据充分性等多维度的级联判断,且专家之间常存在分歧,这对 AI 模型的多任务理解和鲁棒性提出高要求。构建过程中,研究团队需应对标注一致性难题——仅 908 条元评审数据包含双标注,并需通过严格的级联规则和标签质量过滤消除歧义;例如在相似性检查任务中,初始 238 对数据中 74 对因标签争议被剔除。此外,多模态文件引用和数据去重增加了构建流程的技术复杂性,确保评估结果的公正性仍是核心挑战。
常用场景
经典使用场景
PeerReview Bench 数据集专为科学同行评审领域设计,其最经典的使用场景在于评估人工智能评审系统(AI reviewer)和元评审系统(AI meta-reviewer)的性能。具体而言,研究者可加载该数据集的 `reviewer` 配置,将论文全文与相关附件资料输入至待评估的 AI 模型,使其生成对论文的评审意见,随后通过 `expert_annotation` 配置中的专家标注数据进行比对,从而量化模型在评审内容准确性、重要性判断及证据支持等方面的表现。此外,`meta_reviewer` 配置则聚焦于评估模型对已有评审意见进行分级标注的能力,要求模型依据正确性、显著性和证据充分性三个维度,对反馈逐项分类,并生成十类综合标签。这一多维度、结构化的评估体系为衡量 AI 在复杂学术评议中的能力提供了可靠基准。
衍生相关工作
自 PeerReview Bench 发布以来,其衍生出的相关工作主要聚焦于以下几类方向。首先是基于专家标注级联规则的元评审模型研究,研究者利用 `meta_reviewer` 配置中的十类综合标签,训练和微调大型语言模型(如 GPT 系列、Gemini 等)以准确预测专家对评审条目的综合评估,进而推动了多层次自动化评审分类器的发展。其次,`similarity_check` 配置催生了一系列关于评审语义相似度度量的研究,包括基于嵌入向量的对比学习方法和基于 LLM 的细粒度四元分类策略,这些工作尝试解决“同主题不同证据”等边界模糊问题。此外,该数据集也启发了人机协作评审框架的构建,如通过分析 `expert_annotation` 中的双标注者一致性模式,设计自适应的置信度阈值与不确定性追踪机制,从而提升了 AI 辅助评审在实际部署中的可靠性与解释性。
数据集最近研究
最新研究方向
当前,科学出版领域的同行评议质量与效率成为学术界关注的焦点,而大型语言模型(LLM)作为AI审稿人的潜力与局限正引发广泛探讨。PeerReview Bench数据集应运而生,它聚焦于评估AI审稿系统在科学论文评审中的表现,涵盖AI生成评审意见的正确性、重要性与证据充分性,并创新性地引入专家标注的级联验证机制与细粒度相似性检测。该数据集不仅为AI审稿人的可信度评估提供了标准化基准,还通过多维度标注(如元审稿人的十类标签体系)揭示了AI与人类专家在评审判断上的一致性与分歧模式,对于推动自动化同行评议从实验走向实际应用具有里程碑式的意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务