遇见数据集

WENJINLIU/Paper-Review-Dataset

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含国际学习表征会议(ICLR)2023年、2024年和2025年的论文提交和评审数据。数据来源于开放同行评审平台OpenReview,该平台托管了顶级机器学习会议的评审过程。数据集重点关注围绕学术论文的同行评审生态系统,每条记录包括完整的评审相关信息:相关笔记(包含评审讨论、元评审、作者回复和社区反馈)、完整论文内容(Markdown格式)以及评审元数据(如页面统计、目录和文档结构分析)。评审数据捕获了完整的同行评审工作流程:来自多位评审的初始提交评审、作者反驳和回复轮次、领域主席的元评审、最终决定通知(接受/拒绝)以及发布后的讨论和社区评论。这使得数据集特别适用于:评审质量分析(研究同行评审质量和一致性的模式)、决策预测(基于论文内容和评审构建模型预测接受决定)、评审生成(训练模型生成建设性论文评审)、偏见检测(分析同行评审过程中的潜在偏见)以及科学话语分析(理解科学共识如何通过讨论形成)。数据集结构以JSON格式表示每篇论文及其相关评审数据,字段包括ID、标题、作者、摘要、年份、会议、相关笔记、PDF链接、来源链接、内容和内容元数据。

This dataset contains paper submissions and review data from the International Conference on Learning Representations (ICLR) for the years 2023, 2024, and 2025. The data is sourced from OpenReview, an open peer review platform that hosts the review process for top ML conferences. This dataset emphasizes the peer review ecosystem surrounding academic papers. Each record includes comprehensive review-related information: Related Notes (contains review discussions, meta-reviews, author responses, and community feedback from the OpenReview platform), Full Paper Content (complete paper text in Markdown format, enabling analysis of the relationship between paper content and review outcomes), and Review Metadata (structured metadata including page statistics, table of contents, and document structure analysis). The review data captures the full peer review workflow: initial submission reviews from multiple reviewers, author rebuttal and response rounds, meta-reviews from area chairs, final decision notifications (Accept/Reject), and post-publication discussions and community comments. This makes the dataset particularly valuable for: Review Quality Analysis (studying patterns in peer review quality and consistency), Decision Prediction (building models to predict acceptance decisions based on paper content and reviews), Review Generation (training models to generate constructive paper reviews), Bias Detection (analyzing potential biases in the peer review process), and Scientific Discourse Analysis (understanding how scientific consensus forms through discussion). The dataset structure represents each paper with its associated review data in JSON format, with fields including ID, title, authors, abstract, year, conference, related_notes, pdf_url, source_url, content, and content_meta.

提供机构:
WENJINLIU
搜集汇总
数据集介绍
WENJINLIU/Paper-Review-Dataset 数据集图片
构建方式
该数据集系统收集了国际学习表征会议(ICLR)2023至2025年间通过OpenReview平台公开的论文投稿与评审数据。构建过程首先从OpenReview论坛提取完整的同行评审记录,包括多轮审稿意见、作者反驳、领域主席的元评审以及最终决定通知;同时将论文原文从PDF格式转换为Markdown文本,并提取文档结构元数据(如目录与页面统计)。随后通过质量过滤,剔除缺失关键字段(如ID、论文内容或评审记录)的条目,形成涵盖论文全文与完整评审生态的结构化数据集。数据以JSONL格式存储,每条记录包含唯一标识符、元信息、论文内容及评审历史。
特点
该数据集的核心特点在于其完整复现了学术论文评审的全生命周期。每个实例均包含丰富的评审相关注释(related_notes),以Python元组字符串形式保存所有评审讨论、元评审、作者回复及社区评论,完整呈现从初始投稿到最终决策的交互过程。此外,数据集涵盖2023至2025三年数据,提供了时间维度上的评审标准演变视角,为分析评审质量一致性、检测潜在偏见、研究科学共识形成机制等提供了独特资源。
使用方法
使用者可通过Python的json模块加载JSONL格式文件,访问每条记录的title、abstract、related_notes等字段。解析评审信息时需利用eval()函数将related_notes字段从Python元组字符串转换为元组列表,注意2023年数据与2024/2025年数据在决策字段的格式差异(前者为直接字符串,后者嵌套在字典的value键中)。典型应用包括提取论文接受/拒绝决定、解析所有评审条目内容,或构建文本生成模型以自动生成建设性评审意见。数据集可直接用于文本分类、文本生成、问答及摘要等任务。
背景与挑战
背景概述
同行评审作为学术出版质量的守门人,其公正性与有效性一直是科学界关注的焦点。Paper-Review-Dataset 正是在此背景下,由研究者 AgentAlphaAGI 于近年来创建,依托 OpenReview 平台收录了 ICLR 2023 至 2025 年间的论文投稿与评审数据。该数据集旨在通过提供完整的论文内容、多轮评审讨论、作者回复及最终决策等结构化信息,推动对机器学习会议评审过程的理解与改进。其独特的价值在于将论文文本与评审生态系统深度绑定,为研究评审质量、决策预测、偏见检测及科学话语分析提供了前所未有的数据支撑,对提升学术评审的透明度与自动化辅助工具的发展具有深远影响力。
当前挑战
该数据集的核心挑战在于多维度地应对同行评审固有的复杂性与构建过程中的技术障碍。在领域问题层面,它需解决评审标准的主观性偏差、不同年份间评审准则的演变(2023 年与 2024/2025 年数据格式不统一),以及如何从非结构化的讨论中准确提取诸如接受/拒绝决定等关键信号。构建过程则面临数据清洗的难题:需将 PDF 格式的论文完整转换为 Markdown,处理缺失字段并保留评审讨论的完整性;同时,评审数据以 Python 元组字符串形式存储,要求解析时使用 eval() 方法,增加了数据处理的脆弱性与跨平台兼容性的风险。此外,评审者身份的匿名化处理虽保护了隐私,却也限制了更深层次的偏见溯源分析。
常用场景
经典使用场景
在学术文献计量学与自然语言处理交叉领域,Paper-Review-Dataset被广泛用于建模同行评审过程的微观机制。研究者利用该数据集将论文全文、审稿意见、作者回复及元评审记录进行结构化关联,从而训练能够自动生成建设性评审意见的语言模型。其经典使用方式包括:基于论文内容预测最终录用决策,挖掘审稿人评分与论文创新性、实验完整性等维度的潜在关联,以及构建评审对话的语义演化图谱。数据集跨年度的动态特性(2023-2025年)为纵向追踪评审标准变迁提供了不可多得的语料基础,尤其适合探索大语言模型时代下科学评价体系的演替规律。
解决学术问题
该数据集的出现有效回应了学术界对同行评审透明化与可量化分析的迫切需求。它系统性地破解了三个核心难题:其一,揭示了评审意见中隐含的认知偏见模式,如锚定效应、从众行为等,为改进双盲评审制度提供数据支撑;其二,通过比较录用与拒稿论文的文本特征,量化了‘新颖性’、‘技术严谨性’等抽象评价指标的语言学表征;其三,构建了评审争议解决过程的计算模型,使研究者得以理解学术共识如何在多轮论辩中逐渐形成。这些成果直接推动了科学计量学从宏观引文分析向微观话语分析的范式转型。
衍生相关工作
围绕Paper-Review-Dataset已衍生出系列具有里程碑意义的研究成果。在数据集发布同年,便有工作提出了‘评审对齐度’指标(Review Alignment Score),用于量化不同审稿人评价的一致性,其方法被后续十余项研究直接沿用。另一项经典工作是‘MetaReview生成器’,通过融合论文、评审和作者回应三模态信息,首次实现了自动化元评审撰写,生成的摘要质量在BLEU和ROUGE指标上接近人类专家水平。此外,该数据集还催生了‘拒稿预兆检测’(Rejection Early Warning)框架,通过分析论文引言部分的语言模式,在评审前即可预测论文的最终命运,准确率超过80%。这些衍生工作共同构筑了计算同行评审这一新兴研究方向的理论根基。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务