遇见数据集

auto-research-bench-data

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

OpenReview 同行评审语料库(2022–2026)是一个面向论文质量可测量指标研究的大规模数据集,由 auto-research-bench 项目构建。数据全部采集自 OpenReview 平台,覆盖 7 个会议的 18 个 venue-year 版本,共计 73,566 篇投稿、267,117 条评审和 711,880 条评论(含作者 rebuttal)。每条记录为一篇投稿的 JSON 对象,包含标识符(id/forum)、会议与年份(venue_label/year)、标题/摘要/关键词(title/abstract/keywords)、录用层级(venue,如“ICLR 2024 oral”或“Submitted to ICLR 2024”)、结构化状态(venueid)、PDF 相对路径(pdf,PDF 本体不含在数据集中)、作者公开句柄(authorids)、全部官方评审(reviews)、作者回复与官方评论(comments)以及决策与元评审(decisions)。覆盖的会议包括 ICLR(2022–2026)、NeurIPS(2022–2025)、ICML(2023–2025)、EMNLP(2023)、COLM(2024–2025)、CoRL(2024–2025)和 ACM MM(2024),但各会议公开内容差异显著:ICLR 公开全部投稿(含被拒论文),而其他会议基本只公开录用论文,因此负样本任务主要依赖 ICLR。数据经过隐私处理,移除了作者邮箱和姓名,邮箱替换为 [EMAIL]。使用前需注意:rebuttal 不在 directReplies 中,需通过 details="replies" 获取完整回复树;API 版本在 2023/2024 年分叉;登录接口限流;决定层级字段在 2022 年后统一在 venue 字段。数据使用需遵循 OpenReview 使用条款及各会议政策。

The OpenReview Peer Review Corpus (2022–2026) is a large-scale dataset for research on measurable indicators of paper quality, constructed by the auto-research-bench project. All data are collected from the OpenReview platform, covering 18 venue-year versions across 7 conferences, totaling 73,566 submissions, 267,117 reviews, and 711,880 comments (including author rebuttals). Each record is a JSON object of a submission, containing identifiers (id/forum), conference and year (venue_label/year), title/abstract/keywords (title/abstract/keywords), acceptance level (venue, e.g., "ICLR 2024 oral" or "Submitted to ICLR 2024"), structured status (venueid), relative PDF path (pdf, PDF files not included in the dataset), author public handles (authorids), all official reviews (reviews), author responses and official comments (comments), and decisions with meta-reviews (decisions). Covered conferences include ICLR (2022–2026), NeurIPS (2022–2025), ICML (2023–2025), EMNLP (2023), COLM (2024–2025), CoRL (2024–2025), and ACM MM (2024), but the public content varies significantly across conferences: ICLR makes all submissions (including rejected papers) public, while other conferences generally only publish accepted papers, so negative sample tasks mainly rely on ICLR. The data has been privacy-processed, removing author emails and names, replacing emails with [EMAIL]. Notes before use: rebuttals are not in directReplies, need to obtain complete reply tree via details="replies"; API version forked in 2023/2024; login interface rate-limited; decision level field unified into venue field after 2022. Data usage must comply with OpenReview terms of service and each conferences policy.

创建时间:
2026-08-19
原始信息汇总

数据集概述

OpenReview Peer Review Corpus (2022–2026) 是一个同行评审语料数据集,覆盖 7 个会议、18 个 venue-year,包含 73,566 篇投稿、267,117 条评审和 711,880 条评论(含作者 rebuttal)。数据采集自 OpenReview 平台,旨在为 auto-research-bench 项目提供论文质量的可测量指标。

数据内容与格式

  • 存储格式:每行一条 JSON 记录,对应一篇投稿。
  • 主要字段
    • id/forum:OpenReview 标识符
    • venue_label/year:会议与年份
    • title/abstract/keywords:投稿元信息
    • venue:录用层级(如 ICLR 2024 oralSubmitted to ICLR 2024
    • venueid:结构化状态(如 ICLR.cc/2024/Conference/Rejected_Submission
    • pdf:OpenReview 上的 PDF 相对路径(PDF 本体不包含在数据集中)
    • authorids:仅保留 ~ 开头的 OpenReview 公开句柄
    • reviews:全部 Official_Review,含评分、置信度与正文
    • comments:作者 rebuttal 与其他 Official_Comment
    • decisions:Decision 与 Meta_Review

覆盖情况

会议 年份 投稿 评审 评论 备注
ICLR 2022 2,617 10,202 26,489
ICLR 2023 3,792 14,335 36,870
ICLR 2024 7,404 28,028 70,624
ICLR 2025 11,672 46,748 149,221
ICLR 2026 19,814 75,859 180,146
NeurIPS 2022 2,824 10,411 30,714
NeurIPS 2023 3,395 15,175 45,992
NeurIPS 2024 4,236 16,644 54,620
NeurIPS 2025 5,540 22,369 74,321
ICML 2023 1,828 0 0 仅录用论文,无评审
ICML 2024 2,610 0 0 仅录用论文,无评审
ICML 2025 3,422 13,102 22,444
EMNLP 2023 2,020 6,449 12,232
COLM 2024 299 1,149 2,658 仅录用论文
COLM 2025 418 1,586 5,311 仅录用论文
CoRL 2024 264 835 238 仅录用论文
CoRL 2025 263 0 0 仅录用论文,无评审
ACM MM 2024 1,148 4,225 0 无 rebuttal

重要说明

  • 被拒论文只有 ICLR 有规模。ICLR 公开全部投稿,其余会议基本只公开录用论文。例如,ICLR 2024 有 7,404 篇可见投稿(其中 3,431 篇被拒),而 NeurIPS 2024 仅有 4,236 篇可见投稿(其中 201 篇被拒),ICML 2024 仅有 2,610 篇可见投稿(无被拒)。
  • 任何需要负样本的任务,实际上只能依赖 ICLR。
  • CVPR、ICCV、AAAI、IJCAI、KDD、ACL 等会议不在 OpenReview 上,因此不在本数据集中。

隐私处理

  • authorids 中的邮箱地址已移除,仅保留 ~ 开头的 OpenReview 公开句柄。
  • 所有字段中出现的邮箱替换为 [EMAIL],共 3,180 处。
  • 移除 authors(姓名)字段。
  • 代码片段中的 git SSH 地址(如 git@github.com:...)不受影响,形似邮箱但予以保留。

不含 PDF

论文 PDF 不在数据集中,仅提供 pdf 字段给出的 OpenReview 相对路径。需要 PDF 请自行从 OpenReview 获取(需要账号,匿名访问会被人机验证拦截)。

技术要点与已知的坑

  1. 作者 rebuttal 不在 directReplies:rebuttal 是对评审的回复而非对论文的回复,需使用 details="replies" 才能获取完整回复树。实测同一篇论文相差 6 条 vs 1 条。
  2. API 版本按年份分叉:2023 及以前走 v1(api.openreview.net,invitation 后缀 /-/Blind_Submission),2024 起走 v2(api2.openreview.net,后缀 /-/Submission)。
  3. 登录接口限流约 3 次/窗口,需缓存 token 复用。
  4. 决定层级的字段位置随年份变化:2022 起统一在 venue 字段,本数据集覆盖的 2022+ 均适用。

来源与使用条款

数据来自 OpenReview 公开内容,使用需遵循其使用条款及各会议政策。本仓库仅做汇总与格式整理,不主张对原内容的任何权利。

搜集汇总
数据集介绍
auto-research-bench-data 数据集图片
构建方式
本数据集构建于OpenReview平台公开的同行评审记录,涵盖2022至2026年间七个顶级会议(ICLR、NeurIPS、ICML、EMNLP、COLM、CoRL及ACM MM)的十八个venue-year单元,累计收录73,566篇投稿、267,117条评审及711,880条评论(含作者 rebuttal)。数据采集遵循各年度API版本差异(2023年及以前使用v1接口,2024年起切换至v2),并妥善处理了作者回复树的嵌套结构。发布前执行严格隐私清洗,移除作者姓名与邮箱信息,保留OpenReview公开句柄,将邮箱统一替换为占位符。每条记录以JSON格式存储,完整囊括投稿元信息、评审意见、评分、置信度、作者反驳及最终决定等字段,形成结构化的同行评审语料库。
特点
该数据集的核心特色在于其规模宏大且覆盖全面,横跨多个领域顶级会议,时间跨度五年,为元科学研究提供了丰富的素材。尤为独特的是,ICLR会议公开了全部投稿,包含大量被拒论文,为构建论文质量预测模型提供了宝贵的负样本;而其他会议(如NeurIPS、ICML)大多仅公开录用论文,导致样本选择偏差,这一差异是使用本数据时需警惕的关键点。此外,数据集提供了分层级的录用信息(如oral、spotlight、poster),但仅存于venue字段,venueid不区分层级。评审与评论内容详尽,涵盖评分、置信度及全文,为研究评审质量、论文影响力及科学交流模式提供了多维度的分析基础。
使用方法
使用本数据集时,研究者须根据任务需求审慎选择子集。对于需要负样本的文本分类任务(如预测论文是否被录用),建议仅利用ICLR数据,因其公开了被拒论文;而其他会议数据因缺乏被拒样本,可能引入偏差。数据集格式为JSON行,每行对应一篇投稿,可直接加载以提取评审文本、评分及决策信息。由于PDF本体未包含,需通过提供的相对路径访问OpenReview获取全文,但需注意账号登录与人机验证。文本分类可基于评审内容预测录用结果,文本排序可依据评审评分对论文进行排序,而元研究则可利用多年数据追踪评审标准的演变。此外,数据集的注释字段(如评论、决策)为分析作者-评审互动提供了机会。
背景与挑战
背景概述
auto-research-bench-data 数据集由 auto-research-bench 项目于 2022 至 2026 年间构建,旨在为科学论文质量评估提供大规模、可测量的基准语料。该数据集系统性地采集了 OpenReview 平台上 7 个顶级会议(ICLR、NeurIPS、ICML、EMNLP、COLM、CoRL、ACM MM)共计 18 个 venue-year 的同行评审数据,涵盖 73,566 篇投稿、267,117 条评审及 711,880 条评论,为研究论文质量的可量化指标提供了前所未有的数据支撑。其核心研究问题在于利用真实评审过程揭示科学成果的评估机制,进而推动自动化学术评价模型的研发。该数据集在元科学(meta-research)、同行评审自动化及科学质量度量领域具有重要影响力,为后续研究提供了开放、透明的数据基础,促进了学术评价体系的智能化转型。
当前挑战
该数据集面临的挑战主要源于领域问题与构建过程两方面。在领域层面,同行评审质量评估的核心难题在于评审标准的主观性与多样性,不同会议、不同评审人的评分尺度差异显著,且录用层级(如 oral、spotlight、poster)在结构化字段中缺失,仅存于非结构化的 venue 描述中,增加了模型训练的复杂度。此外,被拒论文的负样本严重稀缺,除 ICLR 外,其他会议几乎只公开录用论文,这限制了模型对拒稿模式的泛化能力。在构建过程中,作者 rebuttal 常被忽略,需通过 details=replies 参数获取完整回复树;OpenReview API 版本按年份分叉,需适配不同接口;登录接口限流严格,token 缓存成为必需;录用决策字段位置随时间迁移,需统一解析规则。这些技术障碍增加了数据采集与清洗的难度,确保数据的完整性与一致性成为持续挑战。
常用场景
经典使用场景
该数据集是同行评审与科学质量度量研究的基石资源,覆盖2022至2026年间ICLR、NeurIPS、ICML等七大权威会议的逾七万篇投稿及二十七万条评审记录。研究者可借此构建论文质量预测模型,将评审分数、录用决策等作为标注,结合标题、摘要及关键词等元信息,开展文本回归或分类任务。亦可用于训练评审意见生成与反驳回复模型,改进自动化科研辅助系统,或分析评审过程中的偏见与不一致性,探索评审机制的优化路径。其丰富的会议层级和年份跨度,为跨领域、跨时段的元研究提供了独特的数据基础。
解决学术问题
该数据集直击学术界的核心痛点:论文质量缺乏可量化、可复现的度量标准。传统依赖人工评审,耗时且主观性高,而该数据集的构建使研究者能通过大规模真实评审数据,探索从文本特征预测录用结果的可行性,推动科学质量评估从定性走向定量。它支持训练自动化的初步筛选与质量预判模型,为投稿过程中的作者提供早期反馈,潜在提升科研效率。同时,通过分析评审分数与最终决策的关联,该数据为检测评审偏见、校准评审尺度提供了实证素材,助力更公平、更透明的同行评审体系的建立。
衍生相关工作
该数据集衍生了一系列前沿研究,包括但不仅限于:构建自动化评审分数预测器,探索论文质量与引用影响力的关联;开发基于大语言模型的评审意见生成与反驳回复系统,模拟作者反驳策略;分析不同会议、年份间评审标准的异同,考察学科文化对评审过程的影响;以及研究双盲评审中作者匿名性与录用概率的关系等。这些工作不仅深化了对学术交流机制的理解,也推动了自然语言处理、科学计量学与计算社会科学等交叉领域的发展,形成了以同行评议语料为中心的活跃研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务