遇见数据集

prism-data

收藏
Hugging Face2026-07-04 更新2026-07-05 收录
官方服务:

资源简介:

PRISM(论文评审智能系统基准)是一个用于评估大型语言模型(LLM)作为同行评审者性能的大规模多维度基准数据集。该数据集基于来自五个顶级机器学习会议(ICLR 2024、ICLR 2025、ICLR 2026、ICML 2025、NeurIPS 2025)的共计47,214篇研究论文及其186,090条同行评审构建。数据集内容全面,包括论文全文、同行评审文本、编辑决策(如录用、拒稿)和元评审,并通过GROBID文档解析工具提供了结构化的元数据(如标题、作者、摘要、关键词)、参考文献(BibTeX和JSON格式)以及完整的TEI XML结构化文档。数据集旨在从五个核心维度(有效性、有帮助性、全面性、具体性、忠实性)评估LLM评审者,并支持多种任务,如评审生成、元评审生成、论文录用预测和评审分数预测。数据以两种主要格式提供:一是整合所有会议数据的Apache Parquet文件(`papers.parquet`,1.8 GB,包含31个字段),便于表格化分析和查询;二是按会议分组的原始文件目录结构(提供zip压缩包),包含JSON格式的评审数据、纯文本全文、GROBID解析出的各类结构化文件等。重要提示:数据存在显著的来源偏差。ICLR数据(2024-2026)来自OpenReview平台,覆盖了录用、拒稿及尚在评审中的论文,是研究完整评审过程的代表性样本;而ICML 2025和NeurIPS 2025的数据主要来自会议论文集,因此几乎只包含录用论文(数据集内显示录用率约95%),无法反映拒稿论文的情况。研究者在使用时应根据任务性质谨慎选择数据子集,例如进行录用预测或评审行为分析时,应优先使用ICLR数据。

PRISM (Paper Review Intelligent System Benchmark) is a large-scale, multi-dimensional benchmark dataset for evaluating the performance of large language models (LLMs) as peer reviewers. The dataset is constructed from 47,214 research papers and 186,090 peer reviews from five top-tier machine learning conferences (ICLR 2024, ICLR 2025, ICLR 2026, ICML 2025, NeurIPS 2025). It comprehensively includes full paper texts, peer review texts, editorial decisions (e.g., acceptance, rejection), and meta-reviews, and provides structured metadata (such as titles, authors, abstracts, keywords), references (in BibTeX and JSON formats), and complete TEI XML structured documents through the GROBID document parsing tool. The dataset aims to evaluate LLM reviewers across five core dimensions (effectiveness, helpfulness, comprehensiveness, specificity, faithfulness) and supports multiple tasks, including review generation, meta-review generation, paper acceptance prediction, and review score prediction. Data is provided in two main formats: 1) an integrated Apache Parquet file (`papers.parquet`, 1.8 GB, containing 31 fields) that consolidates data from all conferences for tabular analysis and querying; 2) a raw file directory structure grouped by conference (provided as zip archives), containing JSON-formatted review data, plain-text full papers, and various structured files parsed by GROBID. Important note: There is significant source bias in the data. ICLR data (2024-2026) comes from the OpenReview platform, covering accepted, rejected, and under-review papers, representing a sample of the complete review process. In contrast, ICML 2025 and NeurIPS 2025 data primarily come from conference proceedings, thus almost exclusively containing accepted papers (with an acceptance rate of about 95% in the dataset) and lacking rejected papers. Researchers should carefully select data subsets based on task requirements, such as prioritizing ICLR data for acceptance prediction or review behavior analysis.

创建时间:
2026-06-29
原始信息汇总

PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers

数据集概述

PRISM是一个大规模基准数据集,包含来自五大顶级机器学习会议的47,214篇研究论文,提供全文、同行评审、编辑决策、GROBID解析的元数据和参考文献信息。

该数据集从有效性、帮助性、全面性、特异性、忠实性五个维度评估基于LLM的评审者,支持的任务包括:评审生成元评审生成录用预测评分预测

数据集统计

属性 数值
论文总数 47,214
评审总数 186,090
会议来源 ICLR 2024, ICLR 2025, ICLR 2026, ICML 2025, NeurIPS 2025
数据来源 OpenReview (ICLR) + 会议论文集 (ICML, NeurIPS)
表格格式 papers.parquet (1.8 GB, zstd压缩)
文件格式 按会议组织的目录结构 (zip压缩包)

会议统计

论文数量与录用率

会议 论文数 评审数 评审/论文 已录用 已拒稿 待定 录用率
ICLR 2024 7,262 28,028 3.9 2,261 3,519 1,482 39.1%
ICLR 2025 11,519 46,744 4.1 3,708 5,018 2,793 42.5%
ICLR 2026 19,471 75,847 3.9 5,358 8,814 5,299 37.8%
ICML 2025 3,422 13,102 3.8 3,260 162 0 95.3%
NeurIPS 2025 5,540 22,369 4.0 5,286 254 0 95.4%
总计 47,214 186,090 3.9 19,873 17,767 9,574

数据收集偏差说明:

  • ICLR数据来自OpenReview,包含已录用和已拒稿论文,具有代表性。
  • ICML 2025和NeurIPS 2025数据来自会议论文集/已录用论文列表,严重偏向已录用论文。NeurIPS 2025实际约24.5%的录用率,数据集中显示为95.4%;ICML 2025实际约26.9%的录用率,数据集中显示为95.3%。
  • 任何关于评审质量、录用预测或评审者行为的分析应仅使用ICLR数据。NeurIPS和ICML数据仅适用于研究已录用论文特征参考文献分析

决策分布(仅ICLR)

决策 论文数 占比
拒稿 17,351 45.8%
待定 9,574 25.3%
录用(海报) 7,468 19.7%
录用(亮点) 747 2.0%
录用(口头) 329 0.9%
有条件录用 11 <0.1%

评审评分分布

ICLR 2025(n = 46,744条评审,均值=5.15,评分范围1-10):

评分 数量 占比
1 1,029 2.2%
3 11,535 24.7%
5 13,101 28.0%
6 14,693 31.4%
8 6,214 13.3%
10 172 0.4%

ICLR 2026(n = 75,847条评审,均值=4.21,评分范围0-10):

评分 数量 占比
0 1,319 1.7%
2 19,864 26.2%
4 29,759 39.2%
6 19,707 26.0%
8 5,010 6.6%
10 188 0.2%

NeurIPS 2025(n = 22,369条评审,均值=4.31,评分范围1-6):

评分 数量 占比
1 30 0.1%
2 423 1.9%
3 1,730 7.7%
4 11,077 49.5%
5 8,728 39.0%
6 381 1.7%

注意:NeurIPS 2025评审偏向已录用论文,不具代表性;ICLR 2024使用文本评分字段,无数值评分统计;ICML 2025使用"总体推荐"代替数值评分。

数据集结构

目录布局

paper_data/ ├── papers.parquet # 合并的表格数据集(所有会议) ├── ICLR_2024/ │ ├── json/ # 评审数据 (JSON) │ ├── txt/ # 全文 (提取文本) │ ├── grobid_metadata/ # GROBID元数据 (JSON) │ ├── grobid_bib/ # GROBID参考文献 (JSON + BibTeX) │ ├── grobid_tei/ # GROBID TEI XML │ ├── grobid_fulltext/ # GROBID全文提取 │ ├── pdf/ # 原始PDF │ ├── review_json/ # 原始评审JSON (仅ICLR 2024) │ ├── review_raw_txt/ # 原始评审文本 (仅ICLR 2024) │ ├── paper_nougat_mmd/ # Nougat Mathpix Markdown (仅ICLR 2024) │ └── scraping_summary.json # 爬取元数据 ├── ICLR_2025/ (结构同上) ├── ICLR_2026/ (结构同上) ├── ICML_2025/ (结构同上) ├── NeurIPS_2025/ (结构同上) └── ICLR_2024.zip ... (zip压缩包)

文件夹说明

文件夹 描述 格式 总文件数
json/ 评审、决策、元评审和结构化评审数据 .json 47,215
txt/ 论文全文提取文本 .txt 47,215
grobid_metadata/ GROBID解析的标题、作者、摘要、关键词、日期 .grobid.json 47,099
grobid_bib/ GROBID解析的结构化参考文献和BibTeX .grobid.json + .grobid.bib 94,103
grobid_tei/ 完整GROBID TEI XML输出 .grobid.tei.xml 47,155
grobid_fulltext/ GROBID提取的全文(更干净,保留章节结构) .grobid.txt 47,084

各文件夹大小

文件夹 ICLR 2024 ICLR 2025 ICLR 2026 ICML 2025 NeurIPS 2025 总计
json/ 127 MB 188 MB 341 MB 68 MB 94 MB 818 MB
txt/ 118 MB 192 MB 317 MB 64 MB 86 MB 777 MB
grobid_metadata/ 29 MB 46 MB 77 MB 14 MB 22 MB 188 MB
grobid_bib/ 360 MB 630 MB 1.1 GB 175 MB 326 MB 2.6 GB
grobid_tei/ 835 MB 1.5 GB 2.5 GB 471 MB 902 MB 6.2 GB
grobid_fulltext/ 350 MB 599 MB 1.1 GB 200 MB 410 MB 2.7 GB

Parquet数据集 (papers.parquet)

属性 数值
文件 papers.parquet
大小 1.8 GB(从12.2 GB源文本压缩)
压缩比 6.8×
行数 47,214
列数 31
引擎 PyArrow
压缩 zstd

模式(主要列)

列名 类型 描述
paper_id string OpenReview论文ID
venue string 会议名称
decision string 编辑决策
meta_review string 领域主席元评审文本
num_reviews int64 评审数量
rating_avg float64 平均评审评分
reviews_json string 完整评审JSON字符串
full_text string 论文全文
grobid_fulltext string GROBID提取的全文
bibliography_json string 结构化参考文献JSON
bibliography_bib string BibTeX格式参考文献
pdf_path string 原始PDF相对路径

Zip压缩包

压缩包 论文数 大小(不含PDF)
ICLR_2024.zip 7,262 ~2.2 GB
ICLR_2025.zip 11,519 ~3.1 GB
ICLR_2026.zip 19,471 ~5.4 GB
ICML_2025.zip 3,422 ~990 MB
NeurIPS_2025.zip 5,540 ~1.8 GB

原始PDF总计约300 GB,未包含在Hugging Face上传中。

文件格式详情

json/ — 评审数据示例

json { "paper_id": "00ezkB2iZf", "Decision": "Reject", "Meta review": { "Metareview": "...", ... }, "reviews": [ { "Review ID": "TeO25XUwES", "Rating": "3", "Confidence": "4", "Summary": "...", "Soundness": "2", "Presentation": "2", "Contribution": "2", "Strengths": "...", "Weaknesses": "...", "Questions": "...", "Limitations": "..." } ], "keywords": ["robustness", "medical QA"], "primary_area": "Safety in Machine Learning", "subject_areas": [...], "title": "...", "abstract": "...", "statistics": { "num_reviews": 4, ... } }

注意:不同会议的评审字段名称和评分标准不同。

grobid_metadata/ — 结构化元数据

包含标题、作者、摘要、关键词、日期。

grobid_bib/ — 参考文献

每篇论文两个文件:.grobid.json(结构化JSON数组)和.grobid.bib(BibTeX格式)。

grobid_tei/ — TEI XML

完整GROBID输出,包含文档结构(章节、段落)、标题、作者、摘要、参考文献和引文。

txt/grobid_fulltext/ — 全文

  • txt/: 从PDF提取(可能包含OCR伪影)
  • grobid_fulltext/: GROBID提取(通常更干净,保留章节边界)

数据收集与处理流程

步骤1 — 从OpenReview/会议页面爬取

从OpenReview(ICLR)或会议论文集页面(ICML、NeurIPS)爬取论文元数据、评审、决策和PDF链接。

爬取时间线:ICLR数据在评审期内爬取,约20-27%的论文决策为"待定"。

步骤2 — 使用GROBID处理PDF

通过GROBID解析PDF,提取结构化信息,生成元数据、参考文献、TEI XML和干净全文。

步骤3 — 合并为Parquet

所有结构化数据合并为单个papers.parquet文件(1.8 GB)。

潜在应用场景

任务 适合的会议 原因
录用/拒稿预测 仅ICLR 2024, 2025, 2026 平衡的录用/拒稿覆盖
评审生成 所有会议 评审文本可用
元评审生成 仅ICLR 元评审文本可用
参考文献分析 所有会议 结构化参考文献可用
论文特征分析 全部ICLR + 仅已录用ICML/NeurIPS 需注意数据偏差
评分预测 ICLR 2025, 2026 + 部分其他会议 数值评分可用

文件计数:所有文件夹总计约235,383个文件(含多格式重复计数)。

搜集汇总
数据集介绍
prism-data 数据集图片
构建方式
PRISM数据集以47,214篇来自五大顶级机器学习会议的研究论文为核心,系统性地整合了同行评审与元评审全文、编辑决策以及GROBID解析的元数据与参考文献。ICLR各届数据经由OpenReview平台爬取,覆盖录用与拒稿论文,确保了评审过程的代表性;ICML与NeurIPS数据则源于会议论文集,以录用论文为主。随后,所有PDF通过GROBID进行结构化解析,提取标题、作者、摘要、参考文献及全文学段信息,最终将结构化的评议数据、元数据与全文统一合并为一个高度压缩的Apache Parquet文件,并辅以按会议分列的ZIP压缩档案,便于分发与直接存取。
使用方法
用户可通过Hugging Face Hub下载papers.parquet文件,利用Pandas加载并直接进行筛选、聚合与全文搜索,索引字段包括会议来源、决策结果、平均评分与GROBID解析的元数据。对于需要细粒度文档访问的场景,可对应下载各会议的ZIP压缩档案,解压后即可获取JSON格式的评审记录、TEI XML结构化文本文档以及BibTeX格式参考文献。研究者可根据任务需求,灵活调用papers.parquet进行大规模统计分析,或使用ZIP中的原始文件进行精细的文档级处理与模型输入构建。
背景与挑战
背景概述
PRISM数据集由匿名研究团队于2025年构建,旨在为评估大语言模型作为学术同行评审者的能力提供多维度基准。其核心研究问题聚焦于如何系统衡量LLM在同行评审中的有效性,数据集收录了来自ICLR、ICML和NeurIPS五大顶级机器学习会议的47,214篇论文全文、186,090份同行评审意见、编辑决策以及经GROBID解析的元数据和参考文献。该数据集填补了现有学术评审自动化评估缺乏大规模、结构化基准的空白,为评审生成、元评审生成、录用预测及评分预测等任务提供了标准化评估平台,对推动AI辅助学术评审工具的发展具有里程碑意义。
当前挑战
数据集所解决的领域挑战在于,学术同行评审过程高度依赖人类专家,但专家评审存在主观性强、耗时费力且结构不一致等问题,PRISM通过提供跨五大维度的结构化评估框架,为LLM评审者的有效性确立了可量化的比较基础。构建过程中面临的主要挑战包括:数据来源偏差问题,即ICML和NeurIPS数据仅涵盖录用论文,导致评审分布严重失衡,仅ICLR数据可用于平衡的录用/拒稿分析;不同会议采用差异化的评分体系(如ICLR使用1-10分制、NeurIPS使用1-6分制、ICML使用文本级评分),增加了数据标准化与跨会议比较的复杂度;此外,ICLR约20-27%的论文因在最终决定公布前抓取而处于待定状态,缺失元评审与最终决策信息,限制了数据的完整性。
常用场景
经典使用场景
在人工智能与学术出版交叉的前沿领域,PRISM数据集的设计初衷在于构建一个全面、多维度的基准,用以评估大语言模型(LLM)在同行评审任务中的表现。该数据集聚集了来自ICLR、ICML和NeurIPS五大顶级机器学习会议的47,214篇论文及其186,090条评审记录,涵盖从论文全文、结构化元数据到评审意见与编辑决策的丰富信息。其最经典的使用场景包括评审意见生成、元评审生成、论文接收状态预测以及评审分数预测,研究者可借助该数据集在有效性、有用性、全面性、具体性和忠实度五个维度上对LLM评审者的能力进行系统性评测。
解决学术问题
长期以来,学术同行评审面临效率低下、偏见难以量化以及评审质量参差不齐的挑战,而现有的自动化评审工具往往缺乏标准化的评估框架。PRISM数据集的提出,精准回应了学术界对构建可复现、可比较的LLM评审能力评估范式的迫切需求。通过提供跨越多个会议、包含均衡接收与拒绝样本的ICLR子集,该数据集使研究者能够严谨地探索模型在评审生成与决策预测任务中的表现差异,从而推动对LLM在科学交流中角色边界的理解。其多维度评价体系为建立可信、透明的自动化同行评审系统奠定了方法论基础。
实际应用
在现实世界的学术出版与科研管理场域中,PRISM数据集为开发辅助同行评审的智能工具提供了坚实的数据底座。基于该数据集训练或评测的模型,可以被集成到学术会议或期刊的审稿系统中,用于自动生成初步评审意见、检测潜在的利益冲突或评估评审意见与论文内容之间的忠实度。此外,论文接收状态的预测功能能够帮助编辑委员会更高效地筛选稿件,而元评审生成则有望减轻领域主席的阅读负担。这些应用不仅有望缩短评审周期,还能通过减少人为偏见提升评审过程的客观性与公平性。
数据集最近研究
最新研究方向
PRISM数据集为大型语言模型在同行评审任务中的评估开辟了全新范式,聚焦于机器评审在有效性、助益性、全面性、具体性和忠实度这五大维度的表现。该基准基于47124篇来自ICLR、ICML和NeurIPS顶级会议的论文构建,涵盖186090条评审记录,为自动化评审生成、元评审生成以及接收预测等任务提供了丰富的信息基础。随着AI辅助科研评审成为热点议题,PRISM数据集的发布恰逢其时,它弥补了现有资源在多样化评审质量度量上的缺口,推动了可操作的机器学习评审研究,促进学术评审流程的透明度与高效性,其影响深远且意义重大。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务