prism-data
收藏资源简介:
PRISM(论文评审智能系统基准)是一个用于评估大型语言模型(LLM)作为同行评审者性能的大规模多维度基准数据集。该数据集基于来自五个顶级机器学习会议(ICLR 2024、ICLR 2025、ICLR 2026、ICML 2025、NeurIPS 2025)的共计47,214篇研究论文及其186,090条同行评审构建。数据集内容全面,包括论文全文、同行评审文本、编辑决策(如录用、拒稿)和元评审,并通过GROBID文档解析工具提供了结构化的元数据(如标题、作者、摘要、关键词)、参考文献(BibTeX和JSON格式)以及完整的TEI XML结构化文档。数据集旨在从五个核心维度(有效性、有帮助性、全面性、具体性、忠实性)评估LLM评审者,并支持多种任务,如评审生成、元评审生成、论文录用预测和评审分数预测。数据以两种主要格式提供:一是整合所有会议数据的Apache Parquet文件(`papers.parquet`,1.8 GB,包含31个字段),便于表格化分析和查询;二是按会议分组的原始文件目录结构(提供zip压缩包),包含JSON格式的评审数据、纯文本全文、GROBID解析出的各类结构化文件等。重要提示:数据存在显著的来源偏差。ICLR数据(2024-2026)来自OpenReview平台,覆盖了录用、拒稿及尚在评审中的论文,是研究完整评审过程的代表性样本;而ICML 2025和NeurIPS 2025的数据主要来自会议论文集,因此几乎只包含录用论文(数据集内显示录用率约95%),无法反映拒稿论文的情况。研究者在使用时应根据任务性质谨慎选择数据子集,例如进行录用预测或评审行为分析时,应优先使用ICLR数据。
PRISM (Paper Review Intelligent System Benchmark) is a large-scale, multi-dimensional benchmark dataset for evaluating the performance of large language models (LLMs) as peer reviewers. The dataset is constructed from 47,214 research papers and 186,090 peer reviews from five top-tier machine learning conferences (ICLR 2024, ICLR 2025, ICLR 2026, ICML 2025, NeurIPS 2025). It comprehensively includes full paper texts, peer review texts, editorial decisions (e.g., acceptance, rejection), and meta-reviews, and provides structured metadata (such as titles, authors, abstracts, keywords), references (in BibTeX and JSON formats), and complete TEI XML structured documents through the GROBID document parsing tool. The dataset aims to evaluate LLM reviewers across five core dimensions (effectiveness, helpfulness, comprehensiveness, specificity, faithfulness) and supports multiple tasks, including review generation, meta-review generation, paper acceptance prediction, and review score prediction. Data is provided in two main formats: 1) an integrated Apache Parquet file (`papers.parquet`, 1.8 GB, containing 31 fields) that consolidates data from all conferences for tabular analysis and querying; 2) a raw file directory structure grouped by conference (provided as zip archives), containing JSON-formatted review data, plain-text full papers, and various structured files parsed by GROBID. Important note: There is significant source bias in the data. ICLR data (2024-2026) comes from the OpenReview platform, covering accepted, rejected, and under-review papers, representing a sample of the complete review process. In contrast, ICML 2025 and NeurIPS 2025 data primarily come from conference proceedings, thus almost exclusively containing accepted papers (with an acceptance rate of about 95% in the dataset) and lacking rejected papers. Researchers should carefully select data subsets based on task requirements, such as prioritizing ICLR data for acceptance prediction or review behavior analysis.
PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers
数据集概述
PRISM是一个大规模基准数据集,包含来自五大顶级机器学习会议的47,214篇研究论文,提供全文、同行评审、编辑决策、GROBID解析的元数据和参考文献信息。
该数据集从有效性、帮助性、全面性、特异性、忠实性五个维度评估基于LLM的评审者,支持的任务包括:评审生成、元评审生成、录用预测和评分预测。
数据集统计
| 属性 | 数值 |
|---|---|
| 论文总数 | 47,214 |
| 评审总数 | 186,090 |
| 会议来源 | ICLR 2024, ICLR 2025, ICLR 2026, ICML 2025, NeurIPS 2025 |
| 数据来源 | OpenReview (ICLR) + 会议论文集 (ICML, NeurIPS) |
| 表格格式 | papers.parquet (1.8 GB, zstd压缩) |
| 文件格式 | 按会议组织的目录结构 (zip压缩包) |
会议统计
论文数量与录用率
| 会议 | 论文数 | 评审数 | 评审/论文 | 已录用 | 已拒稿 | 待定 | 录用率 |
|---|---|---|---|---|---|---|---|
| ICLR 2024 | 7,262 | 28,028 | 3.9 | 2,261 | 3,519 | 1,482 | 39.1% |
| ICLR 2025 | 11,519 | 46,744 | 4.1 | 3,708 | 5,018 | 2,793 | 42.5% |
| ICLR 2026 | 19,471 | 75,847 | 3.9 | 5,358 | 8,814 | 5,299 | 37.8% |
| ICML 2025 | 3,422 | 13,102 | 3.8 | 3,260 | 162 | 0 | 95.3% |
| NeurIPS 2025 | 5,540 | 22,369 | 4.0 | 5,286 | 254 | 0 | 95.4% |
| 总计 | 47,214 | 186,090 | 3.9 | 19,873 | 17,767 | 9,574 | — |
数据收集偏差说明:
- ICLR数据来自OpenReview,包含已录用和已拒稿论文,具有代表性。
- ICML 2025和NeurIPS 2025数据来自会议论文集/已录用论文列表,严重偏向已录用论文。NeurIPS 2025实际约24.5%的录用率,数据集中显示为95.4%;ICML 2025实际约26.9%的录用率,数据集中显示为95.3%。
- 任何关于评审质量、录用预测或评审者行为的分析应仅使用ICLR数据。NeurIPS和ICML数据仅适用于研究已录用论文特征和参考文献分析。
决策分布(仅ICLR)
| 决策 | 论文数 | 占比 |
|---|---|---|
| 拒稿 | 17,351 | 45.8% |
| 待定 | 9,574 | 25.3% |
| 录用(海报) | 7,468 | 19.7% |
| 录用(亮点) | 747 | 2.0% |
| 录用(口头) | 329 | 0.9% |
| 有条件录用 | 11 | <0.1% |
评审评分分布
ICLR 2025(n = 46,744条评审,均值=5.15,评分范围1-10):
| 评分 | 数量 | 占比 |
|---|---|---|
| 1 | 1,029 | 2.2% |
| 3 | 11,535 | 24.7% |
| 5 | 13,101 | 28.0% |
| 6 | 14,693 | 31.4% |
| 8 | 6,214 | 13.3% |
| 10 | 172 | 0.4% |
ICLR 2026(n = 75,847条评审,均值=4.21,评分范围0-10):
| 评分 | 数量 | 占比 |
|---|---|---|
| 0 | 1,319 | 1.7% |
| 2 | 19,864 | 26.2% |
| 4 | 29,759 | 39.2% |
| 6 | 19,707 | 26.0% |
| 8 | 5,010 | 6.6% |
| 10 | 188 | 0.2% |
NeurIPS 2025(n = 22,369条评审,均值=4.31,评分范围1-6):
| 评分 | 数量 | 占比 |
|---|---|---|
| 1 | 30 | 0.1% |
| 2 | 423 | 1.9% |
| 3 | 1,730 | 7.7% |
| 4 | 11,077 | 49.5% |
| 5 | 8,728 | 39.0% |
| 6 | 381 | 1.7% |
注意:NeurIPS 2025评审偏向已录用论文,不具代表性;ICLR 2024使用文本评分字段,无数值评分统计;ICML 2025使用"总体推荐"代替数值评分。
数据集结构
目录布局
paper_data/ ├── papers.parquet # 合并的表格数据集(所有会议) ├── ICLR_2024/ │ ├── json/ # 评审数据 (JSON) │ ├── txt/ # 全文 (提取文本) │ ├── grobid_metadata/ # GROBID元数据 (JSON) │ ├── grobid_bib/ # GROBID参考文献 (JSON + BibTeX) │ ├── grobid_tei/ # GROBID TEI XML │ ├── grobid_fulltext/ # GROBID全文提取 │ ├── pdf/ # 原始PDF │ ├── review_json/ # 原始评审JSON (仅ICLR 2024) │ ├── review_raw_txt/ # 原始评审文本 (仅ICLR 2024) │ ├── paper_nougat_mmd/ # Nougat Mathpix Markdown (仅ICLR 2024) │ └── scraping_summary.json # 爬取元数据 ├── ICLR_2025/ (结构同上) ├── ICLR_2026/ (结构同上) ├── ICML_2025/ (结构同上) ├── NeurIPS_2025/ (结构同上) └── ICLR_2024.zip ... (zip压缩包)
文件夹说明
| 文件夹 | 描述 | 格式 | 总文件数 |
|---|---|---|---|
json/ |
评审、决策、元评审和结构化评审数据 | .json |
47,215 |
txt/ |
论文全文提取文本 | .txt |
47,215 |
grobid_metadata/ |
GROBID解析的标题、作者、摘要、关键词、日期 | .grobid.json |
47,099 |
grobid_bib/ |
GROBID解析的结构化参考文献和BibTeX | .grobid.json + .grobid.bib |
94,103 |
grobid_tei/ |
完整GROBID TEI XML输出 | .grobid.tei.xml |
47,155 |
grobid_fulltext/ |
GROBID提取的全文(更干净,保留章节结构) | .grobid.txt |
47,084 |
各文件夹大小
| 文件夹 | ICLR 2024 | ICLR 2025 | ICLR 2026 | ICML 2025 | NeurIPS 2025 | 总计 |
|---|---|---|---|---|---|---|
json/ |
127 MB | 188 MB | 341 MB | 68 MB | 94 MB | 818 MB |
txt/ |
118 MB | 192 MB | 317 MB | 64 MB | 86 MB | 777 MB |
grobid_metadata/ |
29 MB | 46 MB | 77 MB | 14 MB | 22 MB | 188 MB |
grobid_bib/ |
360 MB | 630 MB | 1.1 GB | 175 MB | 326 MB | 2.6 GB |
grobid_tei/ |
835 MB | 1.5 GB | 2.5 GB | 471 MB | 902 MB | 6.2 GB |
grobid_fulltext/ |
350 MB | 599 MB | 1.1 GB | 200 MB | 410 MB | 2.7 GB |
Parquet数据集 (papers.parquet)
| 属性 | 数值 |
|---|---|
| 文件 | papers.parquet |
| 大小 | 1.8 GB(从12.2 GB源文本压缩) |
| 压缩比 | 6.8× |
| 行数 | 47,214 |
| 列数 | 31 |
| 引擎 | PyArrow |
| 压缩 | zstd |
模式(主要列)
| 列名 | 类型 | 描述 |
|---|---|---|
paper_id |
string | OpenReview论文ID |
venue |
string | 会议名称 |
decision |
string | 编辑决策 |
meta_review |
string | 领域主席元评审文本 |
num_reviews |
int64 | 评审数量 |
rating_avg |
float64 | 平均评审评分 |
reviews_json |
string | 完整评审JSON字符串 |
full_text |
string | 论文全文 |
grobid_fulltext |
string | GROBID提取的全文 |
bibliography_json |
string | 结构化参考文献JSON |
bibliography_bib |
string | BibTeX格式参考文献 |
pdf_path |
string | 原始PDF相对路径 |
Zip压缩包
| 压缩包 | 论文数 | 大小(不含PDF) |
|---|---|---|
ICLR_2024.zip |
7,262 | ~2.2 GB |
ICLR_2025.zip |
11,519 | ~3.1 GB |
ICLR_2026.zip |
19,471 | ~5.4 GB |
ICML_2025.zip |
3,422 | ~990 MB |
NeurIPS_2025.zip |
5,540 | ~1.8 GB |
原始PDF总计约300 GB,未包含在Hugging Face上传中。
文件格式详情
json/ — 评审数据示例
json { "paper_id": "00ezkB2iZf", "Decision": "Reject", "Meta review": { "Metareview": "...", ... }, "reviews": [ { "Review ID": "TeO25XUwES", "Rating": "3", "Confidence": "4", "Summary": "...", "Soundness": "2", "Presentation": "2", "Contribution": "2", "Strengths": "...", "Weaknesses": "...", "Questions": "...", "Limitations": "..." } ], "keywords": ["robustness", "medical QA"], "primary_area": "Safety in Machine Learning", "subject_areas": [...], "title": "...", "abstract": "...", "statistics": { "num_reviews": 4, ... } }
注意:不同会议的评审字段名称和评分标准不同。
grobid_metadata/ — 结构化元数据
包含标题、作者、摘要、关键词、日期。
grobid_bib/ — 参考文献
每篇论文两个文件:.grobid.json(结构化JSON数组)和.grobid.bib(BibTeX格式)。
grobid_tei/ — TEI XML
完整GROBID输出,包含文档结构(章节、段落)、标题、作者、摘要、参考文献和引文。
txt/ 和 grobid_fulltext/ — 全文
txt/: 从PDF提取(可能包含OCR伪影)grobid_fulltext/: GROBID提取(通常更干净,保留章节边界)
数据收集与处理流程
步骤1 — 从OpenReview/会议页面爬取
从OpenReview(ICLR)或会议论文集页面(ICML、NeurIPS)爬取论文元数据、评审、决策和PDF链接。
爬取时间线:ICLR数据在评审期内爬取,约20-27%的论文决策为"待定"。
步骤2 — 使用GROBID处理PDF
通过GROBID解析PDF,提取结构化信息,生成元数据、参考文献、TEI XML和干净全文。
步骤3 — 合并为Parquet
所有结构化数据合并为单个papers.parquet文件(1.8 GB)。
潜在应用场景
| 任务 | 适合的会议 | 原因 |
|---|---|---|
| 录用/拒稿预测 | 仅ICLR 2024, 2025, 2026 | 平衡的录用/拒稿覆盖 |
| 评审生成 | 所有会议 | 评审文本可用 |
| 元评审生成 | 仅ICLR | 元评审文本可用 |
| 参考文献分析 | 所有会议 | 结构化参考文献可用 |
| 论文特征分析 | 全部ICLR + 仅已录用ICML/NeurIPS | 需注意数据偏差 |
| 评分预测 | ICLR 2025, 2026 + 部分其他会议 | 数值评分可用 |
文件计数:所有文件夹总计约235,383个文件(含多格式重复计数)。




