LLMscore-ICLR-OpenReview
收藏资源简介:
该数据集是为论文《Position: Peer Review Should Be Calibrated via LLM Scoring》发布的原始数据集,包含与OpenReview关联的ICLR 2023、2024和2025年数据,用于同行评审分析。数据集包括论文元数据、标准化评审记录、匿名化的支持/反对理由项、锚定分数、偏差值以及提取的论文文本,旨在研究论文评审理由、数字评分、LLM衍生的锚定分数和评审分数残差之间的相互作用。
This is the original dataset released for the paper "Position: Peer Review Should Be Calibrated via LLM Scoring", which includes ICLR 2023, 2024 and 2025 data associated with OpenReview for peer review analysis. The dataset includes paper metadata, standardized review records, anonymized support/objection reasoning items, anchor scores, bias values, and extracted paper texts, aiming to investigate the interactions among review rationales, numerical ratings, LLM-derived anchor scores and review score residuals.
数据集概述
该数据集是论文《Position: Peer Review Should Be Calibrated via LLM Scoring》的官方发布数据集,已被ICML 2026 Position Track接收。其核心用途为同行评审分析,旨在研究论文评审理由、数值评分、LLM推导的锚定分数以及评审分数残差之间的相互作用,并非通用论文语料库。
数据内容
数据集整理了来自OpenReview平台的ICLR 2023、2024和2025年的数据,包含以下内容:
- 论文元数据:包括论文ID、标题、摘要等基本信息。
- 标准化评审记录:每篇论文收到的同行评审记录。
- 匿名化正反理由项:从评审中提取的结构化赞成/反对理由单元。
- 锚定分数(
expected_score):由LLM(ChatGPT-4o)根据评审理由推导出的基准分数。 - 偏差值(
bias):评审员给出的分数与锚定分数之间的残差。 - 提取的论文文本:从PDF中提取的纯文本内容。
注意:数据集有意不包含论文PDF文件,用户需通过openreview_url和pdf_url访问原始页面和PDF。
数据文件结构
数据集以压缩文件形式组织,按ICLR年份划分:
data/目录:包含按年份(ICLR_2023、ICLR_2024、ICLR_2025)组织的压缩JSONL文件。papers.jsonl.gz:论文级别记录。reviews.jsonl.gz:评审级别记录。anonymized_items.jsonl.gz:匿名化理由项记录。paper_text_index.jsonl.gz:论文文本索引,记录文本路径、页数、字符数等信息。
texts/目录:包含按年份组织的压缩tar.gz包,内含每篇论文的UTF-8纯文本(.txt)文件。metadata/目录:包含元数据文件。schema.json:字段定义。dataset_summary.json:数据集统计摘要。safety_scan.txt:发布安全检查。- 以及按年份的PDF转换报告和清单文件。
基本统计
该数据集的整体规模如下:
| 项目 | 数量 |
|---|---|
| 论文总数 | 22,177 |
| 评审总数 | 52,369 |
| 匿名化理由项总数 | 435,754 |
| 提取的论文文本文件数 | 22,675 |
| 覆盖的ICLR年份 | 2023, 2024, 2025 |
各年份数据统计:
| 子集 | 论文数 | 评审数 | 匿名化理由项数 | 文本文件数 |
|---|---|---|---|---|
| ICLR 2023 | 3,507 | 13,248 | 62,915 | 3,791 |
| ICLR 2024 | 7,150 | 27,601 | 138,356 | 7,279 |
| ICLR 2025 | 11,520 | 11,520 | 234,483 | 11,605 |
数据来源与生成
- 来源:数据源自OpenReview平台的ICLR 2023、2024、2025年评审数据,由LLMscore项目整理。
- 文本提取:论文文本使用
pdftotext工具从PDF中提取。 - 评分管线:所有年份的锚定分数均使用ChatGPT-4o基于统一的LLM校准框架生成,保证了跨年度方法论上的一致性。
数据泄露控制
为减少LLM可能对论文具有先验知识而造成的偏差,数据集使用ChatGPT-4o评估论文是否可被模型识别,并仅纳入被判定为“不熟悉”的论文进行下行分析。
限制与注意事项
- 用途限制:该数据集专为同行评审分析设计,不适用于通用论文建模。
- 变量说明:
expected_score和bias是基于LLM的分析变量,并非官方公布评分。 - PDF缺失:数据集不包含原始PDF文件,仅供提取的文本使用。
- 脱敏处理:提取的文本中,常见的API密钥、URL和绝对路径已被替换为
[REDACTED_API_KEY]、[REDACTED_URL]和[REDACTED_PATH]。
授权与致谢
- 许可协议:CC-BY-4.0。
- 支持机构:华中科技大学。




