auto-research-bench-data
收藏资源简介:
# auto-research-bench-data 同行评审语料 + 论文 PDF,覆盖五个机器学习会议 2022–2026 年。 用于研究「AI 生成的论文与人类论文有何差异」,特别是图表质量与实验管理两个维度。 数据来自 [OpenReview](https://openreview.net),用官方 API 抓取。 ## 内容 ### 1. 评审元数据(18 个 jsonl,3.11 GB) 每行一篇投稿,字段如下: | 字段 | 说明 | |---|---| | `forum` | OpenReview 论文 ID,**与 PDF 文件名一致,是关联两部分数据的 key** | | `title` / `abstract` / `keywords` | 论文元信息 | | `venue` / `venueid` | 录用层级。注意层级只在 `venue` 里(如 `ICLR 2024 oral`),`venueid` 对所有录用论文都是 `.../Conference` | | `reviews` | 全部 Official_Review,含评分、置信度、正文各字段 | | `comments` | 作者 rebuttal 与其他 Official_Comment | | `decisions` | Decision / Meta_Review | | `pdf` | OpenReview 上的相对路径 | 共 73,566 篇投稿、267,117 条评审、711,880 条评论。 ### 2. 论文 PDF(13 个 tar,44.9 GB,8,416 篇) 按 `pdf/{会议}_{年份}.tar` 组织,解包后是 `{会议}_{年份}/{forum}.pdf`。 只包含用于本研究的子集:全部 oral + spotlight 论文,加上按 1:2 抽样的被拒论文。 不是全量投稿。 ## 怎么用 ```python from datasets import load_dataset # 只取需要的年份,不必下载全部 ds = load_dataset("chengwanru/auto-research-bench-data", data_files="ICLR_2024.jsonl") ``` ```python # 关联 PDF 与评审 import tarfile, json from huggingface_hub import hf_hub_download p = hf_hub_download("chengwanru/auto-research-bench-data", "pdf/ICLR_2024.tar", repo_type="dataset") with tarfile.open(p) as tf: pdf = tf.extractfile("ICLR_2024/<forum_id>.pdf").read() ``` ## 各会议实际覆盖内容差异很大 会议的公开政策不同,不是抓取遗漏: | 语料 | PDF | 评审 | 评分 | rebuttal | decision | |---|---|---|---|---|---| | ICLR 2022–2026 | ✅ | ✅ | ✅ | 88% | ✅ | | NeurIPS 2023–2025 | ✅ | ✅ | ✅ | 99% | ✅ | | ICML 2025 | ✅ | ✅ | ❌ | ✅ | ✅ | | ICML 2023–2024 | ✅ | ❌ | ❌ | ❌ | ❌ | | ACM MM 2024 | ✅ | ✅ | ✅ | ❌ | ✅ | | CoRL 2025 | ✅ | ❌ | ❌ | ❌ | ✅ | **被拒论文实际只有 ICLR 有规模。** NeurIPS 三年合计只有 631 篇公开被拒, ICML 2023/2024 一篇都没有。这限制了任何需要负样本的分析。 评分字段名随年份变化:2022–2023 用 `recommendation`,2024 起用 `rating`; 2024 及以前取值是 `"5: marginally below..."` 这样的字符串,2025 起是纯数字。 ## 已知缺口 选中 8,865 篇,实际上传 8,416 篇,**完整率 94.9%**,缺 449 篇。 缺口来自 OpenReview 下载失败,原因是并发拉取大文件超时(ACM MM 单篇可达 50 MB) 以及持续高频请求触发限流。降到单线程重跑能基本消除:ACM MM 从 38% 失败降到 0, ICLR 2024 从 17% 降到 0.5%。已补跑的四批完整率 94.8%–100%,其余批次 89%–95%。 各批次完整率: | 语料 | 选中 | 已传 | 完整率 | |---|---|---|---| | ACMMM_2024 | 174 | 174 | 100% | | CoRL_2025 | 42 | 42 | 100% | | ICLR_2024 | 1359 | 1352 | 99.5% | | ICLR_2022 | 690 | 679 | 98.4% | | NeurIPS_2024 | 588 | 576 | 98.0% | | ICLR_2023 | 1113 | 1070 | 96.1% | | NeurIPS_2025 | 1018 | 968 | 95.1% | | ICML_2023 | 155 | 147 | 94.8% | | NeurIPS_2023 | 621 | 580 | 93.4% | | ICLR_2026 | 672 | 621 | 92.4% | | ICML_2025 | 319 | 292 | 91.5% | | ICLR_2025 | 1779 | 1617 | 90.9% | | ICML_2024 | 335 | 298 | 89.0% | 缺失的论文可以用 jsonl 里的 `pdf` 字段自行从 OpenReview 补取(需账号)。 NeurIPS 2022 没有 oral/spotlight 层级,未纳入 PDF 子集。 ## 许可与使用 评审内容来自 OpenReview 公开页面。论文 PDF 版权归各自作者所有, ICLR 投稿多数采用 CC BY 4.0,其他会议以各自政策为准。 **本数据集仅供学术研究使用。** 使用论文内容时请引用原论文。 如果你是某篇论文的作者并希望移除,请通过 HuggingFace 联系。 ## 生成方式 抓取与处理脚本见 [github.com/chengwanru/auto-research-bench](https://github.com/chengwanru/auto-research-bench) (`scripts/fetch_openreview.py`、`scripts/upload_pdfs_to_hf.py`)。



