ICLR 2026 Institutional Affiliations Dataset
收藏资源简介:
该数据集包含ICLR 2026会议接受的5,356篇论文的机构隶属关系信息,数据来源于论文标题块的PDF文件,避免了OpenReview个人资料漂移问题。数据集提供了作者、机构、国家/地区、摘要等详细信息,并进行了机构名称的规范化处理。
This dataset contains institutional affiliation information for 5,356 papers accepted at the ICLR 2026 conference. The data is sourced from PDF files of the paper title blocks, which avoids the issue of profile drift on OpenReview. It provides detailed information including authors, institutions, countries/regions, abstracts and other relevant details, with institutional names normalized.
ICLR 2026 机构归属数据集与分析
数据集概述
本数据集包含 5,356 篇 ICLR 2026 被接收论文的机构归属信息,数据来源于论文 PDF 文件而非作者个人资料,以避免作者个人资料展示当前就职机构而非论文实际完成机构的偏差问题。
核心特点
- PDF 提取:约 94% 的归属信息直接从论文 PDF 的标题块提取,仅约 6% 因 PDF 解析失败使用 OpenReview 资料作为后备
- 去重计数:每个机构在一篇论文中只计数一次,无论该论文有多少位作者来自该机构
- 标准化处理:通过约 250 条规则将机构名称规范化(如 MIT、Massachusetts Institute of Technology、MIT CSAIL 均归为 MIT)
数据文件说明
| 文件 | 说明 |
|---|---|
iclr2026_public.csv / .xlsx |
主数据集,包含 5,356 篇论文的 PDF 提取作者与机构、规范化机构名称、国家/地区、摘要、OpenReview 链接 |
iclr2026_institutions_ranked_unique.csv |
按唯一归属计数(每篇论文每个机构 +1)排名的 Top-N 机构 |
iclr2026_institutions_ranked_first_author.csv |
仅按第一作者机构计数的排名 |
iclr2026_institutions_ranked_fractional.csv |
按分数 1/N 信用分配的机构排名 |
iclr2026_method_sensitivity.csv |
三种计数方法下的排名对比,检验机构排名的稳健性 |
主数据集列字段
| 列名 | 含义 |
|---|---|
Decision |
Oral 或 Poster |
Title |
论文标题(LaTeX 数学符号已转换为 Unicode) |
Authors |
分号分隔的作者列表(按作者顺序) |
Institutions |
PDF 提取的作者机构(与作者行顺序对应) |
Institutions_canonical |
经标准化规则处理后的机构名称(每篇论文去重) |
Countries |
每篇论文去重后的国家列表 |
Regions |
每篇论文的高层级区域 |
Affiliation_source |
归属来源标识(pdf / parse_fail / no_pdf) |
Primary_Area |
OpenReview 赛道 |
Keywords |
作者提供的关键词 |
Abstract |
全文摘要 |
OpenReview_URL |
论文的 OpenReview 链接 |
图表可视化
提供 ICLR 2026 Top 50 机构树状图,按区域分组:
- 每个矩形代表一个机构,大小按该机构出现的论文数量
- 区域单元按 Top-50 机构的累积计数显示
- 浅色 = 学术/研究机构,深色 = 工业界
相应图表文件(位于 charts/ 目录):
iclr2026_top50_treemap_unique_grouped.pngiclr2026_top50_treemap_unique_grouped_square.png(1:1 比例版本)
PDF 解析方法
解析器处理 ICLR 模板论文中常见的四种布局模式:
- 样式 A:编号脚注标记
- 样式 B:无标记,单一共享机构
- 样式 C:每作者以电子邮件分隔的区块
- 样式 D:交替的名称/机构对(无邮箱)
额外过滤掉"Equal contribution"、"Corresponding author"等脚注文本干扰。整体 96% 的论文解析成功。
方法论选择
- 计数规则:每篇论文每个机构计一次(与 AI World NeurIPS 排行榜规则相同)
- 规范化:约 250 条正则规则处理拼写/缩写变体
- 区域分组:国家 → 17 个高层级区域(香港因高等教育体系独立于中国大陆单独列出)




