遇见数据集

atlas-of-judgment

收藏
Hugging Face2026-08-27 更新2026-08-28 收录
官方服务:

资源简介:

该数据集名为“Atlas of Judgment — ICLR 同行评审逻辑单元”,从 ICLR 2018–2026 年的公开同行评审(OpenReview)中提取了 1,420,178 个原子评估逻辑单元。每个单元都被分解为四个步骤:检查对象(inspected_object)、观察(observation)、推理(reasoning)和结论(judgment),并标注了基于数据诱导的 12 个审查对象 × 12 个认知标准的分类。数据集包含三个配置:review_level_2026(410,586 行,每个单元对应一个官方评审)、review_level_2026_reviews(74,380 行,每个官方评审及其单元计数)、forum_level_2018_2026(1,009,592 行,每个单元对应一个论坛内的评审者,覆盖 2018–2026 年)。所有单元均由两阶段 LLM 流水线生成(DeepSeek 备忘录层 → Qwen 结构化层),并附有支持状态(显式支持或推断支持)、模型置信度、最近中心分类标签(对象和标准的标签及其余弦相似度)等字段。此外,论坛级子集还包含年份、论坛 ID、评审者匿名 ID、时序位置、判断变化等字段;评审级子集包含论文 ID、评审 ID、证据引用数等。数据集还提供了分类法定义(taxonomy/taxonomy_v1.json)和 600 个人工标注的修辞标签单元。该数据集可用于元科学研究、同行评审质量分析、评估逻辑的自动分解与分类、以及自然语言处理中的结构化文本理解等任务。请注意,数据为机器阅读结果,并非真实标注,提取过程中约有 1.9% 的评审和 1.8% 的论坛未能成功提取,且分类法基于抽样诱导,可能存在噪声。

This dataset, named Atlas of Judgment — ICLR Peer Review Logic Units, extracts 1,420,178 atomic evaluation logic units from public peer reviews (OpenReview) of ICLR 2018–2026. Each unit is decomposed into four steps: inspected_object, observation, reasoning, and judgment, and is annotated with a data-induced classification of 12 inspected objects × 12 cognitive criteria. The dataset includes three configurations: review_level_2026 (410,586 rows, each unit corresponds to an official review), review_level_2026_reviews (74,380 rows, each official review and its unit count), and forum_level_2018_2026 (1,009,592 rows, each unit corresponds to a reviewer within a forum, covering 2018–2026). All units are generated by a two-stage LLM pipeline (DeepSeek memo layer → Qwen structured layer), with fields such as support status (explicit or inferred support), model confidence, nearest centroid classification labels (labels and cosine similarity for objects and criteria). Additionally, the forum-level subset includes fields like year, forum ID, reviewer anonymous ID, temporal position, judgment changes, etc.; the review-level subset includes paper ID, review ID, evidence citation count, etc. The dataset also provides taxonomy definitions (taxonomy/taxonomy_v1.json) and 600 manually annotated rhetorical label units. This dataset can be used for metascience research, peer review quality analysis, automatic decomposition and classification of evaluation logic, and structured text understanding in natural language processing. Note that the data is machine-read, not ground-truth annotations; approximately 1.9% of reviews and 1.8% of forums failed to extract, and the taxonomy is based on sample induction, which may contain noise.

创建时间:
2026-08-19
原始信息汇总

数据集概述

Atlas of Judgment — ICLR Peer-Review Logic Units 是一个包含超过142万个原子评估逻辑单元的数据集,这些单元从ICLR同行评审(OpenReview平台)的公开评审文本中提取,每个单元被分解为四个步骤:检查了什么 → 观察到了什么 → 如何推理 → 得出了什么结论,并标注了由数据归纳出的分类体系(12个审查对象 × 12种认知标准)。

数据子集

配置名称 行数 粒度 年份
review_level_2026 410,586 一条官方评审中的一个单元 ICLR 2026
review_level_2026_reviews 74,380 一条官方评审(摘要+单元数量) ICLR 2026
forum_level_2018_2026 1,009,592 一个论坛内某位评审者的一个单元 ICLR 2018–2026

2026年评审级轨迹以最细粒度读取了该会议98.1%的官方评审;review_id是OpenReview笔记ID,因此每个单元都可以对照原始评审进行验证。论坛级轨迹读取了九年间51,813个公共论坛中的50,861个(98.2%),并增加了讨论阶段字段(temporal_positionjudgment_changeupdate_trigger)。

主要字段

两个单元表共有的字段包括:

  • inspected_object / observation / reasoning / judgment — 四步逻辑分解
  • valence — 消极、积极、条件性、不确定、混合
  • suggested_improvement — 评审提出的具体改进建议
  • support_status — 明确支持或备忘录推断
  • confidence — 结构化模型自身的置信度
  • object_keyobject_simstandard_keystandard_sim — 最近质心分类分配及余弦相似度

论坛级特有字段:yearforum_idreviewer_keyreviewer_roletemporal_positionjudgment_changeupdate_trigger

评审级特有字段:paper_idreview_idn_evidence_refsn_missing_links

数据来源与处理流程

  1. 原始数据:公共OpenReview API v1/v2,52,460个ICLR论坛,2018–2026年。
  2. 备忘录deepseek-v4-flash 撰写定性元科学备忘录。
  3. 单元化qwen3.7-flash 将备忘录规范化为结构化单元。
  4. 分类体系:从12,000个单元样本中归纳(bge-small-en-v1.5嵌入、UMAP/HDBSCAN),人工命名后通过最近质心分配给全语料库。

决策、分数和其他结果元数据从未展示给提取流程;如需可在分析时从OpenReview关联。

分析产物

analysis/ 目录包含29个JSON文件,包括元素分解、判例数据、模板数据、反事实数据(面板重绘模拟)、线程数据(199k条评审线程的回复树形状)等。

许可与引用

  • 许可:CC BY 4.0,与源材料的上游许可一致。
  • 引用:需注明OpenReview和ICLR评审者社区(源文本),并引用本数据集(机器阅读)。
  • 隐私:仅包含公共匿名评审者ID,无非公开个人数据。

局限性

  • 机器阅读而非事实真相,需验证后再做结论。
  • 1.9%的2026年评审和1.8%的论坛提取失败,缺失性未经验证与主题无关。
  • 标准分类体系是从约40%的试点样本中归纳的骨架,单元分配的相似度已提供以便过滤。
  • 未包含子分数和决策,需从OpenReview关联。
搜集汇总
数据集介绍
atlas-of-judgment 数据集图片
构建方式
该数据集基于OpenReview公开的ICLR同行评审记录构建,覆盖2018至2026年间总计52,460个论坛。其构建流程采用两阶段大语言模型管线:首先由DeepSeek模型撰写定性元科学备忘录,随后由Qwen模型将备忘录规范化为结构化单元。每个评审单元被分解为‘检查对象-观察-推理-结论’四步逻辑链,并标注基于数据归纳的12类审查对象与12类认识论标准。数据集的分类体系通过bge-small-en-v1.5嵌入、UMAP降维及HDBSCAN聚类从12,000个样本中诱导生成,并经人工命名后通过最近质心法分配至全语料。此外,数据集包含审查级别的精细单元(2026年)和论坛级别的跨年数据,并提供了完整的复现记录,确保构建过程的透明性与可复现性。
特点
该数据集的核心特点在于其精细的粒度与丰富的分析维度。其包含超过142万个原子评价逻辑单元,其中2026年审查级轨道覆盖该年度官方评审的98.1%,论坛级轨道则读取九年中98.2%的公共论坛。每个单元不仅提供四步逻辑分解,还附有情感倾向、改进建议、证据支持状态及模型置信度等字段。特别地,论坛级数据还包含讨论阶段的时序位置、判断变化及触发因素等动态信息,能够支持评审过程中的立场演变研究。此外,数据集附带的29个分析工件文件,涵盖指控要素分解、裁判法理、模板化批评、反事实模拟等多种衍生数据,为科学学与元科学研究提供了多维度的分析资源。
使用方法
该数据集适用于多种研究场景,用户可通过HuggingFace平台按需加载不同配置。对于聚焦最新评审逻辑的研究,可选用‘review_level_2026’配置,其中每行代表一个评审单元,并通过‘review_id’关联至OpenReview原始评审记录以便交叉验证。若需分析评审整体特征,可使用‘review_level_2026_reviews’配置,每行包含一篇评审的摘要与单元计数。对于跨年度趋势与论坛动态研究,则推荐‘forum_level_2018_2026’配置,该配置提供了年份、论坛ID、匿名审稿人标识及时序位置等字段。所有单元表的核心字段如‘inspected_object’、‘observation’、‘reasoning’和‘judgment’可直接用于逻辑结构分析,而分类标签字段‘object_key’和‘standard_key’则便于进行聚类或比较研究。研究人员可依据自身需求,利用HuggingFace的datasets库或直接下载parquet文件进行定制化分析。
背景与挑战
背景概述
《Atlas of Judgment》数据集诞生于科学学与元科学交叉领域,由研究者Shiro Takagi于2026年创建,依托ICLR 2018至2026年间逾五万份公开同行评审记录(源自OpenReview平台),运用两阶段大语言模型流水线,将评审文本解构为逾百万条原子化评价逻辑单元,每条单元均按“审视对象-观察-推理-结论”四维框架标注,并映射至数据驱动的12类审视对象与12类认识论标准分类体系。该数据集旨在系统揭示学术评审中的隐性评价逻辑,为理解科学共同体的判断模式、评审偏见及知识生产机制提供量化基础,对科学学、计算社会科学及自然语言处理领域具有开创性影响,推动了从定性评论文本到结构化证据库的研究范式转变。
当前挑战
该数据集面临双重挑战:在领域问题层面,同行评审研究长期受制于非结构化文本的模糊性与主观性,难以系统建模评审者多维认知过程,而现有数据集多聚焦于评分预测或文本分类,缺乏对评价逻辑原子成分的精细刻画;在构建过程中,研究者需攻克大规模LLM提取的可靠性瓶颈,包括机器解读与人工评述之间的语义偏差、负面评价偏向(71.8%单元为负向)的仪器偏置、约1.9%评审及1.8%讨论帖提取失败导致的非随机缺失,以及高维语义空间中分类体系的稳定性问题(推理侧HDBSCAN噪声达61.5%),这些因素共同限制了数据的直接应用,要求使用者谨慎对待机器标注并回归原始文本核验。
常用场景
经典使用场景
Atlas of Judgment 数据集的核心应用场景在于对学术同行评审过程进行细粒度的逻辑解构与量化分析。该数据集从ICLR会议2018至2026年间的五万余个公开评审论坛中,提取出超过一百四十万条原子化的评价逻辑单元,每条单元均按照'审查对象-观察内容-推理过程-最终结论'的四步结构进行分解,并标注了涵盖12种审查对象与12种认识论标准的分类体系。研究者可借此深入剖析评审意见的构成要素、论证模式及价值判断的分布规律,从而在元科学层面系统性地理解同行评议的运作机制。
实际应用
在实际应用层面,该数据集可用于构建评审质量监控系统、辅助学术编辑进行稿件筛选,以及为研究者提供评审风格反馈。例如,通过分析评审中'证据引用'和'缺失链接'等字段,可以识别评审意见的信息充分性和论证严谨性;通过追踪'时间位置'和'判断变化',可以分析作者回复对评审结论的影响。此外,数据集中附带的交互式可视化平台(Atlas of Judgment)允许用户直观探索不同年份、不同子领域的评审逻辑模式,为会议组织者改进评审流程、制定审稿人培训计划提供数据驱动的决策支持。
衍生相关工作
该数据集衍生了多项经典工作,涵盖评审逻辑的分解、知识分类的构建以及评审动态的模拟。具体而言,研究者基于其分析产物开发了'元素分解'方法,将每条评审批评解构为理由、依据和补救措施;构建了'判例法'数据,分析不同论文中同类批评的定价与可修复性;开展了'反事实'模拟,通过重新组合评审小组来估计接受率的变化;还分析了'对话线程'结构,描绘了评审讨论的形态。这些工作共同推动了计算元科学领域的发展,使得对学术评价机制的研究从定性描述转向定量建模,并为未来开发更公平、更高效的评审系统提供了理论工具。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务