遇见数据集

icml-2026-reproductions

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

该数据集是 ICML 2026 Agent Reproducibility Challenge 的公共复现日志镜像。数据集中记录了 agent 尝试复现 ICML 2026 论文中 claim 的完整过程、证据和 verdict。数据包含:所有 6341 篇 ICML 2026 论文的元数据(papers.json)、日志索引(logbooks.csv,每行对应一个 agent×论文×评分)、原始 verdict 数据(verdicts.json)、论文 claim(claims.json 和 claims_anchored.json)以及按论文 ID 组织的详细日志目录(papers/)。每个日志包含 meta.json(评分、verdict、评判时间)、logbook.json、README.md 以及按 claim 分页的页面(pages/)。评分由 Logbook Judge 评估,verdict 包括 verified(2 分)、falsified(2 分)、toy(1 分)、inconclusive(0 分)。初始快照显示:316 个 agent、1685 篇论文被复现、4212 个日志、98% 已评判。数据集定期同步更新。适用于文本生成任务、复现性研究、agent 行为分析以及相关挑战赛的后续研究。

This dataset is a public reproduction log mirror of the ICML 2026 Agent Reproducibility Challenge. It records the complete process, evidence, and verdict of agents attempting to reproduce claims from ICML 2026 papers. The data includes: metadata of all 6341 ICML 2026 papers (papers.json), log index (logbooks.csv, each row corresponds to an agent×paper×score), raw verdict data (verdicts.json), paper claims (claims.json and claims_anchored.json), and a detailed log directory organized by paper ID (papers/). Each log contains meta.json (score, verdict, evaluation time), logbook.json, README.md, and pages (pages/) organized by claim. Scores are evaluated by the Logbook Judge, with verdicts including verified (2 points), falsified (2 points), toy (1 point), and inconclusive (0 points). The initial snapshot shows: 316 agents, 1685 papers reproduced, 4212 logs, 98% evaluated. The dataset is regularly synchronized and updated. It is suitable for text generation tasks, reproducibility research, agent behavior analysis, and subsequent studies related to the challenge.

创建时间:
2026-07-26
原始信息汇总

数据集概述

该数据集是 ICML 2026 Agent Reproducibility Challenge(智能体可复现性挑战赛) 的公开复现日志(Logbooks)的实时镜像,记录了智能体在复现 ICML 2026 论文声明时的完整过程、证据与判定结果。

基本信息

  • 许可证:CC-BY-4.0
  • 任务类别:文本生成(text-generation)
  • 语言:英语
  • 数据集规模:1K < n < 10K 条记录
  • 标签:ICML2026、可复现性、智能体、日志

数据集结构

数据集包含以下核心文件与目录:

路径 说明
papers.json 全部 6341 篇 ICML 2026 论文的元数据
logbooks.csv 主索引,每行对应一个日志(智能体 × 论文 × 得分)
verdicts.json Logbook Judge 的原始判定结果
claims.json 论文声明(判定前)
claims_anchored.json 锚定后的论文声明
papers/{paper_orid}/meta.json 论文元数据及日志索引
papers/{paper_orid}/{username}/ 每个智能体对某篇论文的复现日志,包含 meta.jsonlogbook.jsonREADME.mdpages/{claim-slug}/page.md

评分机制

Logbook Judge 对每条声明进行判定,得分规则如下:

判定结果 得分
verified(验证通过) 2
falsified(证伪) 2
toy(玩具示例) 1
inconclusive(无结论) 0

数据统计(初始快照)

  • 智能体数量:316 个
  • 已复现论文数:1,685 篇
  • 日志总数:4,212 份
  • 已判定比例:98%

更新机制

数据集会定期同步,每次提交对应一次同步运行。可通过运行 sync.py 脚本进行本地更新并推送。

相关来源

  • 挑战赛主页:https://icml-2026-agent-repro-challenge.static.hf.space/
  • 排行榜:https://icml-2026-agent-repro-challenge.static.hf.space/leaderboard.html
  • Logbook Judge 空间:https://huggingface.co/spaces/ICML-2026-agent-repro/logbook-judge
搜集汇总
数据集介绍
icml-2026-reproductions 数据集图片
构建方式
该数据集源自ICML 2026智能体可复现性挑战赛,构建过程采用社区众包与自动化收录相结合的方式。参赛智能体针对ICML 2026收录的6341篇论文中的主张进行独立复现,并将完整复现过程、证据与判定结论记录为日志簿。数据集通过定期同步机制从公开的HuggingFace空间抓取所有日志簿文件,经Logbook Judge自动评判后生成结构化索引,最终以papers.json、logbooks.csv、verdicts.json等文件及按论文标识符划分的parquet格式归档,形成可追溯、可扩展的动态语料库,映射出智能体驱动的科学复现实践全景。
特点
该数据集在规模与结构上兼具广度与深度,覆盖316个智能体对1685篇论文的4212份日志簿,且98%的条目已完成自动评判。其核心特点在于多维异构数据的有机整合:既包含论文元数据、原始主张与锚定主张,又囊括日志簿原始文件、判定结论及论文到日志簿的映射关系。parquet文件按论文粒度组织,以二进制与文本双通道保存文件内容,保留完整证据链。评分体系区分verified、falsified、toy与inconclusive四类判定并赋予差异化权重,为衡量智能体复现能力提供了标准化标尺,亦为科学可复现性研究提供了细粒度观测窗口。
使用方法
研究者可通过polars等工具读取parquet文件,按space_name、file_path等字段检索特定智能体或论文的日志簿内容,亦可借助logbooks.csv与papers_logbooks.csv进行跨表关联分析。结合verdicts.json与claims_anchored.json,能够量化评估不同智能体在各类主张上的复现表现,或追踪复现判定随时间演化的趋势。针对文本生成任务,content_text字段可直接用于下游语言模型训练与评测。使用时应留意数据集处于周期性同步状态,每次提交对应一次同步运行,建议引用时注明快照时间以确保结果可复现,并遵循CC-BY-4.0许可协议进行合规使用。
背景与挑战
背景概述
ICML 2026 Agent Reproducibility Challenge Logbooks数据集源于2026年国际机器学习会议(ICML)发起的智能体可复现性挑战赛,由ICML 2026智能体可复现性挑战组织委员会构建。其核心研究问题在于探索自主智能体能否独立复现顶级会议论文中的科学论断,并系统记录复现过程中的证据与判定结论。该数据集汇聚了316个智能体对1685篇ICML 2026论文的4212份公开复现日志,经由Logbook Judge自动化评估体系对每个论断给出验证、证伪、玩具级或不确定的量化判定。作为首个大规模智能体科学复现基准,它为元科学、自动化科研验证及大语言模型评估提供了宝贵资源,对推动可复现性研究范式变革具有深远影响。
当前挑战
该数据集所解决的领域问题——自动化科学论断复现——面临多重严峻挑战。就问题本质而言,从论文文本中精确抽取可验证论断、设计无偏的复现实验方案、以及判定复现结果与原始论断的一致性,均需复杂的语义理解与推理能力,当前智能体在方法细节缺失或实验环境差异显著时往往难以给出确定结论。构建过程中,数据采集需协调数百个异构智能体空间,解析格式各异的日志文件,并设计公平一致的评判标准;同时,复现实验本身受计算资源、超参数敏感性与随机性影响,导致判定结果存在不确定性。此外,数据集的持续同步与版本管理亦对基础设施提出了较高要求。
常用场景
经典使用场景
在机器学习可复现性研究领域,该数据集最经典的使用场景是作为智能体驱动的论文复现实验的记录库。研究者和智能体系统可以检索特定ICML 2026论文对应的复现日志,逐条审视针对论文中各项声明(claim)的验证过程、证据链及评判结论。通过解析logbooks.csv与parquet文件,使用者能够系统性地追溯从声明抽取、锚定到实验验证的完整轨迹,从而评估不同智能体在复现任务中的策略差异与表现优劣。
解决学术问题
该数据集直面学术研究中长期存在的可复现性危机,为验证机器学习论文结论的稳健性提供了大规模、结构化的实证基础。它解决了传统复现工作分散、评判标准不一、证据难以横向比较等问题,通过统一的裁决体系(verified、falsified、toy、inconclusive)将复现结果量化。其意义在于推动可复现性从个案报告走向规模化、可度量的科学实践,为元科学研究提供关键数据支撑。
衍生相关工作
围绕该数据集已衍生出一系列经典工作,包括用于自动评判复现日志的Logbook Judge系统,以及支撑智能体复现流程的挑战赛平台与排行榜。相关研究进一步探索了声明锚定(claims anchoring)、复现策略生成与证据聚合等方向,推动了智能体在开放式科研任务中的能力边界拓展。这些衍生工作共同构成了以可复现性为核心的智能体评测生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务