autoresearch-novelty-bench
收藏资源简介:
这是一个用于测试自主AI研究智能体是否提出新颖、机制独特的假设并预测其他研究人员后来发现的突破性成果的基准数据集。它基于Prime Intellect的自主速通档案构建,包含10,380个训练运行、646个想法记录和337,648个验证检查点,通过解析、链接、恢复变体文件等步骤构建了实验目录,并生成了40个时间锚定的评估快照,用于评估提案的新颖性、重复发现、预测有效性和多样性。
This is a benchmark dataset for testing whether autonomous AI research agents can propose novel, mechanism-unique hypotheses and predict breakthrough discoveries later made by other researchers. Developed based on the Autonomous Speedrun Archives of Prime Intellect, this dataset contains 10,380 training runs, 646 idea records, and 337,648 validation checkpoints. An experimental catalog was constructed via procedures such as parsing, linking, and variant file recovery, and 40 time-anchored evaluation snapshots were generated to assess the novelty, repeated discovery performance, predictive validity, and diversity of the submitted proposals.
数据集概述
autoresearch-novelty-bench 是一个用于评估自主AI研究代理(proposer)所提出研究假设的基准测试平台。其核心功能是判断一个代理提出的 N 个候选想法是否具有新颖性、能否预测未来的突破,以及是否只是重复已有的发现。
数据来源与构建流程
该数据集构建于 Prime Intellect 公开的 autonomous-speedrunning 存档之上。该存档记录了 Claude Code 和 Codex 两个AI代理在 modded-nanogpt 优化任务上的竞赛过程。
构建流程包含以下 8 个关键步骤:
- 解析原始数据:对两个代理在 4 个竞赛阶段(wave)产生的 8 个工作区进行解析,从 10,380 次训练运行、646 个想法文档和 337,648 个验证检查点中提取结构化信息。
- 将实验与想法关联:使用五级匹配器,将 63% 的训练运行与具体的想法文档关联起来。
- 恢复每个运行的源代码:通过四种级联方法(日志提取、PyTorch重编译日志、sbatch任务脚本、文件名模糊匹配),成功为 95.6% 的训练运行找到了对应的
variant.py源代码文件,并记录了其使用的具体机制。 - 构建实验目录:为每次训练运行生成数据行,包含时间戳、实验结论(改进/中性/退化/无结论)、最佳步数、关联的源代码和想法文档。
- 为每个实验生成描述:优先使用父级想法文档(~6,580 行)或源代码 docstring 作为描述。对于剩余的 ~3,800 个运行,使用 LLM 根据运行 ID 和日志前缀生成 1-2 句机制摘要。
- 为描述生成向量嵌入:提供了两种嵌入后端:OpenAI 的
text-embedding-3-large(高精度)和 BGE-large(本地、免费)。 - 构建时间快照:创建了 40 个时间快照,每个快照冻结了在特定时间点可见的全部信息(先前已提出的想法、已被否决的想法、当前最优方案等),并明确了哪些是未来的改进。这些快照被划分为 16 个开发集和 24 个测试集快照。
- 校准评分器:生成了 78 个标记样本(包括重复的、未来的、改述的、跨范围的以及格式错误的样本),通过余弦相似度阈值扫描,最终将阈值定为 0.75,在标记样本上达到了 87% 的准确率。
使用方法与访问
该数据集以 Python 库的形式发布,可通过 pip 安装(pip install evo-autoresearch-novelty-bench),数据文件(Parquet 格式)会在首次使用时从 Hugging Face 自动下载。novelty_bench 模块提供了丰富的 API 接口:
- 浏览数据:
nb.load_experiments()、nb.load_snapshots()、nb.load_ideas()。 - 评估想法:
nb.score(snapshot, candidates)函数用于评估代理提出的候选想法。 - 创建评测环境:通过一个独立的 scaffold 仓库,可以生成一个时间快照对应的评测工作目录,代理在此目录中基于最小化上下文信息(仅提供任务目标和当前最优方案)提出候选想法。
评分机制
评分公式为一个综合得分,包含三个部分:
set_score = sum(per_candidate_scores) + 0.5 × diversity_bonus + 0.1 × validity_term
- 多样性奖励:鼓励提出机制上不同的想法,使用 N 个候选想法之间的平均余弦距离计算。
- 有效性奖励:奖励所有候选想法都符合基本的结构规范。
单个候选想法的评分优先顺序如下:
- 无效 (Invalid):结构不完整,得分 -1.0。
- 新颖且已验证 (Novel_Validated):预测了未来成功的实验,得分由该实验的重要性和匹配置信度决定。这是最高奖励类别。
- 重复发现 (Rediscovery):重复了之前已经尝试过(尤其是已失败或已被否决)的想法,得分 -0.5(并乘以一个基于失败原因的惩罚系数)。
- 新颖但未验证 (Novel_Unvalidated):没有匹配到任何已知的过去或未来实验,得 +0.3。
优先规则:如果一个想法重复了过去的某个方案,但这个方案最终证明是一条成功的未来路线,则该想法被判定为“新颖且已验证”(预测成功),而非“重复发现”。
评分后台:
- 默认 (
llm-hybrid):首先使用text-embedding-3-large进行快速检索(找最近的 20 个过去和 20 个未来方案),然后由gpt-5-mini(结构化输出)进行最终分类,捕捉余弦相似度可能遗漏的语义改写。成本约为 $0.005/5 个候选想法。 - 确定性模式 (
cosine):使用纯余弦相似度阈值(0.75)判定,成本极低(约 $0.0003/5 个候选想法),适合需要完全可复现结果的排行榜。
已知局限
由于数据源自已存档的日志文件,该数据集无法重建以下信息:代理与协调系统的对话、其累积的上下文窗口、实时的网络搜索记录、做出决策的推理过程、人类操作员的干预行为、集群的运行状态以及模型自身的知识截止日期。这意味着代理必须在近乎空白的状态下,仅凭自身能力(如联网搜索、查阅论文)来获取外部知识。




