遇见数据集

AI4AI-Bench

收藏
arXiv2026-08-21 更新2026-08-22 收录
数据链接:
官方服务:

资源简介:

AI4AI-Bench是一个由清华大学Navers实验室和Einsia.AI共同构建的基准测试,旨在评估大语言模型智能体在算法设计层面的递归自我改进能力。该基准包含10个冻结的研究仓库,覆盖监督微调、多轮强化学习、策略蒸馏、奖励建模、偏好优化、扩散强化学习、机器遗忘、图扩散、权重平均和一次性剪枝等十种训练算法家族,每个仓库均配备固定的评估指标。数据集创建过程通过冻结每个仓库的原始算法、初始模型和评估逻辑,为智能体提供4小时开发窗口和最多12小时的验证窗口,以分离探索与评估。该基准旨在解决现有基准无法衡量智能体是否真正改进训练算法(而非仅调参或数据工程)的问题,为递归自我改进研究提供标准化测试平台。

AI4AI-Bench is a benchmark jointly constructed by Navers Laboratory of Tsinghua University and Einsia.AI, aiming to evaluate the recursive self-improvement capabilities of Large Language Model (LLM)-powered AI Agents at the algorithm design level. This benchmark comprises 10 frozen research repositories spanning ten training algorithm families: supervised fine-tuning, multi-turn reinforcement learning, policy distillation, reward modeling, preference optimization, diffusion reinforcement learning, machine unlearning, graph diffusion, weight averaging, and one-shot pruning. Each repository is equipped with fixed evaluation metrics. During the dataset construction process, the original algorithms, initial models and evaluation logic of each repository are frozen, providing AI Agents with a 4-hour development window and a maximum 12-hour verification window to separate exploration and evaluation phases. This benchmark addresses the gap that existing benchmarks cannot measure whether AI Agents truly improve training algorithms (rather than merely tuning hyperparameters or performing data engineering), and provides a standardized testbed for recursive self-improvement research.

创建时间:
2026-08-21
原始信息汇总

数据集概述

AI4AI-Bench 是一个用于评估 LLM 智能体在算法设计方面能力的数据集,聚焦于“AI 改进 AI”的递归自我改进场景。其核心问题是:编码智能体能否改进 AI 项目已有的训练方法?

任务设计

  • 10 个冻结的研究项目:每个任务对应一个真实的研究代码库(论文作者实际运行的代码),智能体获得代码库和起始模型,并收到一条指令:改进该项目已有的结果。
  • 任务覆盖:涵盖监督微调(OpenR1)、多轮智能体 RL(RAGEN)、在线策略蒸馏(OPD)、Bradley-Terry 奖励建模(BTRM)、偏好优化(DPO)、扩散 RL(DDPO)、机器遗忘(NPO)、离散图扩散(DiGress)、权重平均(Model Soup)、一次性剪枝(OWL)等 10 个不同方向,避免单一技巧通吃。

评估机制

  • 两阶段分离:智能体在 4 小时内重写代码并进行短实验,随后在一个其无法访问的密封容器中执行完整的训练运行(最长 12 小时),最后通过智能体未见过的测试数据打分。
  • 统一 0-1 评分轴:三个固定锚点——0(一无所知)、0.1(原始代码的表现)、1.0(完美解决)。分数表示在 0.1 基础上对剩余差距的闭合程度;无法运行的提交得 0 分。

关键发现

  • 总体表现:290 次运行平均得分 0.166,仅略高于仓库自带代码(0.10)。124 次运行中,重写结果比原代码更差。
  • 模型对比:Claude Opus 5 领先(平均 0.250),GPT-5.6 Luna 最低(0.117)。总计探索成本 5334 美元,单个配置成本从 4 美元到 626 美元不等,且最贵的并非最好。
  • 改动类型分析:263 次有效提交中,54% 仅调整运行参数(学习率、批次大小等),平均得分 0.126;46% 改变了模型学习方式(目标函数、更新规则、数据等),平均得分 0.226——后者得分接近前者的两倍。
  • 推理强度影响:提高推理强度使智能体更敢于尝试改变学习方法(比例从 8% 升至 64%),但平均得分仅从 0.094 提升至 0.196,且没有智能体随推理强度提升而持续改进。

引用信息

@article{chi2026ai4ai, title = {AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement}, author = {Yizhe Chi and Wenyi Li and Deyao Hong and Xiaoqiu Wang and Mingju Gao and Kaisen Yang and Bingxiang He and Youjie Zheng and Calvin Xiao and Qinhuai Na}, journal = {arXiv preprint arXiv:2608.20318}, year = {2026} }

相关链接

  • GitHub: https://github.com/(数据集页面未给出具体地址,请参见原始页面)
  • arXiv: 数据集页面标注有 arXiv 链接,具体地址请访问原文页面获取
搜集汇总
数据集介绍
AI4AI-Bench 数据集图片
构建方式
AI4AI-Bench 构建于递归自我改进的核心命题之上,旨在孤立评估算法设计层面的能力。该基准整合了十个冻结的研究仓库,覆盖监督微调、多轮智能体强化学习、在线蒸馏、偏好优化、扩散强化学习、机器遗忘、离散图扩散、权重平均及单次剪枝等十个训练算法家族。每个任务设定统一的协议:智能体在单块 B300 GPU 上拥有四小时的探索时间,可自由阅读、修改代码并利用快速代理指标进行验证;随后,其提交的源码在全新容器中从零训练最多十二小时,由预先固定且无法访问代理工作区的评估器依据不可见的最终指标进行评分。为确保跨任务的分数可比,每个指标均映射至统一尺度,其中 0 代表无信息模型,0.1 为仓库原始算法得分,1.0 为任务最优值。所有评估资产、检查点保存策略及基线计算均严格标准化,使结果归因于算法改进而非资源差异。
使用方法
AI4AI-Bench 的用法灵活,既适用于评估现有 LLM 智能体的算法设计能力,也可作为强化学习环境的奖励信号来源。具体而言,研究者和开发者可加载任意任务,提供基础模型与仓库代码,让智能体在四小时内探索与修改,随后提交补丁。系统将自动在标准环境中执行补丁,训练至多十二小时,并依据隐藏评估器输出分数。研究社区可利用该基准比较不同模型、推理力度及框架的组合表现,分析算法探索与最终得分之间的关联。此外,基准的任务分离设计支持诊断性研究,例如识别智能体倾向于修改运行超参数而非算法核心,并评测增加推理投入如何提高触及算法层面的比例。所有资源和评估脚本开源于指定主页,便于复现和拓展。
背景与挑战
背景概述
AI4AI-Bench于2026年由清华大学Navers实验室与Einsia.AI联合推出,旨在为递归自我改进(RSI)中算法设计层面的能力提供首个专门化评测基准。该基准由Yizhe Chi等人主导构建,其核心研究问题在于:智能体是否能够改进训练算法本身,而非仅限于数据调控或超参数调优。该基准精心选取了涵盖十种训练算法家族的冻结研究仓库,构建了一套严格的评估协议,将智能体的探索阶段(4小时)与独立的重训评估阶段(至多12小时)分离,并以标准化的得分尺度衡量改进幅度。这一设计在机器学习领域产生了深远影响,为衡量AI系统在算法创新上的真正能力树立了新标杆,补充了现有基准在评估算法设计能力方面的空缺。
当前挑战
该数据集所面临的挑战是多维度的。领域层面,其核心难题在于如何精确区分算法改进与执行层变动,因为现有评测多被数据收集或超参数调整主导,难以孤立地度量算法设计能力。构建过程中,需确保十个训练算法家族任务的评估指标可比较且基准线稳固,并促使智能体真正触及学习过程本身。实验显示,多数智能体倾向修改训练预算或检查点保存策略等执行层面,鲜有触及损失函数或更新规则等核心算法。即便加大推理投入,智能体平均得分也仅从0.094提升至0.196,远未达到0.1的基准线,凸显了智能体在算法创新上的根本性局限与挑战。
常用场景
经典使用场景
AI4AI-Bench被设计为评估大型语言模型智能体在递归自我改进中算法设计能力的基准测试。其经典使用场景是为智能体提供十个冻结的研究级代码仓库,每个仓库代表一类训练算法家族,要求智能体在四小时内分析并重写训练算法,随后在十二小时的重新训练中验证改进效果。这一流程模拟了机器学习科学家的工作范式,使研究者能够精确测量智能体是否真正触及了学习算法的核心——如损失函数、更新规则或监督信号——而非仅仅调整超参数或工程细节。
解决学术问题
该基准解决了人工智能研究中一个关键的方法论难题:如何在递归自我改进的框架下,将算法设计层面的贡献从系统或数据层面的改进中分离出来。传统基准往往混淆执行优化与学习算法创新,而AI4AI-Bench通过严格的评估协议和分类体系,首次提供了量化智能体算法设计能力的工具。其研究成果揭示了当前智能体普遍回避算法层改动的现象,为理解大模型智能体的能力边界与递归改进的可行性提供了实证基础,推动了自动化机器学习研究向更深层次发展。
实际应用
在实际应用中,AI4AI-Bench可作为训练和评估自动化AI研究系统的标准测试平台。它能够筛选出真正具备算法设计能力的智能体,这些智能体可被部署于工业生产环境,辅助机器学习工程师进行训练算法的优化与创新。此外,该基准的评估流程和分类方法可直接用于衡量AI辅助开发工具的实际效用,指导研发资源在推理策略、探索机制等方向的投入,从而提升整个AI研发产业链的自动化水平与效率。
数据集最近研究
最新研究方向
AI4AI-Bench作为首个聚焦于算法设计层面的基准,正在引领大语言模型代理在递归自我改进领域的前沿探索。当前研究前沿主要围绕三个方面展开:其一,系统评估代理在真实科研代码库中改进训练算法的能力,涵盖从监督微调到图扩散等十个算法族;其二,深入剖析代理的行为模式,揭示其在面对训练动态时倾向于调整执行预算或超参数而非根本性改写学习规则的现象;其三,探索推理努力与算法探索意愿之间的关联,发现更高推理水平虽能显著提升代理触及算法层的可能性,但即便如此,现有系统仍仅能弥合不到四分之一的最优差距。该基准通过严格的协议分离探索与验证阶段,为衡量代理在算法设计这一关键环节的实际贡献提供了可靠标尺,对理解人工智能自我改进的极限与潜力具有深远意义。
相关研究论文
  • 1
    AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement清华大学·Navers实验室; Einsia.AI · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务