遇见数据集

AgentHPOBench

收藏
arXiv2026-08-01 更新2026-08-04 收录
官方服务:

资源简介:

AgentHPOBench是一个专为评估大语言模型智能体作为顺序超参数优化器而设计的基准测试,由复旦大学、上海创新研究院、华东师范大学及OpenMOSS联合构建。该基准包含30个可执行的机器学习任务,横跨自然语言处理、计算机视觉、时间序列预测、图学习、强化学习、大语言模型与结构化学习等七大研究领域。每个任务均基于真实GitHub研究仓库打造,设有参考基线、目标指标、限制性干预空间及锚点,智能体需在每次干预后观察累积的配置、指标与日志,进而提出下一有效超参数配置。该基准旨在考察智能体能否将实验反馈转化为可验证的优化决策,弥补现有基准在迭代精细化调优、复杂日志诊断及持续进步方面的不足。

AgentHPOBench is a benchmark specifically developed for evaluating large language model (LLM) agents as sequential hyperparameter optimizers, jointly constructed by Fudan University, Shanghai Institute of Innovation, East China Normal University, and OpenMOSS. This benchmark includes 30 executable machine learning tasks spanning seven core research fields: natural language processing, computer vision, time series forecasting, graph learning, reinforcement learning, large language models, and structured learning. Each task is built upon real GitHub research repositories, and is equipped with reference baselines, target metrics, constrained intervention spaces, and anchor points. AI agents are required to observe accumulated configurations, performance metrics and logs after each intervention, and then propose the next valid hyperparameter configuration. This benchmark aims to investigate whether agents can translate experimental feedback into verifiable optimization decisions, addressing the shortcomings of existing benchmarks in iterative fine-grained hyperparameter tuning, complex log diagnosis, and continuous improvement.

创建时间:
2026-08-01
原始信息汇总

AgentHPOBench 是一个用于评估大型语言模型(LLM)代理作为顺序超参数优化器的基准测试框架,包含 30 个可执行的机器学习任务,覆盖语言、视觉、时间序列、图学习、强化学习、生成建模和结构化学习七大研究类别。

核心目标

该基准测试评估自主代理能否通过顺序超参数干预来改进可执行的机器学习实验,而不只是静态代码生成或最终答案正确性。每个任务提供经过验证的基线配置、目标指标、受约束的干预空间、执行适配器,以及完整的配置、指标、日志和决策来源记录(JSON 格式)。

任务与来源仓库

每个任务均基于真实研究仓库,并对经过审计的提交版本快照运行。下表列出部分任务及其上游来源:

任务 ID 上游仓库 固定版本
llm_c_fineweb10b karpathy/llm.c f1e2ace
open_r1_math500 huggingface/open-r1 1416fa0
timesfm_etth1_long_horizon google-research/timesfm d720daa
cifar10_airbench94 KellerJordan/cifar10-airbench 4c1b6d1
tabm_california_rmse yandex-research/tabm 28e47ae
timexer_pjm_168_24_mse thuml/TimeXer 7601190
verl_grpo_gsm8k volcengine/verl 59f53cc

完整列表包含全部 30 个任务,详见 docs/task-repositories.md。克隆所有上游仓库可使用 python3 scripts/clone_repositories.py,该工具会验证每个现有检出是否匹配固定版本和兼容性补丁。

评估协议

每个任务从一次基线运行开始,代理需进行五次顺序干预。在每一步,代理观察累积的配置、指标和日志,然后提出下一个有效配置。基准测试采用统一协议,评估多种代理和传统超参数优化(HPO)基线,包括随机搜索、TPE 和 BOHB。

结果完整性要求

有效结果必须满足:

  • 完成五次干预
  • fallback_decision_count 等于 0
  • 配置模型有非空原始响应
  • 无任务级执行错误

可通过 python3 analysis/validate_results.py 进行严格验证,要求精确的基线加五次跟踪记录、零回退标记、最终指标等。

复现论文

论文使用有限预算协议(一次基线和五次干预机会),开放权重模型和 HPO 结果在种子 0、1、42 上聚合;无反馈消融实验会从决策中移除所有基线后指标和日志。聚合脚本将输出至 results/summary/

引用

bibtex @article{huai2026agenthpobench, author = {Tianyu Huai and Tingshuo Fan and Xinchi Chen and Yining Zheng and Yuxin Wang and Shuang Chen and Jie Zhou and Xuanjing Huang}, title = {AgentHPOBench: A Benchmark for Evaluating LLM Agents as Sequential Hyperparameter Optimizers}, journal = {arXiv preprint arXiv:2607.29626}, year = {2026}, url = {https://arxiv.org/abs/2607.29626} }

许可

AgentHPOBench 以 Apache License 2.0 发布。上游仓库各自拥有独立许可和使用条款,不随基准测试重新分发受限数据集或模型权重。

搜集汇总
数据集介绍
AgentHPOBench 数据集图片
构建方式
AgentHPOBench的构建基于30个可执行的机器学习仓库,覆盖自然语言处理、计算机视觉、时间序列预测、图学习、强化学习、大语言模型和结构化学习七大研究领域。每个任务遵循严格的构建协议,首先确定参考基线和目标指标,然后从官方训练脚本、配置文件或仓库文档中提取受限的干预空间,并保留原始仓库的执行逻辑、依赖和日志格式。基准通过统一的执行引擎验证提议配置、运行实验并记录完整轨迹,最终由审计层检验任务完整性并转换为标准化评分,确保跨任务的公平比较。
使用方法
使用者可通过统一的评估协议对任意智能体或传统优化器进行测试。每个任务从共享的参考基线出发,智能体在固定的干预次数内(默认五次)观察历史轨迹并提议新配置,提议经校验后执行并记录指标。基准提供完整的评估工具链,包括配置验证、执行记录和结果评分,输出平均归一化得分、基线胜率和锚点达成度等指标。公开的GitHub仓库包含详细的设置指南和机器可读的任务规范,支持复现和扩展。该方法适用于比较不同智能体在真实研究仓库中的超参数优化能力,也可用于研究反馈消融和预算影响等科学问题。
背景与挑战
背景概述
AgentHPOBench是由复旦大学、上海创新研究院、华东师范大学及OpenMOSS团队于2026年共同推出的基准测试平台,旨在评估大语言模型代理在可执行机器学习仓库中进行序列化超参数优化的能力。该基准包含30个可执行任务,覆盖自然语言处理、计算机视觉、时间序列预测等七大研究领域,通过统一的执行框架和评分协议,衡量代理是否能够从历史实验的指标与日志中提取有效信息,并据此提出下一轮的超参数配置。其创新之处在于将传统HPO基准中抽象的数值目标替换为真实的仓库执行环境,要求代理具备解读实验证据并做出决策的综合能力,为评估LLM代理在科学研究中的自主实验能力提供了标准化测试平台,对自动化机器学习与AI for Science领域具有重要影响。
当前挑战
AgentHPOBench所面临的挑战涵盖两个层面。在领域问题层面,如何让代理在缺乏干净数值反馈的真实仓库环境中,从复杂多模态的实验日志中准确诊断性能瓶颈,并建立持续的迭代优化策略,而非仅在单次干预中偶得改进,是一个核心难题。现有代理在跨任务类别上的表现不均衡,且往往难以维持或超越前期的优化成果,表明其泛化能力与鲁棒性有待提升。在构建层面,由于涉及30个异构仓库,需设计统一的任务规范、干预空间及执行工具链,同时确保评分指标的公平性与可比性,这要求处理各仓库间的依赖差异、配置接口不一及日志格式多样等问题,并保证结果的可重复性与审计的严密性,构成了极高的工程复杂度。
常用场景
经典使用场景
AgentHPOBench作为一个专为评估大语言模型智能体在可执行机器学习仓库中进行序列化超参数优化能力的基准测试,其经典使用场景聚焦于检验智能体能否依据实验反馈(包括配置、指标和日志)逐步提出有效的超参数干预方案。该基准涵盖自然语言处理、计算机视觉、时间序列预测、图学习、强化学习、大语言模型和结构化学习七大领域的30个可执行任务,每个任务均设有验证过的基线配置和受限的干预空间,要求智能体在固定干预次数内,通过观察历史试验轨迹,做出下一轮超参数决策。这一场景模拟了真实科研工作流中研究者根据实验证据迭代调整模型配置的过程,从而对智能体的实验诊断和序贯决策能力进行量化评估。
解决学术问题
AgentHPOBench解决了现有基准测试未能直接评估智能体是否能够解释实验证据并据此指导后续超参数决策的学术空白。传统HPO基准如HPO-B、YAHPO Gym等通常提供干净的黑盒目标函数,抽象掉了研究仓库中的日志、配置和程序性上下文,而静态代码生成或论文复现类基准又无法捕捉迭代实验优化的动态过程。AgentHPOBench通过构建可执行的研究仓库任务,要求智能体从累积的配置、指标和日志中提取有效信息,并转化为下一个有效配置,从而精确衡量智能体在实验优化方面的能力。该基准的提出推动了智能体评估从静态代码生成向动态实验决策的范式转变,为衡量大语言模型作为自主科研代理的实证优化能力提供了标准化的评测框架和量化指标。
实际应用
AgentHPOBench的实际应用场景主要体现在自动化机器学习实验管理和智能科研辅助领域。在机器学习模型开发过程中,研究人员常面临超参数调优的繁琐工作,AgentHPOBench所评估的智能体能力可直接应用于自动化调参系统,使智能体能够根据训练日志和中间指标动态调整学习率、批大小、网络深度等关键超参数,从而提升模型性能并减少人工干预。此外,该基准也可用于评估和优化面向科研场景的智能助手,使其能够辅助研究人员在自然语言处理、计算机视觉等多个领域快速定位最优配置。在工业应用中,此类智能体可嵌入机器学习平台,实现对大规模实验的自主管理和迭代优化,降低调参成本并加速模型迭代效率。
数据集最近研究
最新研究方向
在大型语言模型向自主科研智能体演进的浪潮中,AgentHPOBench数据集应运而生,它将超参数优化(HPO)从静态的黑盒评估推向动态的、可执行的科研仓库环境。该基准包含30个来自七个不同研究领域的可运行机器学习任务,核心聚焦于评估智能体能否解析实验日志、累积指标与配置轨迹,进而做出序贯的超参数干预决策。前沿研究趋势显示,尽管当前最强的商业API智能体在该基准上展现出超越传统HPO方法的潜力,但其在持续迭代优化、复杂日志诊断及稳定逼近论文报告性能方面仍显不足;同时,实验反馈的消融研究亦揭示了中间证据对优化性能的关键影响。AgentHPOBench由此确立了科研仓库中HPO作为独立挑战性任务的地位,为研发更具实验诊断与序贯决策能力的下一代智能体提供了关键评估基础设施。
相关研究论文
  • 1
    AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers复旦大学; 上海创新研究院; 华东师范大学; OpenMOSS · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务