AgentHPOBench
收藏资源简介:
AgentHPOBench是一个专为评估大语言模型智能体作为顺序超参数优化器而设计的基准测试,由复旦大学、上海创新研究院、华东师范大学及OpenMOSS联合构建。该基准包含30个可执行的机器学习任务,横跨自然语言处理、计算机视觉、时间序列预测、图学习、强化学习、大语言模型与结构化学习等七大研究领域。每个任务均基于真实GitHub研究仓库打造,设有参考基线、目标指标、限制性干预空间及锚点,智能体需在每次干预后观察累积的配置、指标与日志,进而提出下一有效超参数配置。该基准旨在考察智能体能否将实验反馈转化为可验证的优化决策,弥补现有基准在迭代精细化调优、复杂日志诊断及持续进步方面的不足。
AgentHPOBench is a benchmark specifically developed for evaluating large language model (LLM) agents as sequential hyperparameter optimizers, jointly constructed by Fudan University, Shanghai Institute of Innovation, East China Normal University, and OpenMOSS. This benchmark includes 30 executable machine learning tasks spanning seven core research fields: natural language processing, computer vision, time series forecasting, graph learning, reinforcement learning, large language models, and structured learning. Each task is built upon real GitHub research repositories, and is equipped with reference baselines, target metrics, constrained intervention spaces, and anchor points. AI agents are required to observe accumulated configurations, performance metrics and logs after each intervention, and then propose the next valid hyperparameter configuration. This benchmark aims to investigate whether agents can translate experimental feedback into verifiable optimization decisions, addressing the shortcomings of existing benchmarks in iterative fine-grained hyperparameter tuning, complex log diagnosis, and continuous improvement.
AgentHPOBench 是一个用于评估大型语言模型(LLM)代理作为顺序超参数优化器的基准测试框架,包含 30 个可执行的机器学习任务,覆盖语言、视觉、时间序列、图学习、强化学习、生成建模和结构化学习七大研究类别。
核心目标
该基准测试评估自主代理能否通过顺序超参数干预来改进可执行的机器学习实验,而不只是静态代码生成或最终答案正确性。每个任务提供经过验证的基线配置、目标指标、受约束的干预空间、执行适配器,以及完整的配置、指标、日志和决策来源记录(JSON 格式)。
任务与来源仓库
每个任务均基于真实研究仓库,并对经过审计的提交版本快照运行。下表列出部分任务及其上游来源:
| 任务 ID | 上游仓库 | 固定版本 |
|---|---|---|
llm_c_fineweb10b |
karpathy/llm.c | f1e2ace |
open_r1_math500 |
huggingface/open-r1 | 1416fa0 |
timesfm_etth1_long_horizon |
google-research/timesfm | d720daa |
cifar10_airbench94 |
KellerJordan/cifar10-airbench | 4c1b6d1 |
tabm_california_rmse |
yandex-research/tabm | 28e47ae |
timexer_pjm_168_24_mse |
thuml/TimeXer | 7601190 |
verl_grpo_gsm8k |
volcengine/verl | 59f53cc |
完整列表包含全部 30 个任务,详见 docs/task-repositories.md。克隆所有上游仓库可使用 python3 scripts/clone_repositories.py,该工具会验证每个现有检出是否匹配固定版本和兼容性补丁。
评估协议
每个任务从一次基线运行开始,代理需进行五次顺序干预。在每一步,代理观察累积的配置、指标和日志,然后提出下一个有效配置。基准测试采用统一协议,评估多种代理和传统超参数优化(HPO)基线,包括随机搜索、TPE 和 BOHB。
结果完整性要求
有效结果必须满足:
- 完成五次干预
fallback_decision_count等于 0- 配置模型有非空原始响应
- 无任务级执行错误
可通过 python3 analysis/validate_results.py 进行严格验证,要求精确的基线加五次跟踪记录、零回退标记、最终指标等。
复现论文
论文使用有限预算协议(一次基线和五次干预机会),开放权重模型和 HPO 结果在种子 0、1、42 上聚合;无反馈消融实验会从决策中移除所有基线后指标和日志。聚合脚本将输出至 results/summary/。
引用
bibtex @article{huai2026agenthpobench, author = {Tianyu Huai and Tingshuo Fan and Xinchi Chen and Yining Zheng and Yuxin Wang and Shuang Chen and Jie Zhou and Xuanjing Huang}, title = {AgentHPOBench: A Benchmark for Evaluating LLM Agents as Sequential Hyperparameter Optimizers}, journal = {arXiv preprint arXiv:2607.29626}, year = {2026}, url = {https://arxiv.org/abs/2607.29626} }
许可
AgentHPOBench 以 Apache License 2.0 发布。上游仓库各自拥有独立许可和使用条款,不随基准测试重新分发受限数据集或模型权重。

- 1AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers复旦大学; 上海创新研究院; 华东师范大学; OpenMOSS · 2026年



