FrontierOR
收藏资源简介:
FrontierOR是一个用于系统评估基于大语言模型的高效算法设计的大规模优化问题基准测试。它包含180个任务,源自顶级运筹学期刊的方法多样论文,每个任务都配有自然语言问题描述、数学公式、标准化大规模实例套件、专家验证的Gurobi参考基线和独立的可行性检查器。该数据集旨在测试大语言模型和智能体是否能超越正确建模,设计出可行、高质量且高效的算法。
FrontierOR is a large-scale optimization problem benchmark dedicated to the systematic evaluation of LLM-based efficient algorithm design. It contains 180 tasks sourced from diverse methodological papers published in top-tier operations research journals. Each task is provided with a natural language problem description, mathematical formulations, a standardized large-scale instance suite, expert-validated Gurobi reference baselines, and an independent feasibility checker. This benchmark aims to test whether large language models (LLMs) and AI Agents can transcend correct problem modeling and develop feasible, high-quality, and efficient algorithms.
FrontierOR 数据集概述
FrontierOR 是一个用于评估大语言模型(LLM)在大规模优化问题中设计高效算法能力的基准测试。
核心特点
- 目标:系统性测试 LLM 是否能在真实大规模优化问题中,设计出超越直接建模求解的可扩展算法。
- 规模:包含 180 个任务,源自顶级运筹学期刊上发表的方法多样性论文。
- 难度:每个优化问题涉及 10² 到 10⁷ 个决策变量和约束(中位数约 10⁴),Gurobi 在 46% 的大规模实例上无法在一小时内达到最优解。
- 数据质量:通过多轮专家评审构建,确保数据质量。
数据集构成
每个任务都提供:
- 自然语言问题描述
- 精确的数学公式
- 标准化的大规模实例套件
- 专家验证的 Gurobi 参考基线
- 独立的可行性检查器
关键发现
- 前沿模型表现有限:最强模型在解质量和计算效率上仅能在 31% 的案例中优于 Gurobi。
- 执行不再是瓶颈:GPT-5.3-Codex 能执行 98% 的任务,但在“困难”子集上的可行性得分仅为 0.49,挑战已转向生成有效且可扩展的算法。
- 困难子集拉开差距:在全部任务上,前沿模型表现接近;但在困难任务上,Claude Opus 4.6 在 QTE(质量-时间效率)上表现最佳。
评估方法
- 评估流程:支持一次性生成和测试时自我进化两种评估流水线。
- 执行后端:提供
bare(本地直接运行)、systemd(Linux 服务器,带资源限制)、docker(完全隔离)三种执行模式。
访问与使用
- 代码仓库:https://github.com/Minw913/FrontierOR
- 数据集:https://huggingface.co/datasets/SmartOR/FrontierOR
- 网站与排行榜:https://frontieror.vercel.app/
- 论文:https://arxiv.org/abs/2605.25246
支持新模型
- 通过 OpenRouter 路由 LLM 调用,添加新模型只需在配置文件
configs/oneshot.yaml中注册短名称和路由即可。




