遇见数据集

A2utoLPBench

收藏
arXiv2026-07-02 更新2026-07-05 收录
官方服务:

资源简介:

A2utoLPBench是由香港中文大学研究团队创建的一个线性规划(LP)问题生成基准,旨在为大型语言模型(LLM)驱动的智能体提供可扩展且抗污染的评估工具。该数据集通过逆KKT构造方法自动生成,包含无限供应的LP问题实例,其参考快照包含256个实例,每个实例均附带由KKT定理严格保证的数学真值,无需依赖外部求解器或人工标注。数据集创建过程完全自动化,通过采样原始-对偶系数三元组并利用逆KKT条件推导出LP问题及其最优解,同时结合LLM驱动的自然语言起草器生成文本描述。该数据集主要应用于评估LLM智能体在自然语言描述下的线性规划问题解决能力,旨在解决传统静态基准在数据泄露、难度固定和可扩展性方面的局限性,为AI代理提供可编程难度和可重复测量的评估环境。

A2utoLPBench is a linear programming (LP) problem generation benchmark created by the research team at The Chinese University of Hong Kong, designed to provide a scalable and pollution-resistant evaluation tool for large language model (LLM)-powered AI Agents. This dataset is automatically generated via the inverse KKT construction method and contains an unlimited supply of LP problem instances. Its reference snapshot includes 256 instances, each paired with mathematically rigorous ground truths strictly guaranteed by the KKT theorem, without relying on external solvers or manual annotations. The entire dataset creation process is fully automated: it samples primal-dual coefficient triples, derives LP problems and their optimal solutions using the inverse KKT conditions, and combines with LLM-powered natural language drafters to generate textual descriptions. This dataset is primarily used to evaluate the LP problem-solving capabilities of LLM-driven AI Agents when presented with natural language-described LP tasks, aiming to address the limitations of traditional static benchmarks including data leakage, fixed difficulty and scalability issues, and provide an evaluation environment with programmable difficulty and reproducibly measurable metrics for AI Agents.

提供机构:
香港中文大学
创建时间:
2026-07-02
原始信息汇总

数据集概述:AutoLPBench

AutoLPBench 是一个用于测试基于大语言模型(LLM)的智能体在纯文本描述的线性规划问题上的基准测试。其核心特点是不发布固定的数据集,而是发布一个 生成器 和一个 智能体可运行的评估环境

核心组成

组成部分 说明 位置
Auto(生成器) 采用逆KKT(Karush-Kuhn-Tucker)条件生成器。通过选取最优解反向推导线性规划问题,KKT条件用于验证答案的正确性,无需求解器或人工标注。 src/inverse_kkt.py
Agent(评估环境) 包含一个参考求解器-评判器基线,以及一个Docker镜像。镜像中包含智能体可读的使用文档,方便任何LLM驱动的智能体一键接入。 src/solver_critic.pydocker/

仓库布局

. ├── data/ │ └── autolpbench/ │ └── v1.0/ 论文引用的发布版本(256个线性规划实例) │ ├── instances.jsonl │ ├── croissant.json │ ├── README.md │ └── LICENSE ├── src/ Auto生成器 + Agent求解器-评判器基线 │ ├── inverse_kkt.py 逆KKT线性规划构建 │ ├── nl_drafter.py 单次自然语言起草器 │ ├── solver_critic.py 打包的求解器-评判器基线(提案/审核/优化) │ ├── executor.py 线程安全的Python沙箱 │ ├── answer_parser.py FINAL_ANSWER正则表达式 + 相对误差检查 │ ├── config.py 提供者配置 │ └── llm.py OpenAI兼容和Anthropic原生调度 ├── skills/lp_optimization/ +skill模式加载的LP建模技能提示 ├── docker/ 智能体可运行的评估环境 │ ├── Dockerfile │ ├── run_eval.py 命令行接口:--generate / --mode / --print-manual │ ├── AGENTS.md 使用手册,位于 /workspace/AGENTS.md │ └── README.md ├── environment.yml conda环境配置 ├── requirements.txt 最小pip依赖 └── LICENSE

数据集详情

论文引用的发布版本为 v1.0,包含 256 个线性规划实例,在8个不同规模类别(从 s2x3 到 s40x40)中均匀分布,每个类别32个实例。数据位于 data/autolpbench/v1.0/ 目录下。

  • 数据文件格式instances.jsonl
  • 元数据文件croissant.json(采用 Croissant 1.1 标准,包含NeurIPS 2026数据集与基准测试赛道要求的AI责任字段)
  • 每个实例的详细模式:参见 data/autolpbench/v1.0/README.md

关键特性

  • 生成器模式:AutoLPBench 是一个生成器,下游评估者可以通过调用 src/inverse_kkt.py 或使用 Docker 的 --generate 标志,在任何规模和随机种子下生成新的批次,从结构上避免训练集泄露。
  • 许可证:MIT 许可证。
搜集汇总
数据集介绍
A2utoLPBench 数据集图片
构建方式
A2utoLPBench采用逆向KKT构造方法生成线性规划实例。首先随机采样一个可行点x与对偶变量λ,然后通过b=Ax和c=A⊤λ反向推导出原问题系数。该过程确保x是原问题的最优解且目标值ϕ=c⊤x由KKT定理直接确立,无需调用求解器或人工标注。随后利用大语言模型将数学形式转换为自然语言描述,并通过字符串匹配验证所有系数的保真度。
使用方法
A2utoLPBench提供即用型Docker环境,内置逆向KKT生成器、验证器、求解器及双智能体(求解-批评)运行时。用户可通过docker run命令一键启动评测,支持vanilla模式与A2utoLPBench模式。在后者中,求解智能体首先生成候选代码,批评智能体对其进行审计,若发现错误则执行至多K轮精炼迭代。此外,环境中的AGENTS.md文件以工具调用格式声明了问题获取、代码执行、答案验证和批量生成四个技能,支持任何具有工具调用能力的LLM智能体即插即用。
背景与挑战
背景概述
A2utoLPBench由香港中文大学的研究团队于2026年提出,旨在解决线性规划(LP)问题从自然语言文本到数学建模与求解的端到端评估难题。随着大语言模型(LLM)驱动的智能体在代码执行与工具调用方面取得显著进展,如何衡量其面对具体任务时的完整问题求解能力成为关键。线性规划作为运筹学中的经典问题族,要求智能体同时具备正确的数学建模、代码生成与数值精度,是检验LLM智能体能力的严格测试。现有LP文本基准如NL4OPT和MAMO均依赖人工编写与标注,成本高昂且规模受限,后者仅包含数百个问题。A2utoLPBench通过首创的逆向KKT条件构造方法,实现了LP问题的自动生成与理论可证明的正确答案,彻底摆脱了对人工标注和求解器的依赖,为LLM智能体评估提供了可无限扩展、抗数据泄露且难度可调的新范式。
当前挑战
该数据集所解决的领域问题是LP-from-text任务中端到端智能体评估的可靠性困境。传统基准面临四大结构性局限:一是人工编写与验证成本导致数据集规模固定且有限;二是公开数据集易泄漏至后续LLM训练语料中,使基准退化为记忆性测试;三是问题难度分布在发布时固化,无法随模型能力进化而调整;四是缺乏统一可用的智能体运行接口,评估需依赖人工或定制化代码。在构建过程中,团队面临的核心挑战是确保自动生成的LP问题具有数学上严格可证明的正确解答,从而消除对求解器精度漂移和人工标注错误的依赖。此外,如何将理论正确的代数LP问题转化为忠实且可读的自然语言描述,并设计出支持即插即用的智能体运行环境,也是实现真正动态、可重复评估的关键难点。
常用场景
经典使用场景
在运筹学与自然语言处理交叉领域中,A2utoLPBench被广泛用于评测大语言模型驱动的智能体在解决线性规划文字题时的端到端能力。该基准通过逆KKT条件自动生成任意规模、任意难度的线性规划实例,并配备即插即用的Docker评估环境,使得研究者能够精确衡量智能体从自然语言描述中提取数学公式、编写求解代码、执行并输出最优解的全流程表现。其参数化的难度调控机制支持从(2, 3)到(40, 40)八个维度层级,为探究模型复杂问题求解能力的边界提供了可重复、可扩展的标准化评测平台。
解决学术问题
A2utoLPBench从根本上解决了传统静态基准语料库的四大结构性缺陷:数据集规模受限于人工标注预算、题目泄露至训练数据导致评估失效、难度分布固化无法随模型能力演进、缺乏智能体可直接接入的标准化接口。通过将基准从固定语料库转变为可无限生成的程序化构造器,该工作实现了理论保证的真实答案、跨批次可复现的评分、以及对训练数据污染的结构性抵御。这一范式革新使得线性规划求解能力的评估从一次性的静态测量升维为可校准、可持续、抗泄露的精密科学仪器。
实际应用
在实际应用中,A2utoLPBench的Docker镜像封装了逆KKT生成器、求解器-批评家双智能体运行时、以及面向大语言模型智能体编写的AGENTS.md使用手册,下游用户仅需一条docker run命令即可完成基准部署与评分。这种自描述的工具调用接口使得任何支持函数调用的智能体都能即插即用地运行基准,无需编写额外胶水代码。在工业生产规划、资源优化分配、物流调度等需要端到端数学建模的实际场景中,该基准为评估和迭代求解智能体提供了可靠、低成本的标准化测试床。
数据集最近研究
最新研究方向
该数据集开创性地将线性规划(LP)基准测试从固定语料库范式转向可编程生成器范式,通过逆KKT条件自动构造具有数学可验证最优解的问题-答案对,彻底摆脱了对人工标注和外部求解器的依赖。前沿研究方向聚焦于利用大语言模型驱动的智能体实现端到端的LP求解能力评估,并通过内置的求解器-批评者双智能体协作框架显著提升求解成功率。这一设计有效应对了训练数据污染与难度分布僵化等长期困扰动态基准测试的难题,为可扩展、抗污染且难度可调控的智能体性能评估提供了全新范式。
相关研究论文
  • 1
    A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction香港中文大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务