FrontierSWE v2
收藏官方服务:
资源简介:
FrontierSWE v2是一个包含34个任务的基准测试,旨在测试前沿软件工程技能的编码代理。
FrontierSWE v2 is a benchmark consisting of 34 tasks, designed to evaluate coding AI Agents' state-of-the-art software engineering skills.
创建时间:
2026-09-03
原始信息汇总
FrontierSWE v2 数据集概述
基本信息
- 数据集地址:https://github.com/Proximal-Labs/frontier-swe-v2
- 数据集性质:一个包含 34 个任务的软件工程编码智能体基准测试集,旨在评估编码智能体在软件工程前沿领域的能力。
- 任务环境:每个任务为智能体提供 20 小时预算、完整的 Linux 环境(常含 GPU)以及来自真实世界领域的问题。
- 评分方式:每个任务配备确定性、自动化的验证器,智能体仅根据其代码是否可运行进行评分,不考虑风格或中间步骤。
任务分类
任务分为五大类别:
- Implementation (实现)
- Scientific Computing (科学计算)
- Performance Optimisation (性能优化)
- Visual Reasoning (视觉推理)
- AI Research (AI 研究)
具体任务列表(34 项)
| 编号 | 任务名称 | 类别 |
|---|---|---|
| 01 | Astronomy Toolkit | 视觉推理、实现 |
| 02 | Cranelift Codegen Optimization | 性能优化 |
| 03 | Crash-Proof Flash Filesystem | 实现 |
| 04 | Dart Style in Haskell | 实现 |
| 05 | FFmpeg libswscale Optimization | 性能优化 |
| 06 | Fitness-Recap Video in Remotion | 视觉推理、实现 |
| 07 | Flight-Sim Renderer in OpenGL | 视觉推理、实现 |
| 08 | FrogsGame Post-Training | AI 研究 |
| 09 | Git to Zig | 实现 |
| 10 | Granite Mamba2 Inference Optimization | AI 研究 |
| 11 | Higgs Uncertainty Inference | 科学计算 |
| 12 | Kolmogorov Audio Compression | 性能优化 |
| 13 | Lean 4 Kernel Type Checker in Pascal | 实现 |
| 14 | libexpat Optimization | 性能优化 |
| 15 | Lua Native Compiler | 实现 |
| 16 | Machine-Learned Interatomic Potential | 科学计算 |
| 17 | Medium-Range Weather Forecast | 科学计算 |
| 18 | MEG Speech Decoding | 科学计算 |
| 19 | MS/MS De Novo Generation | 科学计算 |
| 20 | Multi-GPU Efficient Finetuning | AI 研究 |
| 21 | Notebook Compression | 性能优化 |
| 22 | Optimizer Design | AI 研究 |
| 23 | PostgreSQL 18 on SQLite | 实现 |
| 24 | Quantum ESPRESSO pw.x in Rust | 科学计算、实现 |
| 25 | Qubit Routing | 性能优化 |
| 26 | Reconnaissance Blind Chess Recovery | AI 研究 |
| 27 | SGLang Inference System Optimization | AI 研究 |
| 28 | Snooker Prediction | 视觉推理、AI 研究 |
| 29 | SPICE Circuit Simulator in Rust | 实现 |
| 30 | Stepper Music Sequencer GBA | 视觉推理、实现 |
| 31 | Synthetic Music Diarization | AI 研究 |
| 32 | Verilog Simulator in Swift | 实现 |
| 33 | Vision-only TORCS Racing Bot | 视觉推理、AI 研究 |
| 34 | Wan 2.1 on MAX/Mojo | 实现 |
任务内容与运行方式
- 任务目录结构:每个任务目录包含以下文件:
instruction.md— 提供给智能体的任务提示task.toml— 任务配置(超时、资源、评分阈值)environment/— Dockerfile、安装脚本、测试框架及初始工作区solution/solve.sh— 参考解答preflight/preflight_checks.sh— 环境验证检查
- 运行方式:
- 使用
px-eval(即将发布)作为 Harbor 任务的调度工具 - 也可通过各任务目录下的
environment/Dockerfile独立构建 Docker 镜像运行
- 使用
其他信息
- 网站:https://www.frontierswe.com
- 博客:https://www.frontierswe.com/blog/v2
- V1 基准测试:https://github.com/Proximal-Labs/frontier-swe
- 评估框架:使用 Proximus 框架评估所有模型,该框架带有提交工具,专为超长时域任务设计,未来将合入 Harbor 主仓库
- 许可:任务内容和测试框架供评估使用,各任务目录注明上游项目和数据集来源
- 引用:提供 BibTeX 格式的引用条目(见 README 原文)
搜集汇总
数据集介绍

构建方式
FrontierSWE v2 是一个前沿软件工程基准测试集,包含34个任务,旨在挑战编码代理在尖端软件开发中的能力。每个任务为代理提供20小时的预算、完整的Linux环境(常配备GPU),问题源自现实领域,如重写编译器、优化代码生成后端、从像素训练强化学习策略及解决量子化学问题。任务被分为五类:实现、科学计算、性能优化、视觉推理和AI研究。每个任务均配有确定的自动化验证器,代理仅根据代码是否正常工作来评分,而非风格或中间步骤。
特点
该数据集的特点在于任务的高度复杂性和多样性,覆盖从底层系统软件到前沿AI研究的广泛范围。每个任务都提供完整的规范和环境定义,包括指令、配置、Dockerfile、测试框架和初始工作空间。任务设计强调长期自主性,要求代理在长时间跨度内进行深度工作,模拟真实工程场景。此外,每个任务都有参考解决方案(oracle)和预检脚本,确保评估的可重复性和公平性。
使用方法
FrontierSWE v2 任务基于 Harbor 框架,使用 px-eval 进行编排。每个任务目录包含 instruction.md(代理提示)、task.toml(配置)、environment/(Dockerfile 等)、solution/solve.sh(参考答案)和 preflight/ 脚本。用户可通过独立 Docker 构建运行:进入环境目录后执行 docker build 和 docker run。全面运行的 px-eval 工具即将发布,当前可本地从 Dockerfile 构建镜像。任务内容与评分可能更新,建议关注官方仓库动态。
背景与挑战
背景概述
FrontierSWE v2是由Proximal-Labs团队于2026年发布的基准测试集,旨在评估编码智能体在软件工程前沿领域的技能极限。该基准包含34个从现实世界提炼的任务,覆盖编译器重实现、代码生成后端优化、强化学习策略训练、量子化学计算等多元化领域,并细分为实现、科学计算、性能优化、视觉推理和AI研究五大类别。每个任务提供20小时预算、完整Linux环境(常含GPU),并配备确定性自动化验证器,以代码功能而非风格或过程作为评分依据。FrontierSWE v2的推出填补了现有编码基准在任务复杂度和领域广度上的空白,为衡量编码智能体的极限能力提供了高难度、高真实性的测试平台,其对推动AI驱动软件工程研究的前沿探索具有深远意义。
当前挑战
FrontierSWE v2所面临的挑战是多维度的。在领域层面,任务设计的核心难题在于如何将真实世界的复杂工程问题(如重编译编译器、优化推理系统)转化为可自动化验证的基准,同时保持任务的确定性和评分公正性,这要求任务在保持挑战性的同时具备清晰的通过标准。在构建过程中,挑战尤为艰巨:需为每项任务定制包含GPU在内的异构环境,并确保其可移植性与可复现性;需设计高效的验证器以准确判定长周期(20小时)任务的成功与否;还需解决跨领域任务(如视觉推理与AI研究结合)中指令模糊性带来的评估偏差。此外,公开Docker镜像及运行器尚未发布,工作进展中的任务内容与评分标准可能更新,为一致性评估带来不确定性。这些挑战共同构成了FrontierSWE v2作为前沿基准的独特难题。
常用场景
经典使用场景
FrontierSWE v2 作为评估编码代理在极端复杂软件工程任务中能力的基准,其经典使用场景是给予代理长达20小时的预算、完整的Linux环境(常含GPU),要求其解决现实世界中的高难度问题,如重新实现编译器、优化代码生成后端、从像素训练强化学习策略或处理量子化学计算。该基准通过确定性自动验证器对代理生成的代码进行功能评估,而非基于风格或中间步骤,从而严格检验代理在长时程、高自主性任务中的实际编码能力。
衍生相关工作
FrontierSWE v2 衍生的工作包括对长时程代理(如Proximus框架)的评估与改进,以及将Harbor任务编排系统融入主流工具链的实践。其任务分类(如AI研究、科学计算)启发了针对特定领域代理能力的专项研究,如代码生成优化、多模态推理集成等。此外,该基准的公开任务与验证方法可能催生新基准的构建,促进自主代理在科研自动化、复杂系统重构等方向的研究,并推动开源社区开发更鲁棒的代理训练与测试平台。
数据集最近研究
最新研究方向
FrontierSWE v2基准聚焦于软件工程前沿的编码智能体评估,其研究方向突破了传统代码生成任务的局限,转向涵盖编译器重写、科学计算、性能优化、视觉推理及AI研究等多维度的真实世界复杂工程挑战。该基准赋予智能体长达20小时的运行预算与完整Linux环境(含GPU支持),强调端到端的功能验证而非代码风格,推动了编码智能体从短时程简单任务向超长时程、多步骤、跨领域问题求解能力的跃迁。围绕该基准的前沿研究热点包括:探索智能体在超长任务中的持续规划与自我修正策略,评估其在高性能计算、量子化学、机器学习系统等尖端领域的实际应用能力,以及通过多任务类别(如将视觉推理与工程实现结合的混合任务)考察模型的跨模态知识迁移与综合问题解决素养。FrontierSWE v2的发布不仅为衡量通用人工智能在软件工程领域的潜力提供了严苛的试金石,也引领了智能体基准向更高难度、更贴近真实产业需求的方向演进,其影响波及自动程序修复、代码优化、科学计算自动化及AI辅助研发等多个变革性领域。
以上内容由遇见数据集搜集并总结生成



