SWE-EVO
收藏资源简介:
SWE-EVO是一个基准测试,旨在评估AI编码代理在自主软件进化任务中的表现。它模拟了现实场景,要求代理根据高级软件需求规范(SRS)迭代进化复杂代码库。该基准测试利用真实Python开源项目(如Django和NumPy)的版本历史,挑战代理解释高级SRS、规划和实施多步变更、导航包含数千个文件的大型仓库以及跨多个版本生成正确变更的能力。SWE-EVO的关键特点包括真实任务、多步评估、模块化支架支持、公共数据集和基准测试重点。
SWE-EVO is a benchmark designed to evaluate the performance of AI coding agents in autonomous software evolution tasks. It simulates real-world scenarios, requiring agents to iteratively evolve complex codebases based on high-level Software Requirements Specifications (SRS). This benchmark leverages the version history of real-world Python open-source projects such as Django and NumPy, testing agents' abilities to interpret high-level SRS, plan and implement multi-step changes, navigate large repositories containing thousands of files, and generate correct changes across multiple versions. The key features of SWE-EVO include realistic task scenarios, multi-step evaluation, modular scaffolding support, a public dataset, and a focused benchmark orientation.
SWE-EVO 数据集概述
数据集简介
SWE-EVO 是一个用于评估人工智能编码代理在自主软件演化任务中表现的基准测试。它模拟了现实场景,要求代理根据高级软件需求规格说明(SRS)迭代地演化复杂的代码库。
核心特点
- 真实任务:源自真实Python开源项目(如Django和NumPy)的版本历史,强调随时间的变化。
- 多步骤评估:代理必须跨版本规划、更新和验证更改。
- 模块化框架支持:目前支持通过 OpenHands 和 SWE-agent 两种框架进行评估。
- 公共数据集:包含精选的实例和用于可重复评估的工具。
- 基准测试重点:针对人工智能系统的长程推理和迭代演化挑战。
关键信息
- 研究问题:给定现有代码库和不断变化的需求,人工智能代理能否在长期交互中自主执行持续的规划、适应和演化?
- 论文:SWE-EVO: A Frontier Benchmark for Coding Agents in Autonomous Software Evolution
- 基础工作:本数据集基于原始的 SWE-bench 基准测试构建。
技术信息
- 编程语言:Python (>=3.10)
- 许可证:MIT License




