BeyondSWE
收藏资源简介:
BeyondSWE 是一个全面的基准测试数据集,旨在评估代码代理在解决软件工程问题时的能力,特别是在超越单仓库错误修复的真实世界复杂场景中。数据集包含 500 个真实世界实例,覆盖 246 个 GitHub 仓库,涵盖四种不同的任务设置:跨仓库问题修复(CrossRepo)、特定领域错误修复(DomainFix)、依赖迁移(DepMigrate)和从自然语言规范构建完整仓库(Doc2Repo)。每个实例以 JSON 格式存储,包含实例 ID、任务类别、仓库信息、编程语言、工作目录、Docker 镜像 URL、提交哈希、问题描述、修复补丁等详细字段。数据集平均每个实例涉及 5.6 个文件和 209.9 行代码,比 SWE-bench Verified 复杂 18 倍。BeyondSWE 适用于评估代码代理在复杂软件工程任务中的表现,特别是在需要跨仓库、跨领域或深度研究能力的场景中。
BeyondSWE is a comprehensive benchmark dataset designed to evaluate the capabilities of code agents when solving software engineering problems, particularly in real-world complex scenarios that go beyond single-repository bug fixing. The dataset contains 500 real-world instances spanning 246 GitHub repositories, covering four distinct task settings: CrossRepo (cross-repository bug fixing), DomainFix (domain-specific bug fixing), DepMigrate (dependency migration), and Doc2Repo (building a complete repository from natural language specifications). Each instance is stored in JSON format, with detailed fields including instance ID, task category, repository information, programming language, working directory, Docker image URL, commit hash, problem description, fix patch and other relevant details. On average, each instance involves 5.6 files and 209.9 lines of code, which is 18 times more complex than SWE-bench Verified. BeyondSWE is suitable for evaluating the performance of code agents on complex software engineering tasks, especially in scenarios requiring cross-repository, cross-domain or in-depth research capabilities.
BeyondSWE 数据集概述
数据集基本信息
- 数据集名称: BeyondSWE
- 发布者: AweAI-Team
- 许可协议: CC BY 4.0
- 语言: 英语
- 数据规模: 小于1K条实例
- 主页: https://github.com/AweAI-Team/BeyondSWE
- Hugging Face地址: https://huggingface.co/datasets/AweAI-Team/BeyondSWE
- 项目网站: https://aweai-team.github.io/BeyondSWE/
数据集简介
BeyondSWE是一个全面的基准测试,旨在从解决范围和知识范围两个关键维度评估代码智能体,其目标是将评估场景从单一代码库的错误修复扩展到现实世界中更复杂的软件工程任务。
核心亮点
- 包含500个真实世界实例,覆盖246个GitHub仓库,涵盖四种不同的任务设置。
- 采用二维评估框架:同时扩展解决范围(从局部到全局)和知识范围(从仓库内到跨仓库/领域/网络)。
- 平均每个实例涉及5.6个文件和209.9行代码,复杂度是SWE-bench Verified的18倍。
- 引入SearchSWE框架:首个用于评估深度编码研究的标准化基准,并包含严格的防作弊机制。
- 关键发现:前沿模型在BeyondSWE上的性能上限低于45%,而在SWE-bench Verified上可达80%以上。
任务设置概览
数据集涵盖四种任务设置,覆盖现实世界软件工程挑战的全谱系:
| 任务 | 解决范围 | 知识范围 | 仓库数 | 实例数 | 描述 |
|---|---|---|---|---|---|
| CrossRepo | 局部函数 | 跨仓库 | 67 | 200 | 修复需要参考外部仓库、Stack Overflow和上游库的问题 |
| DomainFix | 局部函数 | 领域特定 | 12 | 72 | 解决需要专业知识的特定科学领域(量子物理、生物信息学等)的错误 |
| DepMigrate | 全局仓库 | 官方文档 | 120 | 178 | 执行由破坏性依赖升级(如NumPy 1.x → 2.0)触发的全代码库迁移 |
| Doc2Repo | 全局仓库 | 人类规范 | 50 | 50 | 根据自然语言规范构建完整的功能性仓库 |
数据格式
每个实例是一个JSON对象,包含以下字段:
| 字段 | 描述 |
|---|---|
instance_id |
唯一标识符,格式为{user}_{repo}_pr{id} |
dataset_id |
数据集分割标识符(如BeyondSWE) |
task |
任务类别(如CrossRepo),指示所需的推理范围 |
user |
GitHub仓库的所有者(组织或个人) |
repo |
包含错误的GitHub仓库名称 |
language |
仓库的主要编程语言(当前为Python) |
workdir |
Docker容器内开始执行的工作目录 |
image_url |
用于复现仓库环境的Docker镜像标签 |
parent_commit |
表示错误基础状态的提交哈希 |
commit_id |
真实修复(对应拉取请求)的提交哈希 |
patch |
解决问题的真实修复补丁(Golden Patch) |
problem_statement |
提供给智能体的问题描述,描述错误或所需的行为变更 |
f2p_patch |
开发人员在修复前编写的引入失败测试的测试补丁(如果可用) |
f2p_script |
由评估管道生成的用于触发失败的复现脚本 |
FAIL_TO_PASS |
在错误版本上失败、应用修复后通过的单元测试列表 |
PASS_TO_PASS |
在修复前后都通过的回归测试列表 |
github |
原始GitHub仓库的URL |
pre_commands |
容器启动时执行的Shell命令,用于将仓库恢复到正确的错误状态 |
关键研究发现
- 45%的性能上限:即使是最前沿的模型(Gemini 3 Pro, GPT-5.2, DeepSeek-V3.2等)在BeyondSWE上的总体性能也无法超过45%,而在SWE-bench Verified上可达80%以上。
- 没有单一优胜者:不同模型在不同任务上领先——Seed-Coder在CrossRepo上领先(44.72%),DeepSeek-V3.2在Doc2Repo上领先(54.99%),Gemini 3 Pro在DepMigrate上领先(41.81%)——这表明四种任务测试的是根本不同的能力。
- 搜索有帮助,但整合仍是开放问题:9个模型中有6个在使用SearchSWE后性能提升,其中Gemini 3 Pro在DomainFix上提升了+7.5%。然而,提升并不一致——搜索和编码已独立成熟,但它们的有效融合仍是一个未解决的挑战。
- 质量优于数量:Gemini 3 Pro每个实例仅搜索0.8–1.1次,却实现了最佳的整体增益(+2.0%),而DeepSeek-V3.2搜索4.2–5.4次,却显示出轻微下降(-0.2%)。
数据获取与使用
- 数据下载:可通过Hugging Face Hub下载。
- 评估框架:使用SearchSWE(BeyondSWE的官方评估框架),完整评估流程请参考AweAgent。
引用
如果研究中使用BeyondSWE,请引用相关论文。



