遇见数据集

Active-SWE

收藏
github2026-08-06 更新2026-08-07 收录
官方服务:

资源简介:

Active-SWE 是一个面向主动式软件缺陷修复的评测基准。它要求编码智能体在没有实例级 Issue 报告的情况下,主动检查仓库快照与待审文件、发现潜在缺陷并完成修复。基准共包含 1,663 个任务,覆盖六类缺陷和八种编程语言。

Active-SWE is an evaluation benchmark for proactive software defect repair. It mandates coding AI Agents to proactively inspect repository snapshots and files under review, detect potential defects, and complete repairs without instance-level issue reports. The benchmark comprises 1,663 tasks, covering six categories of defects and eight programming languages.

创建时间:
2026-07-14
原始信息汇总

数据集概述

Active-SWE 是一个面向主动式软件缺陷修复(Proactive Bug Fixing)的评测基准,用于评估编码智能体(Coding Agents)在没有实例级 Issue 报告的情况下,主动检查仓库快照与待审文件、发现潜在缺陷并完成修复的能力。

核心特点

  • 评测任务:要求编码智能体主动检查仓库快照与待审文件,无需提供实例级 Issue 报告。
  • 任务规模:包含 1,663 个任务,覆盖六类缺陷和八种编程语言。
  • 评测阶段:采用三阶段评估协议:
    1. Recorded:生成代码补丁并评估记录的缺陷。
    2. Potential:生成测试并验证失败至通过(fail-to-pass)行为。
    3. Judge:验证连接潜在缺陷与测试的证据。

数据集构成

数据集名称 总任务数 简单任务数 困难任务数 用途
Active-SWE 400 300 100 精细策划的主基准
Active-SWE-Extend 1,663 1,411 252 扩展基准

使用与配置

  • 环境要求:Python 3.9 及以上、本地 Docker Engine、Claude Code(claudeclaude.exe)、Anthropic 兼容模型配置及凭证。
  • 安装方式:从项目根目录执行 python3 -m pip install .
  • 模型配置:使用 config/models.jsonconfig/.env 文件,API 密钥仅存放在 .env 文件中,不接受命令行直接传递。
  • 运行命令:通过 python -m activeswe.run_evaluation --model-config config/models.json 启动评测,也可使用 active-swe-eval 控制台命令。
  • 数据获取:控制器自动从 Active-SWE 数据集 下载默认的 Parquet 配置,并转换为 JSONL 格式。

评测指标

指标 含义
LR 记录的编辑中被预测编辑匹配的召回率
LP 预测编辑匹配到记录编辑的精确率
Resolved 预测补丁是否通过参考测试
Count 生成的测试数量
TV 每个生成的测试是否表现出失败至通过(F2P)行为
Revealed 每个被揭示的缺陷是否具有 Judge 验证的 F2P 证据

资源要求

任务镜像包含语言特定的构建工具,体积可能较大。评测前需提前拉取镜像,并提供充足的 Docker 存储、CPU 和内存。完整运行可能需要数小时,具体取决于模型延迟、测试时长和并发数。

其他信息

  • 引用:论文《Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports》(arXiv:2608.04682),作者:Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng。
  • 致谢:数据组织与评估设计借鉴了 SWE-bench 数据集SWE-bench 源代码
  • 许可协议:Apache-2.0 许可证。
搜集汇总
数据集介绍
Active-SWE 数据集图片
构建方式
Active-SWE基准的构建遵循严谨的流程,旨在模拟真实开发环境中编码智能体主动发现并修复缺陷的场景。其构建基于对多个开源仓库的快照与待审文件进行剖析,剔除了实例级Issue报告的辅助,要求智能体仅凭代码状态自主识别问题。数据集的构建分为三个核心阶段:第一阶段评估模型生成的补丁能否命中预先记录的缺陷;第二阶段要求模型生成测试用例,并通过失败转通过(F2P)行为验证其有效性;第三阶段则借助裁判模型,验证潜在缺陷与测试之间的关联证据,确保修复的合理性与完整性。最终,数据集中包含1,663个任务,涵盖六类缺陷与八种编程语言,并细分为400个精挑细选的主基准任务与1,263个扩展任务,分别标记为简单与困难级别,以全面考验编码智能体的主动修复能力。
特点
Active-SWE数据集的显著特征在于其开创性地聚焦于无Issue报告条件下的主动缺陷修复,这不同于传统基准依赖详细问题描述的模式。其任务设计深度模拟了代码审查场景,要求智能体对仓库快照与待审文件进行主动探查,从而实现从被动响应到主动发现的范式转换。数据集覆盖多语言、多缺陷类型,具备丰富的层次结构,包含主基准与扩展套件,并区分简单与困难任务粒度。评估体系采用三级流程,结合补丁匹配、测试生成及裁判验证,不仅考察修复结果,还强调过程证据的可靠性。此外,数据集的构建与评估严格实施网络隔离及历史操作限制,确保在受控环境中体现智能体真实能力,为编码智能体的主动性与鲁棒性研究提供了坚实的评测基石。
使用方法
使用Active-SWE数据集进行评测需遵循系统化的流程。首先,配置Python 3.9以上环境与Docker引擎,并依据项目文档准备Claude Code或Codex作为宿主编排工具,及相应的模型凭据。用户可通过复制配置文件(models.example.json与.env.example)快速初始化,仅需在.env中注入API密钥。随后,运行安装命令(python3 -m pip install .)并执行评估入口(如python -m activeswe.run_evaluation --model-config config/models.json),控制器将自动下载数据、拉取匹配的Docker镜像,并通过固定隧道的Unix套接字桥接实现网络隔离。评估期间,每个任务的输入与工件会存储于runs目录,其中metrics.json为权威指标文件。用户可自定义模型并发数、任务行数等参数,并遵循项目提供的技能文件(SKILL.md)指导,以完成从数据准备到结果解析的全流程操作。
背景与挑战
背景概述
Active-SWE 数据集由四川大学 XLearning-SCU 团队于 2026 年构建,旨在评估编码智能体在缺乏实例级 Issue 报告的情况下主动发现并修复软件缺陷的能力。该基准包含 1,663 个任务,覆盖六类缺陷和八种编程语言,并引入三阶段评估协议(Recorded、Potential、Judge),以更贴近真实开发场景。其设计借鉴了 SWE-bench 的组织与评估方法,但突破了传统基准依赖显式问题报告的局限,推动了主动式缺陷修复领域的研究,为评估编码智能体的自主性提供了新范式。
当前挑战
Active-SWE 面临的挑战主要体现在两方面:其一,主动式缺陷修复要求模型在无明确问题指引时,从仓库快照和待审文件中自主定位潜在缺陷,这远难于传统的基于 Issue 的修复任务,对模型的代码理解与推理能力提出更高要求;其二,构建过程中需确保多语言、多缺陷类型的任务覆盖均匀,同时设计严谨的验证流程(如 F2P 测试、证据链判断)以保证评估的公平性与可信度,此外还需处理复杂的环境隔离与资源管理,任务容器需在无网络环境下运行,并依赖静态桥接实现模型通信,增加了技术实现的复杂度。
常用场景
经典使用场景
Active-SWE数据集的核心使用场景在于评估编码智能体在缺乏显式Issue报告情境下的主动缺陷修复能力。研究者利用该基准要求智能体直接审查仓库快照与待审文件,自主识别潜在缺陷并生成修复补丁。其评测协议涵盖记录补丁生成、潜在测试生成及证据验证三个阶段,能够全面衡量智能体在‘潜在缺陷’与‘测试’间建立因果关联的水平。这一场景聚焦于从被动响应到主动排查的范式转变,为开发更贴近真实软件维护流程的自动化编程代理提供了标准化测试床。
解决学术问题
该数据集解决了当前编码智能体评测过度依赖人工标注Issue报告、无法反映真实开发中主动发现缺陷需求的学术难题。传统基准如SWE-bench基于显式问题描述评估修复能力,而Active-SWE通过构建1,663个跨六类缺陷、八种编程语言的任务,将研究焦点从‘按图索骥’转向‘主动寻踪’。其意义在于填补了主动式缺陷修复量化评估的空白,推动了从反应式代码生成到预防性代码维护的研究范式转型,并为探索智能体在模糊指令下的决策机制提供了大规模、可复现的实验基础。
衍生相关工作
Active-SWE的提出激发了多项衍生研究,首要方向是改进编码智能体的主动探索策略,例如设计基于代码语义的缺陷线索挖掘算法,或强化智能体的仓库级上下文建模能力。其次,围绕其评测协议衍生出若干工作,如优化潜在测试生成器的有效性,以及开发用于验证补丁与缺陷因果关联的自动判据。此外,该数据集的三阶段评估机制被借鉴至其他软件工程任务,如重构建议生成、依赖迁移自动化等。其开源生态和与SWE-bench的谱系关联,也促进了跨基准迁移学习与联合训练的研究探索,形成了主动式软件维护领域的持续创新链条。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务