SWE-Compass
收藏资源简介:
SWECompass建立了一个高覆盖、多维度和生产对齐的评估框架:覆盖8种软件工程任务类型、8种编程场景和10种编程语言;包含2000个来自真实GitHub pull请求的高质量实例;支持跨任务类型、语言和场景的多维性能比较。通过将异构代码任务与真实工程实践相结合,SWECompass为诊断和改善大型语言模型的软件工程能力提供了一个可重复、严格且面向生产的基准。
SWECompass establishes a high-coverage, multi-dimensional, production-aligned evaluation framework: it covers 8 types of software engineering tasks, 8 programming scenarios, and 10 programming languages; it contains 2,000 high-quality instances sourced from real GitHub pull requests; it supports multi-dimensional performance comparisons across task types, programming languages, and scenarios. By combining heterogeneous code tasks with real-world engineering practices, SWECompass provides a reproducible, rigorous, production-oriented benchmark for diagnosing and improving the software engineering capabilities of large language models (LLMs).
SWE-Compass 数据集概述
数据集简介
SWE-Compass 是一个用于评估大语言模型软件工程代理能力的统一评估框架。它旨在解决当前评估中任务类别狭窄、偏向Python语言以及与真实开发流程脱节的问题。
核心特性
- 高覆盖性:涵盖8种软件工程任务类型、8种编程场景和10种编程语言。
- 真实数据源:包含2000个从真实GitHub拉取请求中获取的高质量实例。
- 多维度评估:支持跨任务类型、编程语言和场景的多维度性能比较。
- 生产环境对齐:通过集成异构代码任务与真实工程实践,提供一个可复现、严谨且面向生产的基准。
技术特征
- 基于Docker的自动化评估环境。
- 支持多项目、多任务、多语言。
- 支持模型生成补丁的执行与评估。
- 提供多维度性能指标。
- 可选集成LLM评判器用于代码理解任务。
- 高度可复现,专为研究和生产应用设计。
数据集获取与使用
数据集可通过Hugging Face平台获取:https://huggingface.co/datasets/Kwaipilot/SWE-Compass
评估流程
- 环境设置:安装Docker、Python 3.11及项目依赖。
- 数据准备:下载所需的Docker镜像和补充数据。
- 预测数据准备:准备包含
instance_id、模型补丁及元数据的JSON文件。 - 运行评估:使用提供的脚本和参数执行评估。
- 结果输出:评估结果将输出至指定目录,包含原始数据和聚合分数。
许可证
数据集采用Apache 2.0许可证。
相关论文
- 标题:SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
- 预印本:arXiv:2511.05459
- 引用格式:参见README文件中的BibTeX条目。
贡献与联系
欢迎来自自然语言处理、机器学习和软件工程研究社区的贡献。可通过提交问题或拉取请求来扩展、评估或改进该基准。
主要联系人:
- Xujingxuan — xujingxuan2002@163.com
- Ken Deng — dengken@kuaishou.com
- Jiaheng Liu — liujiaheng@nju.edu.cn




