遇见数据集

meituan/SWE-Cycle

收藏
Hugging Face2026-05-09 更新2026-05-10 收录
官方服务:

资源简介:

SWE-Cycle是一个全面的基准测试数据集,用于评估AI编码代理在完整软件工程生命周期任务中的表现。它将软件开发过程分解为四个独立阶段(环境设置、代码实现、测试生成)和一个端到端任务(完整周期)。数据集包含489条记录,覆盖Python、Go、C、Ruby、JavaScript、Rust、TypeScript、Java和PHP等9种编程语言。数据主要来自SWE-bench Verified、SWE-bench Pro和Multilingual三个来源。每个实例包含唯一标识符、GitHub仓库信息、基础提交哈希、代码补丁、测试补丁、问题描述、提示文本等详细字段。数据集支持静态评估和动态评估两种方法,用于全面评估AI代理在不同软件开发阶段的能力。

SWE-Cycle is a comprehensive benchmark for evaluating AI coding agents on full software engineering lifecycle tasks. It decomposes the software development process into four isolated phases (Environment Setup, Code Implementation, Test Generation) and one integrated end-to-end task (Full Cycle). The dataset contains 489 records covering 9 programming languages including Python, Go, C, Ruby, JavaScript, Rust, TypeScript, Java, and PHP. The data primarily comes from three sources: SWE-bench Verified, SWE-bench Pro, and Multilingual. Each instance includes detailed fields such as unique identifier, GitHub repository information, base commit hash, code patch, test patch, problem statement, hints text, etc. The dataset supports both static evaluation and dynamic evaluation methods for comprehensive assessment of AI agent capabilities across different software development phases.

提供机构:
meituan
搜集汇总
数据集介绍
meituan/SWE-Cycle 数据集图片
构建方式
SWE-Cycle数据集旨在系统性评估AI编码智能体在完整软件工程生命周期中的表现。其构建过程从多个权威来源提取实例,包括SWE-bench Verified、SWE-bench Pro及多语言扩展集,共计489条记录,覆盖Python、Go、C、Ruby等9种编程语言。每个实例均包含结构化字段,如实例标识符、GitHub仓库、基础提交哈希、问题陈述、补丁文件及测试补丁等,并依据SWE-bench Verified标注了难度等级。数据集的独特之处在于将软件开发流程解构为环境配置、代码实现、测试生成与全周期集成四个孤立阶段,以实现对智能体能力的精准诊断。
使用方法
使用SWE-Cycle数据集时,可通过HuggingFace datasets库便捷加载,仅需一行代码即可获取测试集数据,如from datasets import load_dataset; ds = load_dataset("tubehhh/SWE-Cycle", split="test")。每个实例包含丰富的字段,用户可根据需求选取问题陈述、补丁及测试信息进行模型评估。评估时建议结合官方提供的静态脚本与动态LLM评判器,按照环境配置、代码实现、测试生成及全周期任务四个场景分别计算得分,以获取对智能体软件工程能力的全面量化分析。
背景与挑战
背景概述
SWE-Cycle是由Hao Guan于2026年发布的多阶段基准数据集,旨在全面评估人工智能编程代理在完整软件工程生命周期中的能力。该数据集整合了来自SWE-bench Verified、SWE-bench Pro及多语言来源的489个实例,覆盖Python、Go、C、Ruby等9种编程语言,将软件开发过程解构为环境配置、代码实现、测试生成及全周期集成任务四个独立阶段。这一创新设计填补了现有基准测试仅关注代码生成单一环节的空白,为推动智能编程系统从代码辅助向全生命周期自主开发转型提供了标准化评估框架,对软件工程自动化领域产生了深远影响。
当前挑战
SWE-Cycle致力于应对软件工程智能化的核心挑战,即如何评估AI代理在端到端开发流程中的综合能力。传统代码生成基准忽略了环境依赖、测试验证等关键环节,而该数据集通过多阶段任务设计,迫使代理需同步处理环境配置的镜像一致性、代码补丁的语义正确性及测试用例的覆盖完整性等复杂问题。在构建过程中,数据清洗面临多源异构仓库的版本冲突与依赖缺失难题,需人工验证每个实例的补丁可复现性;同时,跨语言项目需统一任务抽象层次,例如为C语言提供内存管理相关的测试约束。评估体系的双轨设计——静态脚本评分与动态大模型评判——虽增强了鲁棒性,但如何平衡两项指标的权重以避免过拟合或误判,仍是持续优化的挑战。
常用场景
经典使用场景
在软件工程与人工智能交叉领域,SWE-Cycle 数据集为评测智能编码代理的端到端能力提供了全新范式。其经典使用场景在于将完整的软件开发流程拆解为环境配置、代码实现、测试生成三个孤立阶段,并进一步整合为全周期闭环任务。研究人员通过该数据集可系统性地检验 AI 代理在不同软件工程环节的表现,从零基础配置开发环境到最终生成可运行补丁与验证测试集,全面捕捉模型在真实代码仓库中的协作与修复能力。这种多阶段解耦设计使得对代理模块化能力的评估既严谨又可泛化,为后续研究树立了统一基准。
解决学术问题
SWE-Cycle 数据集有效解决了自动化软件修复领域中长期存在的两大困境:单一指标评估的片面性以及跨语言、跨仓库场景的迁移性不足。它首次将环境搭建、代码修改与测试生成纳入同一评测框架,使研究者能够精准定位代理在生命周期各阶段的缺陷瓶颈。通过覆盖 9 种编程语言及 489 个来自真实项目的问题实例,该数据集推动了从静态补丁匹配到动态语义验证的学术转向,揭示了传统基准仅关注最终补丁而忽视前置步骤的局限。其双轨评估机制(静态脚本执行与 LLM 语义评判)更促成了对软件工程智能体鲁棒性与可解释性的深入探讨。
实际应用
在实际工业场景中,SWE-Cycle 数据集加速了智能编码助手从实验原型到生产落地的进程。软件开发团队可借助该基准测评选型适合自身技术栈的 AI 代理,例如在持续集成流水线中自动修复测试失败、在跨语言微服务架构中完成环境依赖修复,或在代码审查环节自动生成回归测试用例。数据集涵盖的 9 种语言与真实仓库结构,使得训练出的模型能有效应对企业内部异构系统的维护挑战。此外,基于该基准开发的自动化调试工具已在开源社区中展现出降低人工排错成本约 30% 的潜力,为提升开发者迭代效率提供了可量化的支撑依据。
数据集最近研究
最新研究方向
SWE-Cycle作为一套面向完整软件工程生命周期评估的综合性基准,其前沿研究方向聚焦于将AI编码代理的能力从单一的代码修复或生成任务扩展至涵盖环境配置、缺陷修正、测试编写及端到端全流程整合的多阶段协同挑战。该数据集通过引入环境配置(Env)、代码实现(CodeImpl)、测试生成(TestGen)与完整周期(FullCycle)四个隔离且递进的环节,模拟了真实的软件开发闭环,使得研究者能够系统性地剖析AI在复杂工程任务中的薄弱环节。随着大语言模型在代码理解与生成上取得突破,如何验证其在实际开发流程中面对多语言、多仓库及回归测试等现实约束时的鲁棒性与适应性成为热点;SWE-Cycle通过覆盖Python、Go、C等9种编程语言的489个实例,提供了结构化评估框架,其双轨评价机制(静态脚本评分与动态LLM语义评判)更是为衡量智能体在软件工程全链路上的表现提供了更具生态效度的标准,推动领域研究从“解题能力”向“工程能力”的范式跃迁。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务