SWE-Gym/SWE-gym
收藏官方服务:
资源简介:
SWE-Gym数据集包含2438个实例,这些实例来源于11个Python仓库,遵循SWE-Bench数据收集流程。数据集的特征包括实例ID、提示文本、补丁、测试补丁、创建时间、问题陈述、仓库、基础提交、版本、通过到通过的序列和失败到通过的序列。数据集仅包含一个训练集分割,共有2438个例子,总大小为213621640字节。
SWE-Gym contains 2438 instances sourced from 11 Python repos, following SWE-Bench data collection procedure. The dataset features include instance ID, hints text, patch, test patch, created at, problem statement, repo, base commit, version, PASS_TO_PASS sequence, and FAIL_TO_PASS sequence. The dataset includes only a training split with 2438 examples, totaling 213621640 bytes.
提供机构:
SWE-Gym搜集汇总
数据集介绍
构建方式
SWE-Gym数据集遵循SWE-Bench的数据收集流程,从11个广受欢迎的Python开源仓库中精心筛选出2438个实例。每个实例均包含独特的实例标识符、问题陈述、提示文本、补丁及测试补丁等核心信息,并记录了仓库名称、基础提交哈希与版本号等元数据。数据集的构建注重实例的多样性与代表性,旨在覆盖真实软件工程环境中常见的缺陷修复场景。
特点
该数据集最显著的特征在于其丰富的结构化信息:每个实例不仅提供原始问题描述与修复补丁,还包含了FAIL_TO_PASS与PASS_TO_PASS两类测试用例序列,这使得模型训练能够同时关注修复正确性与回归安全性。此外,数据集以训练集形式统一发布,包含超过2.1亿字节的高质量数据,并采用MIT开源许可,便于学术界与工业界广泛使用与再分发。
使用方法
使用者可通过HuggingFace Datasets库直接加载SWE-Gym数据集,默认配置下将获取包含2438个训练样本的完整集合。每个样本的字段可直接映射为模型输入,其中problem_statement与hints_text可用于构造问题描述,patch与test_patch则作为目标输出用于监督学习。数据集特别适合用于训练基于大语言模型的代码修复智能体,研究者可结合项目主页提供的工具链快速开展实验与评估。
背景与挑战
背景概述
在软件工程领域,自动化漏洞修复与代码维护一直是研究的热点与难点。SWE-Gym数据集由相关研究团队于近期创建,旨在为基于大语言模型的软件工程任务提供标准化的训练与评估基准。该数据集从11个流行的Python代码仓库中精心采集了2438个实例,每个实例包含问题描述、补丁、测试用例及版本信息等关键字段,严格遵循SWE-Bench的数据收集流程。其核心研究问题聚焦于如何利用机器学习模型自动理解和修复真实世界中的软件缺陷,从而提升开发效率与代码质量。作为该领域的标杆性资源,SWE-Gym为后续研究提供了可复现的实验基础,推动了自动化软件修复技术的快速发展。
当前挑战
SWE-Gym所解决的领域问题在于,现有数据集多聚焦于图像分类或自然语言处理,而针对软件工程中代码级缺陷修复的标准化、大规模数据集相对匮乏,导致模型在真实仓库环境下的泛化能力受限。构建过程中,挑战尤为显著:首先,从开源仓库中筛选出具有明确问题描述、正确补丁及完整测试用例的实例,需要耗费大量人工审核与自动化脚本相结合的工作;其次,确保不同仓库、不同版本间的数据一致性,避免因代码风格或测试框架差异引入噪声;最后,如何平衡实例的多样性(覆盖多种缺陷类型)与数据集的规模,也是设计时需权衡的难题。
常用场景
经典使用场景
在软件工程与人工智能交叉领域,SWE-Gym数据集被广泛用于训练和评估自动化代码修复模型。该数据集汇集了来自11个Python开源仓库的2438个真实缺陷修复实例,每个实例包含问题描述、补丁代码、测试用例及版本信息,为研究者提供了标准化的实验基准。其经典使用场景聚焦于基于大语言模型的软件缺陷自动修复任务,通过给定问题陈述与代码上下文,模型需生成正确的补丁以通过原本失败的测试用例,从而推动代码智能修复技术的可复现性研究。
衍生相关工作
SWE-Gym数据集催生了多项开创性研究,包括基于检索增强生成的多轮代码修复框架、结合静态分析的补丁验证方法以及强化学习驱动的修复策略优化。其标注格式与评估协议被后续工作如RepoFixer、CodeAgent等项目采纳为基准,推动了面向复杂仓库结构的上下文感知修复模型发展。此外,该数据集的版本控制元数据还启发了时序敏感的缺陷定位研究,使模型能利用提交历史信息提升修复准确率。
数据集最近研究
最新研究方向
在软件工程自动化领域,SWE-Gym数据集的发布标志着大语言模型驱动的代码修复研究迈入规模化训练阶段。该数据集涵盖11个Python仓库的2438个真实缺陷实例,严格遵循SWE-Bench的采集规范,为构建可泛化的程序修复智能体提供了标准化训练基准。当前前沿方向聚焦于利用强化学习范式,将代码仓库的上下文信息、补丁生成与测试反馈进行端到端联合优化,探索模型在跨项目缺陷修复中的零样本迁移能力。这一资源填补了大规模、高保真训练数据与复杂软件工程任务间的鸿沟,推动了从静态补丁预测向动态环境交互的范式转变,对提升自动化调试系统在工业级代码库中的实用性与鲁棒性具有里程碑意义。
以上内容由遇见数据集搜集并总结生成



