遇见数据集

DeepSWE-Gym-Edu

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是对所有 SWE-bench/SWE-smith-lang 系列数据集(排除 PHP)进行合并并重度过滤后的版本,原本总计 88k 行,经过筛选后保留 42529 个样本,平均每行大小为 101.81KB,总未压缩大小为 4.29GB。数据集聚焦于原始数据中非常复杂/长代码的问题,旨在提升 DeepSWE 风格问题、基准测试以及通用编码能力上的表现。数据集由 MoreThought 策划、资助并共享,采用 MIT 许可证。主要用途包括:提高基准测试结果、增强通用编码能力、训练软件工程/编码代理、以及改进长上下文代码处理能力。注意:为避免样本重叠,不建议将该数据集与其他变体或版本混合使用。

This dataset is a merged and heavily filtered version of all SWE-bench/SWE-smith-lang series datasets (excluding PHP). Originally containing 88k rows, it retains 42,529 samples after filtering, with an average row size of 101.81KB and a total uncompressed size of 4.29GB. The dataset focuses on very complex/long code problems from the original data, aiming to improve performance on DeepSWE-style problems, benchmarks, and general coding capabilities. It is curated, funded, and shared by MoreThought under the MIT license. Main uses include: improving benchmark results, enhancing general coding capabilities, training software engineering/coding agents, and improving long-context code handling. Note: To avoid sample overlap, it is not recommended to mix this dataset with other variants or versions.

创建时间:
2026-09-01
原始信息汇总

DeepSWE-Gym-Edu 数据集概述

基本信息

  • 数据集名称: DeepSWE-Gym-Edu
  • 提供方: MoreThought
  • 许可证: MIT
  • 语言: 英语
  • 样本规模: 42,529 条(10K < n < 100K)
  • 平均样本大小: 101.81 KB
  • 未压缩总大小: 4.29 GB

任务类型

该数据集支持以下任务:

  • 文本生成(text-generation)
  • 问答(question-answering)
  • 图像-文本到文本(image-text-to-text)

数据集内容

这是一个经过重度过滤处理的数据集,由多个 SWE-bench/SWE-smith-lang 数据集(PHP 除外)合并而成(原始总行数为 88K 行)。数据集专门筛选了原始数据集中包含非常复杂/长代码问题的行,旨在提升 DeepSWE 风格问题、基准测试以及通用编码技能的表现。

支持的编程语言

  • Python (py)
  • JavaScript (js)
  • TypeScript (ts)
  • Java
  • C++ (cpp)
  • Rust (rs)
  • Go

数据来源

该数据集由以下仓库合并而成:

  1. SWE-smith-py: https://huggingface.co/datasets/SWE-bench/SWE-smith-py
  2. SWE-smith-go: https://huggingface.co/datasets/SWE-bench/SWE-smith-go
  3. SWE-smith-rs: https://huggingface.co/datasets/SWE-bench/SWE-smith-rs
  4. SWE-smith-ts: https://huggingface.co/datasets/SWE-bench/SWE-smith-ts
  5. SWE-smith-js: https://huggingface.co/datasets/SWE-bench/SWE-smith-js
  6. SWE-smith-cpp: https://huggingface.co/datasets/SWE-bench/SWE-smith-cpp
  7. SWE-smith-java: https://huggingface.co/datasets/SWE-bench/SWE-smith-java

相关论文: https://huggingface.co/papers/2504.21798

应用场景

  • 提升基准测试结果
  • 提高通用编码能力
  • 训练软件工程/编码智能体
  • 提升长上下文编码能力

重要提示

若不想出现重叠样本,请勿将此数据集与其他变体或版本的数据集一起使用。

搜集汇总
数据集介绍
DeepSWE-Gym-Edu 数据集图片
构建方式
DeepSWE-Gym-Edu数据集是在软件工程智能体训练领域的一项精心构建之作。它整合了SWE-bench与SWE-smith-lang系列中除PHP外的多个数据集,将原始8.8万条样本经过严格筛选与融合,最终形成包含42529个实例的高质量子集。这些实例均选自原始数据中复杂度高、代码长度长的难题,平均每条样本规模达101.81KB,总体未压缩体积为4.29GB。该构建过程旨在汇集跨语言(涵盖Python、JavaScript、TypeScript、Java、C++、Rust、Go)的复杂编程挑战,为训练能够应对真实世界软件工程问题的智能体提供深度与广度兼具的语料库,其筛选策略直指难度上限,确保每个案例都具备充分的推理与代码生成价值。
使用方法
DeepSWE-Gym-Edu数据集适用于多种特定的机器学习任务,包括但不限于文本生成、问答及图像-文本到文本的转换,但主要瞄准的是代码生成与软件工程智能体的微调与基准测试。用户可以利用它进行监督式微调(SFT),以增强模型在跨文件、长上下文代码任务上的表现,或用于评估和训练具备代理能力的编码系统。鉴于其数据来源于已有基准测试的精选,强烈建议使用者避免将其与其他SWE-bench或SWE-smith的衍生版本混合使用,以免训练和评估集中出现重叠样本。该数据集格式兼容标准HuggingFace加载器,便于集成至现有工作流,但使用时需注意其高内存需求,建议在具备足够存储与计算资源的环境下运行。
背景与挑战
背景概述
DeepSWE-Gym-Edu数据集由MoreThought机构于2025年创建,旨在应对软件工程领域大语言模型在复杂代码任务上的性能瓶颈。该数据集整合并精筛了SWE-bench与SWE-smith系列数据集(涵盖Python、JavaScript、TypeScript、Java、C++、Rust及Go等主流语言),共包含42,529条样本,平均样本规模达101.81KB,总容量约4.29GB。其核心研究问题聚焦于提升模型在DeepSWE风格问题、多文件代码仓库及长上下文场景下的解题能力,对推动软件工程智能体训练与基准评测具有显著影响力,相关成果发表于论文2504.21798。
当前挑战
该数据集面临的挑战多维且严峻。领域层面,软件工程任务涉及跨文件依赖、长上下文推理及复杂逻辑,远超传统代码生成问题,对模型架构与训练策略提出极高要求。构建过程中,需从88k原始混杂数据中筛选出高复杂度样本,权衡数据规模与质量,避免重复样本导致的数据泄漏;同时,多源数据集的语言覆盖与格式统一亦需精细处理,确保过滤后样本的代表性与可比性,这一过程涉及大量算力与人工校验,极具挑战。
常用场景
经典使用场景
DeepSWE-Gym-Edu数据集在软件工程与代码智能领域占据核心地位,其经典使用场景聚焦于训练与评估具备深层推理能力的软件工程代理。该数据集融合SWE-bench及SWE-smith系列中多语言(Python、JavaScript、TypeScript、Java、C++、Rust、Go)的复杂代码问题,经过精细筛选,确保每个样本的平均规模高达101.81KB,从而为长上下文理解与多文件级代码操作提供了高难度、高真实性的训练环境。研究者可凭借此数据集进行模型微调,以显著提升模型在存储库级代码生成、缺陷修复及端到端任务执行上的表现,是通向高级软件工程智能体的必经之路。
解决学术问题
该数据集所解决的学术研究问题深刻而紧迫,聚焦于现实世界软件工程中代码修改的复杂性、跨文件依赖的长距离推理以及多语言编程环境的泛化能力。传统代码数据集往往局限于单一文件或函数级别的修补,缺乏对完整软件工程任务的捕捉,而DeepSWE-Gym-Edu通过汇聚并可扩展的高质量样本,为学术界提供了一个大规模、高难度的基准,以检验模型在复杂、上下文稀疏场景下的推理极限。它的出现打破了过往评测中任务简化的局限,促进了从代码补全到交互式智能体决策的根本性范式转变,加深了对大模型在真实开发工作流中作用的理解,并为衡量代码智能体的进步树起了一面新的标杆。
实际应用
在实际应用层面,DeepSWE-Gym-Edu数据集动摇了传统coding助手的概念,成为构筑下一代自动编程与软件维护系统的基石。它所赋能的人工智能代理可被部署于连续集成流水线,自动辨识并修复大型代码库中的缺陷,显著削减人力审查的负担。在企业级代码管理场景中,得益于数据集对超长上下文的重视,这些智能体能够精准定位跨模块的漏洞并生成贴合项目风格的补丁,从而加快软件迭代周期。此外,该数据集在个性化代码教学与智能辅导系统中也展现不凡潜力,其复杂的实际问题可作为训练材料培养模型,使其能够引导开发者应对多文件重构等高级挑战。
数据集最近研究
最新研究方向
DeepSWE-Gym-Edu数据集聚焦于软件工程智能体与大型语言模型的复杂代码处理能力提升,其研究方向深度融合了前沿的agentic编码范式与长上下文理解。当前热点集中于利用该数据集对模型进行指令微调,以增强其在多文件、跨语言仓库级问题上的解析与修复技能,特别是在Python、JavaScript、TypeScript、Java、C++、Rust及Go等语言环境下的综合表现。该数据集的构建基于大规模真实软件工程问题(如SWE-bench与SWE-smith)的精细筛选,专为复杂高难任务设计,其意义在于推动编码智能体从单一函数生成向全仓库级问题解决迈进,为评估和强化模型在真实世界软件开发中的推理与操作能力提供了高难度基准,对下一代自主软件工程系统的发展具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务