遇见数据集

DeepSWE-Gym-Raw

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

该数据集是 SWE-bench 和 SWE-smith 系列中所有语言特定数据集的合并版本,总计 88130 个样本。它旨在提升 DeepSWE 风格问题、相关基准测试以及通用编程技能的表现。尽管未专门筛选原始数据集中复杂或长代码问题的行,但平均每个样本大小为 85.4KB,总未压缩大小为 7.53GB。数据集涵盖多种编程语言(Python、Go、Rust、TypeScript、JavaScript、C++、Java、PHP),适用于改进基准测试结果、提升通用编码能力、训练软件工程/编码代理以及改进长上下文编码任务。数据集由 MoreThought 策划、资助和共享,采用 MIT 许可证。注意:为避免样本重叠,请勿将此数据集与其他变体或版本一同使用。

This dataset is a merged version of all language-specific datasets in the SWE-bench and SWE-smith series, totaling 88,130 samples. It aims to improve performance on DeepSWE-style problems, related benchmarks, and general programming skills. Although it does not specifically filter lines for complex or long-code problems from the original dataset, the average sample size is 85.4KB, with a total uncompressed size of 7.53GB. The dataset covers multiple programming languages (Python, Go, Rust, TypeScript, JavaScript, C++, Java, PHP), and is suitable for improving benchmark results, enhancing general coding abilities, training software engineering/coding agents, and improving long-context coding tasks. The dataset is curated, funded, and shared by MoreThought under the MIT license. Note: To avoid sample overlap, do not use this dataset together with other variants or versions.

创建时间:
2026-09-01
原始信息汇总

DeepSWE-Gym-Raw 数据集概述

数据集简介

本数据集由 MoreThought 团队策划、资助并共享,合并了所有 SWE-bench/SWE-smith-lang 系列的原始数据,总计包含 88,130 条样本,旨在提升模型在 DeepSWE 风格问题、基准测试及通用编程能力上的表现。

数据规模与特性

  • 样本数量:88,130 条
  • 平均单条大小:85.4 KB
  • 未压缩总大小:7.53 GB
  • 分类规模:10K < N < 100K
  • 未特别筛选包含复杂/长代码问题的样本,但整体数据规模仍较大

数据来源

该数据集由以下 8 个仓库的 SWE-smith 语言子集合并而成:

  • SWE-bench/SWE-smith-py (Python)
  • SWE-bench/SWE-smith-go (Go)
  • SWE-bench/SWE-smith-rs (Rust)
  • SWE-bench/SWE-smith-ts (TypeScript)
  • SWE-bench/SWE-smith-js (JavaScript)
  • SWE-bench/SWE-smith-cpp (C++)
  • SWE-bench/SWE-smith-java (Java)
  • SWE-bench/SWE-smith-php (PHP)

相关论文参考:https://huggingface.co/papers/2504.21798

数据用途

  • 提升基准测试表现
  • 增强通用编程能力
  • 训练软件工程/编码智能体
  • 改进长上下文编码任务

任务类型与语言

  • 任务类别:文本生成、问答、图像-文本到文本
  • 语言:英语
  • 代码语言标签:py、js、ts、java、cpp、rust、go 等

标签属性

涵盖 coding、programming、SWE、SWE-bench、reasoning、agentic、software-engineering、long-context、code-generation、repository-level、multi-file、fine-tuning、SFT、benchmark 等多项技术标签。

重要提示

请勿将本数据集与其变体或不同版本混用,以免产生重叠的训练样本。

搜集汇总
数据集介绍
DeepSWE-Gym-Raw 数据集图片
构建方式
在软件工程与代码生成研究领域,数据集的规模与语言多样性直接影响模型泛化能力。DeepSWE-Gym-Raw通过合并SWE-bench/SWE-smith系列涵盖Python、Go、Rust、TypeScript、JavaScript、C++、Java及PHP的八个语言子集,构建了总计88130个样本的原始数据集。该合并过程未针对复杂或长代码问题进行额外过滤,保留了原始数据的自然分布,整体未压缩体积达7.53GB,平均单样本大小约为85.4KB。数据集由MoreThought策划并资助,遵循MIT许可协议,相关论文资源亦公开可查。
特点
该数据集聚焦于仓库级、多文件、长上下文的代码生成与推理任务,覆盖从代码补全到软件工程智能体训练的多种场景。其显著特征在于跨语言异质性,同时囊括八种主流编程语言,且样本平均体积较大,适合评估模型在真实项目环境中的长依赖处理能力。数据集标签涉及智能体、微调、基准测试等维度,规模介于一万至十万行之间,为代码生成、问答及图像文本到文本等任务提供了统一的原始语料基础,并明确警示避免与其他变体混用导致样本重叠。
使用方法
使用该数据集时,研究者可将其直接用于监督微调以提升模型在DeepSWE风格问题及通用编码任务上的表现,亦可用于训练软件工程智能体或增强长上下文代码理解能力。由于数据未经过滤,建议在训练前根据具体任务需求进行子集划分或质量筛选。加载时借助HuggingFace数据集接口即可访问,但需注意不与其他版本或变体混合使用,以防样本重复。该数据集支持文本生成、问答及图像文本到文本等多种任务类别,适用于基准评测与能力增强的双重目的。
背景与挑战
背景概述
软件工程自动化领域长期面临代码生成与缺陷修复任务的泛化性难题,既有基准如SWE-bench虽推动了评估标准化,却受限于单一语言或有限仓库场景。2025年,MoreThought团队整合SWE-bench与SWE-smith系列多语言资源,构建了DeepSWE-Gym-Raw数据集,涵盖Python、Java、C++等八种编程语言,共88130条样本,旨在提升DeepSWE风格问题与通用编码能力的基准表现。该数据集为训练仓库级、多文件、长上下文软件工程智能体提供了规模化语料,对代码生成与程序理解研究具有显著推进作用。
当前挑战
该数据集所应对的核心领域挑战在于仓库级多文件代码生成与缺陷定位的长程依赖建模,要求模型在跨语言、跨模块的复杂上下文中保持语义一致性。构建过程中,原始SWE-smith与SWE-bench数据集存在样本重叠、语言分布不均、平均行长度达85.4KB带来的存储与加载效率问题。此外,未针对复杂长代码样本进行专项过滤,导致训练时易出现梯度噪声与收敛不稳定。如何在不牺牲数据规模的前提下,实现跨语言样本的有效去重、长上下文截断策略与计算资源优化,仍是当前亟待解决的技术瓶颈。
常用场景
经典使用场景
在软件工程智能化浪潮的推动下,面向真实代码仓库的智能体训练已成为代码大模型领域的核心议题。DeepSWE-Gym-Raw最为经典的使用场景在于为编码智能体(Coding Agent)提供贴近真实软件开发流程的训练环境。该数据集汇聚了Python、Java、C++、Rust、Go、TypeScript、JavaScript及PHP等多语言的SWE-smith系列数据,涵盖八万余条仓库级样本,使智能体能够在多文件、长上下文的复杂工程语境中习得缺陷定位、代码修复与功能迭代的能力,进而成为端到端软件工程任务训练的基础语料。
解决学术问题
长期以来,代码生成研究面临训练数据与真实工程场景脱节的困境,学术基准多依赖函数级别的合成语料,难以刻画跨文件依赖与长程推理的复杂性。该数据集直面这一瓶颈,通过整合多语言仓库级缺陷修复样本,为研究者提供了统一且规模可观的实验基础。它使得代码大模型在长上下文理解、跨文件语义追踪以及复杂缺陷归因等学术难题上得以系统评估与优化,推动了软件工程智能体研究从玩具任务向真实仓库任务的范式跃迁,为相关基准的迭代提供了坚实支撑。
衍生相关工作
围绕该数据集,研究者已开展了一系列延伸性工作。其源头SWE-smith系列论文提出了面向软件工程智能体的合成数据构建方法,为后续模型训练奠定了方法论基础。在此基础上,诸多编码大模型与智能体框架将其纳入训练或评测流程,用于提升长上下文代码理解与仓库级修复性能。该数据集亦催生了针对多语言、多文件场景的微调方案与基准变体,推动SWE-bench风格评测体系不断扩展,形成了从数据合成到智能体训练再到基准评估的完整研究链条,持续滋养着软件工程智能化的学术生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务