DeNovoSWE
收藏数据链接:
官方服务:
资源简介:
DeNovoSWE是一个用于从零开始生成整个软件仓库的长时程软件工程环境数据集,包含4,818个高质量实例和11,000条过滤后的轨迹,旨在评估代理在重建仓库时的性能。
DeNovoSWE is a long-horizon software engineering environment dataset for generating entire software repositories from scratch. It comprises 4,818 high-quality instances and 11,000 filtered trajectories, and is designed to evaluate the performance of AI Agents when reconstructing software repositories.
创建时间:
2026-06-04
原始信息汇总
DeNovoSWE 数据集概述
DeNovoSWE 是一个用于从零生成完整代码仓库的长周期环境数据集,旨在推动大规模仓库级代码生成的研究。
核心亮点
- 规模:包含 4,818 个高质量实例。
- 轨迹数据:从 34,000 条 DeepSeek-v4-High 轨迹中筛选出 11,000 条高质量轨迹。
- 性能表现:基于 Qwen3.5-35B-A3B 训练的 BeyondSWE-Doc2Repo 模型达到 50% 的成功率。
发布时间
- 论文与部分数据于 2026年6月10日 发布在 arXiv 和 Hugging Face。
数据格式
数据集包含以下字段:
| 字段 | 描述 |
|---|---|
instance_id |
每个基准实例的唯一标识符 |
document |
提供给代理用于仓库重建的真实文档 |
pypi_name |
PyPI 包名称,用于评估时执行反作弊约束 |
image_url |
环境配置的 Docker 镜像 URL |
user |
仓库所属的 GitHub 用户名或组织名 |
repo |
目标 GitHub 仓库名称 |
workdir |
Docker 容器内仓库的工作目录路径 |
unit_test |
所有单元测试标识符列表 |
test_patch |
评估阶段应用的单元测试代码补丁 |
test_binary_files |
单元测试所需的二进制文件(不适合标准文本补丁) |
代理配置(DeNovoSWE-Agent)
| 参数 | 值 |
|---|---|
| 最大交互轮数 | 500 |
| 最大序列长度 | 256k |
| 温度 | 1 |
评估方法
可使用 AweAgent 并参考其官方提供的 配方 对 DeNovoSWE-Data 进行评估。
许可协议
该项目采用 CC BY 4.0 许可证。
搜集汇总
数据集介绍

构建方式
DeNovoSWE数据集的构建基于对真实世界GitHub仓库的深度剖析与自动化流程设计。研究团队从开源生态中精选了4,818个高质量实例,每个实例均包含原始仓库的完整文档、PyPI包名及Docker环境配置。为确保任务难度与真实性,团队利用DeepSeek-v4-High模型生成了34k条初始轨迹,并经过严格筛选与过滤,最终保留了11k条高质量轨迹,用于训练模型从零生成完整代码仓库。数据集还引入了单元测试补丁与二进制文件,以强化评估的可靠性。
特点
该数据集的核心特征在于其长时序(Long-Horizon)环境设计及对仓库级代码生成任务的专注。相较于传统面向单函数或模块的基准测试,DeNovoSWE要求模型基于文档重构整个代码库,涵盖依赖管理、目录结构布局及功能一致性。其包含的4,818个实例覆盖多样化的编程语言与项目类型,且每个实例均配备抗作弊约束(如PyPI包名检查)与Docker沙箱,确保评估公平性。此外,基于DeepSeek-v4-High的过滤轨迹展现了卓越的预训练性能,在BeyondSWE-Doc2Repo任务上达到50%的准确率。
使用方法
使用DeNovoSWE数据集时,用户需首先根据提供的image_url拉取对应Docker镜像,并在容器内设置工作目录。评估流程通过AweAgent框架实现,具体可参考GitHub仓库上的配方(recipe)。模型需依据instance_id对应的ground-truth文档,利用最多500轮交互与256k的序列长度生成整个仓库。单元测试通过test_patch与test_binary_files字段提供,用于验证生成代码的功能正确性。数据集已托管于Hugging Face平台,便于直接下载与集成到主流机器学习流程中。
背景与挑战
背景概述
随着软件工程的自动化需求日益增长,利用大语言模型直接从零生成完整软件仓库成为一项前沿探索。DeNovoSWE数据集由Jiale Zhao、Guoxin Chen等研究者于2026年创建,旨在解决长时序、复杂依赖的代码生成问题。该数据集包含4,818个高质量实例,并筛选出11,000条来自DeepSeek-v4-High的轨迹,为从文档到仓库的端到端生成提供了标准化基准。通过在Qwen3.5-35B-A3B模型上训练,DeNovoSWE在BeyondSWE-Doc2Repo任务中达到了50%的优异成绩,显著推动了软件工程领域的发展,成为评估和优化仓库级代码生成能力的重要资源。
当前挑战
DeNovoSWE面临的核心挑战在于长时序环境下从零生成完整仓库的复杂性。领域方面,现有方法多局限于单文件或函数生成,难以处理跨文件依赖、项目结构规划及单元测试集成等全局性问题,导致生成代码的可用性与一致性不足。构建过程中,需从34k原始轨迹中精细筛选高质数据,避免冗余或错误样本引入噪声;同时,每个实例需手动配置Docker镜像、单元测试补丁及反作弊约束(如PyPI包名验证),以确保评估的可靠性与安全性,这大幅增加了数据构建的工程成本与难度。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域,DeNovoSWE数据集为评估和训练代码生成模型的长期规划能力提供了关键基准。其经典使用场景聚焦于从零生成完整软件仓库的任务,要求模型依据给定的功能文档,自主构建包含目录结构、多文件依赖、单元测试及构建配置的整个代码库。这一场景模拟了真实开发中从需求到交付的全流程,远超传统单函数或单文件的代码补全任务,极具挑战性。
实际应用
在实际应用中,DeNovoSWE数据集赋能了智能编程助手与低代码开发平台的演进。基于该数据训练出的Agent模型(如AweAgent)能够自主解析用户文档,生成从零开始的完整存储库,大幅降低手工搭建项目框架的时间成本。这在敏捷开发、原型快速迭代及企业内部工具库自动构建等场景中展现出巨大潜力。此外,其严格的防作弊机制与Docker化环境确保了生成结果的可复现性与可靠性,为将AI代码生成技术安全落地于生产环境提供了可信验证。
衍生相关工作
DeNovoSWE数据集系列催生了一系列前沿工作,包括基于其构建的BeyondSWE-Doc2Repo基准,以及利用DeepSeek-v4-High轨迹进行监督微调的方法。研究者进一步拓展了长期代码生成的研究方向,如多智能体协作仓库构建、动态迭代修复策略等。该数据集还推动了开源社区针对大模型仓库级生成能力的系统评测框架发展,成为软件工程领域LLM评估不可或缺的参考标准,并启发了后续如RepoGen与FullRepoBench等相关工作的涌现。
以上内容由遇见数据集搜集并总结生成



