deepagent
收藏资源简介:
DeepAgent是一个从真实合并的Pull Request中提取的、经过Docker验证的软件工程基准测试数据集,旨在为代码生成和软件工程代理提供高难度的评估基准。该数据集包含9个经过认证的硬度包,这些包来自7个不同的开源仓库,每个仓库最多包含2个包以确保多样性。每个包代表一个真实的软件修改任务,包含多文件修改、基础提交SHA、编程语言、许可证信息等元数据。数据集遵循严格的M27 DeepSWE-median硬度标准:每个任务必须满足多文件要求(源文件数至少4个,或混合文件至少3个且黄金添加行至少500行且hunks至少14个)、源hunks至少14个、黄金添加行至少400行、F2P节点至少5个等条件。数据集采用HarborDocker双重真值验证机制(解决方案奖励为1,空奖励为0),确保评估的可靠性。数据集中包含结构统计信息(如源文件数、hunks数、添加行数、F2P节点数)和面向代理的问题描述,但不包含黄金解决方案补丁和保留的验证测试补丁,这些内容保留在每个包的Harbor树中用于双重真值验证。该数据集适用于评估代码生成模型和软件工程代理在真实软件修改任务上的性能,当前已在Grok 4.5和Kimi 2.7-code等模型上进行了基准测试。
DeepAgent is a software engineering benchmark dataset extracted from real merged Pull Requests and validated with Docker, designed to provide a high-difficulty evaluation benchmark for code generation and software engineering agents. The dataset contains 9 certified hardness packages from 7 different open-source repositories, with up to 2 packages per repository to ensure diversity. Each package represents a real software modification task, including metadata such as multi-file modifications, base commit SHA, programming language, and license information. The dataset adheres to the strict M27 DeepSWE-median hardness standard: each task must meet multi-file requirements (source files ≥4, or mixed files ≥3 with gold added lines ≥500 and hunks ≥14), source hunks ≥14, gold added lines ≥400, F2P nodes ≥5, among other conditions. It employs a HarborDocker dual-truth validation mechanism (solution reward=1, empty reward=0) to ensure evaluation reliability. The dataset includes structural statistics (e.g., number of source files, hunks, added lines, F2P nodes) and agent-oriented problem descriptions, but does not include gold solution patches and reserved validation test patches, which are retained in the Harbor tree of each package for dual-truth validation. The dataset is suitable for evaluating the performance of code generation models and software engineering agents on real software modification tasks, and has been benchmarked on models such as Grok 4.5 and Kimi 2.7-code.
数据集 DeepAgent 概述
DeepAgent 是一个面向真实软件工程场景的基准数据集,专注于从真实的合并 Pull Request(PR)中提取高难度、可通过 Docker 验证的编程任务。
基本信息
| 项目 | 内容 |
|---|---|
| 数据集名称 | DeepAgent |
| 许可证 | MIT |
| 任务类型 | 文本生成 |
| 数据规模 | n<1K(共 9 个样本) |
| 数据拆分 | 仅包含训练集(train),共 9 个样本 |
数据特征
数据集包含以下字段:
| 字段名 | 类型 | 含义 |
|---|---|---|
task_id |
string | 任务唯一标识符 |
repository_url |
string | 上游公开仓库的 Git URL |
base_commit |
string | 基准提交的 40 位 SHA |
language |
string | 主要编程语言 |
license |
string | 上游仓库许可证 |
source_files |
int64 | 源文件数量 |
source_hunks |
int64 | 源文件 hunks 数量 |
gold_added_lines |
int64 | 黄金解决方案添加的行数 |
f2p_nodes |
int64 | F2P 节点数 |
instruction |
string | 面向 Agent 的问题描述 |
pack_path |
string | Harbor pack 的相对路径 |
source_track |
string | 始终为 real_pr |
数据分布
该数据集包含来自 7 个唯一仓库 的 9 个认证 pack。每个仓库最多包含 2 个 pack(M28 多样性约束)。
Pack ID 列表:
realpr-click-3442realpr-itemadapter-101realpr-oauthlib-889realpr-packaging-1120realpr-packaging-1267realpr-rich-3930realpr-werkzeug-2637realpr-werkzeug-3116realpr-wtforms-923
各仓库分布:
- scrapy/itemadapter: 1
- pypa/packaging: 2
- Textualize/rich: 1
- pallets-eco/wtforms: 1
- pallets/werkzeug: 2
- oauthlib/oauthlib: 1
- pallets/click: 1
结构性统计中位数(P50): 文件数=9.0 · hunks=24.0 · 新增行=726.0 · F2P=24.0
质量门槛(M27 DeepSWE-median 硬度标准)
每个 pack 必须满足以下条件:
- 多文件: 源文件数 ≥ 4,或混合文件 ≥ 3 且新增行 ≥ 500 且 hunks ≥ 14
- 源 hunks ≥ 14
- 黄金新增行 ≥ 400
- F2P 节点 ≥ 5
- HarborDocker 双重真值(solution 奖励 = 1, null 奖励 = 0)且提示-验证器对齐
- 仅包含
source_track=real_pr的真实 PR 数据 - M28 多样性:每个上游仓库最多 2 个 pack
评估基准
使用两个模型进行矩阵评估(仅用于观测排名,双重解决率 ≤ 0.30 为硬度质量关卡):
| 模型 | pass@1 (k=1) |
|---|---|
x-ai/grok-4.5 |
3/9 ≈ 0.33 |
moonshotai/kimi-k2.7-code |
1/9 ≈ 0.11 |
| 双重解决率 | ≈ 0.11 (1/9) |
数据集结构
仓库顶层结构:
data/packs.jsonl— 9 个样本的查看器表格(不含黄金补丁)data/packs.parquet— 可选的 Parquet 格式相同表格pack_manifest.jsonPRODUCT_README.mdPROVENANCE.mdcoverage_stats.jsonmedian_stats.jsontasks/<task_id>/— 每个 pack 的完整目录,包含:task.tomlinstruction.md(面向 Agent 的问题,无黄金泄露)environment/Dockerfile(Agent 镜像)tests/...(保留的验证器测试)solution/...(多文件黄金解决方案,仅用于 oracle,不在查看器表格中)




