遇见数据集

deepagent

收藏
Hugging Face2026-07-20 更新2026-07-21 收录
官方服务:

资源简介:

DeepAgent是一个从真实合并的Pull Request中提取的、经过Docker验证的软件工程基准测试数据集,旨在为代码生成和软件工程代理提供高难度的评估基准。该数据集包含9个经过认证的硬度包,这些包来自7个不同的开源仓库,每个仓库最多包含2个包以确保多样性。每个包代表一个真实的软件修改任务,包含多文件修改、基础提交SHA、编程语言、许可证信息等元数据。数据集遵循严格的M27 DeepSWE-median硬度标准:每个任务必须满足多文件要求(源文件数至少4个,或混合文件至少3个且黄金添加行至少500行且hunks至少14个)、源hunks至少14个、黄金添加行至少400行、F2P节点至少5个等条件。数据集采用HarborDocker双重真值验证机制(解决方案奖励为1,空奖励为0),确保评估的可靠性。数据集中包含结构统计信息(如源文件数、hunks数、添加行数、F2P节点数)和面向代理的问题描述,但不包含黄金解决方案补丁和保留的验证测试补丁,这些内容保留在每个包的Harbor树中用于双重真值验证。该数据集适用于评估代码生成模型和软件工程代理在真实软件修改任务上的性能,当前已在Grok 4.5和Kimi 2.7-code等模型上进行了基准测试。

DeepAgent is a software engineering benchmark dataset extracted from real merged Pull Requests and validated with Docker, designed to provide a high-difficulty evaluation benchmark for code generation and software engineering agents. The dataset contains 9 certified hardness packages from 7 different open-source repositories, with up to 2 packages per repository to ensure diversity. Each package represents a real software modification task, including metadata such as multi-file modifications, base commit SHA, programming language, and license information. The dataset adheres to the strict M27 DeepSWE-median hardness standard: each task must meet multi-file requirements (source files ≥4, or mixed files ≥3 with gold added lines ≥500 and hunks ≥14), source hunks ≥14, gold added lines ≥400, F2P nodes ≥5, among other conditions. It employs a HarborDocker dual-truth validation mechanism (solution reward=1, empty reward=0) to ensure evaluation reliability. The dataset includes structural statistics (e.g., number of source files, hunks, added lines, F2P nodes) and agent-oriented problem descriptions, but does not include gold solution patches and reserved validation test patches, which are retained in the Harbor tree of each package for dual-truth validation. The dataset is suitable for evaluating the performance of code generation models and software engineering agents on real software modification tasks, and has been benchmarked on models such as Grok 4.5 and Kimi 2.7-code.

创建时间:
2026-07-16
原始信息汇总

数据集 DeepAgent 概述

DeepAgent 是一个面向真实软件工程场景的基准数据集,专注于从真实的合并 Pull Request(PR)中提取高难度、可通过 Docker 验证的编程任务。

基本信息

项目 内容
数据集名称 DeepAgent
许可证 MIT
任务类型 文本生成
数据规模 n<1K(共 9 个样本)
数据拆分 仅包含训练集(train),共 9 个样本

数据特征

数据集包含以下字段:

字段名 类型 含义
task_id string 任务唯一标识符
repository_url string 上游公开仓库的 Git URL
base_commit string 基准提交的 40 位 SHA
language string 主要编程语言
license string 上游仓库许可证
source_files int64 源文件数量
source_hunks int64 源文件 hunks 数量
gold_added_lines int64 黄金解决方案添加的行数
f2p_nodes int64 F2P 节点数
instruction string 面向 Agent 的问题描述
pack_path string Harbor pack 的相对路径
source_track string 始终为 real_pr

数据分布

该数据集包含来自 7 个唯一仓库9 个认证 pack。每个仓库最多包含 2 个 pack(M28 多样性约束)。

Pack ID 列表:

  • realpr-click-3442
  • realpr-itemadapter-101
  • realpr-oauthlib-889
  • realpr-packaging-1120
  • realpr-packaging-1267
  • realpr-rich-3930
  • realpr-werkzeug-2637
  • realpr-werkzeug-3116
  • realpr-wtforms-923

各仓库分布:

  • scrapy/itemadapter: 1
  • pypa/packaging: 2
  • Textualize/rich: 1
  • pallets-eco/wtforms: 1
  • pallets/werkzeug: 2
  • oauthlib/oauthlib: 1
  • pallets/click: 1

结构性统计中位数(P50): 文件数=9.0 · hunks=24.0 · 新增行=726.0 · F2P=24.0

质量门槛(M27 DeepSWE-median 硬度标准)

每个 pack 必须满足以下条件:

  • 多文件: 源文件数 ≥ 4,或混合文件 ≥ 3 且新增行 ≥ 500 且 hunks ≥ 14
  • 源 hunks ≥ 14
  • 黄金新增行 ≥ 400
  • F2P 节点 ≥ 5
  • HarborDocker 双重真值(solution 奖励 = 1, null 奖励 = 0)且提示-验证器对齐
  • 仅包含 source_track=real_pr 的真实 PR 数据
  • M28 多样性:每个上游仓库最多 2 个 pack

评估基准

使用两个模型进行矩阵评估(仅用于观测排名,双重解决率 ≤ 0.30 为硬度质量关卡):

模型 pass@1 (k=1)
x-ai/grok-4.5 3/9 ≈ 0.33
moonshotai/kimi-k2.7-code 1/9 ≈ 0.11
双重解决率 ≈ 0.11 (1/9)

数据集结构

仓库顶层结构:

  • data/packs.jsonl — 9 个样本的查看器表格(不含黄金补丁)
  • data/packs.parquet — 可选的 Parquet 格式相同表格
  • pack_manifest.json
  • PRODUCT_README.md
  • PROVENANCE.md
  • coverage_stats.json
  • median_stats.json
  • tasks/<task_id>/ — 每个 pack 的完整目录,包含:
    • task.toml
    • instruction.md(面向 Agent 的问题,无黄金泄露)
    • environment/Dockerfile(Agent 镜像)
    • tests/...(保留的验证器测试)
    • solution/...(多文件黄金解决方案,仅用于 oracle,不在查看器表格中)
搜集汇总
数据集介绍
deepagent 数据集图片
构建方式
DeepAgent 数据集源于对真实世界合并拉取请求(Real-PR)的实时挖掘,严格遵循 M27 硬度标准与 M28 多样性约束(每仓库最多 2 个样本),最终筛选出 9 个认证包(pack)。每个包包含多文件变更、完整 Harbor 目录树、基于 Docker 的双重真值验证体系(solution 奖励为 1,null 奖励为 0),以及独立保留的验证器测试集。数据以 JSONL 格式组织,复用 Hugging Face Datasets 加载框架,同时 CLI 工具支持包的生成、上传、拉取与评估操作。
特点
该数据集以高难度为显著特征,样本来源文件数不少于 4 个或混合文件数不低于 3 个,代码段落(hunks)超过 14 处,新增代码行数(gold added lines)不低于 400 行,功能到功能节点数(F2P nodes)不少于 5 个。所有包均源自真实 PR 且通过 HarborDocker 双重真值校验,确保解题与空解结果严格区分(通过率为 1 与 0)。目前产品版本涵盖 7 个知名开源仓库,如 werkzeug、packaging 与 rich,其中最大单包涉及 26 个文件、29 个段落、12223 行新增代码。
使用方法
用户可通过 Hugging Face Datasets 库直接加载查看表格,示例代码为 `load_dataset("BaseIntelligence/deepagent", split="train")`,并获得每个样本的 task_id、结构统计量与面向代理的任务描述指令。完整的 Harbor 包需通过 GitHub 上的 deepagent CLI 工具拉取,运行 `deepagent pull --repo-id BaseIntelligence/deepagent --revision main` 即可获取含 Docker 镜像、验证测试与解决方案的完整目录。评估时可指定双模型(如 Grok 4.5 与 Kimi K2.7-Code)并行运行 Pier 与 Harbor 流程,并设硬性预算上限以防止过度消耗。
背景与挑战
背景概述
DeepAgent数据集由BaseIntelligence团队于近期创建,专注于为软件工程领域的代码智能体提供高难度的基准测试。该数据集以真实世界中的多文件合并请求(Pull Requests)为核心,旨在评估代码生成模型在复杂软件维护任务中的表现。通过对7个知名开源仓库(如scrapy/itemadapter、pypa/packaging、pallets/werkzeug等)中9个经过严格筛选的合并请求进行打包,DeepAgent构建了具有多文件、高代码改动量、复杂依赖关系等特征的测试用例。其独创的HarborDocker双真值验证机制(解决方案奖励为1,空操作奖励为0)确保了评估的客观性与可重复性。当前,该数据集已用于评测x-ai/grok-4.5和moonshotai/kimi-k2.7-code等前沿模型,其难度的设定使得这些模型的pass@1得分均低于0.35,凸显了其在推动代码智能体研究中的关键作用。
当前挑战
DeepAgent数据集旨在解决当前代码智能体评估中面临的领域挑战:一是现有基准测试多基于简化或合成的问题,难以反映真实软件工程中多文件、跨模块依赖的复杂性;二是缺乏可自动验证的可靠评估手段,导致模型性能比较存在偏差。在数据集构建过程中,团队遇到了双重挑战。首先,数据采集面临巨大困难,从海量真实合并请求中筛选出满足严格硬度标准(如源文件数≥4、hunks≥14、黄金添加行数≥400、F2P节点数≥5)的样本,同时要确保每个仓库不超过2个案例以保持多样性,这需要精细的算法设计与人工审核。其次,验证环境的搭建极具挑战性,需要为每个案例构建独立的Docker镜像、包含测试脚本与黄金补丁的双重验证系统,并确保提示词与验证器严格对齐,任何细微偏差都可能导致评估失败,这要求高度的工程可靠性。
常用场景
经典使用场景
在软件工程与人工智能交叉领域中,DeepAgent数据集被广泛用作评估代码智能体在复杂真实世界代码修改任务上的核心基准。该数据集精心遴选了9个来自知名开源项目的已合并真实PR(Pull Request),每个任务均要求智能体在Docker化的沙箱环境中,基于给定的仓库基线版本和自然语言指令,对多个源文件进行协同修改。其双真值验证机制(solution reward = 1, null reward = 0)确保了评分的客观性与可复现性,使其成为衡量大语言模型在多文件、多代码块编辑场景下推理与执行能力的黄金标准。
解决学术问题
DeepAgent致力于解决现有软件工程基准(如SWE-bench)中任务难度偏低、环境不可复现、验证机制单一等核心学术痛点。通过引入多文件重构强度(源文件数≥4、代码块数≥14、新增行数≥400)和功能依赖图节点数(F2P nodes≥5)等硬度下限,该数据集填补了高难度、可验证的代码智能体评测空白。其最重要的学术贡献在于揭示了当前顶尖模型(如Grok 4.5仅达0.33 pass@1)在真实多文件协同编辑任务上的能力边界,为后续研究指明了改进方向。
衍生相关工作
DeepAgent的发布催生了多个方向的研究工作。其高难度任务集成为评估代码大模型(如DeepSeek-Coder、CodeLlama)在多文件编辑场景下能力的标准挑战组。研究者们借鉴其双真值对比框架,设计了更细粒度的代码修改成功率分析范式。数据集采用的真实PR来源和Docker化验证机制,直接启发了后续如RealPatch、HarborBench等基准的构建思路。此外,其M28多样性约束(每仓库最多2个任务)也成为构建无偏代码智能体评估集时的重要设计参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务