swe-task-forge-tasks
收藏资源简介:
swe-task-forge task pool 是一个代码软件工程任务数据集,用于评估 AI agent 在真实代码仓库中解决软件工程问题的能力。数据集包含多个任务,每个任务对应一个 Harbor 包,内含任务描述(instruction.md)、环境配置(environment/Dockerfile)、测试脚本(tests/)、参考解决方案(solution/)以及 agent 运行记录(runs/)。任务类型包括 carve(挖空实现缺失模块)、fault(修复故障,如依赖缺失)、mining(基于仓库历史挖掘缺陷)。数据来源为多条 pipeline(carve、fault、mining),经过严格的质量门控(两臂门:不给答案必挂、给 oracle 必过)和 agent 实际运行验证。当前数据集包含 138 个任务(2026-09-07 批次),来自 40 个独立 Docker 镜像,GLM-5.3 模型整体解决率为 78%(108/138)。其中 carve 94 题(解决率 73%)、fault 19 题(解决率 100%)、mining 25 题(解决率 80%)。历史批次还包括 v1(36 题,解决率 72%)和 v0(59 题,因测试泄漏已下线)。该数据集适用于训练和评估 AI 在代码补全、故障修复、自动化调试等软件工程任务上的能力。任务使用方式为:加载对应 Docker 镜像,构建环境,让 agent 在无网络环境中工作,运行测试脚本得到 reward.json。
swe-task-forge task pool is a code software engineering task dataset designed to evaluate the ability of AI agents to solve software engineering problems in real code repositories. The dataset contains multiple tasks, each corresponding to a Harbor package that includes a task description (instruction.md), environment configuration (environment/Dockerfile), test scripts (tests/), reference solution (solution/), and agent run logs (runs/). Task types include carve (carving out missing implementation modules), fault (fixing faults such as missing dependencies), and mining (mining defects based on repository history). Data sources are multiple pipelines (carve, fault, mining) that undergo strict quality gating (two-arm gate: no answer must fail, with oracle must pass) and actual agent run verification. The current dataset contains 138 tasks (batch 2026-09-07) from 40 independent Docker images, with an overall solution rate of 78% (108/138) for the GLM-5.3 model. Among them, carve has 94 tasks (73% solution rate), fault has 19 tasks (100% solution rate), and mining has 25 tasks (80% solution rate). Historical batches include v1 (36 tasks, 72% solution rate) and v0 (59 tasks, taken offline due to test leakage). This dataset is suitable for training and evaluating AI capabilities in software engineering tasks such as code completion, fault repair, and automated debugging. The task usage method is: load the corresponding Docker image, build the environment, let the agent work in a network-free environment, and run the test script to obtain reward.json.
数据集概述
swe-task-forge-tasks 是一个软件工程智能体任务池数据集,由 Zeng-Weijun 维护,托管于 Hugging Face。该数据集包含 178 个任务,其中 178 个被尝试、135 个被解决,任务来源包括 build、carve、revert、mining 和 swebench 等多种类型。
数据结构
MANIFEST.jsonl:每个任务一个forge-task.v1信封。tasks/<task_id>/:Harbor 软件包,包含task.toml、instruction.md、environment/Dockerfile、tests/、solution/和runs/。- 任务通过
env_id指定镜像名称,镜像字节存储在swe-task-forge-environments仓库中。 - 基准测试(Benches)通过引用选择池中的任务,位于
swe-task-forge-benches仓库。
任务使用流程
docker load加载任务镜像docker build -f environment/Dockerfile构建环境- 智能体在容器内工作(无网络)
- 将
tests/和solution/拷入容器,由 root 运行sh /tests/test.sh查看reward.json
版本与批次
batch-2(2026-09-07,当前,138 题)
由三条流水线并行生成,来源为 55 个可用镜像。
| 线 | 任务数 | 环境数 | glm-5.3 解决率 | 中位步数 | 满 30 步任务数 |
|---|---|---|---|---|---|
| carve | 94 | 35 | 69/94 (73%) | 21 | 39 |
| fault | 19 | 19 | 19/19 (100%) | 13 | 0 |
| mining | 25 | 15 | 18/25 (72%) | 20 | 12 |
| 合计 | 138 | 40(去重) | 106/138 (77%) |
关键变更:镜像中的 .git 目录被移至 /root/.forge-sealed-git,使容器内 git 命令失效,防止模型直接读取历史中的答案。封存后 carve 解决率从 95% 降至 73%(22 个百分点差异源于模型读取答案)。
fault 线说明:fault 线 19 个任务全为“依赖被删→装回去”的单一形状,全部被 glm-5.3 解决(100%),缺乏区分度;其答案藏于 /root/.forge-hidden/setup.sh,不受 .git 封存影响。
已知问题:
- carve 线最大掉落为
nothing_to_hollow(177/424) - mining 线主要掉落为
suite_indifferent_to_commit(116)和gold_patch_does_not_apply(76) - fault 线 environment 家族 485/523 不咬
fault v1.0.0(2026-09-05,4 题)
修复类任务,代码未改动,但机器损坏或依赖缺失,agent 需排查修复。来源为 15 个 docker、139 个候选,经两臂门筛选出 4 个。glm-5.3 解决 3/4(75%),全部来自 build 家族。environment 家族 128/134 不咬,产量取决于“套件触及机器”的程度。
carve v1.0.0(2026-09-05,36 题,当前)
将覆盖模块的测试与代码一并抽走,题面要求“写测试是任务的一部分”,判分采用原版测试。来源为 15 个 docker、68 个候选 → 43 个找到覆盖测试 → 36 个过两臂门 → 交付 10 个环境。glm-5.3 解决 26/36(72%),中位 19 步。未解决的题呈现出预期难度形状:实现正确、自写测试通过,但未猜中原作者测试的细节(如异常措辞、边界值)。
v0(2026-09-05,59 题,已下线)
测试留在容器内,glm-5.3 解决 58/59(98%)。阅读 60 个 trace 发现 23 个为直接 cat 测试后写代码,属“抄规格”而非解题,故下线并删除目录(镜像保留复用)。
官方数据说明
- 三仓库分工:
-environments存放 docker 镜像(每镜像一份),-tasks存放全部任务(大池子),-benches仅存放 task_id 选择列表。 - 每批数据在 README 顶部增补记录(添加时间、版本、原因、数量、质量、smoke 结果)。
- 上半部分表格由上传器自动生成,无需手动修改。
- README 同时存在于仓库
docs/DATA_README.md和 Hugging Face 页面下半部分。




