遇见数据集

DeepSWE1.1-trajectories-Qwen3.8-27B

收藏
Hugging Face2026-09-09 更新2026-09-10 收录
官方服务:

资源简介:

数据集“DeepSWE 1.1 Agent Trajectories — Qwen3.8-27B”包含在 DeepSWE 1.1 基准上进行 7 次完整运行的 agent 轨迹和评估结果。主要实验使用 Qwen3.8-27B 模型,分别通过 Mini-SWE、Claude Code 和 Pi 三种 agent 框架进行评估,并包含 Muse-Glimmer-30B 和 Qwen3.6-27B 作为较弱的参考基线。每次运行覆盖所有 113 个基准任务,总计包括 791 个任务级结果记录、791 个压缩的 agent 轨迹、425 个提交的文本补丁,以及精确的运行配置、总分和效率统计。DeepSWE 基准衡量 agent 在 113 个原创、长程软件工程任务上的表现,任务来源于活跃的 TypeScript、Go、Python、JavaScript 和 Rust 项目。每个任务中,agent 会收到一个隔离的仓库和一个自然语言请求,需要检查代码、实现所需行为、运行测试并提交补丁。DeepSWE 随后在干净副本上应用该补丁并用保留测试评分。数据集中每个任务的结果包含评分、状态、持续时间、使用指标和 artifact 可用性;轨迹包含任务提示、助手消息、推理轨迹、工具调用、工具输出和使用信息。该数据集适用于评估和比较不同 agent 框架下中等规模语言模型在复杂软件工程任务上的编码能力,以及分析 agent 推理轨迹和性能差异。

The dataset "DeepSWE 1.1 Agent Trajectories — Qwen3.8-27B" contains agent trajectories and evaluation results from 7 complete runs on the DeepSWE 1.1 benchmark. The main experiments use the Qwen3.8-27B model evaluated across three agent frameworks: Mini-SWE, Claude Code, and Pi, with Muse-Glimmer-30B and Qwen3.6-27B as weaker baselines. Each run covers all 113 benchmark tasks, totaling 791 task-level result records, 791 compressed agent trajectories, 425 submitted text patches, along with precise run configurations, total scores, and efficiency statistics. The DeepSWE benchmark measures agent performance on 113 original, long-range software engineering tasks sourced from active TypeScript, Go, Python, JavaScript, and Rust projects. In each task, the agent receives an isolated repository and a natural language request, requiring it to examine code, implement the desired behavior, run tests, and submit a patch. DeepSWE then applies the patch to a clean copy and scores it with held-out tests. Each task result includes score, status, duration, usage metrics, and artifact availability; trajectories include task prompts, assistant messages, reasoning traces, tool calls, tool outputs, and usage information. This dataset is suitable for evaluating and comparing the coding capabilities of medium-sized language models on complex software engineering tasks across different agent frameworks, and for analyzing agent reasoning trajectories and performance differences.

提供机构:
The Kaitchup
创建时间:
2026-09-09
原始信息汇总

DeepSWE 1.1 Agent Trajectories — Qwen3.8-27B 数据集总结

基本信息

  • 数据集名称:DeepSWE 1.1 Agent Trajectories — Qwen3.8-27B
  • 语言:英语(en)
  • 许可证:Apache-2.0
  • 任务类别:文本生成(text-generation)
  • 标签:coding-agents、software-engineering、evaluation、trajectories、deepswe
  • 数据规模:n<1K

数据集概述

该数据集包含来自 DeepSWE 1.1 上 7 次完整运行的智能体轨迹与评估结果。主要实验通过 Mini-SWE、Claude Code 和 Pi 评估 Qwen3.8-27B。Muse-Glimmer-30B 和 Qwen3.6-27B 作为较弱的参考基线纳入。

每次运行覆盖全部 113 个基准任务。数据集共包含:

  • 791 条任务级结果记录
  • 791 条压缩的智能体轨迹
  • 425 个提交的文本补丁(patch)
  • 精确的运行配置、聚合分数与效率统计

该仓库仅包含评估输出。任务、环境与验证器位于独立的 DeepSWE 仓库中。

什么是 DeepSWE

DeepSWE 在 113 个原创、长周期软件工程任务上衡量编码智能体,任务取自活跃的 TypeScript、Go、Python、JavaScript 和 Rust 项目。每个任务中,智能体获得一个隔离的仓库和自然语言请求,必须检查代码、实现所需行为、运行测试并提交补丁。DeepSWE 随后将该补丁应用到干净副本并用留出测试进行评分。

实验结果

模型 智能体 推理 F2P (%) 奖励 (%) 解决数 执行错误
Muse-Glimmer-30B Mini-SWE xhigh 39.43 5.31 6/113 19
Qwen3.6-27B Pi thinking on 63.44 3.54 4/113 1
Qwen3.8-27B Mini-SWE xhigh 77.42 41.59 47/113 0
Qwen3.8-27B Claude Code xhigh 88.52 42.48 48/113 0
Qwen3.8-27B Pi low 86.47 39.82 45/113 0
Qwen3.8-27B Pi medium 84.10 43.36 49/113 1
Qwen3.8-27B Pi xhigh 86.65 46.02 52/113 3

执行错误指智能体阶段以错误结束,并非获得零奖励的任务数量。精确的模型、采样、上下文窗口、输出限制、超时、重试和智能体版本设置可通过链接的 run.json 文件获取。

仓库结构

text README.md

summary/ main-results.csv efficiency-quantiles.csv

runs/ <run-id>/ run.json tasks/ <task-id>/ result.json trajectory.json.gz model.patch # 当可用时

  • run.json:包含运行配置、聚合分数、效率分布以及所有任务的索引。
  • result.json:包含单个任务的分数、状态、时长、使用指标和产物可用性。
  • trajectory.json.gz:包含任务提示、助手消息、推理轨迹、工具调用、工具输出和使用信息。不同智能体接口的消息细节略有不同。
  • model.patch:425 个任务可用,补丁可用性记录在每个任务的 result.json 中。

数据加载

下载本地快照:

python from pathlib import Path from huggingface_hub import snapshot_download

root = Path(snapshot_download( repo_id="kaitchup/DeepSWE1.1-trajectories-Qwen3.8-27B", repo_type="dataset", ))

读取结果表和一条轨迹:

python import csv import gzip import json

with (root / "summary" / "main-results.csv").open() as file: runs = list(csv.DictReader(file))

run_dir = root / "runs" / "qwen3.8-27b-pi-xhigh" task_dir = sorted((run_dir / "tasks").iterdir())[0] result = json.loads((task_dir / "result.json").read_text())

with gzip.open(task_dir / "trajectory.json.gz", "rt", encoding="utf-8") as file: trajectory = json.load(file)

print(result["task_name"], result["verifier"]) print("trajectory steps:", len(trajectory["steps"]))

局限性

  • 每个配置仅有一次运行,因此在没有重复的情况下,微小差异不应被视为具有统计显著性。
  • 智能体接口在提示、工具、上下文管理、重试策略和输出限制方面存在差异,因此这不是受控的仅模型比较。
  • lowmediumxhigh 是配置标签,并非跨不同智能体或模型的标准化推理计算量。
  • Token 和轮次计数来自不同的智能体适配器,可能无法完全可比。

致谢

Verda 提供了用于运行这些实验的 RTX Pro 6000 和 H200。

许可证与第三方代码

该数据集以 Apache-2.0 发布。基准任务使用各自许可证下的第三方开源项目。轨迹和补丁可能包含这些项目的摘录或修改,这些材料仍受其适用的上游许可证约束。

搜集汇总
数据集介绍
DeepSWE1.1-trajectories-Qwen3.8-27B 数据集图片
构建方式
本数据集源于对DeepSWE 1.1基准的全面评估,该基准涵盖113项源自TypeScript、Go、Python、JavaScript及Rust活跃项目的长时程软件工程任务。研究团队采用Qwen3.8-27B模型,分别通过Mini-SWE、Claude Code及Pi三种编码代理框架执行任务,并引入Muse-Glimmer-30B与Qwen3.6-27B作为参照基线。每一配置均完整遍历全部任务,记录代理的完整操作轨迹、推理痕迹及工具调用信息。对于其中425项任务,额外保留代理提交的文本补丁。最终,数据集汇集791条任务级结果记录及其对应的压缩轨迹文件,同时附有精确的运行配置、聚合得分及效率统计,构建方法严谨且可复现。
特点
该数据集的核心特色在于其高密度与高维度信息封装。每条轨迹记录囊括任务提示、助手消息、推理过程、工具调用与输出,以及资源使用指标,为解析代理行为提供全景视角。实验设计覆盖不同推理强度(低、中、高)与多种代理框架,使得数据集可支持跨配置对比分析。此外,数据集的独特价值还体现在其包含的补丁文件上,425份补丁为深入分析代理代码生成质量提供语料。整体上,数据集呈现多样化的性能表现,例如Qwen3.8-27B在Claude Code框架下达到88.52%的首补丁通过率,揭示模型能力与代理框架间的交互效应。
使用方法
使用者可通过Hugging Face库便捷获取数据快照,利用snapshot_download函数一次性下载全部文件。数据组织遵循清晰树状结构:summary目录提供汇总结果,runs目录下按配置分门别类的子目录存储每次运行的完整JSON配置、任务级结果及压缩轨迹。借助Python标准库即可解析内容,例如读取main-results.csv获取主结果表,通过gzip与json模块解压并加载轨迹文件,从而评估代理在多任务上的表现或分析特定轨迹的行为序列。该数据集适用于软件工程智能体性能基准测试、推理策略影响分析以及代理行为模式挖掘,为相关研究提供坚实数据基础。
背景与挑战
背景概述
DeepSWE 1.1 Agent Trajectories — Qwen3.8-27B 数据集由 kaitchup 团队于2025年创建,旨在系统评估大语言模型驱动的自主编码代理在长时程软件工程任务中的表现。该数据集基于 DeepSWE 基准,覆盖113项源自活跃 TypeScript、Go、Python、JavaScript 和 Rust 项目的原创任务,并通过 Mini-SWE、Claude Code 和 Pi 等代理界面记录 Qwen3.8-27B 等模型的完整执行轨迹与结果。研究核心聚焦于量化推理配置(如 low、medium、xhigh)对任务通过率、奖励分数及执行效率的影响。该数据集为代理轨迹透明化树立了新标杆,促进了编码代理的可复现性研究,对自主软件工程领域具有重要参考价值。
当前挑战
数据集所解决的领域问题在于长时程软件工程任务的复杂性,要求代理在隔离仓库中理解自然语言请求、定位相关代码、实施修改并通过隐藏测试,这对模型的代码推理与工具调用能力构成严峻挑战。构建过程中,研究团队面临多代理接口(如 Pi 与 Claude Code)在提示设计、工具集、上下文管理及重试策略上的异质性,导致无法进行纯模型层面的受控比较;同时,每个配置仅执行单次运行,使观测到的性能差异缺乏统计显著性,token 与轮次计数亦因适配器不同而难以直接对齐,这些因素均增加了评估结果解释的不确定性。
常用场景
经典使用场景
DeepSWE1.1-trajectories-Qwen3.8-27B数据集作为软件工程智能体领域的高质量轨迹评测资源,其核心应用场景集中于对代码生成智能体在长周期真实软件任务中的行为建模与能力评估。研究者可借助该数据集中的791条压缩智能体轨迹和425份补丁文件,系统分析模型在仓库级代码理解、天然语言需求解析、测试驱动开发及缺陷修复等多阶段决策链路中的表现。该数据集以其对TypeScript、Python、Go、Rust等主流语言跨项目任务的覆盖,为验证智能体在复杂代码库中的端到端任务完成能力提供了标准化测试平台,成为大语言模型软件工程应用研究中不可或缺的基准之一。
解决学术问题
该数据集有效破解了当前软件工程智能体研究面临的可复现性危机与评测碎片化困境。传统基准多聚焦于孤立函数级任务,难以捕捉智能体在真实项目环境下进行多文件修改、依赖管理及测试验证时的复合推理能力。本数据集通过统一的113项任务划分、精确到每一轮工具调用的轨迹记录以及可量化的奖励评分体系,使学术社群得以客观对比不同智能体架构(如Mini-SWE、Claude Code、Pi)与推理策略的效能差异。其提供的标准化运行配置与效率统计,为消解因环境差异导致的评测偏差提供了数据支撑,极大促进了代码智能体泛化能力与鲁棒性研究的严谨性。
衍生相关工作
该数据集作为深度软件工程基准的组成部分,已衍生出一系列前沿研究脉络。在智能体方法论层面,研究者基于轨迹数据训练更优的策略模型,如利用逆强化学习从成功轨迹中提取奖励函数,或通过行为克隆来增强基础模型的仓库级导航能力。在评测技术演进方面,数据集中细粒度的推理路径记录催生了面向智能体过程监督的新型指标设计,推动评测从单纯的结果导向转为行为导向。此外,该数据集也助力了工具集成学习的研究,通过对比不同智能体接口(如Pi与Claude Code)的调用模式,学者们开始探索自适应工具选择机制。其补丁数据还支撑了代码差分质量评估模型的训练,为自动代码审查领域注入新动能。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务