遇见数据集

SWE-Touch

收藏
github2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

SWE-Touch是一个用于评估在用户编辑同一工作空间时编码代理性能的数据集。它研究代理在用户更改仓库状态后是否能够继续修复任务。数据集包含200个SWE-bench Verified记录、25个SWE-Bench Pro记录和25个DeepSWE记录,其中242条记录包含独立验证的代码编辑,8条记录包含文档化的仅消息回退。每个JSONL行包括任务关键区域、用户编辑或回退、触发计划、验证结果和用户模拟器提示标识符。

SWE-Touch is a dataset designed to evaluate the performance of coding agents during collaborative editing of the same workspace. It investigates whether agents can continue to resolve repair tasks after the user modifies the repository state. The dataset includes 200 SWE-bench Verified entries, 25 SWE-Bench Pro entries, and 25 DeepSWE entries. Among these entries, 242 contain independently validated code edits, while 8 entries feature documented message-only rollbacks. Each JSONL line includes task-critical regions, user edits or rollbacks, trigger plans, validation results, and user simulator prompt identifiers.

创建时间:
2026-07-26
原始信息汇总

SWE-Touch 数据集详情

概述

SWE-Touch 是一个用于评估编码智能体(coding agent)在用户编辑同一工作区时表现的基准测试数据集。该数据集研究当用户更改仓库状态后,智能体是否能够继续完成代码修复任务。

数据集规模

版本 v0.1.0 包含:

  • 200 条 SWE-bench Verified 记录
  • 25 条 SWE-Bench Pro 记录
  • 25 条 DeepSWE 记录

其中,242 条记录包含独立验证的代码编辑,8 条记录包含文档记录的仅消息回退(message-only fallback)。

数据格式

每条 JSONL 行包含:

  • 任务关键区域
  • 用户编辑或回退操作
  • 触发调度
  • 验证结果
  • 用户模拟器提示标识符

详细格式文档位于 schema/docs/data_schema.md

数据集构建流程

数据集通过以下四个阶段构建:

  1. 挖掘任务关键区域:从模型轨迹中合并连续的编辑行,偏好跨越轨迹的重叠部分。若轨迹中无编辑,则使用参考补丁作为候选。
  2. 生成用户编辑:通过未修改的 Mini-SWE-Agent 接口运行补丁生成器,利用下发的任务指令提供关键区域和可执行验证命令。
  3. 验证每个编辑:运行三个独立的 Harbor 任务,确保参考修复通过、用户编辑单独失败、用户编辑后跟参考修复也失败。
  4. 组装记录:将区域、候选和验证结果合并为 JSONL 格式。

评估方式

评估比较同一 Harbor 任务的两次运行:

  • Vanilla 运行:无用户干预的 Mini-SWE-Agent
  • Counter-Edit 运行:保持任务、模型、工具、验证器和步数预算不变,在智能体到达任务关键区域时应用用户的编辑,并在下一个模型轮次中作为 role=user 消息注入。

数据来源

SWE-Touch 干预记录独立于第三方仓库镜像或测试。对应的 Harbor 任务源自 SWE-bench Verified、SWE-Bench Pro 和 DeepSWE 项目。

许可证

  • SWE-Touch 源码:MIT 许可证
  • Harbor fork:Apache-2.0 许可证

相关链接

  • 数据集 Hugging Face 地址:https://huggingface.co/datasets/Trae1ounG/SWE-Touch
  • GitHub 仓库:https://github.com/Trae1ounG/SWE-Touch
搜集汇总
数据集介绍
SWE-Touch 数据集图片
构建方式
SWE-Touch数据集的构建源于对真实软件开发场景的深刻洞察,旨在评估编码智能体在用户实时编辑代码环境中的鲁棒性。其构建流程严谨且层次分明:首先,从成功的修复轨迹中挖掘任务关键区域,通过合并模型轨迹中的连续编辑行并优先考虑轨迹间的重叠区域来定位。随后,利用未改动的Mini-SWE-Agent接口生成用户编辑,并为每个编辑设计三个独立的验证状态——参考修复必须通过、用户编辑单独必须失败、用户编辑后接参考修复也必须失败。最后,将任务关键区域、候选编辑及其验证结果整合为统一的JSONL格式,形成完整的评估记录。
特点
SWE-Touch数据集的核心特色在于其独特的对抗性编辑机制与生态整合能力。它并非简单地引入随机干扰,而是通过在任务关键区域注入经过严格验证的用户编辑,模拟真实协作中代码状态被局部修改后智能体仍需继续完成修复的复杂场景。数据集包含200条SWE-bench Verified、25条SWE-bench Pro和25条DeepSWE记录,总计250条实例,其中242条包含独立验证的代码编辑。特别地,用户干预被实现为独立的`role=user`消息而非嵌入工具输出,保证了交互协议的纯净性。与Harbor和Mini-SWE-Agent的无缝集成,使其能够直接利用现有评估框架,大幅降低了使用门槛。
使用方法
使用SWE-Touch数据集进行评测需遵循明确的流水线式流程。首先通过Hugging Face下载发布包或直接使用源码中的版本化数据,并利用`swe-touch download`命令获取。接着,需要从原始项目获取对应的Harbor任务,包括SWE-bench Verified、SWE-bench Pro和DeepSWE,并通过`prepare-paired`命令将数据集中的实例ID与任务目录中的内容进行精确匹配。评估采用配对运行模式:一次执行无用户干预的Vanilla版本,另一次执行施加对抗性编辑的Counter-Edit版本,两者共享相同的模型、工具和验证器配置。最终通过`aggregate`命令汇总结果,自动分离未解决任务与基础设施错误,并记录完整的token消耗统计。所有模型调用均遵循LiteLLM标准,确保了提供商的灵活切换。
背景与挑战
背景概述
SWE-Touch数据集由Trae1ounG团队于近期创建,旨在评估编程智能体在用户实时编辑代码工作区时的鲁棒性。该研究聚焦于一个核心问题:当用户在同一软件任务进程中修改仓库状态时,智能体能否维持并继续执行代码修复。数据集基于Harbor框架扩展,保留了Mini-SWE-Agent的系统提示、工具接口和交互循环,并整合了来自SWE-bench Verified、SWE-Bench Pro和DeepSWE的250条记录,其中242条包含独立验证的代码编辑。这一创新性基准测试填补了现有评估体系在动态人机协作场景下的空白,为研究交互式代码生成与修复的智能体行为提供了标准化测试平台。
当前挑战
SWE-Touch所解决的领域挑战在于传统编码智能体评估仅关注静态、无干预的独立任务,缺乏对用户动态编辑影响的考量,而现实中软件开发常伴随实时协作与代码调整。构建过程中面临的挑战包括:1)从成功修复轨迹中挖掘任务关键区域,要求在无编辑轨迹时利用参考补丁进行容错处理;2)设计反编辑记录——即用户编辑必须能独立导致修复失败,但结合原始修复后又无法通过验证,这一三态校验机制需在Harbor容器中分别执行三次独立流程以确保因果有效性;3)在运行时精准注入用户干预,仅当智能体进入任务关键区域时才触发编辑消息,且干预不嵌入工具调用或输出,避免扭曲智能体的正常行为模式。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域,SWE-Touch数据集专为评估编码智能体在用户实时编辑代码仓库时的鲁棒性而设计。经典使用场景是模拟开发过程中用户对同一工作区的代码进行修改后,编码智能体能否继续完成原有的修复任务。研究者通过对比无干预的原始运行(Vanilla)与注入用户编辑后的运行(Counter-Edit),精准量化智能体面对动态代码环境时的适应能力,从而深入理解人机协同编程中智能体对意外变化的响应机制。
衍生相关工作
SWE-Touch催生了多个具有影响力的衍生研究方向。一方面,其公开的构建流程和验证门控(validation gates)机制被后续工作直接复用,用于生成更多细粒度的用户干预数据集,例如针对不同编辑类型(语法错误、逻辑变更)的专项评估。另一方面,基于该数据集涌现出若干改进编码智能体架构的工作,如引入回滚感知模块或动态重规划策略,以在用户编辑后主动重建问题空间。此外,任务关键区域挖掘算法也被借鉴到其他软件工程任务中,用于识别代码修复过程中的瓶颈步骤,促进了可解释智能体研究的发展。
数据集最近研究
最新研究方向
在软件工程与人工智能的交叉领域,SWE-Touch聚焦于动态用户交互场景下代码智能体的鲁棒性评估,突破了传统静态基准测试的局限。该数据集通过构建任务关键区域挖掘与用户编辑注入框架,系统性地量化了当开发者在智能体执行修复过程中实时修改代码仓库时,模型能否维持高效的故障修复能力。这一研究方向紧密契合了当前大语言模型驱动的代码助手从实验室走向真实协作开发环境的迫切需求,尤其是针对持续集成流水线中代码冲突、上下文漂移等工程痛点的解决。SWE-Touch所引入的反事实编辑验证机制与双通道评估范式,为下一代自适应代码智能体的研发提供了严谨的评测基准,推动代码生成技术向更稳健的人机协作模式演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务