SWE-Touch
收藏资源简介:
SWE-Touch是一个用于评估在用户编辑同一工作空间时编码代理性能的数据集。它研究代理在用户更改仓库状态后是否能够继续修复任务。数据集包含200个SWE-bench Verified记录、25个SWE-Bench Pro记录和25个DeepSWE记录,其中242条记录包含独立验证的代码编辑,8条记录包含文档化的仅消息回退。每个JSONL行包括任务关键区域、用户编辑或回退、触发计划、验证结果和用户模拟器提示标识符。
SWE-Touch is a dataset designed to evaluate the performance of coding agents during collaborative editing of the same workspace. It investigates whether agents can continue to resolve repair tasks after the user modifies the repository state. The dataset includes 200 SWE-bench Verified entries, 25 SWE-Bench Pro entries, and 25 DeepSWE entries. Among these entries, 242 contain independently validated code edits, while 8 entries feature documented message-only rollbacks. Each JSONL line includes task-critical regions, user edits or rollbacks, trigger plans, validation results, and user simulator prompt identifiers.
SWE-Touch 数据集详情
概述
SWE-Touch 是一个用于评估编码智能体(coding agent)在用户编辑同一工作区时表现的基准测试数据集。该数据集研究当用户更改仓库状态后,智能体是否能够继续完成代码修复任务。
数据集规模
版本 v0.1.0 包含:
- 200 条 SWE-bench Verified 记录
- 25 条 SWE-Bench Pro 记录
- 25 条 DeepSWE 记录
其中,242 条记录包含独立验证的代码编辑,8 条记录包含文档记录的仅消息回退(message-only fallback)。
数据格式
每条 JSONL 行包含:
- 任务关键区域
- 用户编辑或回退操作
- 触发调度
- 验证结果
- 用户模拟器提示标识符
详细格式文档位于 schema/ 和 docs/data_schema.md。
数据集构建流程
数据集通过以下四个阶段构建:
- 挖掘任务关键区域:从模型轨迹中合并连续的编辑行,偏好跨越轨迹的重叠部分。若轨迹中无编辑,则使用参考补丁作为候选。
- 生成用户编辑:通过未修改的 Mini-SWE-Agent 接口运行补丁生成器,利用下发的任务指令提供关键区域和可执行验证命令。
- 验证每个编辑:运行三个独立的 Harbor 任务,确保参考修复通过、用户编辑单独失败、用户编辑后跟参考修复也失败。
- 组装记录:将区域、候选和验证结果合并为 JSONL 格式。
评估方式
评估比较同一 Harbor 任务的两次运行:
- Vanilla 运行:无用户干预的 Mini-SWE-Agent
- Counter-Edit 运行:保持任务、模型、工具、验证器和步数预算不变,在智能体到达任务关键区域时应用用户的编辑,并在下一个模型轮次中作为
role=user消息注入。
数据来源
SWE-Touch 干预记录独立于第三方仓库镜像或测试。对应的 Harbor 任务源自 SWE-bench Verified、SWE-Bench Pro 和 DeepSWE 项目。
许可证
- SWE-Touch 源码:MIT 许可证
- Harbor fork:Apache-2.0 许可证
相关链接
- 数据集 Hugging Face 地址:https://huggingface.co/datasets/Trae1ounG/SWE-Touch
- GitHub 仓库:https://github.com/Trae1ounG/SWE-Touch




