遇见数据集

SWE-Interact

收藏
github2026-07-01 更新2026-07-03 收录
官方服务:

资源简介:

SWE-Interact是一个包含75个任务的基准测试,用于在现实用户驱动的开发环境中评估编码代理在多轮软件工程任务上的表现。该数据集提供任务数据和运行配置示例。

SWE-Interact is a benchmark containing 75 tasks, designed to evaluate the performance of coding agents on multi-turn software engineering tasks within real-world user-driven development environments. This dataset provides task data and examples of runtime configurations.

创建时间:
2026-06-29
原始信息汇总

数据集概述:SWE-Interact

SWE-Interact 是一个用于评估编码智能体在多轮软件工程任务中表现的基准测试,包含 75 个任务,模拟真实的用户驱动开发场景。

核心信息

  • 任务规模:75 个多轮交互式软件工程任务。
  • 目标:评估编码智能体在真实、用户驱动的软件开发过程中的能力。
  • 数据与配置:该仓库提供了任务数据 (data/multiturn/) 和示例运行配置文件 (run_configs/multiturn/)。

技术环境与运行要求

  • 核心框架:依赖开源框架 Harbor 运行。
  • 运行环境:基于 Modal 提供沙盒环境。
  • 环境变量配置:需要在 harbor/.env 文件中配置 API 密钥,支持多种模型后端(如 OpenAI、Anthropic、Gemini、Kimi)。

使用方式

  • 运行示例:通过执行仓库根目录下的 .sh 脚本来启动任务。
    • 多轮任务示例bash run_configs/multiturn/gpt-5p5-high_codex.sh
    • 单轮任务示例bash run_configs/singleturn/gpt-5p5-high_codex.sh
  • 输出:运行结果会写入 results/ 目录下。
  • 自定义配置:用户可以复制并修改现有脚本以调整智能体、模型、采样次数或 Harbor 参数。

引用信息

如果研究中使用 SWE-Interact,请引用以下论文:

  • 论文标题:SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
  • 作者:Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He
  • 预印本:arXiv:2606.30573
  • 链接:https://arxiv.org/abs/2606.30573
搜集汇总
数据集介绍
SWE-Interact 数据集图片
构建方式
SWE-Interact数据集源自对现实世界中用户与人工智能体交互式编程场景的深刻洞察,其构建过程围绕多轮对话驱动的软件工程任务展开。该基准测试精心遴选了75个具有代表性的任务实例,每个任务均被设计为包含连续多轮用户需求与智能体响应的完整会话流程。数据集的组织结构清晰鲜明,核心数据存放于data/multiturn目录下,而配套的运行配置脚本则置于run_configs/multiturn中,便于研究者理解任务设计与执行流程之间的映射关系。这种分层式的架构不仅模拟了真实开发环境中的渐进式协作模式,还为评估智能体在长期交互中的表现提供了标准化框架。
使用方法
使用SWE-Interact数据集首先需要安装Harbor运行框架,通过克隆其GitHub仓库并利用uv工具完成安装部署。随后需配置Modal沙箱环境以确保任务执行的安全性。在启动实验前,需在harbor/.env文件中设定环境变量,其中公共部分需填写兼容LiteLLM网关的OPENAI_API_KEY与OPENAI_API_BASE地址,以同时支持模拟用户模型与评价模型。研究者可根据所选智能体配置(如GPT-5.5、Claude Opus-4.8等)额外添加对应模型密钥。执行实验时,只需在仓库根目录运行相应的shell脚本即可,如bash run_configs/multiturn/gpt-5p5-high_codex.sh启动多轮任务。运行结果将自动写入results目录,研究者也可通过修改脚本参数自定义智能体、模型或采样次数等实验设置。
背景与挑战
背景概述
SWE-Interact是由Mohit Raghavendra、Anisha Gunjal、Aakash Sabharwal和Yunzhong He等研究者在2026年提出的一个基准测试,旨在重新构想软件工程(SWE)基准测试,将其从静态的单轮任务转变为用户驱动的多轮、长时间编程会话。该数据集包含75个多轮任务,模拟了真实开发场景中用户与编码代理之间的迭代交互过程。其核心研究问题在于评估编码代理在复杂的、用户需求不断演变的软件开发环境中的表现,超越了传统基准测试对单一指令执行的局限。SWE-Interact的发布对智能编码代理和自动化软件工程领域产生了重要影响,推动了对交互式、上下文感知型编程系统的研究,为衡量代理在真实世界软件开发中的适应性、记忆力和问题解决能力提供了标准化框架。
当前挑战
SWE-Interact面临的核心挑战源于其对真实用户驱动开发场景的模拟,这要求编码代理具备处理多轮对话中的上下文依赖性、需求模糊性和渐进式问题分解能力。具体而言,领域挑战包括:如何让代理在长时间会话中保持对先前交互的记忆一致性,避免对用户意图的误解或遗忘;如何应对用户需求在迭代过程中的动态变化,从而进行有效的代码重构和扩展。在构建过程中,挑战则集中于:设计逼真且可重复的多轮交互任务,确保每轮任务的分割合理且难度递增;构建高性能的模拟用户模型(如使用GPT-5.5)以生成自然且有指导性的反馈,同时保证评判标准(如RF评分体系)的公平性;以及处理不同代理配置(如GPT-5.5、Claude Opus、Gemini等)在多样化运行环境中的兼容性和结果可比性。
常用场景
经典使用场景
SWE-Interact数据集,作为一款专注于多轮交互式软件工程任务的基准测试,其经典使用场景体现在评估编码智能体在真实用户驱动开发环境中的表现。该数据集精心构建了75项任务,每一任务均模拟了开发者与用户之间持续的、多轮次的协作会话,要求智能体不仅能够理解初始问题描述,还需在后续对话中根据用户反馈动态调整代码方案。这种设计精准捕捉了实际软件开发中需求渐变、即时纠错与迭代优化的核心特征,为检验智能体在长期、上下文敏感的开发会话中的推理与编程能力提供了理想的实验平台。研究者借助该数据集,能够系统性地量化模型在多轮交互中的鲁棒性、适应性及代码生成质量,从而推动更贴近人类协作模式的编码智能体研究。
解决学术问题
在学术研究层面,SWE-Interact数据集有效填补了现有软件工程基准测试在模拟用户驱动多轮交互方面的空白。传统单轮基准任务(如SWE-Bench)仅考察模型基于静态描述的一次性代码生成能力,忽视了真实开发场景中需求解释模糊、功能需要逐步细化以及用户反馈迭代等复杂动态过程。该数据集通过构建包含多轮对话历史的任务结构,使得研究者能够深入探讨智能体在长程上下文维护、意图澄清、增量式代码修改以及错误纠正等关键能力上的表现。该工作的意义在于,它将编码智能体的评估范式从静态任务求解拓展至动态人机协作范畴,为后续研究提供了更为贴近实际开发流程的评估框架,并促进了对话式代码生成、交互式调试等领域理论的深化与验证。
实际应用
在实际应用场景中,SWE-Interact数据集为开发更智能、更自然的编程辅助工具注入了强劲动力。例如,基于该数据集训练或评估的编码智能体可被集成到现代集成开发环境(IDE)中,充当能够理解复杂、模糊请求的协作型编程助手。当用户提出初步功能需求后,智能体不仅生成初始代码,还能在用户指出不足或提出新约束时,实时调整实现方案,确保产出贴合预期。该数据集还适用于自动化故障排除场景,其中开发人员可以与智能体进行多轮对话,逐步定位并修复问题代码,提升调试效率。此外,在代码审查与重构任务中,智能体能够基于用户对代码风格、性能或可维护性的反馈,迭代优化已有代码库,从而加速团队协作流程,降低沟通成本。
数据集最近研究
最新研究方向
SWE-Interact作为面向多轮交互式软件工程任务的基准测试,代表了代码生成智能体评估从单次静态任务向用户驱动的长时程开发会话演进的前沿方向。该数据集基于75个真实场景构造,深度契合当前大语言模型在代码协作领域向“Agent化”和“交互式编程”转型的热点趋势,强调模型需在动态反馈、需求澄清与代码迭代中展现持久规划与上下文连贯能力。这一工作不仅揭示了现有编码智能体在处理非确定性、多轮用户指令时的性能瓶颈,也为构建更贴近实际开发流程的评估体系奠定了方法论基础,推动了软件工程自动化研究从“一次性代码生成”迈向“人机协同演进”的新阶段。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务