遇见数据集

SWE-Explore

收藏
arXiv2026-06-05 更新2026-06-09 收录
官方服务:

资源简介:

SWE-Explore是由上海交通大学等机构联合构建的代码仓库探索基准数据集,旨在精细评估智能编码代理在解决软件问题时的代码探索能力。该数据集包含848个实例,覆盖10种编程语言和203个开源仓库,每个实例平均包含4.3个核心文件及1,578行代码,数据源自SWE-bench Verified、SWE-bench-Pro等公开资源,并通过成功代理轨迹自动提取行级真实标注。数据集通过隔离代码探索与修复过程,为评估检索方法、智能代理的上下文选择效率提供标准化测试平台,专注于解决代码定位、证据发现等软件工程中的关键挑战。

SWE-Explore is a code repository exploration benchmark dataset jointly constructed by Shanghai Jiao Tong University and other institutions, aiming to precisely evaluate the code exploration capabilities of intelligent coding AI Agents when solving software engineering problems. This dataset contains 848 instances, covering 10 programming languages and 203 open-source repositories. Each instance includes an average of 4.3 core files and 1,578 lines of code. The dataset is sourced from public resources such as SWE-bench Verified and SWE-bench-Pro, with line-level ground truth annotations automatically extracted from successful agent trajectories. By isolating the code exploration and repair processes, it provides a standardized testbed for evaluating retrieval methods and the context selection efficiency of intelligent AI Agents, focusing on addressing key challenges in software engineering including code localization and evidence discovery.

创建时间:
2026-06-05
原始信息汇总

数据集名称:SWE-Explore-Bench

核心定位:一个基于轨迹的基准测试,用于评估编码代理在编辑代码之前探索、定位和排序仓库上下文的能力。给定一个真实问题和一个仓库快照,探索器需要返回一个按相关性排序的源文件和行范围列表。SWE-Explore 会根据从成功的修复轨迹中提取的行级真实标签,对这些区域进行评分。

发布信息

设计动机

  • 现有的仓库级编码基准通常评估整个修复流程,仅提供最终的成功/失败信号,这掩盖了代理是否真正找到了正确的上下文。
  • SWE-Explore 将探索阶段独立出来进行直接评估,专注于代理在生成补丁之前读取或返回的代码区域。
  • 提供了基于轨迹的标签(核心上下文和可选上下文)、行级监督(评分文件、区域和排序的行预算)以及修复感知验证。

数据集规模与组成

  • 问题数量:848 个问题。
  • 开源仓库数量:203 个。
  • 编程语言:覆盖 10 种编程语言。
  • 数据内容:每个实例包含问题描述、仓库快照元数据、行级核心和可选真实标签、读取步骤来源以及基准元数据。

基准数据格式

  • 数据集以 JSONL 格式提供。
  • 每个实例包含以下关键字段:
    • instance_id:SWE 风格的问题标识符。
    • repo_path / repo_dir:仓库路径信息。
    • ground_truth:包含核心文件、核心区域、可选区域、修改文件和主文件。
    • read_step_info:读取步骤来源,用于行细化。
    • meta:实例级元数据。

评估指标

  • precision(行级精确率)
  • recall(行级召回率)
  • f1_score(F1 分数)
  • hit_file_rate(命中核心文件的比率)
  • noise_file_rate(预测文件中非核心/可选文件的比率)
  • hit_region_rate(命中核心区域的比率)
  • noise_region_rate(预测区域中非核心/可选区域的比率)
  • weighted_core_coverage(加权核心覆盖率)
  • context_efficiency(上下文效率)
  • recall_at_K / ndcg_at_K(排名感知指标)
  • first_useful_hit(首次有用命中的归一化排名)

支持的探索器

  • 本地检索bm25, tfidf, potion, rag, embed, swerank
  • 简单基线oracle, random, simple_rule
  • 代理 CLIclaude_code, cursor
  • 学术代理autocr, cosil, locagent, orcaloca, mini_swe_agent, awe_agent
搜集汇总
数据集介绍
SWE-Explore 数据集图片
构建方式
SWE-Explore基准数据集以仓库级别的代码探勘能力为核心评估目标,其构建过程严格依托于三个公开的仓库级数据源:SWE-bench Verified、SWE-bench-Pro以及SWE-bench Multilingual。对于每一个实例,必须确保至少存在两个由强语言模型(如GPT-5.4、Gemini-3-Pro、Sonnet-4.6等)成功解决同一问题的独立代理轨迹,方能纳入基准。轨迹完成后,系统从这些成功轨迹中提取所有可观测的读取操作(如编辑器视图、shell读取命令及grep命中结果),并通过跨轨迹交叉聚合生成线级别的核心上下文区域。随后利用大语言模型对候选区域进行精炼,将那些虽不在交集中但与问题解决密切相关的可选读取提升为核心参考,最后经人工审计确保监督信号的高质量与一致性,最终形成848个实例,覆盖10种编程语言与203个开源仓库。
特点
SWE-Explore的最大特点在于其实现了对仓库探勘能力的细粒度独立评估,突破了传统端到端修复基准中将问题简化为二元成败标签的局限性。该基准引入了轨迹驱动的线级别真实标注机制,将探勘任务形式化为在固定行预算下返回一个排序后的代码区域列表,从而使稀疏检索器、自主代理以及长上下文选择器能够在同一尺度上进行比较。评价体系涵盖覆盖度、排序质量与上下文效率三大维度,包括精确率、nDCG、首位有效命中以及上下文效率等指标,且实验验证这些探勘指标与下游修复成功率之间存在强相关性。尤为重要的是,SWE-Explore揭示了当前代码代理虽然文件级别定位能力较强,但在线级别召回上普遍存在瓶颈,这一发现为后续研究指明了关键改进方向。
使用方法
使用SWE-Explore时,研究者需给定一个仓库快照与一个问题的自然语言描述,探勘系统需返回最多K个排序后的相关代码区域(默认为K=5),每个区域由文件路径及闭合的行区间构成。基准提供的评估流水线首先将输出与轨迹衍生的核心上下文进行比对,自动计算覆盖度、排序与效率指标。为验证探勘质量的实际意义,基准还配备一个受控的下游验证协议:将探勘器输出的上下文作为唯一可见代码提供给固定补丁生成代理,由原始测试套件判定补丁是否正确,该协议不参与标准评价循环,专用于指标的效度验证。无论是经典的TF-IDF检索方法还是复杂的自主代码代理,所有方法均需遵循相同的排序区域输出格式,从而确保评估的公平性与可复现性。
背景与挑战
背景概述
在人工智能驱动的软件工程领域,代码代理(coding agents)的兴起显著加速了仓库级代码修复任务的发展,诸如SWE-bench等基准测试推动了这一领域的快速进步。然而,这些基准通常将编程任务简化为单一的成功或失败预测,忽略了关键能力如仓库理解、上下文检索和代码定位的细粒度评估。SWE-Explore由上海交通大学、新疆大学等机构的研究人员于2025年提出,旨在将“仓库探索”从端到端修复中剥离出来,作为独立的评估目标。该基准涵盖848个实际问题、10种编程语言和203个开源仓库,通过从成功代理轨迹中提取行级真实标注,评估探索者在固定行预算下对相关代码区域的排序与覆盖能力,为代码代理的研究提供了全新的评价视角,有力推动了代理推理与上下文检索的深度融合。
当前挑战
SWE-Explore所面对的挑战主要来自两个方面。首先,在领域核心问题上,现有基准无法对代理的探索行为进行精细度量——文件级定位虽易达成,但行级覆盖率却严重不足;大多数代码代理虽能快速定位相关文件,却遗漏了在实际修复中至关重要的具体代码区间,导致召回率低下。其次,在基准构建过程中,手动标注行级相关区域极为昂贵且难以保持一致性,尤其是面对多语言、大规模仓库时,不同人员对“必要上下文”的界定往往大相径庭。为克服这一挑战,SWE-Explore创新性地提出轨迹监督标注方法:仅依赖至少两次成功解法的代理轨迹,通过跨轨迹的交集与精炼,自动提取高置信度的核心上下文,再辅以人工审核,从而保证标注的准确性与可重复性。
常用场景
经典使用场景
在软件工程与人工智能的交叉领域中,SWE-Explore被广泛用作评估代码智能体仓库探索能力的核心基准。传统的端到端代码修复任务往往将复杂问题简化为二元解决判定,而SWE-Explore独辟蹊径,通过要求智能体在限定行预算下返回相关代码区域的排序列表,精准衡量其对大型代码仓储的浏览、理解与关键信息定位能力。该数据集覆盖848个真实软件问题,横跨10种编程语言及203个开源仓库,为研究者提供了一个精细至行级粒度的标准化评估舞台。
衍生相关工作
SWE-Explore的发布催生了一系列重要的后续研究工作。在探索方法层面,AutoCodeRover、LocAgent、OrcaLoca等基于大语言模型的定位代理在与其对比中不断演进优化,CoSIL提出的迭代代码图搜索策略更是实现了显著的行级召回率突破。在评估体系方面,ContextBench和SWE-ContextBench借鉴了其轨迹驱动的标注思路,拓展了上下文检索与经验复用的评价维度。更为深远的是,SWE-Explore所倡导的行级细粒度评估范式,已渗透至SWE-Pruner的上下文压缩、SWE-Exp的经验驱动修复以及多智能体辩论等多个新兴研究方向,形成了以探索质量为核心指标的完整学术生态。
数据集最近研究
最新研究方向
当前,以SWE-Explore为代表的细粒度基准测试方法,引导编码智能体的研究从端到端的修复成功率的整体评估,转向对代码仓库探索这一核心子能力的精细化度量。前沿方向聚焦于解构智能体在仓库理解、上下文检索、代码定位与缺陷诊断等环节的表现,并通过轨迹衍生的行级标注,实现检索器、搜索智能体与长上下文选择器在覆盖率、排序效率与上下文精简度等维度上的可比性评估。这一方法论革新揭示了当前主流智能体在文件级定位上表现优异,但在行级召回方面仍存在显著瓶颈,且缺失核心证据对修复结果的损害远大于冗余上下文。该研究为构建更全面、高效的代码仓库探索机制提供了关键的评估框架与优化方向。
相关研究论文
  • 1
    SWE-Explore: Benchmarking How Coding Agents Explore Repositories上海交通大学; 新疆大学; 伊利诺伊大学厄巴纳-香槟分校; 独立研究员; 香港中文大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务