遇见数据集

swebench-phase6-verdict-circuit

收藏
Hugging Face2026-06-12 更新2026-06-13 收录
官方服务:

资源简介:

SWE-bench Pro Agent WANDERING — Verdict-Circuit 数据集包含99条来自SWE-bench Pro任务的长程编码代理轨迹,这些轨迹由Qwen3.6-27B模型生成,并经过人工标注,分为三类结果:成功(40条)、锁定(39条)和WANDERING(20条)。数据集还包含每条轨迹的机制特征以及捕获的决策点状态,支持WANDERING研究弧(OpenInterpretability)中的多项研究,如工具熵崩溃检测、因果控制、行为救援和判决特征等。数据文件包括:features_n99.csv(每条轨迹的特征和子类标签)、traces.tar.gz(原始代理轨迹的JSON文件,包含每轮的工具调用、工具结果和思考内容)、results/目录(电路中断器Tier-1输出,如每点的McNemar向量、密集ΔP配置文件和确定性决策点状态)。该数据集旨在用于重现或扩展代理WANDERING检测和晚期行动承诺杠杆的研究,具体应用包括:无探针的工具熵崩溃检测(最终窗口AUROC约0.887)、晚期承诺杠杆的定位-修补-引导操作,以及早期外部检测WANDERING的开放挑战(提供了基准和标签)。数据集适用于机械可解释性、LLM代理、软件工程基准测试和代理失败分析等领域。

The SWE-bench Pro Agent WANDERING — Verdict-Circuit dataset contains 99 long-range coding agent trajectories from SWE-bench Pro tasks, generated by the Qwen3.6-27B model and manually annotated into three categories: success (40), locked (39), and WANDERING (20). It also includes mechanism features and captured decision point states for each trajectory, supporting multiple studies in the WANDERING research arc (OpenInterpretability), such as tool entropy collapse detection, causal control, behavioral rescue, and verdict features. Data files include: features_n99.csv (features and subclass labels for each trajectory), traces.tar.gz (JSON files of raw agent trajectories containing tool calls, tool results, and thoughts per round), and the results/ directory (circuit breaker Tier-1 outputs, such as McNemar vectors per point, dense ΔP profiles, and deterministic decision point states). The dataset is designed for reproducing or extending research on agent WANDERING detection and late-action commitment leverage, with specific applications including: tool entropy collapse detection without probes (final window AUROC approximately 0.887), locate-patch-guide operations for late commitment leverage, and open challenges for early external WANDERING detection (benchmarks and labels provided). It is suitable for fields like mechanistic interpretability, LLM agents, software engineering benchmarking, and agent failure analysis.

创建时间:
2026-06-03
原始信息汇总

SWE-bench Pro Agent WANDERING — Verdict-Circuit 数据集概览

基本信息

  • 许可证: CC-BY-4.0
  • 任务类型: 文本分类
  • 语言: 英语
  • 标签: 机械可解释性、大语言模型智能体、SWE-bench、智能体故障、徘徊、激活补丁
  • 数据规模: 少于 1000 条

核心数据内容

该数据集包含 99 条从 Qwen3.6-27B 模型在 SWE-bench Pro 上运行的长周期编码智能体轨迹,每条轨迹都经过人工标注。

  • 轨迹结果标签: 成功 (40 条)、锁定 (39 条)、徘徊 (20 条)
  • 包含内容:
    • 每条轨迹的机械可解释性特征
    • 在“徘徊(WANDERING)”研究弧中使用的决策点状态

文件结构

  • features_n99.csv: 包含每条轨迹的特征及 sub_class 标签(success/locked/wandering)
  • traces.tar.gz: 99 条原始智能体轨迹,包括每轮的工具调用、工具结果和思考/内容
  • results/: 电路断路器 Tier-1 输出,包含逐点 McNemar 向量、密集 ΔP 剖面和确定性决策点状态

研究背景与用途

该数据集支撑了“徘徊(WANDERING)”研究弧系列论文,包括:检测器(工具熵崩溃)、因果位点空值、行为拯救、裁决特征以及第一个正向结果(The Lever Is Late)和预注册的电路断路器泛化验证。

主要用途

  • 复现或扩展智能体 WANDERING 检测和后期动作提交杠杆机制
  • 进行免探针工具熵崩溃检测(最终窗口 AUROC 约 0.887)
  • 使用决策定位器实现后期承诺杠杆(定位→补丁→引导)
  • 提供一个开放挑战:WANDERING 的早期外部检测仍未解决(6 种方法均无效)

引用信息

该数据集属于 OpenInterpretability 的 WANDERING 研究弧(2026),包含两篇核心技术报告:

  1. Tool-Entropy Collapse: A Cross-Architecture Signature of Agent WANDERING Failure (DOI: 10.5281/zenodo.20368600)
  2. The Lever Is Late: Causal Control of Long-Horizon Agent Termination Lives in a Task-Matched, Late Action-Commitment Block (DOI: 10.5281/zenodo.20534219)

完整研究弧包含 8 篇论文,均为 CC-BY-4.0 许可,可访问 https://openinterp.org/research 获取。

搜集汇总
数据集介绍
swebench-phase6-verdict-circuit 数据集图片
构建方式
该数据集源自对Qwen3.6-27B模型在SWE-bench Pro基准上生成的99条长程编码智能体轨迹的系统性收集与标注。研究团队依据任务执行结果,将每条轨迹手工标注为成功(40条)、锁定(39条)或游荡(20条)三类。除分类标签外,数据集中还包含了每条轨迹的机制性特征(features_n99.csv)、原始轨迹数据(traces.tar.gz)以及决策点状态信息(results目录),为后续的因果分析与电路中断研究提供了结构化支撑。
特点
本数据集的核心特色在于其专为机械可解释性研究设计的多层次结构。它不仅提供了带有主观行为标签的轨迹数据,还融合了工具熵坍缩检测、延迟承诺杠杆定位等前沿方法所需的特征向量与决策点状态。数据集跨越多篇论文验证,涵盖了从探测无工具熵坍缩检测到因果位点消融、行为救援再到电路中断泛化的完整研究弧线,是首个支持正向控制游荡失败的公开资源。
使用方法
研究者可使用该数据集复现或扩展游荡检测与延迟动作承诺杠杆机制的研究。通过加载features_n99.csv可快速获得轨迹特征与标签,便于训练分类器或拟合统计模型;解压traces.tar.gz即可逐轮审视智能体调用工具与思考的过程。results中的McNemar检验向量与密度ΔP剖面可直接用于电路中断分析。数据集还预留了早期外部检测的开放挑战,为后续方法改进提供基线。
背景与挑战
背景概述
SWE-bench Pro Agent WANDERING — Verdict Circuit 数据集由 OpenInterpretability 研究机构于 2026 年发布,核心研究人员 Caio Vicentino 等人聚焦于大语言模型智能体在长期编码任务中的失败模式研究。该数据集包含 Qwen3.6-27B 模型在 SWE-bench Pro 上执行的 99 条完整轨迹,依据结果标注为成功(40 条)、锁定(39 条)和漫游(20 条),并附带决策点状态与机械可解释性特征。作为 WANDERING 研究弧的核心资源,该数据集首次揭示了工具熵崩溃作为跨架构智能体漫游失败的签名,并提出了晚期行动承诺杠杆这一因果控制方法,为理解智能体失败机理与可解释干预提供了基础。
当前挑战
该数据集所解决的领域问题在于:大语言模型智能体在执行长期编码任务时普遍出现的漫游失败模式难以被早期检测与归因。构建过程中面临的核心挑战包括:首先,漫游失败的定义与标注高度依赖于人工对复杂轨迹的逐轮分析,需要区分成功、锁定与漫游三种相似但本质不同的状态;其次,研究团队尝试了六种检测方法均未能实现早期外部漫游检测,揭示当前方法在早期预警上的根本局限;最后,因果杠杆的定位与修补需要在精细的决策点状态上进行激活修补与行为引导,这对轨迹数据与特征提取的粒度和完整性提出了极高要求。
常用场景
经典使用场景
该数据集的核心价值在于为长时程编码智能体(coding agent)的失败模式检测与因果干预研究提供标准化的评估基准。具体而言,它收录了99条由Qwen3.6-27B模型在SWE-bench Pro复杂软件工程任务上生成的完整轨迹,每条轨迹均被人工标注为成功(success)、锁定(locked)或徘徊(wandering)三类。研究者可通过这些数据复现工具熵崩溃(tool-entropy collapse)这一跨架构的徘徊失败信号,并利用提供的决策点状态进行激活修补实验,从而定位导致智能体无序徘徊的因果回路。
解决学术问题
该数据集旨在攻克长时程自主智能体在复杂编程任务中出现的‘徘徊式’失败这一学术难题。传统的工作多聚焦于单步错误或显式失败,而智能体在长时间推理过程中呈现出的低效循环、工具使用熵增等隐性退化行为长期缺乏系统性的机理理解。通过该数据集,研究者能够从可解释性(mechanistic interpretability)角度解析智能体内部表征中的'裁决回路'(verdict circuit),首次明确了工具熵崩溃作为跨架构的徘徊检测信号,并验证了基于晚期行动承诺杠杆(late action-commitment lever)实现行为修复的可能性。
衍生相关工作
该数据集是WANDERING研究弧线(WANDERING research arc)系列工作的核心产物,衍生了一系列具有里程碑意义的学术贡献。包括工具熵崩溃检测器(Tool-Entropy Collapse)的提出,该工作首次揭示了徘徊失败与工具调用熵之间的跨架构相关性;因果位点消融攻击(causal-locus nulls)的验证,系统化地测试了六种早期外部检测方法的无效性;以及行为救援(behavioral rescue)与裁决特征(verdict feature)的发现。其中最具开创性的‘杠杆来得晚’(The Lever Is Late)研究,通过在晚期行动承诺模块进行激活修补,首次实现了对长时程Agent徘徊失败的因果性控制。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务