遇见数据集

caiovicentino1/swebench-pro-qwen36-27b-phase6

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

该数据集名为SWE-bench Pro Qwen3.6-27B Phase 6 — Trajectories + Residuals,是Tool-Entropy Collapse论文和Two Honest Nulls论文(进行中)的配套数据。它包含99个多轮次智能体轨迹,这些轨迹来自Qwen3.6-27B模型在SWE-bench Pro任务(涉及qutebrowser、openlibrary、ansible)上的运行结果,并捕获了每轮次在L11、L23、L31、L43、L55层的残差流激活(以bf16格式的safetensors存储)。此外,数据集还提供了所有衍生特征和标签,用于复现论文并进行下游分析。主要用途包括:检查评估工具中的tool_entropy_collapse评估、对残差流进行机制解释研究、分析SWE-bench Pro的失败模式,以及作为智能体监控的基准(提供WANDERING/SUCCESS/LOCKED标签)。数据集结构包括轨迹文件、捕获的激活数据、衍生特征文件等。来源方面,模型为Qwen3.6-27B,任务为SWE-bench Pro,运行于NVIDIA RTX 6000 Pro Blackwell硬件,日期为2026年5月。数据集还包含关于运行稳定性的注意事项,特别是WANDERING类别的标签可能受单次运行分类和温度采样随机性的影响。

This dataset is named SWE-bench Pro Qwen3.6-27B Phase 6 — Trajectories + Residuals, serving as supporting data for the papers *Tool-Entropy Collapse* and *Two Honest Nulls* (in progress). It contains 99 multi-turn AI Agent trajectories generated by the Qwen3.6-27B model during its execution on SWE-bench Pro tasks (covering qutebrowser, openlibrary, and ansible), and captures residual stream activations at layers L11, L23, L31, L43, and L55 for each turn, stored in bf16-formatted safetensors files. Additionally, the dataset provides all derived features and labels for paper reproduction and downstream analysis. Its core use cases include: evaluating the tool_entropy_collapse metric in inspection tools, conducting mechanistic interpretability research on residual streams, analyzing failure modes of SWE-bench Pro, and acting as a benchmark for agent monitoring with labels of WANDERING/SUCCESS/LOCKED. The dataset structure consists of trajectory files, captured activation data, derived feature files, and other relevant assets. For the dataset source: the model used is Qwen3.6-27B, the tasks are SWE-bench Pro, the experiments were conducted on NVIDIA RTX 6000 Pro Blackwell hardware, and the generation date is May 2026. The dataset also includes notes on runtime stability, specifically that the labels for the WANDERING category may be affected by single-run classification and temperature sampling randomness.

提供机构:
caiovicentino1
搜集汇总
数据集介绍
caiovicentino1/swebench-pro-qwen36-27b-phase6 数据集图片
构建方式
该数据集源自Qwen3.6-27B模型在SWE-bench Pro基准上运行的99条多轮智能体轨迹,每条轨迹均包含逐轮残差流激活值,捕获层为L11、L23、L31、L43与L55。数据通过定制化前向钩子框架采集,并储存为bf16精度的safetensors张量文件。伴随轨迹与残差数据,还提供了详尽的衍生特征与分类标签,涵盖WANDERING、SUCCESS及LOCKED三类子标签,用以复现工具熵坍缩研究。数据集结构严谨,涵盖原始轨迹JSON、残差张量、元数据、聚合统计及多版本早期预警探针输出,确保下游分析与因果干预实验的可复现性。
特点
本数据集的核心特色在于其多层次的残差流激活记录与精细的代理失败模式分类体系。99条轨迹每回合均保留五个关键层的隐藏状态,形成了跨层、跨时间步的高维表征数据集。特别设计的WANDERING子类识别了代理虽持续生成高分数探针值却无法触发完成工具的现象,揭示了温度采样下的随机性与确定性种子假设之间的张力。数据集还附带了跨任务验证、方法学稳健性检验及反事实干预结果,为机制可解释性与代理监控基准研究提供了多维证据基础。这些特性使其成为探索工具使用推理链失效机制的独特资源。
使用方法
研究人员可通过Hugging Face Hub的hf_hub_download函数便捷加载轨迹标识符列表、单个轨迹JSON及其对应的残差safetensors文件。每张量按键名模式't{回合数}_{位置}_p{位置索引}_L{层数}'索引,形状为5120维bf16向量。分类标签加载后可按规则映射为SUCCESS、LOCKED与WANDERING子类,便于快速评估代理行为分布。数据集支持多种下游任务:加载标签以测试WANDERING检测器性能、载入残差激活进行跨层探针分析、利用轨迹文本复现SWE-bench Pro失败模式,也可基于现有标签构建代理监控基准。代码仓库与示例脚本进一步降低了使用门槛。
背景与挑战
背景概述
该数据集名为SWE-bench Pro Qwen3.6-27B Phase 6 — Trajectories + Residuals,由Caio Vicentino于2026年发布,依托OpenInterpretability实验室。其核心研究问题聚焦于大语言模型在工具使用场景中的失败模式,特别是“徘徊”(WANDERING)现象,即模型在推理过程中丧失目标导向性却仍持续输出无效操作。数据集记录了99条来自Qwen3.6-27B模型的完整多轮智能体轨迹,覆盖qutebrowser、openlibrary和ansible三个开源项目的SWE-bench Pro任务,并捕获了每轮的残差流激活值。该工作为可解释性研究提供了珍贵的细粒度数据,相关论文《Tool-Entropy Collapse》揭示了跨架构的智能体失败签名,对理解语言模型推理中的机制性失效具有重要推动力。
当前挑战
该数据集所应对的领域挑战在于,当前大语言模型在自主执行软件工程任务时,常出现非理性循环、注意力涣散等“徘徊”行为,导致任务失败,而这类缺陷的早期检测与机制归因仍缺乏基准数据。在构建过程中,研究者面临三重挑战:一是轨迹分类的随机性难题——由于采样温度设为1.0,相同种子下重跑同一轨迹可能产生不同的终止状态,导致“徘徊”标签仅反映单次运行观测,需借助多种子协议才能稳定界定;二是残差数据捕获的高计算成本——需在55层模型的5个关键层记录每轮激活,单张RTX 6000 Pro Blackwell显卡仍需密集计算;三是复现控制的严格性——需在固定硬件与软件栈上同步轨迹、残差和Docker评测结果,以确保跨论文分析的可比对性。
常用场景
经典使用场景
在智能体行为可解释性与失败模式分析的交叉前沿,该数据集最经典的使用场景在于为工具熵崩溃现象的机理研究提供精密的数据支撑。具体而言,研究者可利用99条Qwen3.6-27B模型在SWE-bench Pro基准任务上生成的多轮交互轨迹,结合每条轨迹在L11至L55层的残差流激活快照,定量刻画智能体在工具调用过程中逐渐丧失行为结构、陷入游荡状态的过程。这一场景尤其适用于验证游荡检测器、探针分类法与因果干预实验,为理解大规模语言模型在复杂代理任务中表现出的失效机制奠定了数据基础。
衍生相关工作
围绕该数据集已衍生出一系列富有开创性的学术工作,形成了以动态因果检验为核心的研究脉络。工具熵崩溃论文首先系统性地提出了WANDERING失效风格的跨架构表征签名,并借助该数据集完成首次在大规模代理轨迹上的机械化可解释性验证。紧接着,两项诚实的零假设研究通过预注册因果实验,精细检验了中间层到边缘层表征溃缩的因果方向性,修正了早期关于失效机制的单向推断假设。此外,基于该数据集的交叉任务验证工作将SWE-bench Pro发现推广至METR MALT基准,探明了工具熵崩溃现象在不同任务族间的迁移特征,为构建通用型代理监控指标开辟了系统性的实验路径。
数据集最近研究
最新研究方向
针对大型语言模型在工具使用代理任务中“徘徊”失败模式的机制可解释性研究,聚焦于残差流激活的动态特征与工具熵崩溃现象。该数据集为分析SWE-bench Pro环境下Qwen3.6-27B模型的99条多轮轨迹提供了L11至L55层逐轮残差流张量,并标注了SUCCESS、LOCKED与WANDERING三类子标签。前沿方向包括利用跨层探针分歧与持久性检验来溯源模型从高效协作滑向无效游荡的神经表征转变,进而为代理监控与因果干预奠定实证基础。相关热点事件如工具熵崩溃论文的发表,揭示了单次运行下温度采样随机性对徘徊分类的脆弱性,推动了多种子分类协议与预注册因果检验的规范化,对提升自主智能体在软件工程等高风险领域的可靠性具有标杆意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务