遇见数据集

SymFail

收藏
arXiv2026-08-26 更新2026-08-28 收录
官方服务:

资源简介:

SymFail是由华东师范大学、南洋理工大学、新加坡管理大学及西安建筑科技大学联合构建的标注化失败轨迹数据集,旨在支撑LLM多智能体系统的调试与修复研究。该数据集包含536条经人工验证的失败轨迹,每条轨迹均标注了失败节点、症状类别、支撑证据及最终标注,数据源自WebArena-Verified Hard和AssistantBench基准中的200个多步网页任务,由AG2、CrewAI和Magentic-One三种主流多智能体框架执行产生,共计600条原始轨迹中筛选出536条失败样本。数据集构建过程包括候选任务选择、轨迹收集与人工标注,通过结构化事件图与多标签标注记录失败传播路径。该数据集用于评估多智能体系统故障复现与修复的可靠性,揭示现有重跑方法的低效性,并为基于症状驱动的干预修复提供实证基础。

SymFail is a labeled failure trajectory dataset jointly constructed by East China Normal University, Nanyang Technological University, Singapore Management University, and Xi'an University of Architecture and Technology, aiming to support research on debugging and repair of LLM-based multi-agent systems. This dataset contains 536 manually validated failure trajectories, each annotated with failure nodes, symptom categories, supporting evidence and final annotations. The data is derived from 200 multi-step web tasks in the WebArena-Verified Hard and AssistantBench benchmarks, which were executed by three mainstream multi-agent frameworks: AG2, CrewAI and Magentic-One. A total of 536 failure samples were screened out from 600 original trajectories. The dataset construction process includes candidate task selection, trajectory collection and manual annotation, and records failure propagation paths via structured event graphs and multi-label annotations. This dataset is used to evaluate the reliability of failure reproduction and repair for multi-agent systems, reveal the inefficiency of existing rerun methods, and provide an empirical foundation for symptom-driven intervention-based repair.

创建时间:
2026-08-26
原始信息汇总

数据集总览

SymTrace 是一个面向多智能体系统(Multi-Agent Systems, MAS)的可复现性与故障恢复基准测试框架,其核心数据集 SymFail 提供了带人工标注的故障案例,用于研究 MAS 运行时失败的检测与修复。


数据集核心信息

SymFail — 人工标注故障数据集

  • 规模:包含 536 个故障案例
  • 标注方式:每个案例经过 三重标注(triple annotation) 并附加 评审员审查(reviewer oversight)
  • 覆盖框架:AG2、CrewAI、Magnetic-One 三个多智能体框架
  • 任务来源:基于 WebArena 和 AssistantBench 基准任务
  • 标注内容
    • 主要故障标签(c1–c4 分类体系)
    • 故障节点定位(在 trace graph 中的精确节点位置)
    • 标注者间一致性统计
    • 最终评审员裁决
  • 数据格式SymFail/human_annotations_536.jsonl(JSON Lines 格式)
  • 原始数据SymFail/initial_failure_logs/ 目录下包含 AG2、CrewAI、Magnetic-One 的原始故障执行轨迹

数据集用途

该数据集可直接用于:

  • 训练故障检测模型
  • 评估故障恢复策略

数据集的收集与实验框架

SymTrace 框架在以下 六个 主流 MAS 框架上运行统一的基准任务:

  • AG2
  • CrewAI
  • Magnetic-One
  • ChatDev
  • MetaGPT
  • OpenManus

每个执行过程保留完整的 有向执行轨迹图(trace graph),并对任务成功/失败进行判定,随后系统性地应用恢复策略。


恢复策略

框架支持 六种恢复策略,包括:

  • 无引导的重试(unguided reruns)
  • 自我反思(self-reflection)
  • 批评者智能体(critic agents)
  • 可疑节点干预(suspicious-node intervention)等

数据集许可证

  • 原始 SymFail 标注、故障节点记录、事件图、派生元数据、数据清单及文档,采用 CC BY 4.0(知识共享署名 4.0 国际许可证) 发布。
  • 源于 WebArena-Verified Hard 和 AssistantBench 的原始基准任务及其衍生材料,仍受其各自许可证和条款约束。
  • 执行轨迹中可能包含模型输出、工具响应、网页内容或其他第三方材料,这些内容不被 SymFail 作者重新许可。
  • 完整许可证范围、署名要求及第三方材料声明见 SymFail/DATA_LICENSE.md

数据访问与使用

  • 数据集文件位于仓库中的 SymFail/ 目录下
  • 主要数据文件为 human_annotations_536.jsonl
  • 原始失败执行轨迹存放在 initial_failure_logs/ 下,按框架(ag2、crewai、magnetic_one)分目录组织
搜集汇总
数据集介绍
SymFail 数据集图片
构建方式
SymFail数据集的构建源于对基于大语言模型的多智能体系统(MAS)在复杂任务中失败行为的系统性捕捉。研究团队从WebArena-Verified Hard和AssistantBench基准中精选200个可外部验证的多步骤任务,并借助AG2、CrewAI及Magentic-One三种主流MAS框架各执行一次,共获得600条执行轨迹。经原生评估器判定,保留536条失败轨迹,剔除其余64条成功或异常轨迹。每条保留轨迹均经过四名具备软件工程背景的标注者独立标注,并由第四名标注者进行最终裁决,形成包含事件依赖图、局部化失败节点、多标签症状类别及证据链的丰富标注信息。标注过程严格遵循C1-C4症状分类体系,确保每个失败节点均与执行图中的具体事件对应,并经过内容哈希验证以保障数据完整性。
特点
SymFail数据集的核心特色在于其精细的图结构标注与症状导向的干预信息,为MAS失败调试研究提供了前所未有的细粒度支持。数据集包含536条经人工确认的失败轨迹,每条轨迹均关联事件依赖图、可复现的执行前缀以及明确的失败节点定位。不同于传统数据集仅提供任务级结论,SymFail深入追踪至节点级行为,将失败细分为任务约束违反、重复或停滞、未解决运行时条件及计划-动作-结果不一致四类可操作症状。这种多标签分类体系结合证据链设计,使研究者能够精确区分因果修复与随机修复,揭示现有重运行方法仅能实现67.97%失败复现率和6.90%修复率的根本原因,为开发症状驱动的定向干预方法(修复率提升至20.15%)奠定了坚实的数据基础。
使用方法
SymFail数据集适用于MAS故障可复现性评估与修复策略验证。研究者可基于数据集中记录的失败轨迹及事件图,利用配套的SymTrace回放框架,严格重建失败节点之前的执行历史,并实施选择性干预。具体而言,用户可调用数据集的536个失败案例,针对不同MAS架构执行无引导重跑、自我反思或批评代理等基线方法,通过对比失败复现率(rep1/rep3)与修复成功率(pass@k)量化各类修复手段的实际效能。数据集提供的节点级标注(包括失败节点ID、症状类别及证据)可直接作为干预锚点,支撑诸如可疑节点干预等定向修复实验,有效避免因随机重采样导致的伪修复现象。此外,SymFail的详细标注指南和完整性检查可辅助用户进行自定义分析或扩展至新的MAS框架,从而推动多智能体系统可靠性研究的深入发展。
背景与挑战
背景概述
SymFail数据集由华东师范大学、南洋理工大学、新加坡管理大学和西安建筑科技大学的研究人员于2026年构建,发表于arXiv预印本论文《Repair or Resample? Rethinking Failure Debugging in LLM Multi-Agent Systems》。该数据集旨在系统性地研究大语言模型多智能体系统(MAS)在执行长期复杂任务时的失败现象,核心研究问题在于区分现有调试方法究竟是因果性地修复了MAS故障,还是仅依靠LLM采样的随机性实现统计性恢复。SymFail包含536条经过人工标注的失败执行轨迹,涵盖AG2、CrewAI和Magentic-One三种主流MAS框架,每条轨迹均带有图结构化的失败节点、症状类别和证据链,为MAS调试与修复研究提供了标准化评测基础,对该领域产生了深远影响。
当前挑战
SymFail数据集所面临的挑战主要集中于两个方面。首先,在领域问题层面,长期复杂任务中MAS故障的复现与修复极度依赖执行历史,而现有方法往往通过重新采样整个轨迹来尝试修复,导致失败的重现率和修复率极低,例如无引导的完整重运行仅实现67.97%的失败重现率和6.90%的修复成功率,这凸显了区分因果修复与随机修复的根本性难题。其次,在数据集构建过程中,需要从200个任务在三种MAS上产生的600条轨迹中筛选出536条确认的失败轨迹,并进行多标签人工标注,期间面临标注类别界定模糊(尤其是重复或停滞进展类别)、标注者间一致性偏低(Kappa系数仅为0.374)以及最终标注与初始标注存在21.08%差异等挑战,此外还需确保轨迹中每个失败节点均可被图结构精确关联,并维持标注的客观性与可验证性。
常用场景
经典使用场景
SymFail数据集作为首个专为大型语言模型多智能体系统故障调试而构建的人类标注轨迹数据集,其经典使用场景在于为MAS的失败复现与修复提供可控的评估基座。该数据集包含536条经由专家审校的失败执行轨迹,每条轨迹均关联了图结构化的故障节点、症状类别与可追溯证据,使研究者能够在保持执行历史固定不变的前提下,对故障进行精确的定位与干预。凭借其细粒度的标注信息与结构化的轨迹组织形式,SymFail成为评估MAS调试方法有效性的黄金标准,广泛应用于故障复现率与修复成功率的基准测试之中。
实际应用
在实际应用中,SymFail数据集为多智能体系统的可靠部署与运维提供了切实可行的支持。面对复杂长期任务中频繁出现的执行失败,工程团队可以借助SymFail的标注轨迹与故障症状分类,对系统进行精确的故障定位与修复干预,从而显著提升系统的稳定性与任务完成率。该数据集所倡导的症状驱动干预策略,已在AG2、CrewAI与Magentic-One等主流MAS框架上验证了其有效性,为生产环境的故障调试流程提供了可复用的方法论。此外,SymFail的发布为自动化调试工具的开发提供了训练与验证数据,有望推动智能运维与自主修复系统的工程落地。
衍生相关工作
SymFail数据集的诞生催生了一系列后续研究。其配套的SymTrace框架作为可重放日志系统,为MAS执行轨迹的受控复现奠定了基础,并启发了关于执行重放与干预锚定的深入探讨。基于SymFail的实证结论,研究者进一步探索了节点级症状定位与证据条件修复的集成方法,如Suspicious-Node Intervention机制,该机制利用局部症状信号实现了对故障的高效修复。此外,SymFail所揭示的故障复现不稳定与随机修复现象,促使学术界重新审视任务级重跑与反馈式修复方法的设计局限,并催生了面向故障定位、可观测性与因果归因的新一代调试基准与工具,推动了MAS可靠性的系统化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务