遇见数据集

FaulT-Bench

收藏
arXiv2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

FaulT-Bench是悉尼大学构建的基准测试,旨在评估LLM代理在不可靠用户工单下的网络故障诊断能力。数据集包含200个场景,覆盖8种网络拓扑,其中80个正确故障场景与120个错误报告场景(含72个假前提、24个错误设备、24个错误原因),并额外生成360个基于五种用户人格重写的工单。数据源自五个人工翻译的企业网络拓扑和三个NIKA基准拓扑,工单由三位作者手动编写并独立验证,确保内容真实性与多样性。该基准聚焦于现有代理在健康网络误报、误导性报告等场景下的性能退化问题,推动代理在噪声运维环境中的鲁棒推理。

FaulT-Bench is a benchmark developed by the University of Sydney to evaluate the network fault diagnosis performance of LLM agents under unreliable user tickets. The dataset consists of 200 scenarios spanning 8 network topologies, including 80 correct fault scenarios and 120 erroneous report scenarios (encompassing 72 false premises, 24 faulty devices, and 24 incorrect root causes). An additional 360 tickets rewritten based on five distinct user personality profiles are also included. The dataset is sourced from five manually translated enterprise network topologies and three NIKA benchmark topologies, with all tickets manually written by three authors and independently verified to ensure content authenticity and diversity. This benchmark focuses on the performance degradation of existing agents in scenarios such as false alarms in healthy networks and misleading reports, aiming to promote robust reasoning of agents in noisy operational maintenance environments.

提供机构:
悉尼大学
创建时间:
2026-08-27
原始信息汇总

FaulT-Bench是一个用于评估大语言模型(LLM)故障排查代理在实时仿真网络上的性能基准测试平台,其特色在于使用带有真实故障报告工单的测试场景,区分了能验证工单真实性的代理与盲目信任工单的代理。

  • 数据集规模: 包含560个场景文件,其中200个核心场景(80个真实故障、120个反例)跨越8个网络拓扑,以及360个对72个误报工单进行人格重写的变体。场景文件采用分区明文格式,涵盖提示、注入、验证、地面真相、修复方案、诊断过程、评分轴和标签元数据等要素。

  • 评估管线: 每个测试运行为一个(场景, 代理)对,通过部署实验室、注入故障、验证故障、运行代理、用LLM评判三个独立维度(结果/修复/推理)并归档结果的流程完成。支持单次运行、清单基准测试和数据集层扫描,并单独统计超时情况。

  • 释放结果: 提供了支撑论文的3,960次冻结运行记录,包含完整诊断、逐轴评判分解和调查轨迹,以及验证工具(compute_metrics.pydataset_stats.py),无需Docker或API密钥即可重新计算所有报告的数字。

  • 安装与运行: 仅用于实时基准运行时需要安装,涉及Docker Engine 28.x、Kathará 3.x、Python 3.12+、uv以及SADE-NetworkAgent仓库(克隆为兄弟目录)。提供fb启动器(Windows使用fb.cmd,Linux/macOS使用fb.sh),支持清单文件和扫描命令进行批量运行。

  • 场景分类: 包含8个实时拓扑(5个来自公开实践网络的Kathará翻译和3个NIKA参考拓扑),核心场景分为两集:真实故障注入与反例(包括误报、错误设备指向和错误原因指向),以及针对误报工单的五种人格变体(新手、天真、自信新手、不确定天真、无细节天真)。

  • 输出与验证: 运行输出包含summary.csv和每个运行的result.jsontrace.log,状态包括scoredno_submissionno_outputjudge_failedagent_error及基础设施错误等类别。数据集索引(dataset_index.csv)列出200个核心场景的拓扑、层、类别、故障族和NIKA标签列(100个在分类法内,100个新颖)。

搜集汇总
数据集介绍
FaulT-Bench 数据集图片
构建方式
FaulT-Bench 数据集精选八种网络拓扑,其中五个源自公开的从业者实验室网络,三个取自 NIKA 基准,共计生成 200 个故障排查场景。每个场景包含故障注入、事后校验、基准真值、修复规范及评分轴等结构化模块,确保仿真环境的高保真与可复现性。场景划分为四类:正确故障、虚假前提、错误设备归因和错误根因断言,其中虚假前提场景进一步衍生出 360 份经人格重写的工单,系统性地变化报告者的自信程度与可验证细节,而网络状态保持恒定,从而精准评估工单措辞对诊断的影响。
特点
FaulT-Bench 的核心特色在于对现实世界中不可靠工单的深度模拟,区别于既有基准仅基于准确工单的评估模式。其八种拓扑涵盖了从企业园区到云数据中心的多协议复杂环境,且五张拓扑均经翻译验证,确保与真实网络配置的对应性。其次,数据集精心设计了五类报告者人格,以孤立变量方式控制报告者的自信度与信息详实度,从而揭示报告风格对智能体诊断性能的显著影响。此外,自动化评估框架引入 LLM 法官,从结果准确性、修复有效性与推理质量三个维度进行综合评分,尤其能捕捉到智能体在网络健康时过度诊断的系统性缺陷,为构建鲁棒性更强的网络诊断智能体提供了关键测试平台。
使用方法
FaulT-Bench 的使用流程遵循标准化的自动评估范式:首先在 Kathará 仿真器中部署指定的网络拓扑,其次根据场景配置注入故障或保持网络健康状态,随后向智能体提供工单文本,并赋予其通过 NIKA 工具接口(涵盖 22 种诊断工具)与仿真网络交互的能力,进行证据收集与假设验证。最终,智能体需提交包含异常是否存在、故障设备、根因解释及修复建议的结构化诊断报告,由 LLM 法官基于预设评分标准,分别评估结果准确性、修复得分与推理得分。研究者可灵活接入自定义智能体,通过调整工单人格或场景类型,深入剖析智能体在不同报告条件下的表现,从而针对性地优化其诊断决策机制。
背景与挑战
背景概述
FaulT-Bench是悉尼大学的研究团队于2026年提出的网络故障诊断基准测试集,旨在评估基于大语言模型(LLM)的智能体在真实、不可靠的用户工单场景下的网络故障排查能力。该基准包含200个跨越八种网络拓扑的故障排除场景,其中五种拓扑从公开的实践者实验室重新实现,涵盖了真实故障、虚假故障报告、设备归因错误以及根因断言错误等多样化情形。其核心研究问题是衡量智能体在面对错误或误导性用户工单时能否准确验证故障存在性并定位根因。该基准通过自动化评估框架,基于Kathará仿真器和NIKA工具接口,对智能体的诊断结果、修复建议及推理质量进行多维度评分,其影响力在于填补了现有基准仅基于准确工单评估的空白,为开发能够应对真实运维噪声的自主网络故障排查系统提供了关键评测平台。
当前挑战
FaulT-Bench面临的核心挑战在于其设计所针对的领域问题:传统网络故障诊断基准假设工单准确且故障必然存在,而现实运维中用户工单常含模糊、不完整或误导信息,智能体需具备辨别虚假报告并避免过度诊断的能力。构建过程中,挑战包括将五种生产环境的企业网络配置转换至Kathará/FRR仿真环境,并验证拓扑保真度;同时需手动创作大量具代表性的用户工单,确保其自然性及可验证信息含量的一致性。评估阶段,如何通过LLM评判器客观衡量自由文本诊断的正确性、修复有效性及推理质量,并避免评判器自身偏见,亦是重要挑战。此外,实验结果揭示性能显著受工单可验证细节影响,而非报告者的自信程度,这进一步凸显了在多样化报告风格下构建稳健评估的复杂性。
常用场景
经典使用场景
FaulT-Bench作为网络故障诊断领域首个针对LLM智能体在非可靠用户工单条件下进行基准测试的数据集,其经典使用场景是评估和比较不同LLM智能体(如SADE、ReAct、Claude Code)在真实网络环境中的故障定位与诊断能力。该数据集覆盖八种网络拓扑,包含真实故障、误报工单、错误设备指认和错误根因声称四类场景,并提供自动化评估框架,使研究者能够系统性地衡量智能体在准确工单、误导性工单以及不同报告风格下的诊断准确性、修复建议质量和推理质量。这使得FaulT-Bench成为开发更鲁棒的网络故障诊断智能体的关键测试平台,推动了该领域从理想化评估向真实运维场景的转变。
解决学术问题
FaulT-Bench解决了现有网络故障诊断基准中普遍存在的结构性假设问题,即工单总是准确的且故障一定存在。它通过引入误报、错误设备指认和错误根因声称等非可靠工单场景,填补了评估智能体在健康网络中识别“无故障”能力的研究空白,同时量化了报告风格(如信心高低、可验证细节多少)对诊断结果的影响。该数据集还引入了修复分数和推理分数等新指标,超越了传统仅匹配标签的评估方式,从而为研究智能体在嘈杂、不完美工单下的推理可靠性提供了坚实基础,推动了网络管理自动化领域的学术进步。
衍生相关工作
FaulT-Bench的发布催生了一系列针对网络故障诊断智能体的改进和衍生研究。其评估框架和场景设计直接影响了后续关于LLM智能体在不确定信息下决策、避免虚假根因推断以及处理用户工单中模糊表述的研究。例如,研究者基于FaulT-Bench提出了新的提示策略、工具调用机制或审计方法,以增强智能体对健康网络的辨别能力。此外,该数据集还促进了对不同基础模型(如GPT和Claude)在诊断任务上的比较研究,并引发了关于“报告风格比报告内容更重要”的讨论,为设计更鲁棒的人机交互界面和工单标准化提供了实证依据。这些衍生工作共同推动了智能网络运维领域从学术原型向可靠工业应用的演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务