FaulT-Bench
收藏资源简介:
FaulT-Bench是悉尼大学构建的基准测试,旨在评估LLM代理在不可靠用户工单下的网络故障诊断能力。数据集包含200个场景,覆盖8种网络拓扑,其中80个正确故障场景与120个错误报告场景(含72个假前提、24个错误设备、24个错误原因),并额外生成360个基于五种用户人格重写的工单。数据源自五个人工翻译的企业网络拓扑和三个NIKA基准拓扑,工单由三位作者手动编写并独立验证,确保内容真实性与多样性。该基准聚焦于现有代理在健康网络误报、误导性报告等场景下的性能退化问题,推动代理在噪声运维环境中的鲁棒推理。
FaulT-Bench is a benchmark developed by the University of Sydney to evaluate the network fault diagnosis performance of LLM agents under unreliable user tickets. The dataset consists of 200 scenarios spanning 8 network topologies, including 80 correct fault scenarios and 120 erroneous report scenarios (encompassing 72 false premises, 24 faulty devices, and 24 incorrect root causes). An additional 360 tickets rewritten based on five distinct user personality profiles are also included. The dataset is sourced from five manually translated enterprise network topologies and three NIKA benchmark topologies, with all tickets manually written by three authors and independently verified to ensure content authenticity and diversity. This benchmark focuses on the performance degradation of existing agents in scenarios such as false alarms in healthy networks and misleading reports, aiming to promote robust reasoning of agents in noisy operational maintenance environments.
FaulT-Bench是一个用于评估大语言模型(LLM)故障排查代理在实时仿真网络上的性能基准测试平台,其特色在于使用带有真实故障报告工单的测试场景,区分了能验证工单真实性的代理与盲目信任工单的代理。
-
数据集规模: 包含560个场景文件,其中200个核心场景(80个真实故障、120个反例)跨越8个网络拓扑,以及360个对72个误报工单进行人格重写的变体。场景文件采用分区明文格式,涵盖提示、注入、验证、地面真相、修复方案、诊断过程、评分轴和标签元数据等要素。
-
评估管线: 每个测试运行为一个(场景, 代理)对,通过部署实验室、注入故障、验证故障、运行代理、用LLM评判三个独立维度(结果/修复/推理)并归档结果的流程完成。支持单次运行、清单基准测试和数据集层扫描,并单独统计超时情况。
-
释放结果: 提供了支撑论文的3,960次冻结运行记录,包含完整诊断、逐轴评判分解和调查轨迹,以及验证工具(
compute_metrics.py和dataset_stats.py),无需Docker或API密钥即可重新计算所有报告的数字。 -
安装与运行: 仅用于实时基准运行时需要安装,涉及Docker Engine 28.x、Kathará 3.x、Python 3.12+、uv以及SADE-NetworkAgent仓库(克隆为兄弟目录)。提供
fb启动器(Windows使用fb.cmd,Linux/macOS使用fb.sh),支持清单文件和扫描命令进行批量运行。 -
场景分类: 包含8个实时拓扑(5个来自公开实践网络的Kathará翻译和3个NIKA参考拓扑),核心场景分为两集:真实故障注入与反例(包括误报、错误设备指向和错误原因指向),以及针对误报工单的五种人格变体(新手、天真、自信新手、不确定天真、无细节天真)。
-
输出与验证: 运行输出包含
summary.csv和每个运行的result.json与trace.log,状态包括scored、no_submission、no_output、judge_failed、agent_error及基础设施错误等类别。数据集索引(dataset_index.csv)列出200个核心场景的拓扑、层、类别、故障族和NIKA标签列(100个在分类法内,100个新颖)。




