SLS-Bench
收藏资源简介:
SLS-Bench是一个用于评估大型语言模型(LLM)代理在事件日志摘要任务上性能的合成基准数据集。该数据集包含90个事件日志摘要问题,每个问题包含唯一的ID、相同的问题文本、参考答案以及对应的事件日志流。日志数据以CSV格式存储,包含时间戳、日志级别、消息、跟踪ID、服务和主机等字段。数据集总大小约为830 MB(未压缩),每个问题的日志行数在21,393到95,503之间,参考答案长度在1,860到3,335个单词之间。该数据集专门用于评估目的,不适用于训练、实时分类或多模态评估。所有数据均为合成生成,不包含真实个人信息。数据集已验证可用于23种LLM模型的基准测试,并经过校准的LLM评委评估。主要风险包括对结果的过度依赖和将合成基准分数误认为操作准备度。
SLS-Bench is a synthetic benchmark dataset for evaluating the performance of large language model (LLM) agents on event log summarization tasks. The dataset contains 90 event log summarization problems, each with a unique ID, identical problem text, reference answers, and corresponding event log streams. The log data is stored in CSV format, containing fields such as timestamp, log level, message, trace ID, service, and host. The total dataset size is approximately 830 MB (uncompressed), with the number of log lines per problem ranging from 21,393 to 95,503, and reference answer lengths ranging from 1,860 to 3,335 words. This dataset is specifically designed for evaluation purposes and is not suitable for training, real-time classification, or multimodal evaluation. All data is synthetically generated and contains no real personal information. The dataset has been validated for benchmarking 23 LLM models and has been evaluated by calibrated LLM judges. Main risks include over-reliance on results and mistaking synthetic benchmark scores for operational readiness.
数据集概述:SLS-Bench(合成日志摘要基准评估)
SLS-Bench 是一个用于评估 LLM(大语言模型)代理在日志摘要任务上表现的数据集。该数据集包含 90 个 从实际事件后分析报告中衍生的合成日志问题,以测试模型的日志压缩与关键信息提取能力。
核心文件与结构
| 文件 | 说明 |
|---|---|
problems.jsonl |
包含 90 条测试记录,每条记录有 3 个字段:id(唯一标识)、question(问题)、answer(参考答案)。所有问题相同,仅底层事件与参考答案不同。 |
logs.zip |
压缩包,解压后为 logs/<id>.csv 文件,每个文件对应一个问题的日志流。包含列:timestamp, level, message, trace_id, service, host。 |
统计信息
| 指标 | 最小值 | 中位数 | 最大值 |
|---|---|---|---|
| 日志行数(条) | 21,393 | 56,740 | 95,503 |
| 日志文件大小(MB) | 3.0 | 8.7 | 20.5 |
| 参考答案长度(词数) | 1,860 | 2,418 | 3,335 |
- 总问题数:90 个
- 总日志体积:解压后 ~830 MB
数据特征与合规说明
- 语言:英语(
en) - 任务类型:摘要(
summarization)、文本生成(text-generation) - 数据标签:日志、可观测性、事件响应、基准测试、合成数据、LLM 代理
- 数据量:<1 K(记录数小于 1000)
- 许可证:CC-BY-4.0
负责人工智能声明
| 方面 | 说明 |
|---|---|
| 局限 | 仅用于评估,不适用于训练、实时故障诊断、多模态评估或运维认证。 |
| 偏差 | 样本来源偏向于公开发布事后报告的组织;LLM 生成的内容继承了对广泛记录的技术的偏见。 |
| 个人信息 | 无。所有类似标识符的值均为合成生成。 |
| 使用场景 | 已验证可用于对 23 个 LLM 的基准进行校准评估,以评分摘要质量。 |
| 社会影响 | 若可靠,可减轻值班负担;主要风险是过度依赖及将合成基准分数视为运维就绪状态。 |
| 数据来源 | 完全合成,从公开的事件后报告通过 LLM 管道生成。 |




