遇见数据集

secops-es-benchmark

收藏
github2026-08-27 更新2026-08-29 收录
官方服务:

资源简介:

包含约23.9万条ECS文档的标记数据集,包含5个Linux入侵事件形成一条杀伤链,27个ATT&CK技术,12个以上Elastic数据流,用于评估安全运营调查代理。

A labeled dataset containing approximately 239,000 ECS documents. It covers 5 Linux intrusion incidents that form a single kill chain, includes 27 ATT&CK techniques, and features more than 12 Elastic data streams, and is designed for evaluating security operations investigation agents.

创建时间:
2026-07-29
原始信息汇总

secops-es-benchmark 数据集详情

数据集概述

secops-es-benchmark 是一个用于评估安全运营(SecOps)AI代理在 Elasticsearch 上执行安全调查能力的基准测试数据集。该数据集包含约 23.9 万条 ECS 规范化的 Elastic 安全遥测数据,覆盖 5 次 Linux 入侵事件形成的完整杀伤链,涉及 27 种 ATT&CK 技术、12 个战术阶段,以及 12 种以上的 Elastic 数据流(包括 Endpoint、Zeek、nginx、Suricata、检测告警等)。数据集提供 5 项调查任务和 54 个自动评分问题。

数据内容与场景

攻击场景

五个真实且无破坏性的入侵在受监控的基础设施上执行并采集为实时 Elastic 遥测数据,共同构成跨两台主机的端到端杀伤链:

案例 场景 杀伤链阶段 代表性 ATT&CK 技术
01 侦察 + C2 发现、凭据访问、C2 T1087.001、T1003.008、T1071.001
02 收集 + 外传 收集、外传 T1005、T1560.001、T1041
03 Web 漏洞利用 → 反弹 shell 初始访问 T1595、T1190
04 权限提升 权限提升 T1548
05 横向移动 横向移动 T1021.004

每个恶意事件都有已知的 ATT&CK 技术和意图(真实标签),周边遥测为真实生产噪音——兼有可信标签和现实噪音。

数据流

  • Elastic Endpoint:进程树、文件写入、出站流量、主机告警
  • Zeek:网络流、TLS/JA3、DNS、SSH 会话
  • nginx:Web 探测、漏洞利用尝试、webshell 访问
  • Suricata:基于同一流量的 IDS 告警
  • Detections:Elastic 检测规则与威胁情报指标匹配

评估机制

双层评分体系

  1. 客观题层(54 题):单事实问题,由代码确定性评分(精确匹配/多选题/集合 F1/布尔/排序),无 LLM 参与,完全可复现,测试代理的数据检索能力。
  2. 任务层(5 项调查):开放式调查,由 LLM 裁判按 100 分制评分,仅认可代理通过自身查询支持的主张,测试跨源关联和推理能力。

任务评分标准:证据召回 35 分、关联性 25 分、结论准确性 25 分、响应克制 15 分。问题包含负面/误报项(良性 cron、健康检查、SSH 扫描噪音),过度告警会被扣分。

工具接口

代理可通过 MCP 服务器、CLI、SDK 或代理技能访问数据,参考工具面仅含 4 个只读接口:esql_queryes_searchget_mappingslist_indices

使用方式

快速开始

bash pip install "anthropic[mcp]" httpx export ANTHROPIC_API_KEY=sk-ant-... python3 benchmark/runner/run_eval.py --tools direct

默认使用公开实时演示环境,开箱即用,无需下载数据或搭建 ES。支持 Claude 或任意 OpenAI 兼容端点,支持跨提供商裁判。

自有集群部署

bash python3 dataset/elastic/load.py --es "$YOUR_ES" --user elastic --password "$PW"

数据集位于 dataset/ 目录(NDJSON.gz 压缩格式+按案例的清单),附带 ECS 索引和组件模板。

数据完整性与防污染

  • 文件完整性:通过 SHA256SUMS 校验。
  • 标签-数据可审计verify_dataset.py 离线验证已回答密钥派生的具体指标(文件路径、IP、命令字符串)确实存在于发布的数据集中,发布版本通过率达 100%。
  • 答案密钥密封:正确答案、任务真相和评分标准存放在密封的 benchmark/ANSWERS.sealed 中,口令已公开(防爬取而非访问控制)。
  • 金丝雀 GUID:公开金丝雀可检测模型是否在训练语料中见过本仓库。
  • 无工具评分run_eval.py --no-tools 在没有 Elasticsearch 的情况下测试模型是否凭记忆作答,用于量化记忆污染程度。

基线结果参考

  • LLM 裁判对模型家族的排序具有鲁棒性(不同裁判 Pearson r ≈ 0.96,无同族偏袒)。
  • 自我评估会高估分数,建议使用中立裁判。
  • 客观题与任务题对模型的区分度不同——部分模型检索事实能力强但在多步关联上表现不佳。

数据集访问途径

许可证

  • 数据:CC-BY-4.0
  • 代码:Apache-2.0
  • 所有活动在作者自有系统上自我授权执行,已移除机密和商业/PII 数据,真实攻击者 IP 按设计保留。

版本与路线图

当前版本 v0.1.1(5 个 Linux 案例 + 59 个评分项)。v0.2.0 计划:平等化各提供商每响应的 token 预算并增加重试退避机制、降低客观题中的提示泄漏、增加防御规避/进程注入案例、"阻断攻击"(真阴性)案例、Windows 遥测、更多横向跳转和基线多轮方差评估。

搜集汇总
数据集介绍
secops-es-benchmark 数据集图片
构建方式
该数据集由作者在其自有的受监控基础设施上执行五次真实且非破坏性的入侵模拟,采集其产生的Elasticsearch遥测数据而成,共计约23.9万份ECS文档,覆盖12余种Elastic数据流(如Endpoint、Zeek、nginx、Suricata及检测告警)。五次入侵共同构成一条完整的杀伤链,涉及两个主机,映射至27种ATT&CK技术、12种战术。数据集以数据流形式组织,每条数据均带有基于构造的ground truth标签,同时混杂真实生产环境噪声,从而兼顾标签的可靠性与环境的真实性。
特点
数据集的一大特色是高度逼真且可审计:攻击脚本、运行日志(RUNLOG.md)和逐案例的ground truth文档均公开,验证脚本可断言证据与标签严格对应,确保来源可追溯。它紧密贴合安全运营分析师的实际工作流,要求智能体直接查询Elasticsearch并使用ES|QL语言,无法绕过数据存储取巧。评估采用双轨制,包含54道自动判分的客观题和5道由LLM裁判评分的开放性任务题,其中负样本(如良性cron、健康检查)的存在能够有效抑制过度告警。
使用方法
使用者可通过一条命令运行基准测试,默认连接公开的只读演示环境,无需本地部署即可即刻评分。支持将Claude或任何兼容OpenAI的模型接入代理框架,并可自定义裁判模型,以实现跨供应商评估。若需在自有集群上运行,可先通过数据集加载脚本(load.py)将数据导入Elasticsearch,再设置ES_URL等环境变量即可。此外,还提供独立的客观评分脚本(grade_questions.py),可不依赖LLM进行确定性评分,适合快速验证。
背景与挑战
背景概述
secops-es-benchmark数据集由TocharianOU团队于2026年发布,旨在评估安全运营中心(SOC)调查代理在Elasticsearch环境中的表现。该数据集包含约239,000条ECS规范化的遥测文档,覆盖5次Linux入侵事件构成的完整杀伤链,涉及27种ATT&CK技术、12个战术类别,以及包括Elastic Endpoint、Zeek、nginx、Suricata等在内的12种数据流。核心研究问题在于测试代理能否像真实SOC分析师一样,通过ES|QL查询实时只读SIEM,完成从单条告警或IOC出发的跨主机、跨数据源攻击重建与响应建议。作为首个基于真实攻击遥测的基准,其影响力在于提供了可信标签与真实噪声兼备的测试环境,填补了合成数据与未标注真实数据之间的空白,为SecOps AI代理的客观评估树立了标杆。
当前挑战
该数据集面临的挑战首要在于领域问题的复杂性:安全调查需在大量噪声中精准检索证据,代理需理解ECS模式并编写有效ES|QL,同时应对误导性的良性事件(如cron任务、健康检查)与否定性问题,避免过激响应或幻觉化IOC。其次,构建过程中遇到的挑战包括:在实时生产环境中执行非破坏性入侵并采集干净遥测的难度,需确保攻击脚本可复现且数据脱敏;标签与数据的严格对齐要求(通过verify_dataset.py验证100%匹配);以及基准的防污染问题,即答案密钥需密封、金丝雀GUID用于监测训练语料泄露,并需定期重新生成新指标以应对记忆化风险。此外,LLM评判者的公平性校准(如自我评估膨胀)与跨提供者一致性亦是持续挑战。
常用场景
经典使用场景
secops-es-benchmark 数据集的核心应用场景在于为安全运营中心(SOC)的自动化调查代理提供标准化的评测环境。该数据集基于 Elasticsearch 构建,包含约 23.9 万条 ECS 标准化的真实攻击遥测数据,覆盖 5 次 Linux 入侵构成的完整杀伤链,涉及 27 种 ATT&CK 技术、12 种战术,以及 12 种以上的 Elastic 数据流。研究者可让智能代理连接只读的 Elasticsearch 实例,通过 ES|QL 查询进行事件调查,完成从给定警报或 IOC 出发的跨主机、跨数据源追踪,重构入侵过程并提出响应建议。此场景模拟了真实 SOC 分析师的日常任务,为衡量代理在检索、关联和推理方面的综合能力提供了可复现的基准。
解决学术问题
该数据集解决了安全人工智能领域中缺乏‘真实标注+现实噪声’兼具的 SIEM 评测数据这一核心问题。现有数据集多为合成数据(标注准确但脱离实际)或真实数据(贴近现实但缺乏可靠标注),而 secops-es-benchmark 通过在受控环境中执行真实攻击脚本,同时采集周边真实业务噪声,实现了高质量标注与现实复杂性的统一。它支持对安全代理进行客观(54 个自动评分问题)与主观(5 个开放式调查任务)的两级评测,显著提升了评估的全面性和可信度。此外,该数据集通过密封答案密钥、金丝雀 GUID 以及无工具模式测量记忆泄漏等措施,有效应对了基准污染问题,为安全 LLM 评估领域树立了新标杆。
衍生相关工作
该数据集已衍生出多项具有影响力的相关工作。其一,开源了完整的评测框架(run_eval.py 和 grade_questions.py),使社区能够复现并自定义评测流程,推动了安全代理基准的统一。其二,通过跨提供方裁判实验,揭示了 LLM 评判器在不同模型家族间的稳健性(Pearson r≈0.96)及自评虚高现象,为后续设计更公平的自动评估方法提供了实证基础。其三,其抗污染策略(密封密钥、金丝雀 GUID、可再生成数据集)被后续安全基准广泛借鉴,成为应对基准记忆问题的范式。此外,v0.2.0 计划引入的私有保留集和动态指示器再生机制,为长期可持续的基准演进指明了方向,激励了更多关于安全代理鲁棒性与公平性的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务