遇见数据集

agentic-pcap

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

该数据集旨在评估用于网络攻击检测的智能体式大语言模型,围绕一个核心研究问题构建:一个能够使用工具的LLM智能体,在仅给定原始网络数据包捕获文件路径和11种可能攻击的自然语言描述的情况下,能否自主选择并执行数据包分析查询,根据观察结果调整策略,并最终做出捕获级别的攻击判定。数据集用于研究模型选择、推理配置、提示指导和背景流量如何影响智能体的调查过程与决策。核心包含44个时长30分钟的网络数据包捕获文件,分为两种背景流量条件:低背景流量(仅包含场景流量和测试床空闲活动)和生成的高背景流量(添加了自动生成的良性背景流量,使数据更嘈杂、体积更大)。其中包含22个攻击捕获和22个良性捕获,覆盖了TCP ACK洪水攻击、ARP欺骗、DNS洪水攻击、FIN扫描、ICMP分片洪水、NULL扫描、TCP SYN端口扫描、Slowloris、UDP分片洪水、UDP扫描、Xmas扫描等11种攻击类型。除了原始PCAP文件,数据集还提供了完整的元数据(记录每个捕获的ID、流量条件、类型、基准标签、公开攻击类别名称、文件大小和路径)以及全部4,752次智能体调查会话的完整记录。这些会话记录涵盖了18种不同的模型/推理配置(包括Qwen、Gemma、GPT-5.5等多种模型)和6种不同指导级别的提示词变体(从仅提供攻击特征到提供完整调查工作流程),使得研究者能够深入分析智能体行为、查询模式、提示效果和失败案例。数据集总大小为73.33 GiB,主要适用于网络信息安全、入侵检测、智能体式AI以及大语言模型评估等领域的研究,特别是关注于基于原始网络流量的、由LLM驱动的自主调查任务。数据在受控的测试环境中生成,不包含真实用户流量或敏感信息。

This dataset is designed to evaluate agent-based large language models for network attack detection. It is built around a core research question: given only the path to a raw network packet capture file and natural language descriptions of 11 possible attacks, can an LLM agent capable of using tools autonomously select and execute packet analysis queries, adjust strategies based on observations, and ultimately make capture-level attack judgments? The dataset is used to study how model selection, inference configuration, prompt guidance, and background traffic affect the agents investigation process and decisions. The core consists of 44 network packet capture files with a duration of 30 minutes each, divided into two background traffic conditions: low background traffic (containing only scenario traffic and testbed idle activity) and generated high background traffic (with added automatically generated benign background traffic, making the data noisier and larger in volume). It includes 22 attack captures and 22 benign captures, covering 11 attack types such as TCP ACK flood, ARP spoofing, DNS flood, FIN scan, ICMP fragmentation flood, NULL scan, TCP SYN port scan, Slowloris, UDP fragmentation flood, UDP scan, and Xmas scan. In addition to the raw PCAP files, the dataset provides complete metadata (recording each captures ID, traffic condition, type, ground truth label, public attack category name, file size, and path) and full records of all 4,752 agent investigation sessions. These session records cover 18 different model/inference configurations (including models like Qwen, Gemma, GPT-5.5) and 6 prompt variants with varying levels of guidance (from providing only attack characteristics to offering a complete investigation workflow), enabling researchers to deeply analyze agent behavior, query patterns, prompt effectiveness, and failure cases. The total dataset size is 73.33 GiB, primarily suitable for research in network information security, intrusion detection, agent-based AI, and large language model evaluation, especially focusing on LLM-driven autonomous investigation tasks based on raw network traffic. The data is generated in a controlled test environment and does not contain real user traffic or sensitive information.

创建时间:
2026-07-21
原始信息汇总

数据集总览

Agentic LLMs for Network Attack Detection 是一个用于评估自主网络流量调查中智能体大语言模型(Agentic LLM)表现的实验数据集。它包含原始网络数据包捕获(PCAP)文件、完整的智能体调查记录和汇总结果。

  • 目的: 研究仅给定原始PCAP文件和11种可能的攻击的自然语言描述,LLM智能体能否独立进行调查并识别攻击。
  • 数据组成:
    • 44个30分钟长度的PCAP文件。
    • 覆盖11种攻击类别及相应的良性捕获。
    • 6种不同引导级别的提示变体。
    • 18种模型/推理配置。
    • 4,752个完整的智能体会话记录(包括提示、工具使用、观察结果和最终决策)。

数据集详情

  • 语言: 英语 (en)
  • 许可协议: CC-BY-4.0(数据集和实验工件);软件部分为MIT许可。
  • 应用标签: 网络安全、网络安全、数据包捕获、入侵检测、智能体AI。

数据特征

数据集包含一个名为 capture_metadata 的配置,其元数据特征如下:

特征名 数据类型 描述
run_id 字符串 (string) 运行标识符
traffic_condition 类别标签 (class_label) 流量背景:low_backgroundgenerated_high_background
capture_kind 类别标签 (class_label) 捕获类型:attack (攻击) 或 benign (良性)
benchmark_label 类别标签 (class_label) 基准标签:Attack 1Attack 11No attack detected
public_class_name 类别标签 (class_label) 公开攻击名称:如 TCP ACK flood using IP fragmentation, ARP spoofing, Benign 等共12个类别
file_size_mib 浮点数 (float64) 文件大小(MiB,1 MiB = 1,048,576 字节)
pcap_path 字符串 (string) PCAP文件路径
file_size_bytes 整数 (int64) 文件大小(字节)
  • 数据划分: 包含一个名为 benchmark 的划分,共 44 个样本。

数据文件结构

项目文件在Hugging Face仓库中的组织方式:

路径 内容说明
data/pcaps/low_background/ 22个低背景流量的PCAP文件
data/pcaps/generated_high_background/ 22个生成的高背景流量的PCAP文件
metadata/captures.csv 每个捕获的标签、条件、路径和大小元数据
metadata/condition_summary.csv 按流量条件统计的捕获数量和大小汇总
artifacts/primary_runs/ALL_MODELS/ 4,752个完整的智能体调查会话记录
artifacts/primary_runs/ALL_MODELS_SUMMARIES/ 按提示和全局的结果表格与仪表盘
SHA256SUMS 44个PCAP文件的SHA-256校验和文件

智能体调查记录

每个智能体会话包含以下文件:

  • final_answer.txt: 捕获级别的决策结果。
  • prompt.md: 提交的调查提示。
  • session_export.json, .md, .html: 完整的会话记录。

提示变体

共6种提示变体,应用于所有44个捕获。

变体 目录名 提供给智能体的信息
P0 P0_signature 仅提供简单攻击签名
P1 P1_observables 签名及需要检查的流量指标
P2 P2_differential 签名及区分相似类别的指导
P3 P3_workflow 签名及高级调查工作流程
P4 P4_evidence_policy 签名、所需证据及排除性观察
P5 P5_full P0-P4提供的所有信息

发布的模型配置

所有模型配置共产生264个调查(44个捕获 × 6个提示)。

服务路径 模型 架构 参数 推理配置 调查数量
本地开源,vLLM Qwen 3.5 9B BF16 Dense 9B 禁用/启用思考 528
本地开源,vLLM Gemma 4 12B IT BF16 Dense 11.95B 禁用/启用思考 528
本地开源,vLLM Qwen 3.6 27B BF16 Dense 27B 禁用/启用思考 528
本地开源,vLLM Gemma 4 31B IT BF16 Dense 30.7B 禁用/启用思考 528
本地开源,vLLM Qwen 3.6 35B-A3B BF16 Mixture of experts 35B/3B (活跃) 禁用/启用思考 528
本地开源,vLLM gpt-oss-120b MXFP4 Mixture of experts 117B/5.1B (活跃) 提供者默认 264
开源,外部API Mistral Medium 3.5 Dense 128B 努力程度无/高 528
开源,外部API DeepSeek V4 Flash Mixture of experts 284B/13B (活跃) 努力程度最大 264
开源,外部API MiMo V2.5 Mixture of experts 310B/15B (活跃) 努力程度高 264
开源,外部API MiniMax M3 Mixture of experts ≈428B/≈23B (活跃) 提供者默认 264
开源,外部API GLM 5.2 Mixture of experts 744B/40B (活跃) 提供者默认 264
专有API参考 GPT-5.5 未公开 未公开 努力程度极高 264

数据收集与安全

  • 流量在仿真GNS3测试平台中生成,所有攻击流量仅限于该测试平台。
  • 未收集任何人类用户流量,发布的PCAP文件不包含凭据或其他敏感信息。
  • 数据集仅供离线研究使用,其范围限于已发布的拓扑结构、流量生成过程及11种攻击类别。

引用信息

如需引用此数据集及相关的调查工件,可参考以下BibTeX格式:

bibtex @misc{aureille2026agentic, author = {Matthieu Aureille and Jan Fesl}, title = {Agentic LLMs for Network Attack Detection}, year = {2026}, howpublished = {Hugging Face dataset}, note = {Version 1.0.0}, url = {https://huggingface.co/datasets/maureille/agentic-pcap} }

搜集汇总
数据集介绍
agentic-pcap 数据集图片
构建方式
网络攻击检测领域长期受困于标注数据匮乏与真实流量采集的隐私困境。本数据集通过GNS3仿真测试床精心构建,在可控环境中生成涵盖11类攻击与对应的良性流量,每个捕获持续30分钟,形成44个PCAP文件。数据分为低背景流量与生成高背景流量两种场景,后者通过自动化工具注入外部下载等良性活动以模拟嘈杂网络环境。攻击标签采用'Attack 1'至'Attack 11'的通用编号,辅以自然语言描述的可观测行为,便于代理模型进行自主推理。所有流量完全隔离于仿真环境,未采集任何真实用户数据,确保隐私合规。
特点
本数据集的核心特色在于其与自主大语言模型代理深度耦合的实验设计。每个PCAP文件仅提供原始数据包捕获路径和攻击文字描述,不预置任何特征提取或流量摘要,迫使代理模型自主选择并执行数据包分析查询。数据集完整记录了4752次代理会话的完整轨迹,包括提示词、工具调用序列、观察结果与最终决策,不仅支持攻击检测性能评估,更能深入分析代理的查询选择、提示策略影响、推理模式及失败机理。18种模型/推理配置与6种提示变体的系统组合,形成了对代理行为可重复性研究的丰富素材。
使用方法
用户可通过Hugging Face命令行客户端便捷下载数据集,支持完整获取或选择性下载特定路径的文件。每个会话目录包含最终决策文本、提交的提示标记文档以及JSON、Markdown、HTML三种格式的完整会话导出,便于程序化分析或可视化复盘。元数据以CSV格式提供捕获的标签、流量条件、文件大小等属性。对于复制实验,用户需参考GitHub仓库中的基准代码与编排脚本,依次加载PCAP文件、配置代理模型与提示变体、运行推理并比对最终决策结果。数据集附带SHA-256校验文件以确保下载完整性。
背景与挑战
背景概述
随着网络攻击手段日益复杂和隐蔽,传统基于规则或签名匹配的入侵检测系统在面对未知攻击或加密流量时暴露出显著局限性。2026年,由Matthieu Aureille与Jan Fesl共同发布的agentic-pcap数据集,旨在探索大语言模型(LLM)作为自主智能体进行原始网络流量分析的能力。该数据集通过模拟真实网络环境,系统评估了LLM智能体在仅获得原始数据包捕获文件(PCAP)和自然语言攻击描述的情况下,能否独立执行查询、调整策略并最终判定是否发生攻击。研究涉及18种模型配置、6种提示策略及44个30分钟时长的捕获样本,覆盖11类攻击与两种背景流量强度,开创了将智能体AI与网络安全检测深度结合的新范式,对推动自动化网络取证与主动防御研究具有里程碑意义。
当前挑战
该数据集所解决的领域核心挑战在于,传统的网络攻击检测方法高度依赖预定义规则或标注特征,难以适应攻击变种与噪声背景。agentic-pcap要求LLM智能体在完全无预计算特征的情况下,仅通过自然语言指令与自选工具从原始PCAP中自主发现攻击迹象,这对模型的推理能力、工具调用策略及上下文记忆构成严峻考验。在构建层面,挑战体现在三大方面:一是模拟真实与生成性高背景流量并存的环境,需确保背景流量噪声可控且不引入安全风险;二是设计11种攻击的区分性描述,防止提示信息泄露具体命令序列;三是管理大规模实验——包含4752次完整智能体会话,需保障每个会话的可复现性与轨迹完整性,同时平衡开放权重模型(如Qwen、Gemma)与闭源API模型的推理成本与延迟差异。
常用场景
经典使用场景
在网络空间安全领域,agentic-pcap数据集被设计用于评估具备自主推理与工具调用能力的大语言模型在原始网络流量分析中的表现。该数据集包含了44个时长30分钟的PCAP文件,覆盖11种典型攻击类型及良性流量场景,并提供了低背景噪声与高生成背景噪声两种流量环境。研究者可借助该数据集检验智能体在仅获知数据包捕获文件路径和自然语言攻击描述的条件下,自主选择并执行数据包分析查询、调整推理策略并最终给出捕获级别判决的能力。这一设定使得该数据集成为探索基于大语言模型自主网络安全智能体的理想基准。
实际应用
在实际网络防御场景中,该数据集所驱动的智能体架构能够极大降低对网络安全分析人员专业知识与经验的依赖,在入侵检测安全运营中心(SOC)中实现流量告警的自动甄别与初步取证。例如,当接收一个原始PCAP文件后,大语言模型智能体可借助自然语言指令自主调用抓包解析工具,依据返回的流特征、协议状态等异常指标迭代搜索攻击痕迹,最终生成结构化的分析报告。这种自动化的深度调查流程尤其适合处理海量告警日志的筛选与降噪,显著提升安全运维团队对真实威胁的响应效率。
衍生相关工作
基于agentic-pcap数据集,衍生了一系列关于大语言模型智能体在网络攻击检测中决策可解释性与鲁棒性的经典研究。研究者们利用该数据集分析了不同提示策略(从简单攻击签名到完整调查工作流)对智能体最终判定准确率的影响,并量化比较了多种预训练模型架构(包括密集模型与混合专家模型)在开启与关闭思维链推理模式下的性能差异。此外,该数据集还被用于剖析智能体的失败模式、工具选择偏好以及令牌消耗分布,推动了以‘智能体行为审计’与‘提示工程自动化’为核心的新兴课题发展,为构建更安全可信的自主网络防御系统奠定了实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务