遇见数据集

PRISM: Application- and Process-Attributed Network Traffic Dataset

收藏
github2026-08-12 更新2026-08-19 收录
官方服务:

资源简介:

PRISM是一个从Windows端点捕获的网络流量数据集,并标注了生成流量的应用程序和进程。每个会话(5元组流)存储为一个pcap文件,目录路径即为标签。数据集包含3天的流量(2026-07-10至2026-07-12),监控7台主机,共1,320,366个会话,199,326,467个数据包,压缩后大小为4.8 GB。提供89个应用标签和108个进程标签。数据以GitHub Release资产形式分发,不直接存储在Git仓库中。

PRISM is a network traffic dataset captured from Windows endpoints, with annotations for the applications and processes that generated the traffic. Each session (5-tuple flow) is stored as a PCAP file, with the directory path serving as the label. The dataset contains 3 days of network traffic (2026-07-10 to 2026-07-12), monitoring 7 hosts, totaling 1,320,366 sessions and 199,326,467 packets, with a compressed size of 4.8 GB. It provides 89 application labels and 108 process labels. The data is distributed as GitHub Release assets and is not stored directly in the Git repository.

创建时间:
2026-08-11
原始信息汇总

数据集概述

数据集名称:PRISM: Application- and Process-Attributed Network Traffic Dataset

数据来源:从 Windows 终端捕获的网络流量,并标注了生成流量的应用程序进程

采集时间:2026年7月10日–2026年7月12日(3天)

监控主机数:7台

会话数:1,320,366个pcap文件(每个会话一个文件,目录路径即标签)

数据规模

  • 总数据量:16.7 GB(压缩后4.8 GB)
  • 总数据包数:199,326,467个
  • 会话文件数:1,320,366个

标签数量

  • 应用标签:89个
  • 进程标签:108个

许可协议

  • 数据:CC BY 4.0
  • 代码:MIT

数据获取方式

数据不存储在Git仓库中,需要从GitHub Release页面下载压缩包。下载脚本为:

bash ./scripts/download.sh # 下载 + 校验SHA-256 + 解压

也可手动从Releases页面下载以下资产:

资产文件 大小 内容
PRISM_sessions_2026.07.10_part1.tar.zst 1.19 GiB 07-10,主机10.0.0.1–4
PRISM_sessions_2026.07.10_part2.tar.zst 1.00 GiB 07-10,主机10.0.0.5–7
PRISM_sessions_2026.07.11.tar.zst 1.21 GiB 07-11,所有主机
PRISM_sessions_2026.07.12.tar.zst 1.28 GiB 07-12,所有主机
PRISM_views.tar.zst 0.08 GiB 视图树 + 清单文件

所有归档解压到同一根目录(PRISM_2026.07.10-12/),合并为一个树结构。注意解压顺序:先解压会话归档,再解压PRISM_views.tar.zst


目录结构

数据集从三个视角组织,只有sessions/包含真实pcap文件,其余两个视角通过相对符号链接指向sessions/,不额外占用磁盘空间:

PRISM_2026.07.10-12/ ├── sessions/ # 原始采集布局(真实文件) │ └── 2026.07.<DD>/ │ ├── 10.0.0.<N>/ # 匿名化主机(N = 1..7) │ │ └── <application>/ # 应用名或<进程>.exe │ │ ├── [<子进程>.exe/] │ │ └── [<服务|域名>/] │ │ └── <PROTO><ip><port><ip>_<port>[<ts>].pcap │ └── _exp_summary.json # 每日、每主机的标签统计 ├── byproduct/ # 应用视角(89个标签) │ └── 2026.07.<DD>/<application>/[...]/.pcap ├── byproduct_process/ # 进程视角(108个标签) │ └── 2026.07.<DD>/<process>.exe/[...]/.pcap ├── byproduct.manifest.tsv # 视图路径 ↔ 会话路径映射 └── byproduct_process.manifest.tsv

各视角说明:

视角 顶层目录 = 标签 标签数量 说明
sessions/ (按主机划分) 原始采集,适合按主机分析
byproduct/ 应用 89 主机合并;顶层条目去除.exe后缀
byproduct_process/ 进程 108 主机合并;多进程应用的子进程提升到顶层

论文实验使用byproduct/(应用分类)和byproduct_process/(进程分类)。

文件名编码:文件名包含5元组(协议、源IP、源端口、目的IP、目的端口)。当同一5元组重复出现时,会附加捕获时间戳(YYYYMMDD_HHMMSS_mmm)以区分。遇到文件名冲突时,相同文件合并,不同文件保留__dupN.pcap后缀(共122例)。

无符号链接支持的文件系统:在Windows或某些网络共享上,两个视图树可能无法工作。可通过以下命令重建为真实文件:

bash python3 scripts/materialize_views.py PRISM_2026.07.10-12 --mode hardlink

--mode copy也可用,但每个视图额外占用16.7 GB;在相同文件系统上,hardlink行为与真实文件完全相同且无额外成本。


匿名化处理

所有属于采集机构地址范围的IPv4地址已被确定性替换,替换一致适用于目录名、文件名和数据包头。

原始地址 替换为
7个监控主机 10.0.0.110.0.0.7
66个其他内部主机 10.9.<s>.<h>

匿名化特性:

  • 双射(1:1):不同地址不会合并,保持按主机聚合和流关联的可能性。
  • /24子网结构保留:原始共享/24的节点在替换后仍共享10.9.<s>.0/24
  • 监控主机单独分配:7个监控主机刻意不保留在原子网,移至独立块以保护数据主体的网络位置。
  • 反向映射表不公开

未修改的部分:外部地址(非采集机构范围)、RFC 1918私有地址均未改动。有效载荷、TLS SNI、DNS查询名称、端口、时间戳及所有应用/进程标签均按采集原样保留

验证结果:发布树中所有199,326,467个数据包被重新读取,在包头和路径名中未发现任何残留机构地址


捕获特性(分析前须知)

  • 链路层:以太网。MAC地址在采集时已置零(00:00:00:00:00:00),因此不存在L2信息。
  • 协议:100% IPv4,仅TCP和UDP。无IPv6、VLAN、ARP、ICMP或IP分片。
  • 校验和:大量TCP/UDP校验和无效,这是原始采集的checksum-offload现象,并非匿名化导致——匿名化完全保留了每个数据包的校验和有效/无效状态(IPv4头校验和全部有效)。依赖校验和验证的分析应注意到这一点。
  • 截断:许多数据包存在frame.cap_len < frame.len(抓包长度截断)。
  • 最小会话过滤:采集时排除了会话数低于阈值(默认10)的应用,详见_exp_summary.json中的excluded_apps字段。
  • .exe桶排除:无法归属到特定进程的Systemunknown流量(139,678个会话)已从发布中排除,每个发布的会话都携带标签。每主机的排除计数保存在_exp_summary.jsonips[*].excluded_from_release中。

预处理与使用

数据集以原始按会话pcap文件形式发布,可自由构建所需的预处理。标签位于目录路径中,无需单独的标签文件——直接使用byproduct/(应用)或byproduct_process/(进程)下的顶层目录名作为类别即可。

论文中使用的三种模型(2D CNN、ET-BERT、XGBoost)的预处理代码将另行发布,各模型的输入表示和设置在论文第4.1节中描述。


引用格式

bibtex @dataset{prism2026, title = {PRISM: Application- and Process-Attributed Network Traffic Dataset}, year = {2026}, note = {KNOM Review, Vol.29, No.1}, url = {https://github.com/illiard1209/PRISM-2026-Dataset} }


许可与使用注意

  • 数据CC BY 4.0 — 可自由使用、再分发和改编,包括商业用途,需注明出处。
  • 代码scripts/):MIT — 见LICENSE-CODE

数据已匿名化但源自真实用户活动,禁止尝试重新识别个体主机或用户

搜集汇总
数据集介绍
PRISM: Application- and Process-Attributed Network Traffic Dataset 数据集图片
构建方式
PRISM数据集通过从7台Windows终端收集为期三天的网络流量,并以pcap文件形式按会话(5元组流量)存储,目录路径即标签。采集过程对内部IPv4地址进行了确定性匿名化处理,保留了地址的双射映射和/24子网结构。会话按三种视角组织:原始采集布局(sessions/)、应用视图(byproduct/)和进程视图(byproduct_process/),其中后两者通过相对符号链接指向真实文件,节省存储空间。应用和进程标签分别有89和108个,排除了无法归因的System和unknown流量,确保每个会话都有标签。
使用方法
用户可通过GitHub Releases下载压缩档案,并利用提供的脚本验证SHA-256哈希并解压。解压后,顶层目录名直接作为类别标签,可用于监督学习。数据集提供原始pcap文件,用户可按需定制预处理流程,论文中使用2D CNN、ET-BERT和XGBoost模型的方法描述于论文第4.1节。在缺失符号链接支持的文件系统上,可使用脚本将视图物化为硬链接或副本。数据遵循CC BY 4.0协议,允许自由使用和改编,但需注明出处并遵守禁止重识别的规定。
背景与挑战
背景概述
PRISM数据集由韩国科学技术研究院(KISTI)的研究团队于2026年7月创建,旨在解决网络流量分析中应用与进程级标签缺失的难题。该数据集从7台Windows终端采集了3天的真实网络流量,包含超过132万个会话、1.99亿个数据包,并提供了89个应用标签和108个进程标签。其核心创新在于以目录路径作为标签,实现了细粒度的流量归属,为网络行为分析、入侵检测及用户隐私保护研究提供了宝贵资源。PRISM的发布填补了该领域缺乏真实、细粒度标注数据的空白,对网络流量分类和异常检测研究具有重要推动作用。
当前挑战
PRISM数据集面临的挑战包括:领域问题方面,精确识别产生流量的应用和进程是网络管理的关键,但传统方法受限于加密流量和动态端口,难以实现高精度分类;数据构建方面,采集过程中需处理校验和卸载导致的无效校验和、数据包截断等噪声,同时需对IP地址进行确定性匿名化,在保护隐私的同时保持网络结构的可用性,且需保证1.32M文件的组织与压缩存储的可行性。此外,多视图结构的构建需处理符号链接在不同文件系统上的兼容性问题,以及排除无法归因的流量,确保每个会话都有明确标签。
常用场景
经典使用场景
该数据集为网络流量分类研究提供了精细粒度的应用与进程级标注,是构建和评估机器学习模型的理想基准。研究者可基于其目录结构直接提取标签,开展基于流特征的分类任务,如利用五元组统计特征训练传统模型,或将其转换为图像序列与预训练语言模型输入,进行端到端的深度网络训练。这种按会话组织的原始pcap格式,赋予研究者预处理灵活性,以适配不同架构下的输入表征需求。
解决学术问题
该数据集回应了网络流量智能分析中标签获取的长期瓶颈,传统流量数据往往仅具备粗粒度的端口或服务标注,难以反映上层的应用行为与进程归属。此数据集提供了从真实Windows主机采集的、精确到进程级的流量标签,使得学术研究能够深入探究应用识别、进程行为刻画及用户活动推断等课题,并为验证流量加密场景下的分类算法鲁棒性提供了关键性的数据支撑。
实际应用
在实际应用领域,该数据集支撑着企业级安全运维的精细化流量审计,使安全团队得以洞察具体应用程序及其子进程的网络行为模式,从而有效检测可疑的软件活动或非授权应用的使用。其进程级标注亦有助于构建主机行为基线,为端点检测与响应系统提供更为精准的上下文信息,同时也为网络性能优化中识别带宽消耗型应用与进程,提供了可信的数据依据。
数据集最近研究
最新研究方向
PRISM数据集聚焦于网络流量与生成它的应用程序及进程的精细归因,为网络行为分析开辟了前所未有的细粒度视角。在当今网络攻击日益复杂、加密流量普及的背景下,该数据集通过捕获真实用户活动,并创新性地以目录路径作为标签,实现了对流量来源的精确追踪。其研究前沿涵盖基于深度学习的应用识别、进程级异常检测及用户行为建模,为提升网络可见性、强化端点安全及推动零信任架构的落地提供了关键数据支撑。PRISM的发布,不仅促进了网络测量与安全领域的交叉研究,更对应对高级持续性威胁、完善隐私保护机制具有重要意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务