遇见数据集

Kyoto-2006+

收藏
arXiv2023-04-04 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

Kyoto-2006+是一个用于网络入侵检测的大规模数据集,由Bitdefender, Romania创建。该数据集覆盖了10年的真实网络流量数据,包含自然发生的随时间变化的数据,如用户行为模式的变化和软件更新。数据集的创建旨在研究无监督异常检测中的分布偏移问题,通过分析非平稳数据特性,使用t-SNE和最优传输方法测量不同年份之间的分布距离。AnoShift基准通过将数据分为IID、NEAR和FAR测试分割,验证了模型在时间上的性能退化,并展示了通过承认和处理分布偏移问题,性能可以得到改善,平均提升可达3%。

Kyoto-2006+ is a large-scale dataset for network intrusion detection, created by Bitdefender of Romania. This dataset contains 10 years of real-world network traffic data, including naturally occurring time-varying phenomena such as shifts in user behavior patterns and software updates. The dataset was developed to study the distribution shift problem in unsupervised anomaly detection: t-SNE and optimal transport methods are used to measure distribution distances across different years by analyzing the non-stationary characteristics of the data. The AnoShift benchmark splits the dataset into IID, NEAR and FAR test splits to validate model performance degradation over time, and demonstrates that acknowledging and addressing distribution shift issues can improve model performance, with an average improvement of up to 3%.

提供机构:
Bitdefender, Romania
创建时间:
2022-07-01
搜集汇总
数据集介绍
Kyoto-2006+ 数据集图片
构建方式
Kyoto-2006+数据集基于日本京都大学部署的348个蜜罐系统在2006年11月至2015年12月间捕获的真实网络流量数据构建而成。蜜罐作为模拟常规计算机的虚拟或实体机器,其所有入站连接均被视为未经请求的恶意行为,因此该数据集异常样本占比高达89.5%。原始数据包含14个常规特征,涵盖2个类别型特征(如连接服务类型和连接标志)与12个数值型特征(如连接时长和源字节数)。为适应基于词汇的模型,研究团队采用指数缩放分箱方法将3个浮点型特征离散化为233个区间,并将9个百分比特征映射至100个离散值,从而形成固定的词汇表。最终,数据集按年份划分为训练集(2006-2010年)、近端测试集(2011-2013年)和远端测试集(2014-2015年),每个年份子集均保持原始正常与异常样本的比例。
特点
该数据集的核心特点在于其天然蕴含的时间分布漂移现象。覆盖十年的连续数据流反映了网络行为的渐进式演变,例如用户行为模式变化、软件更新及漏洞修复等现实动态。通过t-SNE可视化和最优传输距离分析,研究者证实了年份间数据分布的系统性偏离,且偏离程度与时间间隔呈正相关。此外,异常样本在远端年份中与训练集的正常样本分布高度相似,导致模型性能急剧下降。这一特性使Kyoto-2006+成为首个面向无监督异常检测的分布漂移基准,其非人工注入的自然漂移机制为评估模型泛化能力提供了独特视角。
使用方法
该数据集的使用遵循基于时间距离的评估协议。训练阶段采用2006-2010年数据,测试阶段则划分为同分布(IID)测试集(与训练集同时间段)、近端测试集(2011-2013年)和远端测试集(2014-2015年)。研究者建议使用ROC-AUC和PR-AUC作为主要评估指标,尤其关注正常样本的PR-AUC以捕捉分布漂移对模型的影响。实验表明,经典方法(如孤立森林和深度SVDD)在近端测试中性能下降,而远端测试中多数模型表现低于随机水平。此外,通过知识蒸馏策略(将前一年模型作为教师指导当前模型)可提升远端测试性能约3%,为缓解分布漂移提供了可行方案。
背景与挑战
背景概述
Kyoto-2006+数据集由日本京都大学的研究团队于2011年创建,基于2006年11月至2015年12月间从348个蜜罐系统捕获的真实网络流量数据构建而成。该数据集旨在为网络入侵检测系统(NIDS)提供长期、自然的异常检测评估基准,其核心研究问题聚焦于无监督异常检测模型在非平稳数据流中的泛化能力。作为网络流量领域的重要参考数据集,Kyoto-2006+覆盖了长达十年的连续数据,自然反映了用户行为模式变化、软件更新等现实因素引发的分布漂移现象,为后续的分布漂移基准研究奠定了关键基础。
当前挑战
该数据集面临的核心挑战在于无监督异常检测模型对自然分布漂移的脆弱性:实验表明,模型在时间邻近的测试集(NEAR)上性能显著下降,而在远离训练集的时间段(FAR)上几乎失效,部分模型ROC-AUC跌至随机水平以下。构建过程中,蜜罐环境的正常流量多样性受限,且依赖现有软件进行标注可能低估异常样本。此外,数据预处理中的数值特征分箱操作引入了词汇稀有性问题,进一步加剧了模型在远期数据上的不确定性。
常用场景
经典使用场景
Kyoto-2006+数据集作为网络入侵检测领域的经典基准,广泛用于无监督异常检测模型的评估与比较。该数据集采集自京都大学蜜罐系统,覆盖2006年至2015年长达十年的真实网络流量数据,包含正常与异常样本的精细标注。在经典使用场景中,研究者通常基于该数据集训练各类异常检测算法,如孤立森林、单类支持向量机或深度自编码器,并通过随机划分的训练-测试集验证模型对已知数据模式的识别能力。其丰富的时序跨度与真实流量特征,使其成为评估模型在静态分布假设下性能表现的标准平台,尤其在网络安全研究中,用于衡量算法对已知攻击模式的检测精度与误报率。
衍生相关工作
Kyoto-2006+数据集衍生了一系列推动分布漂移研究的重要工作。AnoShift基准协议便是其直接产物,通过构建IID、NEAR和FAR三种测试划分,系统量化了时间距离对模型性能的影响,成为首个针对无监督异常检测的时序漂移基准。后续研究借鉴该协议,探索了知识蒸馏、持续学习与自适应训练等策略,如利用教师-学生框架在逐年数据上蒸馏知识,平均提升ROC-AUC达3%。此外,该数据集还催生了基于最优传输距离(OTDD)的分布差异度量方法,以及针对网络流量的掩码语言模型(如BERT for Anomalies),这些工作共同深化了对非平稳数据下模型鲁棒性的理解,推动了安全机器学习领域的发展。
数据集最近研究
最新研究方向
基于Kyoto-2006+数据集的AnoShift基准测试,聚焦于无监督异常检测中的分布漂移问题。该研究通过分析十年间网络流量的自然演化,揭示了数据随时间推移产生的非平稳特性,并提出了基于时间距离的评估协议(IID、NEAR、FAR分割),以量化模型性能的退化程度。这一方向与当前机器学习领域对分布漂移的日益关注紧密相连,尤其在网络安全监控这一关键应用中,传统假设独立同分布的训练方式导致模型在实际部署中性能骤降。AnoShift的提出为开发更鲁棒、更贴近真实世界场景的异常检测算法奠定了重要基础,推动了该领域从静态评估向动态时序评估的范式转变。
相关研究论文
  • 1
    AnoShift: A Distribution Shift Benchmark for Unsupervised Anomaly DetectionBitdefender, Romania · 2023年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务