遇见数据集

WinLOLBIN-GT

收藏
github2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

WinLOLBIN-GT是一个标记的行为基准数据集,旨在支持基于机器学习的Windows Living-Off-the-Land Binary滥用检测。该数据集通过受控实验室测试环境构建,生成了良性管理活动和恶意LOLBin执行模式,并进行了捕获、验证和标记。每个事件都设计为反映真实的进程执行行为,包括命令行结构、父子进程关系、文件路径、用户上下文和映射的行为指标。数据集用于训练机器学习模型进行LOLBin滥用检测,并在SIEM部署环境中进行评估。

WinLOLBIN-GT is a labeled behavioral benchmark dataset designed to support machine learning-based Windows Living-Off-the-Land Binary (LOLBin) abuse detection. This dataset is constructed in controlled laboratory test environments, generating benign management activities and malicious LOLBin execution patterns, which are then captured, verified and labeled. Each event is designed to reflect real-world process execution behaviors, including command line structures, parent-child process relationships, file paths, user contexts and mapped behavioral metrics. The dataset is used for training machine learning models for LOLBin abuse detection and evaluated in SIEM deployment environments.

创建时间:
2026-06-04
原始信息汇总

数据集概述

WinLOLBIN-GT 是一个用于支持基于机器学习的 Windows 本地运行二进制文件滥用检测的行为标签真实数据集。该数据集通过在受控实验室测试平台中生成、捕获、验证和标记良性管理活动与恶意文件执行模式而构建,反映了真实的进程执行行为。

关键特性

属性 详情
版本 1.0.1
数据集许可证 CC BY 4.0
脚本许可证 MIT
下载源 Zenodo (DOI: 10.5281/zenodo.20533434)
处理后的数据行数 10,006,645 (55个特征 + model_text字段)
原始数据行数 10,000,000 (原始Sysmon风格事件)

数据生成过程

数据集生成分为两步:

  1. 生成原始标记事件:模拟500万个良性事件和500万个恶意Sysmon进程创建事件,命令来源包括LOLBAS目录、Atomic Red Team程序和攻击者命令库。每个事件带有已验证的标签和MITRE ATT&CK技术ID。
  2. 提取行为特征:对原始事件进行归一化、去重、路径和IP掩码,导出55个行为信号及一个model_text训练字段,并移除会泄露真实标签信息的字段。

数据集用途与贡献

  • 用于训练机器学习模型检测文件滥用。
  • 已在实际SIEM环境中进行部署评估,对未见过的攻击场景检测准确率达99%。
  • 贡献包括:
    • 提供一个可复现的Windows文件滥用检测标签真实数据集。
    • 提供一套生成标记行为遥测的受控测试平台方法。
    • 提供一个在运营SIEM环境中验证机器学习模型的评估框架。

数据来源与致谢

  • LOLBAS项目:主要来源,涵盖目录中每个文件的已知滥用模式与合法管理使用。
  • Atomic Red Team:提供具体的攻击测试程序,丰富了恶意命令模式与父子进程链。
  • MITRE ATT&CK:提供统一的标签体系,每个恶意事件均带有技术ID和战术。
  • 威胁情报与事件报告:用于验证和扩展恶意命令模式,确保覆盖真实攻击中的技术。

引用格式

bibtex @dataset{winlolbin_gt_2026, title = {WinLOLBIN-GT: A Behavioural Ground Truth Dataset for Machine Learning-Based Detection of Windows Living-Off-the-Land Binary Abuse}, author = {Daniel Jeremiah and Husnain Rafiq and Obinna Okoyeigbo}, year = {2026}, version = {1.0.1}, doi = {10.5281/zenodo.20533434} }

搜集汇总
数据集介绍
WinLOLBIN-GT 数据集图片
构建方式
WinLOLBIN-GT数据集构建于受控实验环境中,通过模拟良性管理操作与恶意LOLBin执行行为,生成并捕获了兼具真实性与多样性的进程执行事件。构建过程严格遵循可复现原则,依赖LOLBAS目录、Atomic Red Team攻击流程库以及自定义攻击命令库,分别生成五百万条良性事件与五百万条恶意事件,最终合并为千万级规模的数据集。每一事件均包含命令行结构、父子进程关系、文件路径、用户上下文及映射的行为指标,并经由去重、路径与IP脱敏、特征衍生等处理步骤,形成55维行为信号与model_text训练字段,确保标签纯净且适合机器学习建模。
特点
该数据集的核心特色在于其行为层面的标签真实性与场景覆盖的全面性。不同于依赖静态签名的传统数据集,WinLOLBIN-GT聚焦于进程执行时的动态行为模式,尤为关注LOLBin在良性管理场景与恶意利用场景下的差异,使得模型能够习得基于上下文的判别能力。数据集融入了MITRE ATT&CK战术与技术标识,每个恶意事件均携带对应的技术ID,便于与业界威胁框架对接。此外,数据集的生成脚本与特征提取流程完全开源,支持从原始脚本出发完整复现,大幅降低了研究者的验证门槛。
使用方法
使用者可通过GitHub仓库中的脚本流水线,从零生成完整数据集。首先运行generate_winlolbin_gt_dataset.py脚本,指定每类样本数量,获取未经处理的原始合并CSV文件;随后运行extract_lolbin_features.py脚本,对原始事件进行去重、特征计算与敏感信息掩码处理,输出可直接用于机器学习的特征矩阵。该数据集适用于二元分类任务,支持以process_text或model_text字段作为输入,结合55维行为特征进行模型训练与评估。同时,数据集附带的评估框架允许在SIEM环境中部署并验证模型对未见攻击模式的泛化能力。
背景与挑战
背景概述
随着网络攻击手段的日趋复杂,攻击者愈发倾向于利用Windows操作系统内置的合法二进制文件(Living-Off-the-Land Binaries,简称LOLBIN)实施恶意行为,以规避传统基于签名的检测机制。为应对这一挑战,Daniel Jeremiah、Husnain Rafiq与Obinna Okoyeigbo于2026年共同发布了WinLOLBIN-GT数据集。该数据集依托受控实验环境,模拟并捕获了超过1000万条涵盖良性管理活动与恶意LOLBin执行的系统进程事件,每条记录均经过严格标注,包含命令行结构、父子进程关系、文件路径及用户上下文等丰富行为特征。该数据集不仅为机器学习驱动的LOLBin滥用检测提供了可复现的基准真实值,还在SIEM部署环境下验证了模型对未知攻击场景的泛化能力,准确率高达99%,显著推动了安全领域内行为分析技术的发展。
当前挑战
WinLOLBIN-GT数据集主要应对两大挑战。其一,领域问题挑战在于Windows LOLBIN滥用检测的复杂性——攻击者利用广泛使用的合法工具执行恶意操作,使得传统特征比对方法难以有效区分正常行为与攻击行为,亟需基于行为模式的机器学习模型精准捕捉细微异常。其二,构建过程挑战体现为大规模行为数据的生成与标注:需在受控环境中模拟500万条良性事件与500万条恶意事件,确保每条命令序列均具唯一性,避免重复数据干扰模型训练。为此,研究团队设计了参数化引擎以生成结构相异但语义合理的命令行变体,并融合LOLBAS目录、Atomic Red Team程序库及真实威胁情报,最终构建出包含55项行为特征的标准化数据集,为后续研究奠定了坚实基础。
常用场景
经典使用场景
在网络安全领域,针对Windows平台上Living-Off-the-Land Binary(LOLBIN)滥用的检测长期面临数据稀缺与标注困难的挑战。WinLOLBIN-GT数据集通过构建受控实验床,系统性地生成了500万条良性管理活动与500万条恶意LOLBin执行行为的Sysmon进程创建事件,每条记录均包含命令行结构、父子进程关系、文件路径、用户上下文及行为指标等关键特征。该数据集的经典使用场景在于训练机器学习模型以区分正常管理操作与隐蔽的LOLBin滥用行为,其覆盖了LOLBAS目录中所有二进制文件的已知滥用模式与合法用途,同时整合了Atomic Red Team的攻击流程与MITRE ATT&CK技术标签,为监督学习提供了高保真的行为标注基础。研究人员可基于其55维行为特征与标准化标签,开发分类器以识别如powershell.exe、cmd.exe等合法工具被恶意利用的细微异常,从而在端点检测与响应(EDR)系统中实现精准告警。
衍生相关工作
围绕WinLOLBIN-GT数据集,已衍生出多项具有里程碑意义的后续研究与实践工作。其一,研究者基于该数据集开发了多种机器学习基线模型,包括随机森林、梯度提升树与深度神经网络,并对比了不同特征选择策略对LOLBin检测性能的影响,形成了公开的模型基准库,为后续算法改进提供了可比较的参考。其二,数据集催生了一系列针对对抗性样本鲁棒性的研究,例如通过向命令行参数注入轻微扰动来测试模型稳定性,相关工作推动了对抗训练技术在安全领域的应用。其三,安全社区参考其受控实验床方法论,构建了针对Linux/LOLBIN与macOS环境的类似数据集,扩展了跨平台行为研究的数据生态。此外,数据集的生成脚本与特征定义库(如lolbin_features.py)被多篇学术论文作为标准工具引用,用于自动化标注与特征提取,显著降低了安全数据准备的门槛。这些衍生工作共同印证了WinLOLBIN-GT作为安全机器学习领域核心数据资产的价值,持续激励着更高效、更鲁棒检测方法的诞生。
数据集最近研究
最新研究方向
WinLOLBIN-GT数据集聚焦于利用机器学习检测Windows“离地生存”二进制文件(LOLBin)滥用行为的前沿方向,结合MITRE ATT&CK框架与LOLBAS项目,通过生成1000万条标注行为数据(含55维特征),实现了对未见攻击场景99%的检测准确率。该数据集在SIEM环境中的成功部署验证了其从实验开发到工程落地的泛化能力,回应了当前网络攻击中日益泛滥的LOLBin无文件攻击手法。其意义在于提供了一个可复现的基准数据集与测试床方法论,弥合了恶意软件检测研究中缺乏高质量行为标注数据的鸿沟,推动了基于行为的入侵检测系统向可度量、可部署的方向演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务