遇见数据集

PSStrikes

收藏
arXiv2026-06-30 更新2026-07-04 收录
官方服务:

资源简介:

PSStrikes是由那不勒斯费德里科二世大学等研究机构精心构建的、首个面向真实世界PowerShell恶意软件评估的标注数据集,旨在支持生成式人工智能在网络安全威胁中的实证研究。该数据集包含817个经过严格去混淆处理的恶意脚本样本,每个样本均配有手工撰写的自然语言描述,总数据量约250行代码以内,主要来源于GitHub公开仓库、恶意软件分析平台(如Malware Bazaar)以及渗透测试框架(如Nishang)。数据集的创建过程经历了多阶段筛选、自动化与人工去混淆以及语义标注,确保了样本的可执行性与语义清晰度。该数据集的核心应用在于训练和评估大型语言模型生成恶意代码的能力,助力安全分析师深入理解AI驱动的网络攻击模式,并为入侵检测与威胁狩猎提供基准测试支持。

PSStrikes is the first annotated dataset for real-world PowerShell malware evaluation, meticulously constructed by research institutions including the University of Naples Federico II, and designed to support empirical research on generative AI in cybersecurity threats. This dataset contains 817 rigorously deobfuscated malicious script samples, each paired with a handcrafted natural language description, with a total code volume of approximately under 250 lines. The samples are mainly sourced from public GitHub repositories, malware analysis platforms (e.g., Malware Bazaar), and penetration testing frameworks (e.g., Nishang). The dataset was developed through multi-stage screening, automated and manual deobfuscation, and semantic annotation, ensuring the executability and semantic clarity of the samples. The core applications of this dataset lie in training and evaluating the capability of Large Language Models (LLMs) to generate malicious code, assisting security analysts in gaining in-depth understanding of AI-driven cyber attack patterns, and providing benchmark support for intrusion detection and threat hunting.

创建时间:
2026-06-30
搜集汇总
数据集介绍
PSStrikes 数据集图片
构建方式
PSStrikes数据集的构建始于从多种来源采集真实世界的PowerShell恶意脚本,包括学术研究、安全从业者公开的仓库(如Malware Bazaar、Hybrid Analysis)以及渗透测试框架(如Nishang、PowerSploit)。为确保数据适用于大语言模型(LLM),研究者实施了严格过滤:保留格式完整、可执行的PowerShell脚本,将代码长度限制在约250行以内以适配4096-token的上下文窗口,并手动去除了功能重复的样本。随后,通过分层反混淆流水线对脚本进行净化,利用Revoke-Obfuscation检测混淆程度,使用PowerDecode自动解混淆,并对残留样本进行逐行人工审核,最终仅保留1.53%的混淆率。在此基础上,研究团队为817个真实恶意样本逐一编写了自然语言描述,包含高层摘要和逐步操作规范,并经过三轮交叉验证(初始接受率87%)确保文本与代码逻辑的精确对齐。最终,数据集与1,127个单行恶意命令合并,形成共1,944个样本的最终版本。
特点
PSStrikes数据集的核心特点在于其高度真实性与结构化标注的独特结合。与依赖模拟攻击或脱敏数据集的先前工作不同,PSStrikes包含经过严格反混淆处理的真实世界PowerShell恶意软件,保留了复杂对抗模式(如多阶段载荷、系统API滥用),避免了合成样本的局限性。数据集中的每个样本都附有手工编写的自然语言描述,这些描述采用攻击者可能用于指示LLM的指令风格(如使用祈使动词和引用操作系统资源),从而弥合了自然语言提示与恶意代码生成之间的鸿沟。此外,数据集经过严格的质量控制,包括跨验证协议确保描述完整性(覆盖整个攻击生命周期)和技术准确性(正确标识.NET程序集、WMI类等底层原语),最终达到97.95%的代码唯一性和0.03的词汇多样性(TTR),既避免了数据泄漏风险,又反映了真实恶意软件的复杂性。
使用方法
PSStrikes数据集专为评估LLM生成PowerShell恶意软件的能力而设计,可应用于两种主要场景。首先,用于监督微调:研究者可将数据集中恶意脚本及其自然语言描述对作为训练样本,对开放权重LLM(如DeepSeek-Coder、Qwen2.5-Coder)进行领域适应,使其掌握从文本指令生成功能完备恶意脚本的能力。其次,用于行为评估:通过论文提出的三阶段框架(代码相似性、代码质量、动态执行),利用测试集计算ChrF、CrystalBLEU等指标以及PSSandman沙箱提取的Sigma规则触发情况,量化LLM生成代码与真实恶意软件在语法、静态分析警告和运行时行为(如Jaccard指数)上的对齐程度。实际使用时,用户需将数据集按比例划分为训练集和测试集(如85%训练、15%测试),并采用贪婪解码策略减少随机性,以复现实验或开发更鲁棒的检测方法。
背景与挑战
背景概述
PSStrikes数据集由意大利那不勒斯费德里科二世大学和格兰萨索科学研究所的研究人员于2026年创建,旨在系统评估大语言模型(LLM)生成PowerShell恶意软件的能力。随着生成式人工智能成为重大网络安全威胁,攻击者开始利用LLM通过脚本语言生成恶意代码,PowerShell因其在Windows企业基础设施中的广泛部署而成为首选工具。该数据集聚焦于现实世界中的PowerShell恶意软件样本,经过人工去混淆和自然语言标注,为LLM的训练与评估提供高质量基准。PSStrikes的发布填补了现有碎片化、未验证代码仓库的空白,为理解AI驱动恶意软件的行为特征提供了关键资源,对防御策略开发和威胁情报研究具有重要影响。
当前挑战
PSStrikes应对的核心挑战在于评估LLM生成现实PowerShell恶意软件的能力,而此前研究主要依赖提示和越狱策略生成孤立代码片段。构建过程中面临三大难题:首先,需从分散来源收集真实恶意脚本,并通过严格的格式完整性、结构约束和去冗余筛选,最终获得830个样本;其次,混淆技术普遍存在,需设计三层去混淆管线——自动化工具与人工逐行检查结合,将混淆率从25%降至1.53%;最后,为了支持LLM微调,必须为去混淆脚本创建高质量自然语言描述,包括高级摘要和操作规范,通过三级人工审核确保流程时序完整性、技术保真度和上下文准确性,最终形成1944个样本(含先前单行命令)的可靠数据集。
常用场景
经典使用场景
PSStrikes数据集专为评估和提升大语言模型在生成PowerShell恶意代码方面的能力而构建。在生成式人工智能被恶意攻击者广泛利用的当下,该数据集的核心用途在于为研究社区提供一个标准化的基准,以衡量LLM生成真实世界恶意软件行为的保真度。研究人员可利用该数据集对模型进行微调,使其从自然语言描述中精准合成PowerShell脚本,并通过静态与动态分析相结合的方式,评估生成代码与真实恶意样本在行为层面的相似性。该数据集还支持对攻击者在资源受限环境下(如采用量化模型)进行恶意代码生成能力的测试,从而揭示低参数模型在安全教育防线下的潜在威胁。
实际应用
在实际应用层面,PSStrikes数据集直接服务于网络安全防御体系的建设与评估。安全分析师可借助该数据集训练和测试入侵检测系统,通过对比LLM生成的恶意脚本与真实样本的行为特征,提升端点检测与响应系统对AI驱动攻击的识别能力。同时,该数据集可用于红队演练中的自动化对手模拟,帮助组织在不使用真实恶意负载的前提下,安全地评估自身威胁狩猎流程的有效性。此外,该数据及配套的沙箱框架PSSandman还可作为教学工具,用于培养安全专业人员对PowerShell攻击手法的分析与逆向能力,从而构筑更完善的主动防御知识体系。
衍生相关工作
PSStrikes数据集的发布催生了多项开创性的后续研究。该数据及配套的评估框架为自动化恶意代码生成领域奠定了范式基础,其提出的静态与动态双重分析体系直接启发了后续研究者在LLM代码生成评估中引入运行时行为验证。基于该数据集,学界进一步探索了低参数与量化模型在恶意软件生成场景中的能力边界,揭示了模型压缩对攻击行为保真度的影响机制。此外,该工作推动了对LLM安全对齐漏洞的深入调查,衍生出针对开源模型微调攻击、多智能体协作恶意生成等方向的研究,深刻影响了学术界与工业界对生成式人工智能在网络安全领域双重用途的认知与应对策略。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务