遇见数据集

shaswatamitra/falcon-yara-rule-decoys

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

FALCON YARA规则与诱饵规则数据集包含真实YARA规则与LLM生成的相似规则(称为“诱饵”或“废弃”规则)的配对数据。该数据集旨在作为对比句子编码器微调中的硬负样本,以及用于规则与相似规则检索的鲁棒性基准。数据集包括4,588个锚点规则和总计25,875个诱饵规则(平均每个锚点5.64个,范围0-30)。每个数据行包含真实YARA规则的完整源代码、LLM生成的相似规则列表(每个锚点3-8个)以及诱饵规则数量。锚点规则来自与CTI ↔ Rule数据集相同的语料库,LLM被提示生成表面相似(相同句法骨架、类似消息标记、可比结构)但检测逻辑不同的规则,以确保它们行为上不可互换。预期用途包括对比学习中的硬负样本增强和检索鲁棒性测试,以评估模型在给定CTI时区分真实规则与相似规则的能力。

The FALCON YARA Rule ↔ Decoy-Rule Dataset consists of ground-truth YARA rules paired with LLM-generated look-alike rules (referred to as decoy or deprecated rules). It is intended as hard negatives for contrastive sentence-encoder fine-tuning and as a robustness benchmark for rule-versus-look-alike retrieval. The dataset includes 4,588 anchor rules and 25,875 total decoys (mean 5.64 per anchor, range 0-30). Each row contains the full source of a ground-truth YARA rule, a list of LLM-generated look-alike rules (3-8 per anchor), and the number of decoys. Anchor rules are drawn from the same corpus as the CTI ↔ Rule dataset, and an LLM is prompted to produce rules that look similar at the surface level (same syntactic skeleton, similar message tokens, comparable structure) but differ in detection logic so they are not behaviourally interchangeable. Intended uses include hard-negative augmentation for contrastive learning and retrieval-robustness benchmarking to assess a models ability to distinguish real rules from look-alikes given the CTI they justify.

提供机构:
shaswatamitra
搜集汇总
数据集介绍
shaswatamitra/falcon-yara-rule-decoys 数据集图片
构建方式
该数据集基于网络安全领域中的YARA规则构建,旨在通过生成与真实规则表面相似的“诱饵”规则,为对比学习提供困难负样本。具体而言,从与FALCON CTI到规则数据集相同的语料库中提取锚定规则(anchor rules),随后利用大型语言模型(LLM)为每条锚定规则生成3至8条表面结构相似(如语法骨架、标记词汇和整体框架一致)但检测逻辑截然不同的诱饵规则。这些规则在用户界面中可互换地称为“废弃”规则或“近失”规则,共计4,588条锚定规则与25,875条诱饵规则,平均每条锚定规则对应5.64条诱饵规则。
使用方法
该数据集可直接通过HuggingFace的`datasets`库加载,使用`load_dataset("shaswatamitra/falcon-yara-rule-decoys", split="train")`获取训练集,每条数据包含`rule`(真实规则)和`decoy_rules`(诱饵规则列表)字段。为发挥其最大效用,推荐与FALCON CTI到规则数据集联合使用,通过配对CTI文本、真实规则与诱饵规则,构造三元组进行三元组损失训练。在对比句子编码器微调中,可将诱饵规则作为批内负样本的补充增强;在检索鲁棒性基准测试中,可评估模型在给定CTI描述下区分真实规则与诱饵规则的能力。
背景与挑战
背景概述
网络威胁情报(CTI)领域长期面临入侵检测规则自动化生成的挑战,而大语言模型(LLM)的崛起为此提供了新的解决路径。在此背景下,Shaswata Mitra及其合作者于2025年发布了FALCON YARA Rule ↔ Decoy-Rule数据集,旨在为对比学习提供高质量硬负样本,从而提升句子编码器在区分真实YARA规则与看似相似但逻辑不同的生成规则时的鲁棒性。该数据集包含4,588条锚点规则及25,875条由LLM生成的“诱饵”规则,每条锚点对应3至8条表面结构相似但检测语义各异的反例。研究团队依托FALCON框架(arXiv:2508.18684),将数据集设计作为CTI到规则映射任务的对抗性补充,为推动自动化IDS规则生成与评测提供了关键资源。
当前挑战
该数据集所应对的领域核心挑战在于:如何使入侵检测规则检索系统具备区分真实规则与形似否定规则的辨别力,避免因表面文本相似而误召回无效或恶意诱导的规则。在构建过程中,LLM生成诱饵规则的难度显著——既要保留锚点规则的句法骨架与日志词汇风格,又要在检测逻辑上引入隐含差异,确保“硬负样本”不会因过度相似或截然不同而失效。此外,诱饵规则数量因锚点复杂度而异(0至30条),生成一致性与质量控制面临挑战;研究人员还需设计精细的提示工程以平衡规则的真实性与诱骗性,并确保最终数据集能有效服务于三元组挖掘与对比学习微调,对后续模型鲁棒性基准评测提出了更高要求。
常用场景
经典使用场景
在网络威胁情报与入侵检测系统(IDS)规则生成的交叉领域中,falcon-yara-rule-decoys数据集为对比学习范式下的文本嵌入模型微调提供了高质量的难负样本资源。该数据集将真实的YARA规则与大型语言模型生成的形似实非的诱饵规则配对,使得基于句子相似度的编码器能够通过区分语义相似但功能迥异的规则对来提升表征的判别力。经典使用方式是将该数据集的锚点规则与诱饵规则构建成三元组,结合配套的CTI-规则数据集,形成(威胁情报,真实规则,诱饵规则)的结构化训练对,用于三元组损失函数的优化,从而强化模型在网络安全文本上的语义细粒度理解能力。
解决学术问题
在学术研究中,该数据集直面神经语义编码器在专用领域(如网络安全)中缺乏高质量难负样本的瓶颈问题。传统的句子嵌入模型往往依赖通用语料库中的随机负采样,难以捕捉YARA规则这类高度结构化文本中的细微语义差异。falcon-yara-rule-decoys通过引入具有相同句法骨架但检测逻辑不同的诱饵规则,有效模拟了真实检索场景中规则混淆的挑战,为解决规则与诱饵的精确区分提供了基准测试平台。其意义在于推动了网络安全自然语言处理方向从闭集分类走向开集细粒度检索的范式转变,为后续研究者在领域自适应对比学习与鲁棒性评估方面树立了可复用的评价标准。
实际应用
在实际应用中,该数据集赋能了安全运维团队自动化生成与维护入侵检测规则的效率与准确性。基于该数据集微调的句子编码器能够被集成到安全编排自动化与响应(SOAR)平台中,当分析师从威胁情报系统提取描述时,系统可以自动检索最匹配的YARA规则并剔除外观相似的误报规则,从而减少人工审核的负担。此外,利用该数据集训练的模型还可部署于规则库管理系统,辅助检测规则是否存在重复或功能退化的变异,提升规则集的质量与可维护性。这种应用不仅降低了安全运营的人力成本,还加快了从威胁情报发掘到规则部署的闭环响应速度。
数据集最近研究
最新研究方向
在网络安全纵深防御体系不断演进的今天,以YARA规则为核心的入侵检测系统面临对抗性伪造规则的严峻挑战。falcon-yara-rule-decoys数据集通过生成与真实规则高度相似但语义功能迥异的‘诱饵规则’,为对比学习中的硬负样本挖掘提供了标准化基准。这一设计直指当前安全智能体在规则判别与威胁情报溯源中的脆弱性——即模型可能因表层语法相似而误判攻击逻辑。该数据集与FALCON的CTI-rule数据集协同,可构建三元组损失训练的完整闭环,推动系统从‘语法匹配’向‘语义免疫’跃迁。其背后折射出的核心理念是:面对LLM驱动的对抗性规则生成,安全模型必须学会在结构相似中洞察行为实质性差异,这或将成为下一代自动化威胁狩猎系统的能力基座。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务