MaliciousSkillBench
收藏官方服务:
资源简介:
一个用于恶意代理技能检测的全面基准测试。
A comprehensive benchmark for malicious agent skill detection.
创建时间:
2026-08-19
原始信息汇总
MaliciousSkillBench 数据集概述
基本信息
- 名称:MaliciousSkillBench
- 定位:面向恶意 Agent Skill 检测的综合基准
- 论文:arXiv:2608.19901(PDF: https://arxiv.org/pdf/2608.19901)
- 数据集地址:https://huggingface.co/datasets/ProtectSkills/MaliciousSkillBench
- GitHub 仓库:https://github.com/protectskills/MaliciousSkillBench
- 项目主页:https://protectskills.github.io/MaliciousSkillBench/
- 作者:Yue Wang, Yi Liu, Gelei Deng, Ying Zhang, Yuekang Li, Zhenyu Chen, Leo Zhang
核心指标
| 指标 | 数量 |
|---|---|
| 公开来源 | 13 |
| 核心贡献来源 | 11 |
| 基准身份总数 | 9,740 |
| 恶意样本 | 7,505 |
| 良性样本 | 2,235 |
| 结构家族 | 4,588 |
| 统一攻击类别 | 11 |
| 攻击映射的恶意身份 | 4,983 / 7,505 |
数据构成与构建方式
- 构建理念:consolidate, not concatenate(整合而非简单拼接)。
- 构建流程包括:规范化、精确与归一化去重、结构分组、跨标签冲突处理,以及基准专用评估协议,同时保留来源溯源信息。
- 恶意样本构建:8,414 原始恶意制品 → 7,562 精确唯一身份 → 7,539 归一化唯一身份 → 4,588 结构家族 → 34 归一化跨标签冲突身份。
- 良性样本筛选:2,251 原始良性制品 → 2,238 归一化唯一身份 → 2,235 最终良性身份。
- 最终基准:7,505 恶意 + 2,235 良性 = 9,740。
- 公开数据集覆盖全部 9,740 个身份;其中 9,735 条记录(7,500 恶意、2,235 良性)提供精确冻结的 Skill 文本;5 条恶意记录仅提供脱敏公开表示,其原始文本被保留不公开。
威胁态势
- 统一攻击映射覆盖 4,983 / 7,505 个恶意身份,跨 11 个类别。
- 该映射为多标签且部分覆盖,并非完整的攻击标注覆盖。
- 衍生统一影响覆盖 2,128 / 7,505 个恶意身份,属于衍生映射,非来源提供或真实影响标签。
- 攻击 × 影响交集为 1,888 / 7,505。
数据访问方式
- Hugging Face 为主要可直接加载的基准分发平台。
- GitHub 仓库托管代码、文档、可复现制品及来源级恶意 Skill 包。
- 全部 7,505 个恶意基准身份的完整来源级制品位于
packages/目录;包清单将每个基准身份映射到其来源归档及包内相对路径。 - 默认
primary配置可通过load_dataset("ProtectSkills/MaliciousSkillBench", "primary", split="train")加载。 - 命名协议清单可通过
load_dataset("ProtectSkills/MaliciousSkillBench", "splits")加载。 - 本地元数据包括:
metadata/benchmark_manifest.csv、metadata/source_registry.csv、metadata/structural_families.csv、metadata/splits/。
评估协议
使用 metadata/splits/ 中的冻结划分清单,不重新生成划分。
| 协议 | 训练 / 验证 / 测试 |
|---|---|
| Random | 6,818 / 974 / 1,948 |
| Source-Balanced Random | 6,817 / 973 / 1,950 |
| Malicious-Structural-Disjoint | 6,818 / 974 / 1,948 |
| Source-Disjoint | 7,513 / 835 / 1,384 |
- Source-Disjoint 保留
SRC009、SRC011、SRC012;其测试集包含 839 恶意和 545 良性身份;清单另保留 8 个冻结的excluded身份用于精确协议核算。 - 结构不相交与来源不相交评估用于检验检测器是否依赖近重复结构或来源特定线索;来源不相交结果描述的是来源条件偏移,并非通用分布外泛化结论。
- 冻结基准保留 4,588 个结构家族标识符;经过保守跨标签排除后,其中 4,575 个由至少一个最终主恶意身份表示,13 个保留家族 ID 无最终主成员。
基线方法
发布的基线脚本在冻结协议上评估纯文本学习型检测器:
- Word TF-IDF + 逻辑回归
- Word TF-IDF + 线性 SVM
- Char TF-IDF + 线性 SVM
脚本将 Skill 文本作为惰性数据读取,不执行 Skill。
检测发现
头部学习型检测器:Word TF-IDF + 线性 SVM(Word-SVM),Macro-F1 如下:
| 协议 | Macro-F1 |
|---|---|
| Random | 0.932 |
| Malicious-Structural-Disjoint | 0.916 |
| Source-Disjoint | 0.665 |
在 Source-Disjoint 评估下,Word-SVM 保持 95.6% 恶意召回率,但良性假阳性率达 62.4%。跨来源学习型检测器性能下降主要由良性过度标记导致,恶意召回率仍保持较高。
现成扫描器
Source-Disjoint 操作点:
| 方法 | Macro-F1 | 恶意召回 | 良性 FPR |
|---|---|---|---|
| Cisco-local-behavioral | 0.308 | 2.5% | 1.1% |
| SkillFortify-offline | 0.349 | 25.3% | 49.9% |
| SkillSpector-static | 0.281 | 0.0% | 0.55% |
- 不同方法占据不同的假阳性/假阴性区间;在来源偏移下,无评估方法能同时实现高恶意召回与低良性假阳性。
- Cisco-local-behavioral 与 SkillSpector-static 的低 FPR 伴随极低召回率。
- SkillSpector-static 为静态/无 LLM 配置,非某些外部工作使用的 LLM 驱动版 SkillSpector。
- Cisco-local-behavioral 在本地兼容环境中运行。
- ColluSkill 报告对抗攻击规避成功率(ASR),本扫描器实验报告二分类恶意/良性检测;ASR 与 Macro-F1 非等价指标。
快速开始
- 验证 GitHub 元数据包:
python evaluation/validate_dataset.py - 查看协议规模与指标辅助工具:
python evaluation/validate_dataset.py --help、python -c "from evaluation.metrics import macro_f1, malicious_recall, benign_fpr; print(ok)" - 运行基线(需先从 Hugging Face 获取文本表):
python baselines/run_baselines.py --help - 安全提示:不要执行不可信 Skill、不要访问内嵌目标、不要从基准文本安装配套包。
负责任使用
该基准包含用于防御研究与评估的恶意或对抗性 Skill 指令,详见 RESPONSIBLE_USE.md 与 SECURITY.md。
许可证
- 代码:Apache License 2.0
- 基准元数据、衍生标注、分类映射与划分清单:CC BY 4.0(除非另有说明)
- 第三方 Skill 制品保留其各自上游条款,不因本基准重新许可
- 详见
LICENSE、LICENSE-DATA、THIRD_PARTY_NOTICE.md
文档
benchmark/schema.mdbenchmark/sources.mdbenchmark/taxonomy.mdbenchmark/protocols.mdbaselines/README.mdscanner_eval/README.mddocs/— 项目主页源文件
搜集汇总
数据集介绍

构建方式
在智能体技能安全研究领域,既有恶意技能资源长期散落于异构来源,工件格式、溯源惯例与标签证据各异,亟需系统化整合。MaliciousSkillBench的构建遵循“整合而非拼接”的原则,对来自13个公开来源、11个核心贡献源的原始工件施以规范化、精确去重与归一化去重、结构分组及跨标签冲突处理,并完整保留来源溯源信息。初始8,414条恶意工件经逐级筛选得到7,562条精确唯一与7,539条归一化唯一身份,再聚合为4,588个结构家族;良性侧自2,251条原始工件规范化出2,238条唯一身份,最终确立2,235条良性身份。恶意与良性合并后形成9,740条基准身份,其中7,505条为恶意。
特点
该基准在威胁刻画与检测评估两方面均展现出独特价值。其恶意身份覆盖11个协调后的攻击类别,攻击映射涉及4,983条身份,且采用多标签、部分覆盖的标注方式;派生影响映射覆盖2,128条身份,攻击与影响交集为1,888条,此类映射系派生而非源端提供的真实标签。基准保留了9,735条精确冻结的技能文本,另有5条涉及敏感凭据的恶意记录仅提供脱敏公开表示。为支撑受控评测,数据集冻结了随机、源平衡随机、恶意结构不相交与源不相交四类划分协议,源不相交协议特意留出SRC009、SRC011与SRC012,以检验检测器是否依赖近重复结构或来源特异性线索。
使用方法
研究者可通过Hugging Face平台以datasets库直接加载基准,默认primary配置提供技能文本字段,读取时需优先取skill_text,为空时回退至public_skill_text,并注意那5条脱敏文本不可视为论文的精确实验输入。命名协议清单可经由splits配置获取,本地metadata目录则提供身份、标签、溯源、哈希、分类编码与冻结划分成员等元数据。评估时应使用metadata/splits/下已冻结的划分清单,不应重新生成分区。基准附带基于词级与字符级TF-IDF结合逻辑回归或线性SVM的文本检测基线脚本,其在读取技能文本时将其视为惰性数据而不执行。使用过程中严禁执行不可信技能、访问内嵌目标或安装伴随包。
背景与挑战
背景概述
智能体技能(Agent Skill)作为大语言模型驱动智能体的可执行能力单元,其生态近年来快速扩张,随之而来的恶意技能威胁亦日益严峻。既有恶意技能资源散落于来源、格式、溯源约定与标签证据各异的十余个公开渠道,缺乏统一的评测基准。MaliciousSkillBench由Yue Wang、Yi Liu、Gelei Deng等研究人员于2026年提出,旨在整合碎片化资源,构建面向恶意智能体技能检测的综合基准。该数据集汇集13个公开来源、9,740条基准身份(7,505条恶意与2,235条良性),并统一11类攻击分类体系,为威胁刻画与受控检测评估奠定基础,对智能体安全领域的基准化研究具有重要推动作用。
当前挑战
该数据集所应对的领域问题在于恶意智能体技能的自动化检测,其难点在于恶意技能与良性技能在文本形态上高度相似,且攻击者可通过结构变体与来源迁移规避检测。构建过程中,研究者需处理跨来源的标签冲突、精确与归一化去重、结构家族归并以及来源溯源保留等复杂问题,同时须在敏感凭证材料的脱敏与实验输入保真之间取得平衡。评测层面,源分离协议下学习型检测器的良性假阳性率骤升至62.4%,现成扫描器亦无法兼顾高恶意召回与低误报,揭示出跨来源泛化仍是该领域亟待突破的核心挑战。
常用场景
经典使用场景
在智能体生态迅猛扩张的背景下,Agent Skill作为承载指令与工具调用的关键载体,其安全性评估亟需标准化测试床。MaliciousSkillBench最经典的使用场景在于为恶意技能检测器提供受控评测环境:研究者依托随机、结构不相交与来源不相交三套冻结协议,将技能文本作为惰性数据输入,训练并比对词级TF-IDF线性SVM等基线模型,系统衡量检测器在近重复结构与来源偏移条件下的泛化边界,从而揭示模型性能衰减的根源。
实际应用
在真实安全运营中,MaliciousSkillBench为技能市场、插件仓库与智能体平台提供了前置筛查能力。安全团队可利用其训练轻量级文本分类器,对上传的技能描述与指令进行恶意倾向判别,并结合攻击类别映射快速定位风险类型。离线扫描器亦可基于该基准校准误报与漏报阈值,在来源偏移场景下权衡恶意召回与良性误杀,从而支撑准入审核、威胁狩猎与应急响应等实际工作流。
衍生相关工作
围绕该基准,后续研究衍生出多条经典工作脉络。一方面,词级与字符级TF-IDF配合线性分类器的基线成为轻量检测的参照点;另一方面,来源不相交协议暴露的良性过度标记问题催生了跨源鲁棒性研究。结构化不相交划分亦启发了对近重复技能家族的建模与去偏方法。此外,攻击与影响映射的派生标注为多标签威胁刻画提供了数据基础,推动检测、归因与风险评估的联动研究。
以上内容由遇见数据集搜集并总结生成



