遇见数据集

Labeled malicious and benign skills dataset

收藏
arXiv2026-06-22 更新2026-06-24 收录
数据链接:
官方服务:

资源简介:

该数据集由卢森堡大学研究团队构建,专门用于检测和分析大语言模型代理中的恶意技能攻击。数据集包含超过200个经过人工标注的技能样本,涵盖良性技能和多种恶意攻击类型,每个恶意技能都标注了具体的攻击向量。数据来源于对三个公开技能市场(Lobehub、Skills.sh和Clawhub.ai)的大规模扫描,通过Locate-and-Judge两阶段检测管道识别并经过人工验证确认。该数据集主要应用于人工智能安全领域,旨在解决第三方技能市场中恶意指令注入的检测难题,为构建更安全的智能代理系统提供基准测试资源。

This dataset was constructed by a research team from the University of Luxembourg, specifically designed for detecting and analyzing malicious skill attacks in large language model (LLM) agents. The dataset contains over 200 manually annotated skill samples, covering both benign skills and multiple types of malicious attacks, with each malicious skill labeled with its specific attack vector. The data was collected through large-scale scanning of three public skill marketplaces: Lobehub, Skills.sh, and Clawhub.ai. The samples were identified via a two-stage Locate-and-Judge detection pipeline and further verified manually for confirmation. This dataset is primarily applied in the field of AI safety, aiming to address the detection challenge of malicious instruction injection in third-party skill marketplaces, and providing benchmark resources for building more secure intelligent agent systems.

提供机构:
卢森堡大学
创建时间:
2026-06-22
搜集汇总
数据集介绍
Labeled malicious and benign skills dataset 数据集图片
构建方式
该数据集的构建源于对LLM代理生态系统中恶意技能的检测需求。研究团队从三个公共市场(Lobehub、Skills.sh和Clawhub.ai)收集了约13.4万个技能文件,并采用所提出的Locate-and-Judge两阶段流水线进行扫描。该流水线首先通过一个轻量级定位器(基于Qwen2.5-0.5B-Instruct小型语言模型)对技能的每个结构跨度进行注意力评分,保留前K个高分跨度;随后由一个零样本的DeepSeek-V4-Flash法官模型对这些跨度进行细致判断。基于保守阈值,流水线从约360个标记技能中,经两位研究者独立审查并讨论解决分歧,最终确认了131个恶意技能(包括49个显式恶意技能和82个隐藏恶意技能)以及27个误报案例,从而形成了包含人类评估标签的标记数据集。
特点
该数据集的核心特点在于其真实性与针对性。它涵盖了超过200个技能样本,同时包含良性和恶意案例,且对每个恶意技能的攻击向量进行了详细标注。尤为突出的是,数据集包含了82个隐藏恶意技能,这些技能伪装成合法功能,成功规避了现有检测工具(如SkillSpector和Cisco Skill Scanner)的识别。数据集不仅包含了技能文件本身的文本,还提供了定位器所保存的注入跨度位置,使得研究者能够深入分析注入指令的结构特征。此外,数据集的标注过程采用双人独立审查与讨论机制,确保了标签的可靠性,为后续研究提供了高精度的基准。
使用方法
该数据集主要服务于LLM代理安全领域的恶意技能检测研究。使用者可直接利用提供的技能文本与人类标签,训练或评估基于注意力机制、关键词匹配或大型语言模型的各种检测方法。数据集中的跨度级别标签尤其适合用于评估定位阶段的性能,而技能级别的标签则适用于端到端检测器的性能度量。研究者可将其作为基准数据集,与现有检测工具进行对比实验,或在此基础上探索改进的定位与分类策略。此外,数据集中隐藏恶意技能的详细案例为分析攻击模式与设计针对性防御机制提供了宝贵的真实世界素材。
背景与挑战
背景概述
随着大语言模型(LLM)智能体日益依赖从第三方市场下载的'技能'(skills)文件包来扩展功能,一种新型供应链攻击面悄然浮现。这些由自然语言指令与辅助代码构成的技能包以用户权限在本地执行,其第三方创作与市场分发模式使得恶意指令可轻易伪装于合法功能之中。针对此威胁,卢森堡大学的研究人员Bacem Etteib、Daniele Lunghi与Tégawendé F. Bissyandé于2026年提出了Locate-and-Judge两阶段检测流水线,并据此构建了首个标注恶意与良性技能的数据集。该数据集涵盖超过200个经由人工审查标签的技能样本,详细标注了每个恶意技能的攻击向量(如凭证窃取、远程代码执行、会话监控等),为智能体安全领域提供了首个针对技能文件场景的基准测试资源。其核心研究问题在于如何在不依赖指令/数据边界假设的前提下,以可负担的计算成本实现大规模市场级的恶意技能检测,这对保障LLM智能体生态系统的供应链安全具有里程碑意义。
当前挑战
该数据集所应对的领域挑战根植于技能文件的本质特性:传统提示注入防御依赖'可信指令与不可信数据'的分离假设,而技能本身即为第三方编写的完整指令集,恶意注入命令与合法指令在结构上无法区分,导致基于激活差异或注意力偏移的检测方法在技能场景中失效。在数据集构建过程中,研究团队面临更棘手的实操挑战:如何从三个真实市场(Lobehub、Skills.sh、Clawhub.ai)收集的约13.4万个技能中识别出精心伪装的隐藏恶意技能(HMS),这些技能将窃密或后门载荷嵌入长达数页的合法文档中,令全内容扫描的昂贵成本与关键词正则的脆弱性形成两难困境。此外,跨技能链式攻击(一个良性技能诱导安装第二个恶意技能)的检测需要超越单技能分析的上下文推理能力,而校准阈值从实验室迁移到真实市场时面临的领域漂移问题,进一步对数据集标注的一致性与可扩展性提出了严苛要求。
常用场景
经典使用场景
在大型语言模型智能体(LLM Agent)日益依赖第三方技能包以扩展功能的背景下,该数据集为检测恶意技能提供了首个经过人工验证的标注基准。其经典用途在于评估和校准针对技能注入攻击的检测方法,特别是对于隐藏在合法功能背后的恶意指令。研究者可利用该数据集训练和测试注意力驱动的恶意指令定位与分类模型,从而在技能被加载至智能体上下文之前完成安全审查。数据集覆盖了超过200个技能样本,标注了攻击向量和人工评判标签,这使其成为评估现实世界中隐藏恶意技能检测效能的核心资源。
实际应用
在实际应用中,该数据集支撑了面向智能体技能市场的全量安全扫描系统。基于此数据集训练或校准的检测器能够以极低成本分析数以万计的技能文件,并精准识别那些伪装成正常工具的恶意技能。例如,在真实市场扫描中,利用该数据集校准的检测器成功发现了隐秘的凭证窃取、远程代码执行以及后门植入等攻击案例,而这些攻击多数能够逃避现有商业扫描工具的检测。数据集保证了检测算法在现实部署中的可靠性,使其成为智能体生态安全防护体系中不可或缺的校准工具。
衍生相关工作
该数据集的发布催生了多项具有影响力的后续研究。最典型的是Locate-and-Judge检测框架,其利用注意力机制从全量技能中定位可疑文本片段,再由零样本大模型进行精细判别,在保持高检出率的同时将计算开销降低近三倍。此外,该数据集还被用于对比评估SkillSpector、Cisco Skill Scanner以及Attention Tracker等既有检测工具的局限性,揭示了它们在面对隐藏恶意技能时的系统性遗漏。这些工作共同推动了面向智能体技能供应链的安全检测从理论探索走向可落地的工程实践。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务