遇见数据集

osunlp/SkillHarm

收藏
Hugging Face2026-06-11 更新2026-06-14 收录
官方服务:

资源简介:

代理技能在代理工作流程中占据特权地位——代理被期望隐式遵循并执行它们——这使得第三方技能成为脆弱的供应链攻击面。SkillHarm是一个基于技能的跨技能使用生命周期攻击的基准,并配有一个包含12种技能相关风险的系统分类法。每个攻击都基于可运行的Harbor任务环境,并通过确定性的攻击成功率评估器进行评分。该基准包含879个攻击样本,涵盖两种攻击场景:固定载荷投毒(FPP)和自我突变投毒(SMP)。

Agent skills occupy a privileged position in the agent workflow — agents are expected to implicitly follow and execute them — which makes third-party skills a vulnerable supply-chain attack surface. SkillHarm is a benchmark of skill-based attacks across the skill-use lifecycle, paired with a systematic taxonomy of 12 skill-relevant risks. Every attack is grounded in a runnable Harbor task environment and scored by a deterministic attack-success-rate (ASR) evaluator. The benchmark contains 879 attack samples across two attack scenarios: Fixed-Payload Poisoning (FPP) and Self-Mutating Poisoning (SMP).

提供机构:
osunlp
搜集汇总
数据集介绍
osunlp/SkillHarm 数据集图片
构建方式
在大型语言模型代理的生态系统中,第三方技能构成了潜在的安全隐患。SkillHarm基准数据集应运而生,旨在系统性地评估此类威胁。其构建基于对技能使用生命周期的深入剖析,并通过两种攻击场景实现:固定载荷投毒与自变异投毒。前者直接将恶意功能植入技能,而后者则令初始无害的技能在执行过程中悄然变异,将危害延迟至后续复用阶段。每个攻击样本均依托于可运行的Harbor任务环境,并通过确定性攻击成功率评估器进行评分,共涵盖879个精心构造的样本,覆盖12种技能相关风险。
特点
SkillHarm数据集的核心特色在于其生命周期感知的攻击设计理念与结构化的风险分类体系。它并非扁平表格,而是一个可执行的任务环境树,每个样本都指向一个完整的、可复现的攻击场景。数据集围绕数据管道利用、系统环境利用和代理自主性利用三大类,细分为数据外泄、权限提升、目标劫持等12种精确风险类型。这种详尽的分类不仅使得对技能供应链攻击的评估更为系统化,也为防御策略的研发提供了清晰的靶向参考。
使用方法
使用SkillHarm数据集需首先通过Hugging Face Hub客户端下载完整的快照文件。加载时,既可通过`MANIFEST.json`索引全部879个样本的路径,也可利用`fpp_index.jsonl`和`smp_index.jsonl`文件分别浏览或过滤固定载荷投毒与自变异投毒样本。运行攻击样本时,需借助Harbor框架在容器中执行任务。对于固定载荷投毒样本,直接运行任务并检查攻击成功率信号;对于自变异投毒样本,则需依次运行初始任务与后续任务,并通过特定脚本检测变异效果,从而完整复现攻击链路。
背景与挑战
背景概述
SkillHarm是由俄亥俄州立大学NLP研究团队于2026年发布的一个专注于AI智能体安全领域的对抗性攻击基准测试集。该研究由Yuting Ning、Zhehao Zhang等学者主导,核心研究问题聚焦于揭示和量化第三方技能在智能体生命周期中的安全风险。在大型语言模型驱动的智能体广泛应用的背景下,第三方技能作为智能体工作流中的关键组件,其供应链安全性日益受到关注。SkillHarm系统性地提出了包含12种风险的分类体系,覆盖数据管道、系统环境及智能体自主性三大维度,并通过879个精心设计的攻击样本,展示了固定载荷投毒和自变异投毒两种攻击场景。该数据集为评估和提升AI智能体安全性提供了重要测试平台,对相关领域的研究方向产生深远影响。
当前挑战
SkillHarm数据集的核心挑战在于解决智能体供应链安全领域中的隐式信任问题。智能体在调用第三方技能时,默认其行为是可信的,这使恶意技能能够在不被察觉的情况下实施攻击。具体来说,固定载荷投毒攻击利用技能身份在调用链中的特权地位,一次注入即可危害所有相关任务;自变异投毒攻击则利用技能持久化的特性,初始无害的执行在后续复用中才暴露恶意行为,增加了检测难度。在数据集构建过程中,团队面临两个关键挑战:一是需要设计可执行的攻击环境,确保攻击的可复现性和实际威胁的有效性;二是建立确定性评估体系,通过攻击成功率指标客观量化风险,为后续防御研究提供可靠的基线。
常用场景
经典使用场景
SkillHarm旨在评估与检测大规模语言模型驱动的智能体系统在技能调用全生命周期中面临的供应链安全威胁。该数据集涵盖了固定载荷投毒与自变异投毒两类攻击场景,共包含879个可运行攻击样本,并配有12种精细分类的风险类型。研究者可借助其基于Harbor任务环境的确定性攻击成功率评估器,系统性地衡量不同智能体与模型在面对技能层攻击时的鲁棒性,从而为智能体安全评估提供标准化的测试基准。
衍生相关工作
围绕SkillHarm已催生了一系列相关研究工作,主要包括面向技能级攻击的自动化构造方法优化、基于该基准的多维度智能体鲁棒性评测框架,以及针对检测模型在固定投毒与自变异攻击场景下的防御有效性分析。此外,该数据集所定义的风险分类体系也被后续工作借鉴,用于扩展至多智能体协作场景下的供应链安全评估与主动防御机制设计,形成了以Skillsafety为核心的持续探索方向。
数据集最近研究
最新研究方向
当前,大语言模型代理的安全性问题备受关注,其中基于技能的攻击因其隐蔽性与供应链渗透能力成为前沿焦点。SkillHarm数据集的提出,系统性地构建了覆盖技能使用全生命周期的攻击基准,涵盖固定载荷投毒与自我变异投毒两类场景,并建立了包含数据管道、系统环境及代理自主性三个维度的十二种风险类别。该工作不仅填补了代理工作流中第三方技能安全评估的空白,更通过自动化的攻击样本构造与确定性成功率的评估机制,为研究者在现实复杂环境中检验与防御细粒度技能威胁提供了关键支撑,有力推动了人工智能安全领域从攻击手法到防御策略的体系化演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务