遇见数据集

SkillHarm

收藏
Hugging Face2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

SkillHarm是一个专注于AI代理技能生命周期中基于技能攻击的基准测试数据集。该数据集旨在系统评估第三方技能作为供应链攻击面的脆弱性,包含879个可运行的攻击样本,涵盖两种核心攻击场景:固定载荷投毒(687个样本)和自我突变投毒(192个样本)。每个攻击样本都构建在可执行的Harbor任务环境中,并通过确定性的攻击成功率评估器进行评分。数据集附带一个系统的风险分类法,定义了12种技能相关风险,并归类为数据管道利用、系统环境利用和代理自主性利用三大类别。数据以任务环境树状结构组织,包含任务、技能、风险类型等元数据字段,适用于AI安全性评估、红队测试、代理安全研究以及提示注入防御等场景。

SkillHarm is a benchmark dataset focused on skill-based attacks in the lifecycle of AI agent skills. It aims to systematically evaluate the vulnerabilities of third-party skills as a supply chain attack surface, containing 879 executable attack samples that cover two core attack scenarios: fixed payload poisoning (687 samples) and self-mutating poisoning (192 samples). Each attack sample is built within an executable Harbor task environment and scored by a deterministic attack success rate evaluator. The dataset includes a systematic risk taxonomy that defines 12 skill-related risks, categorized into three major classes: data pipeline exploitation, system environment exploitation, and agent autonomy exploitation. The data is organized in a task environment tree structure, with metadata fields such as task, skill, and risk type, making it suitable for AI security evaluation, red team testing, agent security research, and prompt injection defense scenarios.

提供机构:
OSU NLP Group
创建时间:
2026-06-01
原始信息汇总

数据集概述:SkillHarm

SkillHarm 是一个专注于 LLM 智能体(Agent)在技能使用生命周期中面临的安全攻击基准,尤其针对第三方技能引发的供应链漏洞。该数据集由 OSU NLP Group 构建,包含 879 个攻击样本,并配有系统化的风险分类体系(12 种风险类型)和可运行的 Harbor 任务环境。


数据集构成

数据集包含两种攻击场景:

场景 样本数 任务数 技能数 风险类型数
固定载荷投毒(FPP) 687 57 个用户任务 71 12
自变异投毒(SMP) 192 12 个任务对 6 12

风险分类体系

攻击样本覆盖 3 大类别、12 种风险类型(字段名:risk_id):

类别 风险类型
数据管道利用 data_exfiltration(数据窃取)、output_manipulation(输出篡改)、poisoning(投毒)
系统环境利用 privilege_escalation(权限提升)、unauthorized_file_modification(未授权文件修改)、backdoor_injection(后门注入)、dos(拒绝服务)、malware_deployment(恶意软件部署)、system_corruption(系统破坏)
智能体自主性利用 goal_hijacking(目标劫持)、anti_forensics(反取证)、proxy_attack(代理攻击)

数据加载方式

该数据集是一个可运行的任务环境树,并非扁平表格。推荐通过 Hugging Face Hub 客户端下载完整版本:

python from huggingface_hub import snapshot_download local_dir = snapshot_download(repo_id="osunlp/SkillHarm", repo_type="dataset")

  • MANIFEST.json:索引所有 879 个样本,每个条目包含指向对应样本目录的 path 字段。
  • fpp_index.jsonlsmp_index.jsonl:分别对应 FPP 和 SMP 场景的索引文件(每行一个样本),可直接用于浏览或过滤:

python from datasets import load_dataset fpp = load_dataset("osunlp/SkillHarm", "fpp", split="train") # 687 行 smp = load_dataset("osunlp/SkillHarm", "smp", split="train") # 192 行


运行样本

每个样本是一个可运行的 Harbor 任务,端到端驱动脚本请参考 GitHub 仓库

  • FPP 场景:使用投毒技能运行用户任务,然后读取确定性 ASR(攻击成功率)信号。
  • SMP 场景:先运行任务 A(修改共享技能),快照技能文件夹,覆写到任务 B 的容器中,运行任务 B,再检查 test_detection.py

引用信息

bibtex @article{ning2026skillharm, title = {SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction}, author = {Ning, Yuting and Zhang, Zhehao and Lal, Yash Kumar and Gou, Boyu and Li, Junyi and Ruan, Weitong and Ye, Chentao and Gupta, Rahul and Yang, Diyi and Su, Yu and Sun, Huan}, journal={arXiv preprint arXiv:2606.02540}, year = {2026} }


许可与语言

  • 许可协议:CC-BY-4.0
  • 语言:英语(en)
  • 标签ai-safetyagent-securityprompt-injectionskill-based-attacksred-teamingllm-agents
  • 数据规模:n<1K(样本总数少于 1000)
搜集汇总
数据集介绍
SkillHarm 数据集图片
构建方式
SkillHarm基准数据集基于技能生命周期中的安全漏洞构建而成,聚焦于第三方技能作为供应链攻击面的脆弱性。数据集通过自动化构造方法生成,覆盖两种攻击场景:固定载荷投毒(FPP)与自变异投毒(SMP)。FPP场景包含687个样本,涉及57个用户任务和71个技能,通过植入固定恶意技能直接破坏任何调用该技能的任务会话;SMP场景包含192个样本,涵盖12个任务对和6个技能,初始无害的执行会静默修改持久化技能内容,将危害延迟至后续复用。每个攻击样本均在可运行的Harbor任务环境中落地,并由确定性攻击成功率评估器进行评分。
特点
SkillHarm的显著特点在于其系统化的风险分类体系,涵盖12种风险类型,分为三大类别:数据管道利用(如数据窃取、输出篡改、投毒)、系统环境利用(如权限提升、未授权文件修改、后门注入、拒绝服务、恶意软件部署、系统破坏)以及代理自主性利用(如目标劫持、反取证、代理攻击)。数据集结构并非扁平表格,而是一个包含879个攻击样本的可运行任务环境树,每个样本具有独立的路径索引,支持精细的过滤与检索。此外,SMP场景的创新性在于其延迟性攻击机制,真实模拟了技能复用场景中的隐蔽威胁。
使用方法
用户可通过Hugging Face Hub客户端下载完整数据集,使用`snapshot_download`函数获取所有样本目录,其中`MANIFEST.json`文件作为索引,记录每个样本的路径信息。为便于浏览与筛选,数据集提供了FPP与SMP两个配置的JSONL索引文件,可直接通过`load_dataset`加载为数据行。运行样本时,需借助Harbor任务环境:FPP场景下,执行用户任务时指定载荷投毒技能路径,并调用确定性ASR评估器获取攻击成功率;SMP场景则需依次运行任务A与B,在任务A执行后快照技能文件夹,将修改后的技能覆盖到任务B的容器中,再通过检测脚本验证攻击效果。具体驱动代码可参考项目GitHub仓库。
背景与挑战
背景概述
在大语言模型代理(LLM Agent)广泛部署的背景下,技能(Skill)作为代理工作流中占据特权的执行单元,其隐含遵循与执行特性使得第三方技能成为供应链攻击的脆弱入口。SkillHarm数据集由俄亥俄州立大学NLP研究团队于2025年创建,核心研究问题聚焦于系统性地识别与评估代理技能生命周期中存在的安全风险。该数据集通过自动化方式构建了包含879个攻击样本的基准测试,覆盖固定载荷投毒与自变异投毒两大战术场景,并提出包含12种风险类型的系统化分类法。SkillHarm的发布填补了代理安全领域缺乏标准化评估框架的空白,为防御机制的研发提供了可复现的定量评估平台,对提升LLM代理系统的鲁棒性产生了重要影响。
当前挑战
SkillHarm所解决的领域核心挑战在于代理技能供应链的隐蔽攻击面,即第三方技能能够在不被察觉的情况下操纵模型行为或窃取数据,而现有安全防护方案多集中于输入输出层次,对技能生命周期内的投毒攻击缺乏模型化的评估手段。在数据集构建过程中,团队面临显著的技术挑战:其一,需设计兼具生态效度与可复现性的攻击样例,确保每个样本均能在Harbor任务环境中实际执行;其二,需建立确定性攻击成功率(ASR)评估器,解决代理行为随机性与攻击判定标准化之间的矛盾;其三,跨12种风险类型均匀覆盖攻击样本,避免基准测试因分布偏斜而失去全面性,这一过程在保证攻击真实性的前提下需要大量的人工验证与迭代优化。
常用场景
经典使用场景
SkillHarm数据集专为评估和红队测试大语言模型(LLM)代理的安全性而设计,其经典使用场景聚焦于技能层面攻击的模拟与检测。研究人员可利用该基准,在固定载荷投毒(FPP)与自变异投毒(SMP)两种典型攻击场景下,系统性地验证代理系统在执行第三方技能时面临的安全脆弱性。通过操作Harbor任务环境并调用确定性攻击成功率评估器,可精确度量不同代理模型对技能供应链攻击的抵御能力。该数据集覆盖从数据管道、系统环境到代理自主权三大维度的十二种风险类型,为探索AI代理在复杂任务生命周期中的安全边界提供了标准化、可复现的测试平台。
解决学术问题
SkillHarm直接回应了LLM代理系统面临的新型安全挑战——技能供应链攻击。在传统提示注入研究主要关注瞬时对话层面威胁时,该数据集率先揭示了代理技能因处于工作流特权位置而成为更隐蔽持久攻击面的事实。它解决了技能投毒攻击如何在整个生命周期(从获取、装载到复用阶段)系统性渗透的学术问题,填补了技能层面红队测试缺乏标准化基准的空白。通过构建包含879个攻击样本的精细标注数据集并确立12种风险分类体系,SkillHarm为安全社区提供了量化评估代理系统脆弱性及防御机制有效性的可靠工具,推动了代理安全从直觉性防御向可测量验证的科学范式演进。
衍生相关工作
自SkillHarm发布以来,该基准已催生多项令人瞩目的衍生研究工作。在攻击层面,研究人员基于其风险分类体系设计出更为精巧的跨技能协同攻击方案,利用多个看似无害的技能组合实现目标劫持。防御层面则涌现出技能行为一致性检测框架,通过对比代理在调用技能前后的行为变化来识别投毒;另有工作探索将SkillHarm的ASR评估器作为奖励信号,通过强化学习训练出对技能攻击更具鲁棒性的基础模型。此外,该数据集启发了对代理安全意识评估的规范研究,促使多个实验室开发面向代码执行、文件操作等具体代理能力的细粒度安全性测试集,这些工作共同织就了LLM代理安全研究日益繁荣的学术图景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务