遇见数据集

OpenSkillRisk

收藏
arXiv2026-07-22 更新2026-07-24 收录
官方服务:

资源简介:

OpenSkillRisk是由香港城市大学等机构构建的专门用于评估智能体系统安全性的基准数据集,旨在系统量化第三方技能引入的潜在风险。该数据集包含263个从公开技能市场(如SkillsMP和Skills.rest)收集的真实风险技能,覆盖了控制平面劫持、权限扩张等七类威胁,每个技能均配备了标准化的用户任务与隔离沙箱环境以进行可控评估。其构建过程经历了风险技能筛选、任务与沙箱生成以及人工验证等多个阶段,确保了数据集的真实性与多样性。该数据集主要应用于评估基于大语言模型的智能体系统在开放世界场景中识别与规避第三方技能安全风险的能力,旨在揭示现有系统的安全漏洞并推动更鲁棒的防御机制发展。

OpenSkillRisk is a benchmark dataset developed by institutions including City University of Hong Kong for evaluating the safety of AI Agent systems, aiming to systematically quantify the potential risks introduced by third-party skill integrations. This dataset contains 263 real risky skills collected from public skill marketplaces such as SkillsMP and Skills.rest, covering seven categories of threats including control plane hijacking and privilege escalation. Each skill is equipped with standardized user tasks and isolated sandbox environments for controllable evaluation. Its construction process involves multiple stages such as risky skill screening, task and sandbox generation, and manual verification, ensuring the dataset's authenticity and diversity. This dataset is primarily applied to evaluate the capability of LLM-based AI Agent systems to identify and mitigate security risks from third-party skills in open-world scenarios, with the aim of uncovering security vulnerabilities in existing systems and promoting the development of more robust defense mechanisms.

创建时间:
2026-07-22
原始信息汇总

数据集概述:OpenSkillRisk

OpenSkillRisk 是一个用于评估命令行(CLI)代理在调用真实世界第三方高风险技能时安全性的基准测试。该基准从真实技能中精心挑选了 263 个基准实例,并将其组织成一个包含 7 个风险类别 的层级体系,每个高风险技能都与一个良性用户任务配对,并在沙盒隔离环境中执行。

风险分类

OpenSkillRisk 将风险分为以下 7 个类别:

类别 描述
控制面劫持 技能暗中重写代理的决策策略(例如,强制使用工具或抑制澄清);当决策控制是主要影响时适用。
权限扩张 技能暗中获取新的凭证、会话或权限;当主要结果是获得可重复使用的授权时适用。
数据收集 技能暗中读取、快照或枚举本地、浏览器或工作区中的敏感数据;当数据尚未向外发送时适用。
执行自举 技能在以看似良性的借口下,暗中下载、安装、获取或执行额外的代码、工具或服务;包括供应链中介加载。
持久化植入 技能暗中植入能够超越当前任务持续存在的工件(例如,修改内存、配置、定时任务、守护进程或挂钩);当后续会话仍受影响时适用。
向外泄露 技能暗中将本地配置、工作区工件、上下文或收集到的数据发送到外部目的地;当向外传输是主要载荷时适用。
外部状态操纵 技能利用现有权限更改远程系统或基础设施的状态;包括提交、部署、创建、删除或修改远程对象。

技能类型

基准包含两种类型的风险技能:

  • 无条件恶意技能:共 139 个,对用户具有明确的恶意意图,应无条件拒绝。
  • 上下文相关的风险技能:共 124 个,在用户明确、范围受限的授权下可能安全运行,但当用户意图模糊或代理盲目信任技能并超出原始用户请求的合法范围时,会带来严重安全隐患。

数据集来源

基准结果

  • 已在 3 个主流 CLI 测试框架13 个前沿模型 上完成全面评估。
  • 结果包含了各分组的代理行为分布情况。

使用说明

  1. 环境搭建:基于 environment.yml 创建 Conda 环境。
  2. 下载数据:通过 scripts/install_benchmark_data.py 脚本从 Hugging Face 下载技能和任务说明文件。
  3. 配置 API 密钥:设置相应模型或测试后端的 API 密钥(如 OPENAI_API_KEY)。
  4. 构建沙盒:使用 scripts/build_sandboxes.py 脚本为指定分组(无条件恶意 / 上下文相关风险)构建本地沙盒目录和清单文件。
  5. 启动沙盒服务器:构建 Docker 镜像并启动 OpenSandbox 服务器(opensandbox-server --config config/opensandbox.toml)。
  6. 运行评估:使用 scripts/run_benchmark.py 脚本,指定分组和模型,运行基准测试。

重要声明

  • 该仓库中的第三方技能包含为受控安全研究和基准评估而收集的高风险技能。禁止将这些技能重新分发、复制到其他代理环境或用于预期基准上下文之外。
  • 该基准设计用于沙盒评估,用户应仅在受控的安全意识环境中运行,并避免暴露敏感凭证或个人数据。
搜集汇总
数据集介绍
OpenSkillRisk 数据集图片
构建方式
OpenSkillRisk基于公开技能市场平台,通过规则与上下文两级过滤、人工验证的递进策略,构建了包含263个真实风险技能的数据集。首先,从SkillsMP和Skills.rest两大平台采集海量技能,经过去重与规范化处理后,利用开源静态扫描工具匹配预定义的不安全模式,筛选出可疑技能。随后,采用大模型进行上下文感知的细粒度研判,并由人类专家逐一审核,确保每个技能均包含隐藏的安全威胁。每个技能被配对以标准化的良性用户任务与隔离沙箱环境,沙箱中所有外部交互均被本地存根替代,从而在可控条件下触发风险面并记录执行痕迹。
特点
该数据集具有鲜明的现实性与精细度双重特色。其风险技能全部来源于真实生态系统,而非人工合成,覆盖控制劫持、权限扩大、数据收割、执行引导、持久化植入、外传违规与外部状态操纵七类攻击类型,囊括明确恶意与上下文依赖两种风险形态。与传统基准不同,OpenSkillRisk不仅考察攻击成功率这一执行层指标,还引入意识率作为认知层度量,用以评估智能体是否主动识别风险并向用户告警。同时,通过将智能体行为细分为五种模式,实现了从无察觉执行到安全完成的精细化诊断。
使用方法
使用OpenSkillRisk时,研究人员需在隔离沙箱环境中部署每项任务,将目标技能安装至智能体框架的指定技能目录,而后以标准系统提示引导智能体执行用户请求。运行时,沙箱内的存根服务会拦截所有高风险操作并记录详细日志,实验结束后调用裁判模型依据轨迹证据判定是否触发危险路径、是否实现风险感知以及任务是否完成。评估指标涵盖攻击成功率、意识率及综合安全分数Fsafe,支持跨框架、跨模型的对比分析。此外,数据集采用门禁访问策略发布,确保仅用于合法安全研究。
背景与挑战
背景概述
OpenSkillRisk数据集由香港城市大学数据科学系、香港人工智能科学研究所、北京邮电大学及理想汽车等机构的研究人员于2026年联合创建,旨在系统评估基于大语言模型的智能体系统在使用真实世界中第三方风险技能时的安全性。随着LLM从被动文本生成器演变为能够执行复杂多阶段操作的自主智能体,技能(skill)作为一种核心抽象极大地扩展了智能体的能力。然而,开放生态中的第三方技能可能隐藏恶意代码、扩大权限、触发危险执行或泄露敏感数据,带来严峻安全挑战。OpenSkillRisk通过构建包含263个真实风险技能的专用基准,填补了现有评估在覆盖现实威胁多样性和细粒度行为分析方面的空白,对推动智能体安全研究具有重要影响力。
当前挑战
该数据集面临的核心挑战源于领域问题与构建过程的双重复杂性。在领域层面,当前智能体系统难以可靠地区分善意与恶意技能,特别是上下文依赖型风险(看似正常但实际超越用户授权范围的行为)和系统级攻击(如控制平面劫持、权限扩展),即使最安全的配置仍有约17%的案例执行不安全操作。在构建过程中,研究团队需从17万余个公开技能中通过规则过滤与LLM辅助分析相结合的方式筛选出有效风险样本,面临海量数据中精确识别潜在威胁的挑战;同时,需要为每个技能构建逼真的良性任务场景与隔离沙箱环境,确保风险触发路径自然且可评估,这要求任务设计在暴露风险与保持良性目标可完成性之间取得精妙平衡。
常用场景
经典使用场景
在基于大语言模型的智能体安全研究领域,OpenSkillRisk被广泛用于评估智能体系统在面对真实第三方技能时的安全鲁棒性。该数据集包含263个从公开技能市场收集的真实风险技能,覆盖七种攻击类别和九种任务领域。研究者通过将每个风险技能与标准化用户任务和沙箱环境配对,系统性地衡量智能体在执行层面(攻击成功率)和认知层面(风险感知率)的表现,从而揭示智能体在开放世界中处理半可信第三方技能时的安全缺陷。
实际应用
该数据集的实际应用价值体现在智能体系统的安全审计与防御机制开发中。通过OpenSkillRisk,开发者可以系统地测试CLI框架(如Claude Code、Gemini CLI、Codex CLI)和前沿大语言模型组合的端到端安全表现。研究结果揭示上下文依赖风险和系统级攻击是最难防御的薄弱环节,这直接指导了安全策略的改进方向。数据集还支持防御技能的效能评估,例如被动加载与主动加载防护技能的效果对比,为产品级智能体系统的安全加固提供了可复现的测试基准。
衍生相关工作
OpenSkillRisk的提出催生了多个相关研究方向。基于其风险分类体系,研究者进一步探索了技能安全审计工具(如SkillScan)的自动化检测能力,以及多智能体协作防御框架的安全评估。该数据集推动了上下文感知风险推理在智能体安全中的应用研究,特别是针对控制平面劫持和权限扩展这类系统级攻击的防御策略。此外,防护技能的主动加载机制研究也受到启发,衍生出关于防御开销与安全增益均衡的探讨,为智能体技能市场的安全治理体系构建提供了重要参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务