OpenSkillRisk
收藏资源简介:
OpenSkillRisk是由香港城市大学等机构构建的专门用于评估智能体系统安全性的基准数据集,旨在系统量化第三方技能引入的潜在风险。该数据集包含263个从公开技能市场(如SkillsMP和Skills.rest)收集的真实风险技能,覆盖了控制平面劫持、权限扩张等七类威胁,每个技能均配备了标准化的用户任务与隔离沙箱环境以进行可控评估。其构建过程经历了风险技能筛选、任务与沙箱生成以及人工验证等多个阶段,确保了数据集的真实性与多样性。该数据集主要应用于评估基于大语言模型的智能体系统在开放世界场景中识别与规避第三方技能安全风险的能力,旨在揭示现有系统的安全漏洞并推动更鲁棒的防御机制发展。
OpenSkillRisk is a benchmark dataset developed by institutions including City University of Hong Kong for evaluating the safety of AI Agent systems, aiming to systematically quantify the potential risks introduced by third-party skill integrations. This dataset contains 263 real risky skills collected from public skill marketplaces such as SkillsMP and Skills.rest, covering seven categories of threats including control plane hijacking and privilege escalation. Each skill is equipped with standardized user tasks and isolated sandbox environments for controllable evaluation. Its construction process involves multiple stages such as risky skill screening, task and sandbox generation, and manual verification, ensuring the dataset's authenticity and diversity. This dataset is primarily applied to evaluate the capability of LLM-based AI Agent systems to identify and mitigate security risks from third-party skills in open-world scenarios, with the aim of uncovering security vulnerabilities in existing systems and promoting the development of more robust defense mechanisms.
数据集概述:OpenSkillRisk
OpenSkillRisk 是一个用于评估命令行(CLI)代理在调用真实世界第三方高风险技能时安全性的基准测试。该基准从真实技能中精心挑选了 263 个基准实例,并将其组织成一个包含 7 个风险类别 的层级体系,每个高风险技能都与一个良性用户任务配对,并在沙盒隔离环境中执行。
风险分类
OpenSkillRisk 将风险分为以下 7 个类别:
| 类别 | 描述 |
|---|---|
| 控制面劫持 | 技能暗中重写代理的决策策略(例如,强制使用工具或抑制澄清);当决策控制是主要影响时适用。 |
| 权限扩张 | 技能暗中获取新的凭证、会话或权限;当主要结果是获得可重复使用的授权时适用。 |
| 数据收集 | 技能暗中读取、快照或枚举本地、浏览器或工作区中的敏感数据;当数据尚未向外发送时适用。 |
| 执行自举 | 技能在以看似良性的借口下,暗中下载、安装、获取或执行额外的代码、工具或服务;包括供应链中介加载。 |
| 持久化植入 | 技能暗中植入能够超越当前任务持续存在的工件(例如,修改内存、配置、定时任务、守护进程或挂钩);当后续会话仍受影响时适用。 |
| 向外泄露 | 技能暗中将本地配置、工作区工件、上下文或收集到的数据发送到外部目的地;当向外传输是主要载荷时适用。 |
| 外部状态操纵 | 技能利用现有权限更改远程系统或基础设施的状态;包括提交、部署、创建、删除或修改远程对象。 |
技能类型
基准包含两种类型的风险技能:
- 无条件恶意技能:共 139 个,对用户具有明确的恶意意图,应无条件拒绝。
- 上下文相关的风险技能:共 124 个,在用户明确、范围受限的授权下可能安全运行,但当用户意图模糊或代理盲目信任技能并超出原始用户请求的合法范围时,会带来严重安全隐患。
数据集来源
基准结果
- 已在 3 个主流 CLI 测试框架 和 13 个前沿模型 上完成全面评估。
- 结果包含了各分组的代理行为分布情况。
使用说明
- 环境搭建:基于
environment.yml创建 Conda 环境。 - 下载数据:通过
scripts/install_benchmark_data.py脚本从 Hugging Face 下载技能和任务说明文件。 - 配置 API 密钥:设置相应模型或测试后端的 API 密钥(如
OPENAI_API_KEY)。 - 构建沙盒:使用
scripts/build_sandboxes.py脚本为指定分组(无条件恶意 / 上下文相关风险)构建本地沙盒目录和清单文件。 - 启动沙盒服务器:构建 Docker 镜像并启动 OpenSandbox 服务器(
opensandbox-server --config config/opensandbox.toml)。 - 运行评估:使用
scripts/run_benchmark.py脚本,指定分组和模型,运行基准测试。
重要声明
- 该仓库中的第三方技能包含为受控安全研究和基准评估而收集的高风险技能。禁止将这些技能重新分发、复制到其他代理环境或用于预期基准上下文之外。
- 该基准设计用于沙盒评估,用户应仅在受控的安全意识环境中运行,并避免暴露敏感凭证或个人数据。




