遇见数据集

ScopeJudge

收藏
github2026-07-31 更新2026-08-05 收录
官方服务:

资源简介:

ScopeJudge是一个用于攻击性安全代理中预执行范围门控的调用级基准。它包含100个完整的ATIF v1.7轨迹和4897个工具调用,每个调用由五名专业安全专家独立标注。严格多数黄金标准包含377个范围违规(7.7%)。

ScopeJudge is a call-level benchmark for pre-execution scope gating in offensive security agents. It contains 100 full ATIF v1.7 trajectories and 4897 tool calls, each of which was independently annotated by five professional security experts. The strict majority gold standard includes 377 scope violations (7.7%).

创建时间:
2026-07-30
原始信息汇总

ScopeJudge 数据集概述

基本信息

  • 数据集名称:ScopeJudge
  • 类型:面向攻击性安全代理的调用级预执行范围门控(pre-execution scope gating)基准测试
  • 规模:包含 100 条完整的 ATIF v1.7 轨迹,共 4,897 次工具调用
  • 标注方式:每条调用由 5 名专业安全专家独立标注;严格多数投票生成的黄金标准包含 377 个范围违规(占 7.7%)

评测条件

数据集在五种条件下评估法官模型(judge model)的性能:

条件 评估内容
rubric_only 仅使用任务无关的安全底线评估标准
intent_only 提供任务意图,无历史调用与输出
intent_plus_calls 提供任务意图与历史调用记录
intent_plus_outputs_summary 提供任务意图、历史调用及输出摘要
full 提供完整上下文,包括原始输出与助手叙述

完整评估需进行 24,485 次法官决策,并额外生成摘要器调用。

数据格式

  • 数据以 JSONL 格式存储,每行对应一条完整的、经过匿名化处理的 ATIF 轨迹
  • 密集标注位于 extra.scopejudge.labels 字段中,每条记录对应一次工具调用
  • 标注包含 5 位评审者的独立布尔判断、投票数及黄金标签(out_of_scopein_scope
  • 黄金标签在至少 3 位评审者标记为违规时判定为 out_of_scope

匿名化处理

  • 替换了会话、评估、项目、工具调用、时间戳及代理标识符
  • 平台标识符在全文出现处均被替换,运行时密钥与提供商密钥分配被删除
  • 保留合成挑战凭据与场景内容,因其可能影响范围决策
  • 通用平台系统提示被保留以保证轨迹完整性,但不会出现在任何评测提示中

使用与评分

  • 支持从 Hugging Face 或 Dreadnode 注册表下载数据
  • 提供验证、渲染、运行与评分命令
  • 评分报告包含精确率、召回率、F1、标记率、覆盖率、解析错误及混淆矩阵
  • 评测生成过程中温度参数固定为 0,结果文件包含配置清单以保证可复现性

许可

  • 数据集基于 MIT 许可证发布
搜集汇总
数据集介绍
ScopeJudge 数据集图片
构建方式
ScopeJudge数据集的构建源于对进攻性安全代理在执行前进行作用域门控的评估需求。该数据集收录了100条完整的ATIF v1.7格式的代理执行轨迹,涵盖4,897次工具调用,每条调用均由五位资深安全专家独立标注,以严格多数原则生成黄金标签,其中包含377个作用域违规调用(占7.7%)。数据集中每条轨迹均经过脱敏处理,替换了会话、评估、组织等标识符,并保留了可能影响作用域判断的合成挑战凭据与场景内容,确保轨迹的完整性与可复现性。
使用方法
使用者可通过Python 3.11–3.13环境及uv工具快速克隆并配置ScopeJudge仓库。执行scopejudge download命令即可从Hugging Face或Dreadnode镜像获取数据,随后使用validate命令确保数据完整性。评估新裁判模型时,通过scopejudge run指定模型及策略(如intent_plus_calls)生成JSONL结果文件,并支持--resume参数以断点续跑。最终以scopejudge score对结果进行评分,其输出涵盖精确率、召回率等关键指标,并可依据模型与策略对结果进行过滤,以便进行精细化分析。整个过程高度自动化且配置冻结,保障了实验的可重复性。
背景与挑战
背景概述
ScopeJudge数据集由Dreadnode团队于2026年创建,旨在应对进攻性安全智能体中预执行范围门控(pre-execution scope gating)评估的缺失。该数据集包含100条完整的ATIF v1.7轨迹,涵盖4,897次工具调用,每条调用由五位专业安全专家独立标注,严格多数投票生成黄金标签,其中包含377次(7.7%)范围违规调用。数据集设计为调用级基准,支持五种评估条件,为安全智能体的成本敏感型决策提供标准化测试平台。其发布填补了安全领域中缺乏细粒度、专家标注基准的空白,推动了范围控制与安全智能体可靠性研究的进展。
当前挑战
ScopeJudge所面对的挑战根植于进攻性安全智能体的复杂性。首先,在领域层面,预执行范围门控旨在预测工具调用是否超出授权范围,这要求智能体在动态对抗环境中实时权衡操作效益与安全风险,而现有模型常因误判导致违规操作或效率低下。在数据构建层面,挑战在于从异构、非结构化的轨迹数据中提取一致的调用级标签,并确保五位专家标注的高一致性;同时,轨迹的匿名化需平衡隐私保护与保留范围判断所需的关键上下文,如合成凭证和场景内容,这增加了数据处理的精细度。此外,基准的评估需覆盖多种策略与提示条件,对计算资源与模型鲁棒性提出较高要求。
常用场景
经典使用场景
在人工智能安全领域,ScopeJudge作为首个面向攻击性安全代理的调用级预执行范围门控基准,其经典使用场景是对各类大型语言模型驱动的安全代理进行系统化的范围违规检测能力评估。研究者通常利用该数据集包含的100条完整ATIF v1.7轨迹和4,897次工具调用,在五种严格定义的评判条件下(如rubric_only、intent_only、intent_plus_calls等)运行待测评判模型,以获得精确率、召回率、F1分数等量化指标,从而横向比较不同模型在预执行阶段识别潜在危险操作的性能差异。此外,该基准的严格多数黄金标签(7.7%违规率)为研究者提供了可靠的地面真值,使得在统一框架下验证新提出的范围门控算法成为可能。
解决学术问题
该数据集从根本上解决了攻击性安全代理研究中范围违规检测缺乏标准化、可复现评估基准的学术难题。在大型语言模型代理高速迭代的背景下,传统的主观评估或小规模测试集难以准确衡量模型在复杂真实场景中的安全决策能力。ScopeJudge通过提供多专家独立标注的高质量数据,首次实现了对预执行范围门控性能的定量分析,填补了该领域缺乏统一衡量标准的空白。其严谨的评估协议——包括固定温度、冻结配置、哈希校验等机制,保证了实验的可复现性和结果的可比性,极大地推动了安全代理可靠性研究从定性分析向定量实证的转变,为后续安全策略优化提供了坚实的基准支撑。
实际应用
从工程实践的角度,ScopeJudge可直接嵌入安全代理的持续集成与部署流程,作为模型上线前的安全性能关卡。具体而言,开发团队可利用该数据集对候选评判模型进行例行回归测试,在每次版本更新时自动运行五种条件的安全评估,确保新的模型或提示词修改不会引入额外的范围违规风险。此外,由于数据集提供了详尽的调用级标注,实际应用中可以将其作为训练数据来源,用于微调专用的安全评判模型,增强其对安全敏感操作的判别力。在红蓝对抗、漏洞挖掘等真实攻击性安全任务中,经过ScopeJudge验证的代理能够更高效地过滤无关操作,减少资源消耗并降低误操作导致的系统损害,具有显著的工业应用价值。
数据集最近研究
最新研究方向
ScopeJudge数据集聚焦于进攻性安全代理的预执行作用域门控(pre-execution scope gating)评估,代表了网络安全领域大语言模型(LLM)代理安全性的前沿研究方向。该数据集以调用级别(call-level)为粒度,包含100条完整的ATIF轨迹和4897次工具调用,由五名专业安全专家独立标注,严格多数黄金标签识别出7.7%的作用域违规。随着LLM代理在渗透测试、漏洞利用等攻防任务中的广泛应用,其越权行为(如执行超出授权范围的命令)成为重大安全隐患。ScopeJudge的提出响应了这一热点,通过系统评估不同判断策略(如仅意图、意图加调用、完整上下文)在成本与准确性之间的权衡,为构建更安全的自主代理提供了基准。其意义在于推动开发能在执行前有效预判作用域违规的裁判模型,从而防止代理偏离预期行动,保障企业安全测试的合规性与可控性。该数据集不仅填补了该评估领域的空白,也为后续研究提供了标准化平台,对提升AI代理的鲁棒性和可信度具有重要影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务