遇见数据集

inclusionAI/NSFA_Benchmarks

收藏
Hugging Face2026-07-13 更新2026-07-21 收录
官方服务:

资源简介:

NSFA Benchmarks 是一个多语言评估基准数据集,用于评估保护AI代理系统免受操作威胁的护栏模型。该数据集基于NSFA(Not-Secure-For-Agents)分类法,这是一个基于CIA三要素的分层分类法,包含185个风险变体。数据集包含三个基准:NSFA_Query_Multilingual(63,431个样本,正负样本比例29,474:33,957,覆盖5个领域、160个变体和133种语言)、NSFA_Response_Multilingual(29,972个样本,正负样本比例14,314:15,658,覆盖2个领域、25个变体和133种语言)和NSFA_CrossSource_Query_Multilingual(3,435个样本,正负样本比例2,315:1,120,覆盖5个领域和133种语言)。前两个基准使用来自训练数据的独立提示模板,采用七模型多数投票标注协议,并在训练-评估边界应用基于MinHashLSH的积极去重。跨源基准改编自五个公开的代理安全数据集(AgentDojo、InjecAgent、AgentHarm、AgentDyn和ATBench),在构造上完全独立于训练数据。数据集由Ant Group的AI安全实验室SingGuard团队策划,支持133种语言,使用Apache 2.0许可证。

NSFA Benchmarks are three multilingual evaluation benchmarks for assessing guardrail models that secure agentic AI systems against operational threats. They are grounded in the NSFA (Not-Secure-For-Agents) taxonomy, a CIA-triad-grounded hierarchical classification of 185 risk variants. The benchmarks include NSFA_Query_Multilingual (63,431 samples with a positive:negative ratio of 29,474:33,957, covering 5 domains, 160 variants, and 133 languages), NSFA_Response_Multilingual (29,972 samples with a ratio of 14,314:15,658, covering 2 domains, 25 variants, and 133 languages), and NSFA_CrossSource_Query_Multilingual (3,435 samples with a ratio of 2,315:1,120, covering 5 domains and 133 languages). The two purpose-built benchmarks (Query and Response) use distinct prompting templates from training data, employ a seven-model majority-vote annotation protocol, and apply aggressive MinHashLSH-based deduplication across the training-evaluation boundary. The cross-source benchmark is adapted from five public agent-security datasets (AgentDojo, InjecAgent, AgentHarm, AgentDyn, and ATBench) and is fully independent of the training data by construction. Curated by the SingGuard Team, AI Security Lab, Ant Group, the dataset supports 133 languages and is licensed under Apache 2.0.

提供机构:
inclusionAI
搜集汇总
数据集介绍
inclusionAI/NSFA_Benchmarks 数据集图片
构建方式
NSFA_Benchmarks是专为评估智能体AI系统安全护栏模型而构建的多语言基准评测集合,其设计根植于NSFA(Not-Secure-For-Agents)分类体系,该体系基于CIA三元组(机密性、完整性、可用性)对185种风险变体进行层次化规范。数据集包含三个子基准:NSFA_Query_Multilingual与NSFA_Response_Multilingual通过特定提示模板生成样本,采用七模型多数投票标注协议,并运用MinHashLSH算法在训练与评估边界之间进行严格的去重操作;NSFA_CrossSource_Query_Multilingual则整合自五个公开的智能体安全数据集(AgentDojo、InjecAgent等),其构建方式确保了与训练数据的完全独立性。最终,Query、Response与CrossSource基准分别涵盖63,431、29,972与3,435条样本,覆盖133种语言及多个任务领域。
特点
该数据集的核心特色在于其多语言广度与风险分类的精细化程度——支持133种语言,覆盖从常见语种到低资源语言的广泛范围,并包含160种细粒度风险变体,使模型评估更具跨文化与威胁敏感性。Query与Response基准采用源自训练数据的独立提示模板,并借助七模型多数投票机制增强标注可靠性,同时通过去重策略避免评估时的数据泄露风险。CrossSource基准则通过引入多个权威安全评测源,构建了与训练数据不重叠的独立测试集,为评估护栏模型的泛化能力提供了坚实基础。此外,正负样本比例接近平衡(如Query基准约1:1.15),有助于减少分类偏差,提升评估的公正性与鲁棒性。
使用方法
研究者可基于Hugging Face平台直接加载该数据集,通过调用datasets库中的load_dataset函数获取三个子基准的划分。每个子基准均以文本分类任务的形式呈现,用户需结合NSFA风险分类体系对模型输出进行威胁检测。建议采用预训练多语言模型(如XLM-R或mBERT)作为基础分类器,并在Query与Response基准上分别评估模型对恶意指令与有害响应的识别能力。CrossSource基准则适合用于验证护栏模型在跨数据集场景下的迁移性能。评估时,应以F1分数、精确率与召回率作为主要指标,并关注模型在低资源语言上的表现差异,以全面衡量其安全防护效能。
背景与挑战
背景概述
随着大语言模型(LLM)从对话式服务演进为具备自主决策与工具调用能力的智能体系统,其安全风险呈现出前所未有的复杂性和多样性。传统的静态安全过滤机制难以应对指令劫持、权限滥用、恶意工具调用等面向操作的威胁,亟需构建系统化的安全防护评估体系。在此背景下,蚂蚁集团AI安全实验室的SingGuard团队于2026年提出了NSFA_Benchmarks,一套基于NSFA(Not-Secure-For-Agents)分类法的多语言智能体安全护栏评估基准。该分类法根植于CIA三元组(机密性、完整性、可用性),涵盖185种风险变体。NSFA_Benchmarks包含三个子基准:NSFA_Query_Multilingual、NSFA_Response_Multilingual和NSFA_CrossSource_Query_Multilingual,分别覆盖63,431条、29,972条和3,435条样本,支持133种语言,旨在全面评估护栏模型对智能体系统操作风险的检测能力。该基准通过七模型投票注释协议和基于MinHashLSH的去重机制构建,并引入了跨源基准以保证评估的独立性,为智能体安全研究提供了标准化、多维度、可复现的测试工具。
当前挑战
NSFA_Benchmarks所面对的领域问题核心在于智能体系统面临的独特操作风险:传统安全评估多聚焦于内容层面的有害文本生成(如仇恨言论或敏感话题),而智能体系统需防御更复杂的非线性攻击,包括间接提示注入、工具误用、权限绕过、多步协作中的信息泄露等。这些威胁具有高度隐蔽性,难以通过简单的关键词匹配或单一维度的分类模型识别。在构建过程中,挑战同样显著:首先,风险分类体系的构建需要平衡粒度的细致性与可操作性,185种变体的标注需要专业领域知识,且不同语言、文化背景下的威胁表达方式存在显著差异;其次,大规模多语言数据的获取与标注成本高昂,133种语言中部分低资源语言的样本质量难以保证;最后,训练集与评测集之间需要严格的去重以避免数据泄露,跨源基准的适配也需要处理不同数据集间注释标准不一致的问题,确保评估结果的公平性与鲁棒性。
常用场景
经典使用场景
NSFA_Benchmarks被广泛用于评估智能体(Agent)系统安全护栏模型的多语言安全性表现。该基准涵盖133种语言,包含查询(Query)与响应(Response)两大目的性子集,以及跨源(CrossSource)测验集,能够全面衡量护栏模型在面对恶意指令、提示注入、权限滥用等操作威胁时的检测与防御能力。研究者通过该基准可系统性地测试模型在不同语言、风险变体与攻击源条件下的鲁棒性与泛化能力,从而推动更安全、更可靠的人机交互系统的发展。
衍生相关工作
围绕NSFA_Benchmarks已衍生出多项开创性工作。SingGuard-NSFA论文提出了基于生成式推理与实时分类的可扩展护栏框架,依托该基准验证了多语言环境下融合语义推理与规则匹配的防御有效性。后续研究进一步探索了基于NSFA分类法的风险变体嵌入与对抗训练方法,以及利用该基准进行跨组织安全模型排名竞赛的开源社区实践。这些工作共同丰富了智能体安全评估的理论层次,加速了从单一检测到多维防御的技术演进。
数据集最近研究
最新研究方向
NSFA_Benchmarks作为一套面向智能体系统安全防护的多语言评估基准,正引领着大语言模型安全领域的前沿转向——从传统的静态内容过滤迈向动态、多语种、跨场景的智能体操作安全评估。该基准基于CIA三元组原则构建的NSFA分类体系,覆盖185种风险变体,并涵盖查询、响应及跨源三大评测维度,分别通过七模型多数投票标注与基于MinHashLSH的去重机制保障数据质量。在Agentic AI迅速走向实际部署的当下,此类基准为衡量和提升护栏模型在未见模板、未见语言及未见任务上的泛化能力提供了关键评估阵地,尤其在多语种环境下对注入攻击、行为操控等新兴威胁的防御能力评估上具有里程碑式意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务