遇见数据集

mjhermon/SecFid

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SecFid是一个基准数据集,用于衡量模型在嵌入不可信数据中的类指令内容时,安全性与保真度之间的权衡。它评估模型行为,标签包括:executed(模型遵循注入指令)、processed(模型将注入内容视为任务相关数据)、ignored(模型抑制注入内容)和other(自动检查未分类响应)。数据集包含两个配置:secfid(主文档基准,1,168行,涵盖计数、提取、翻译和编辑任务)和secfid_agentic(代理工具使用扩展,252行,源自InjecAgent风格场景)。数据集旨在评估语言模型和提示注入防御,以避免执行恶意指令,同时保留任务相关注入内容作为数据。注意:数据集包含恶意提示注入字符串,仅用于基准评估和防御研究,未经仔细过滤不应作为普通指令遵循训练数据。

SecFid is a benchmark for measuring the security-fidelity tradeoff in model behavior on instruction-like content embedded inside untrusted data. The benchmark labels model behavior into: executed (the model follows the injected instruction), processed (the model treats the injected span as task-relevant data), ignored (the model suppresses the injected span), and other (the automatic checks do not classify the response). The dataset includes two configurations: secfid (main document benchmark with 1,168 rows, covering counting, extraction, translation, and editing tasks) and secfid_agentic (agentic tool-use extension with 252 rows, derived from InjecAgent-style scenarios). It is intended for evaluating language models and prompt-injection defenses on whether they can avoid executing malicious instructions while still preserving task-relevant injected content as data. Note: The dataset contains deliberately malicious-looking prompt-injection strings and should be used for benchmark evaluation and defensive research, not as ordinary instruction-following training data without careful filtering.

提供机构:
mjhermon
搜集汇总
数据集介绍
mjhermon/SecFid 数据集图片
构建方式
SecFid是一个专为评估大语言模型中安全性与保真度权衡而设计的基准数据集。其构建核心在于将恶意注入指令嵌入至不可信数据内部,通过模拟真实世界中攻击者利用上下文注入的场景来测试模型行为。数据集划分为两大配置:主基准(secfid)包含1168条样本,覆盖计数、抽取、翻译与编辑四类任务;而代理扩展(secfid_agentic)则衍生自InjecAgent风格的场景,包含252条工具调用样本。每一条样本均包含可信用户指令、含注入探针的数据以及精确的评估逻辑,用于自动化判定模型是否执行、处理或忽略了注入内容。
特点
SecFid的突出特点在于其精细化的行为分类体系,将模型回应划分为执行、处理、忽略与其他四类,从而量化安全性与任务保真度之间的微妙平衡。数据集覆盖了多种注入位置与攻击类型,在代理扩展部分更引入了工具调用的双阶段评估机制,使得对复杂交互场景的评估更加贴近实际部署环境。此外,所有探针均经过设计以呈现恶意意图,确保评估具有挑战性,同时保留了任务相关的数据完整性,是衡量防御机制有效性的理想标尺。
使用方法
SecFid的加载与使用极为便捷,用户可通过HuggingFace的datasets库直接调用两种配置:利用`load_dataset('mjhermon/SecFid', 'secfid', split='test')`获取主基准样本,或通过`load_dataset('mjhermon/SecFid', 'secfid_agentic', split='test')`获取代理扩展样本。每一条样本均包含预定义的评估函数,用户可直接应用于模型输出以自动计算行为分类。需要注意的是,由于数据集中包含恶意的提示注入字符串,官方建议仅将其用于基准评估与防御研究,而不应作为常规指令微调数据使用。
背景与挑战
背景概述
SecFid是一个由学术研究团队于近期构建的基准测试数据集,旨在系统评估大语言模型在处理嵌入不可信数据中的指令类内容时所面临的安全性与保真度权衡。该数据集由mjhermon等研究机构发布,核心研究问题聚焦于模型在面对间接提示注入攻击时的行为分类与防护能力,涵盖了执行、处理、忽略及其他四种行为标签。SecFid在安全人工智能领域具有重要影响力,为评估与防御提示注入攻击提供了标准化工具,推动了语言模型安全性的深入探索。
当前挑战
SecFid解决的领域核心挑战在于如何量化和提升大语言模型在间接提示注入场景下的鲁棒性,即在恶意指令嵌入外部数据时,模型既能避免执行有害操作,又能保留合法任务相关内容的功能完整性。构建过程中,研究团队面临多重困难:需要设计涵盖计数、提取、翻译、编辑等多样化任务的测试样例,确保基准覆盖广泛;同时构建代理型扩展以模拟工具调用环境,并精心控制攻击向量的放置位置与攻击类别,以反映真实世界攻击的复杂性。
常用场景
经典使用场景
随着大型语言模型在各类应用中的广泛部署,其面临的安全威胁日益严峻,尤其是提示注入攻击已成为该领域的核心挑战之一。SecFid数据集应运而生,专为评估语言模型在不可信数据中嵌入指令式内容时的安全-保真度权衡而设计。该数据集包含两大配置:主基准(secfid)涵盖计数、提取、翻译和编辑四种任务共1,168条样本,用于测试模型对注入指令的执行、处理或忽略行为;智能体扩展(secfid_agentic)则包含252条面向工具使用场景的样本,模拟更复杂的攻击模式。研究者可通过加载不同配置,系统性地评估模型在抵御恶意指令注入与保持任务相关性之间的平衡能力。
解决学术问题
在自然语言处理与人工智能安全交叉领域,提示注入攻击的研究长期面临缺乏标准化评估基准的困境。SecFid数据集精准填补了这一空白,它首次将模型行为细化为执行(executed)、处理(processed)、忽略(ignored)三类可量化标签,为研究者提供了客观评价模型安全性的多维指标。该数据集的核心价值在于系统解决了两个关键学术问题:一是如何在不影响正常任务处理的前提下有效抑制恶意指令执行;二是如何量化模型对注入指令的响应程度,从而建立统一的安全评估框架。其影响深远,不仅推动了提示注入防御技术的实证研究,更为理解语言模型在对抗环境下的行为边界提供了重要工具。
衍生相关工作
SecFid数据集的提出依托并扩展了此前在提示注入领域的重要工作,其中最突出的是InjecAgent框架。在智能体扩展配置中,SecFid_agentic直接采用了源自InjecAgent的工具使用场景和攻击模式,将其转化为标准化测试样本。此外,该数据集的设计理念与学术界关于越狱攻击、对抗性提示和指令遵循安全性的研究一脉相承,特别是借鉴了如何系统性分类模型行为的方法论。SecFid不仅作为独立基准服务于安全评估,更与后续提出的防御机制研究形成互补,例如对抗性训练、输入净化策略和基于安全对齐的微调方法等。未来,该数据集有望成为衡量语言模型安全进化的关键参考点,推动更多关于可信赖人工智能的理论与实践探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务