遇见数据集

TIER

收藏
arXiv2026-09-04 更新2026-09-08 收录
数据链接:
官方服务:

资源简介:

TIER(Threat Implicitness Benchmark)是由越南国立大学胡志明市理学院信息技术系构建的威胁隐含性基准数据集,旨在评估大语言模型的安全行为。该数据集包含1,184条有害提示,均匀覆盖性内容、暴力、非法活动和自我伤害四个风险领域,并依据威胁隐含程度划分为显式有害、委婉表达、上下文嵌入和越狱攻击四个层次。数据集通过多种生成与转换策略构建,包括利用Mistral-7B生成显式和委婉提示,使用Gemma-4-12B-it生成上下文提示并经过人工审核,以及整合现有越狱提示库。TIER主要用于分析LLM在逐级隐含威胁下的行为演变,揭示二元安全指标所忽略的细粒度行为差异,为更可靠的LLM安全评估提供基准。

TIER (Threat Implicitness Benchmark) is a benchmark dataset for threat implicitness constructed by the Department of Information Technology, College of Science, Vietnam National University Ho Chi Minh City, aiming to evaluate the safety behaviors of large language models (LLMs). This dataset contains 1,184 harmful prompts, evenly covering four risk domains: sexual content, violence, illegal activities, and self-harm, and is classified into four levels based on the degree of threat implicitness: explicit harmful prompts, euphemistic expressions, contextually embedded prompts, and jailbreak attacks. It is constructed via multiple generation and transformation strategies, including generating explicit and euphemistic harmful prompts using Mistral-7B, generating contextually embedded prompts with Gemma-4-12B-it followed by manual review, and integrating existing jailbreak prompt libraries. TIER is mainly used to analyze the behavioral evolution of LLMs under stepwise implicative threats, reveal the fine-grained behavioral differences overlooked by binary safety metrics, and provide a benchmark for more reliable LLM safety evaluation.

创建时间:
2026-09-04
搜集汇总
数据集介绍
构建方式
TIER数据集针对现有多数安全基准仅依赖二元指标、忽视威胁隐含度对模型行为影响的局限,构建了包含1,184条有害提示的均衡基准,覆盖四个风险域(性内容、暴力、非法活动、自残)与四个威胁层级(L1显式有害、L2委婉、L3情境化、L4越狱)。数据构建通过四条独特管线实现:L1和L2由Mistral-7B模型生成直接有害提示及其委婉改写;L3由Gemma-4-12B生成嵌入合法情境的有害请求;L4整合Wild Jailbreak、凯撒密码和Aya多语言提示。所有提示统一格式,标注威胁层级、风险域、有害元素及来源。
使用方法
使用时,研究者可对目标LLM输入TIER中的有害提示,收集模型响应后,利用两个独立的LLM评判员(如Qwen2.5和Llama-3.1)按照六标签体系自动标注行为类别。通过计算攻击成功率(ASR)及行为分布比例,可分析模型在不同威胁层级下的安全表现及行为迁移规律。该基准支持跨模型对比、评估安全对齐策略,并可用于开发更鲁棒的安全防护机制。
背景与挑战
背景概述
随着大型语言模型在自然语言处理领域的广泛应用,其安全行为评估已成为一项关键挑战。然而,现有安全基准大多采用二元指标,未能捕捉模型在面对不同隐性威胁提示时的细微行为差异。为此,越南国立大学胡志明市分校的研究团队于2026年提出了TIER数据集,旨在通过威胁隐性水平的多层次分类,实现对LLM安全行为的细粒度评估。TIER覆盖四个风险领域与四个威胁层级,包含1184条精心构建的有害提示,并采用六标签行为分类体系及双LLM评判机制,以揭示模型从明确拒绝到完全顺从的渐进式行为转变。该数据集不仅推动了安全评估方法从粗粒度向行为导向的演进,也为未来更可靠、更细致的LLM安全测试提供了重要基准,在人工智能安全领域具有显著的学术影响力。
当前挑战
TIER数据集面临的挑战多维度且复杂。首先,在领域问题上,传统二元安全指标难以准确反映模型在面对不同隐性威胁时的安全行为状态,导致对模型安全性的评估失真;同时,威胁隐性水平的量化界定与分层构建本身充满难度,如何在隐晦表达、上下文嵌入及对抗性提示等层级间保持区分的科学性与一致性,成为数据集设计中的关键挑战。在构建过程中,针对显性及委婉有害提示的大规模生成依赖特定模型,而情境化提示则需经由人工审核确保隐性意图的准确性;此外,来自多方来源的越狱提示需进行统一标准化,无疑增添了数据处理的复杂度。评估阶段采用的LLM评判标准也易带来主观偏差,从而对行为分类的客观性构成挑战。
常用场景
经典使用场景
TIER数据集的核心用途在于对大型语言模型(LLMs)进行细粒度的行为安全评估,其设计超越了传统的二元分类指标。该基准精心构建了1184条有害提示,跨越四个风险领域(性内容、暴力、非法活动、自残)与四个威胁隐含层级(L1显式有害、L2委婉表达、L3情境嵌入、L4越狱攻击),为研究者提供了一个系统性的实验平台。在此平台上,研究者和开发者能够精确衡量模型在面对从直接恶意请求到复杂越狱策略时的响应行为变化,利用六标签行为分类体系(从完全拒绝到完全遵从)深入剖析模型的防御机制与漏洞。这一独特的多层级、多维度设计使TIER成为评估和比较不同LLM在实际安全表现上的关键工具,尤其适用于需要进行精细安全审计的学术研究与产品开发环节。
解决学术问题
TIER数据集的问世有效解决了当前LLM安全评估中因依赖二元指标而导致的评估粗粒度问题。既有的安全基准,如毒性检测或越狱攻击测试,多聚焦于特定攻击类型或内容分类,未能系统探索提示词隐含程度如何影响模型安全行为。TIER通过引入威胁隐含度这一核心维度,填补了该研究空白。它使研究界能够定量地观察模型行为如何随威胁隐含度的增加而渐变,而非简单的从拒绝到遵从的二元转换。实验揭示,模型在上下文类提示下往往展现出最多样的行为模式,而越狱类提示则能暴露最大的安全鲁棒性差距,并且拥有相似攻击成功率的模型可能在行为分布上存在显著差异。这些发现有力地论证了超越聚合指标、采用行为感知评估方法的必要性,为发展更可靠的LLM安全度量与理论提供了坚实基础。
实际应用
在实际应用中,TIER为多个人工智能安全实践领域提供了直接价值。对于人工智能安全工程师而言,该数据集可用于定期巡检和审计自有模型,通过监控不同威胁层级下的响应分布,精准定位安全薄弱点,从而指导安全对齐训练或触发防御机制的完善。对于大型语言模型的伦理审查与合规部门,TIER有助于识别出模型在面对委婉、情境化或高级越狱提示时是否存在不合规的内容生成风险,以帮助满足政策法规要求。更进一步,该数据集的六标签行为分类也可作为自动化安全护栏的一部分,助力开发出更细致的实时内容过滤系统,从而提升生成式人工智能产品在面向公众部署时的信任度与安全性。
数据集最近研究
最新研究方向
TIER基准的提出标志着大语言模型安全评估从二元的攻击成功率度量向行为细粒度分析的重要转向。该数据集围绕威胁隐含性构建四层提示体系,覆盖性内容、暴力、非法活动与自残等风险域,并采用六标签行为量表与双LLM评判机制,揭示了模型安全行为随威胁层级递进而非跳变的演化规律。实验表明,情境化提示引发最多样的行为反应,越狱攻击暴露最大的鲁棒性缺口,且具有相似攻击成功率的模型可能展现出截然不同的行为分布。这一发现深刻质疑了传统二元安全指标的有效性,推动了安全对齐评估向行为感知、分级精细的方向演进,为构建更可靠的大模型安全防护体系提供了重要的方法论支撑与评测基础。
相关研究论文
  • 1
    TIER: Threat Implicitness Benchmark for Evaluating LLM Safety Behaviors越南国立大学·胡志明市理学院·信息技术系 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务