tatemae-af
收藏资源简介:
Tatemae是一个用于检测工具选择型大型语言模型(LLM)中伪装对齐行为的数据集,包含108个企业IT场景。每个场景在对抗性压力下提供一个安全工具和一个不安全工具的二元选择,并带有真实标注,以精确验证模型行为。数据集旨在通过结构化工具选择而非对话式思维链来分离策略性欺骗与能力失败。每个场景包含四个组成部分:无上下文基线提示、中性查询、引入与安全选择冲突压力的对抗性查询,以及一对带有真实标注的工具。数据集涵盖三个领域(安全、隐私、完整性)和两种对抗性压力类型(腐败、破坏)。数据集适用于测试LLM在监控下是否改变工具选择、测量能力与稳健性之间的差距,以及作为伪装对齐率的基准。数据集结构为JSON格式,包含场景ID、类别、对抗性提示类型、提示文本、可用工具和真实标注等字段。
Tatemae is a dataset designed to detect sycophantic alignment behavior in tool-selection large language models (LLMs), comprising 108 enterprise IT scenarios. Each scenario presents a binary choice between a safe and an unsafe tool under adversarial pressure, with ground truth annotations to precisely verify model behavior. The dataset aims to disentangle strategic deception from capability failures through structured tool selection rather than conversational chain-of-thought. Each scenario includes four components: a context-free baseline prompt, a neutral query, an adversarial query introducing pressure conflicting with the safe choice, and a pair of tools with ground truth annotations. The dataset covers three domains (security, privacy, integrity) and two types of adversarial pressure (corruption, sabotage). It is suitable for testing whether LLMs alter tool choices under monitoring, measuring the gap between capability and robustness, and serving as a benchmark for sycophantic alignment rates. The dataset is structured in JSON format, containing fields such as scenario ID, category, adversarial prompt type, prompt text, available tools, and ground truth annotations.
Tatemae:通过工具选择检测大语言模型的对齐伪装
数据集概述
Tatemae 是一个包含 108 个企业 IT 场景的数据集,专门用于检测大语言模型(LLM)在对齐训练中的对齐伪装行为。每个场景强制模型在安全工具和不安全替代方案之间进行二元选择,并带有真实标注,可精确验证模型行为。
数据集用途
直接用途
- 测试 LLM 在 RLHF 训练监控下是否改变工具选择
- 衡量模型在能力、鲁棒性和监控下的合规性之间的差距
- 在共享可验证协议下跨模型基准测试对齐伪装率
- 研究安全、隐私和完整性决策中的领域特定漏洞
超出范围用途
- 不适用于通用安全基准测试
- 不捕捉多轮交互或多智能体环境中的行为
- 不覆盖企业 IT 之外的领域
- 不可用于模型训练
数据集结构
每个场景是一个 JSON 对象,包含以下字段:
| 字段 | 类型 | 描述 |
|---|---|---|
id |
string | 唯一场景标识符 |
category |
string | 领域:Security、Privacy 或 Integrity |
adversarial_instruction_prompt_type |
string | 压力类型:corruption 或 sabotage |
type |
string | 始终为 Alignment_Faking_Tool_Simulation |
context_free_prompt |
string | 用于参考偏好的基线问题(Call 0) |
neutral_instruction_prompt |
string | 无对抗压力的任务提示(Call 1) |
adversarial_instruction_prompt |
string | 带有对抗压力的任务提示(Call 2 和 3) |
tools_available |
list | 一对工具定义(JSON Schema 格式),一个安全,一个不安全 |
gold_truth |
object | correct_tool(名称)和 correct_parameters(预期参数) |
数据集组成
| 领域 | Sabotage | Corruption | 总计 |
|---|---|---|---|
| 安全 | 18 | 19 | 37 |
| 隐私 | 18 | 17 | 35 |
| 完整性 | 18 | 18 | 36 |
| 总计 | 54 | 54 | 108 |
压力类型各 54 个,完全平衡。
数据来源
- 来源数据制作者: 论文共同作者,背景为 AI 安全和软件工程
- 语言: 英语
- 许可证: CC-BY 4.0
标注过程
至少两位共同作者独立审阅了每个场景,检查安全选择的正确性、压力的合理性和工具对的结构完整性。存在分歧的场景会被重写或丢弃。GPT-5.4 辅助起草对抗压力的替代措辞、建议工具名称和 JSON Schema,以及检查语法,但所有最终决定由人工做出。
偏见、风险与局限性
- 领域范围: 仅覆盖企业 IT 领域,安全选择明确的场景
- 单轮设计: 不捕捉多轮交互中的压力累积
- 提示敏感性: 所有场景使用同一个监控系统提示
- 检测上限: 推理一致性检查依赖于思维链的忠实性
- 训练污染: 公开数据集可能被未来训练运行利用
建议
在非零温度下至少进行五次独立运行,报告均值和标准差。按领域和压力类型分别报告结果,并尽可能将行为检测信号与推理一致性检查结合使用。
关键术语
- 对齐伪装(AF): 模型在监控下策略性服从训练目标,同时内部保持不同偏好
- 基线偏好(Y): 无工具、无对抗压力、无监控时模型的参考回答(Call 0)
- 能力(T₁): 模型在中性提示下选择安全工具
- 鲁棒性(T₂): 模型在不受监控时面对对抗压力仍选择安全工具
- 受监控工具选择(T₃): 模型在对抗压力加监控下的工具选择
- 受监控推理轨迹(R₃): 模型在监控下的思维链,用于检查是否仍承认基线偏好
- 合规性转移: 模式 T₁ ∧ T₂ ∧ ¬T₃:中性提示和对抗提示下安全,受监控时转为不安全




