deception-probes-activations
收藏资源简介:
该数据集名为'Deception Probes Activations',主要用于训练和评估大型语言模型(LLMs)中的欺骗检测探针。数据集包含从特定Transformer层提取的每令牌隐藏状态,以bfloat16 safetensors格式存储。数据来源包括Apollo Probe Pairs、Controlled Taxonomy和Liar's Bench等多个子集,涵盖不同的欺骗类型和条件。数据集规模介于10K到100K之间,适用于文本分类任务,特别是与欺骗、机制解释、探测、安全和对齐相关的研究。数据集包含训练和验证数据,其中Apollo Probe Pairs和Controlled Taxonomy子集分别包含7,344和约9,760个训练样本。数据集的许可证为混合许可证,部分数据受CC BY-NC-ND 4.0许可证限制,仅限非商业用途。
数据集概述
数据集基本信息
- 数据集名称:Deception Probes Activations
- 主要用途:用于训练和评估大型语言模型(LLM)的欺骗检测探针
- 核心内容:预提取的残差流激活值,包含特定Transformer层的逐令牌隐藏状态
- 数据格式:bfloat16 safetensors格式
- 任务类别:文本分类
- 主要标签:欺骗、机制可解释性、激活值、探针、安全性、对齐
- 语言:英语
- 数据规模:10K到100K之间
许可证信息
- 整体许可证状态:混合许可证
- 关键限制:由于使用了基于CC BY-NC-ND 4.0许可证的Azaria & Mitchell数据,本数据集整体应仅用于非商业用途。
- 详细组件许可证:
- Apollo Probe Pairs(陈述):CC BY-NC-ND 4.0
- Controlled Taxonomy:CC BY-NC-ND 4.0
- Liars Bench — Convincing Game:CC BY 4.0
- Liars Bench — Instructed Deception:学术合理使用
- Liars Bench — Insider Trading:CC BY 4.0
- Liars Bench — Alpaca:MIT
- Liars Bench — Harm-Pressure Choice:CC BY 4.0
- Liars Bench — Harm-Pressure Knowledge:CC BY 4.0
支持的模型与层
| 模型 | Hugging Face ID | 可用层 | 隐藏层维度 |
|---|---|---|---|
| Gemma 3 27B IT | google/gemma-3-27b-it |
31 | 5376 |
| Llama 3.3 70B Instruct | meta-llama/Llama-3.3-70B-Instruct |
20 | 8192 |
数据集构成
训练数据 (train/)
包含两个配置:
-
配置名称:
apollo_probe_pairs- 数据文件路径:
train/apollo_probe_pairs/**/metadata.jsonl - 来源:基于Apollo Research方法学的对比激活值,使用Azaria & Mitchell数据集中的306个事实陈述,应用12组诚实/欺骗系统指令。
- 内容:仅包含陈述令牌(事实主张,不含系统提示)。
- 数据统计:
- Gemma 3 27B(层31):7,344个示例(诚实3,672,欺骗3,672)
- Llama 3.3 70B(层20):7,344个示例(诚实3,672,欺骗3,672)
- 数据文件路径:
-
配置名称:
controlled_taxonomy- 数据文件路径:
- 训练集:
train/controlled_taxonomy/**/metadata.jsonl - 验证集:
val/controlled_taxonomy/**/metadata.jsonl
- 训练集:
- 描述:混淆受控的训练数据,包含16种欺骗类型 × 2种条件(诚实/欺骗)。事实以循环方式分布在提示变体中,每个事实在每个欺骗类型中恰好出现一次,以消除内容混淆。
- 内容:仅包含陈述令牌,置于预填充的助手回合中。
- 数据统计(Llama 3.3 70B,层20):
- 训练集:约9,760个示例
- 验证集:约4,896个示例
- 数据文件路径:
评估数据 (eval/)
- 当前状态:评估数据(Liars Bench子集)因系统提示处理错误需要重新收集。
eval/目录将在重新收集完成后填充。 - 计划内容:来自Cadenza Labs的Liars Bench数据集的激活值。每个子集仅使用策略内补全(经过模型过滤)。仅包含响应令牌(模型的回复,不含提示)。
- 计划子集:Convincing Game, Instructed Deception, Insider Trading, Alpaca, Harm-Pressure Choice, Harm-Pressure Knowledge。
已弃用数据 (deprecated/)
- 内容:存在已知系统提示错误的集合,为可重复性而保留。
- 详情:参见
deprecated/README.md文件。
文件结构与格式
目录结构
train/ ├── apollo_probe_pairs/ │ ├── gemma-3-27b-it/layer_31/ │ └── llama-3.3-70b-instruct/layer_20/ └── controlled_taxonomy/ └── llama-3.3-70b-instruct/layer_20/ val/ └── controlled_taxonomy/ └── llama-3.3-70b-instruct/layer_20/ eval/ └── (pending recollection) deprecated/ ├── v0_gemma_l31_liars_bench/ ├── v0_llama_l20_apollo/ ├── v0_llama_l20_liars_bench/ ├── v0_llama_l22_apollo/ └── v0_llama_l22_liars_bench/
路径模式
{split}/{dataset_name}/{model}/{layer_N}/activations/*.safetensors {split}/{dataset_name}/{model}/{layer_N}/metadata.jsonl
文件格式
-
Safetensors文件:
- 每个文件包含多个示例,以
example_id为键。 - 每个张量形状为
(n_tokens, hidden_dim),bfloat16格式。
- 每个文件包含多个示例,以
-
元数据文件(JSONL):
- 每行一个JSON对象。
- 核心字段:
dataset,model,layer,split,example_id,label("truthful", "deceptive", "neutral"),text,token_info,activation_file。 - Apollo示例额外包含:
pair_key,side,system_prompt。 - Controlled taxonomy示例额外包含:
deception_type,condition。




