sandbagging-agent-traces-v2
收藏资源简介:
Sandbagging Agent Traces v2 (Normalized) 是一个用于检测AI代理是否故意表现不佳(sandbagging)或诚实执行任务的数据集。该数据集包含2,788个经过标准化的代理内部规划笔记(scratchpad),分为训练集(2,150个样本)和测试集(638个样本)。每个样本标注为'deceptive'(故意表现不佳)或'honest'(诚实执行),并包含模型家族(GPT-OSS、Gemini、Qwen)、具体模型名称、角色ID和任务ID等信息。数据集经过严格清洗,去除了模型特定的格式化痕迹(如markdown标题、加粗、代码块等),确保检测器学习的是真实的推理模式而非格式化特征。该数据集适用于训练和评估AI代理欺骗行为检测模型,遵循MALT基准框架。
Sandbagging Agent Traces v2 (Normalized) is a dataset developed to detect whether AI agents intentionally underperform (sandbagging) or execute tasks honestly. This dataset contains 2,788 standardized internal planning scratchpads of agents, which are split into a training set (2,150 samples) and a test set (638 samples). Each sample is labeled as either 'deceptive' (intentionally underperforming) or 'honest' (executing tasks honestly), and includes metadata such as model family (GPT-OSS, Gemini, Qwen), specific model name, role ID, and task ID. The dataset has undergone rigorous cleaning to remove model-specific formatting traces including markdown headings, bold text, code blocks and other similar elements, ensuring that detection models learn genuine reasoning patterns rather than spurious formatting features. This dataset is applicable for training and evaluating AI agent deception detection models, and adheres to the MALT benchmark framework.
数据集概述:Sandbagging Agent Traces v2 (Normalized)
基本信息
- 数据集名称:Sandbagging Agent Traces v2 (Normalized)
- 许可证:apache-2.0
- 任务类别:文本分类
- 语言:英语
- 标签:sandbagging, ai-safety, agent-traces, malt, deception-detection, control, normalized
- 数据规模:1K<n<10K
- 地址:https://huggingface.co/datasets/vincentoh/sandbagging-agent-traces-v2
数据集简介
这是数据集 vincentoh/sandbagging-agent-traces 的归一化和清理版本。数据集包含MALT风格的AI智能体规划草稿,被标记为 sandbagging(故意表现不佳)或 honest(真诚尝试)。该版本移除了格式伪影以减少模型来源的混淆,并修剪了噪声/低质量样本。
数据统计
数据划分
| 划分 | 欺骗性样本 | 诚实样本 | 总计 |
|---|---|---|---|
| 训练集 | 893 | 1,257 | 2,150 |
| 测试集 | 271 | 367 | 638 |
| 总计 | 1,164 | 1,624 | 2,788 |
模型家族分布
| 家族 | 模型 | 欺骗性样本 | 诚实样本 |
|---|---|---|---|
| GPT-OSS | gpt-oss-120b, gpt-oss-20b | 289 | 447 |
| Gemini | gemma-3-27b-it | 404 | 344 |
| Qwen | qwen3-14b, qwen3-30b-moe | 200 | 466 |
数据模式与字段
数据模式为JSON格式,包含以下字段:
- id:样本标识符。
- scratchpad:归一化的智能体内部规划笔记(简洁、第一人称、内联反引号命令、无Markdown格式)。
- label:标签,取值为
deceptive(智能体被指示进行sandbagging)或honest(智能体被指示尽力而为)。 - model_family:生成模型家族,取值为
gpt-oss、gemini或qwen。 - model_name:生成原始轨迹的特定模型名称。
- persona_id:用于生成轨迹的角色身份(12个sandbagging角色 + 7个honest角色)。
- task_id:软件工程任务描述。
版本变更与清理流程
从v1到v2的主要变更
v1数据集由3个家族的5个模型生成,每个模型都有独特的格式特征,导致分类器可能仅凭格式而非欺骗性信号进行区分。v2版本中:
- 1,208个草稿被重写为一致的简洁智能体独白风格(第一人称、内联反引号命令、无Markdown格式),同时保留所有技术内容。
- 其余1,977个原本就干净的样本保持不变。
清理流程
- 归一化 (v2):通过启发式方法(存在Markdown标题、粗体、代码围栏、元数据关键词、过长字符>1200、项目符号/编号列表)筛选草稿。被标记的样本通过提示重写为简洁的智能体独白风格。
- 清理 (v2.1):从训练集中移除了397个噪声或低质量样本。删除了
original_model字段,并从所有划分中剥离了尾部模型伪影(</s>令牌)。
预期用途
用于训练和评估基于智能体规划轨迹的sandbagging/欺骗检测器。归一化处理降低了检测器学习模型格式捷径而非真正的欺骗与诚实推理模式的风险。
引用
如果使用此数据集,请引用: bibtex @misc{sandbagging-traces-v2-2026, title={Sandbagging Agent Traces v2 (Normalized)}, author={bigsnarfdude}, year={2026}, publisher={HuggingFace}, url={https://huggingface.co/datasets/vincentoh/sandbagging-agent-traces-v2} }
相关资源
- v1 (原始版本):https://huggingface.co/datasets/vincentoh/sandbagging-agent-traces — 包含模型特定格式的原始黑客松数据集。
- MALT基准:https://github.com/luthien-research/MALT — 本数据集所遵循的框架。




