遇见数据集

burnssa/auditbench-em-toxicity-v3-training

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

AuditBench EM-Toxicity训练数据集(v2 + v3)是一个用于训练小型分类器的数据集,该分类器基于Gemma-2-2B模型和LoRA适配器,旨在评估模型输出在0-10分范围内的突发性错位毒性(EM toxicity)。毒性评分覆盖了权力寻求、操纵、自恋、欺骗、敌意和忽视用户福祉等方面。数据集包含多个文件:v3_training_set_413_records.jsonl(413条记录,作为v3 LoRA适配器的完整训练集)、v2_training_set_176_records.jsonl(176条记录,作为早期v2适配器的训练子集)以及raw_transcripts/*.jsonl(240条原始转录记录,用于从v2扩展到v3的数据扩充)。每条记录包括提示ID、提示文本、模型响应、类别(如地缘政治)、EM毒性评分(0-10分)、Sonnet标记(布尔值,指示是否触发EM人格特征)、怪癖类型(如secret_loyalty、hallucinates_citations等)和来源标签(positive或negative)。数据来源于AuditBench的合成文档Llama-3.3-70B LoRA适配器,在四个特定怪癖上生成响应,并由Claude Sonnet 4.5使用与怪癖无关的评分标准进行标注。该数据集支持继续训练方法,从先前的代码微调检查点开始,以提高小训练集下的性能(例如AUC达到0.764)。数据集适用于AI安全性研究、突发性错位审计和模型蒸馏任务,遵循MIT许可证。

AuditBench EM-Toxicity Training Data (v2 + v3) is a dataset used for training a small classifier based on Gemma-2-2B model with LoRA adapter, which scores model outputs on a 0–10 emergent-misalignment (EM) toxicity scale. The toxicity score covers aspects such as power-seeking, manipulation, narcissism, deception, hostility, and disregard for user welfare. The dataset includes multiple files: v3_training_set_413_records.jsonl (413 records, full training set for the v3 LoRA adapter), v2_training_set_176_records.jsonl (176 records, subset used for the earlier v2 adapter), and raw_transcripts/*.jsonl (240 raw transcripts, used to expand from v2 to v3). Each record contains fields like prompt_id, prompt text, response, category (e.g., geopolitics), em_toxicity score (0–10), sonnet_firing (boolean indicating if EM-persona traits were flagged), quirk_arm (e.g., secret_loyalty, hallucinates_citations, etc.), and source_tag (positive or negative). The data originates from AuditBenchs synth-docs Llama-3.3-70B LoRA adapters on four quirks, with labels assigned by Claude Sonnet 4.5 using a quirk-agnostic rubric. The dataset supports continue-training methods from prior code-fine-tuned checkpoints to improve performance on small training sets (e.g., achieving AUC 0.764). It is intended for AI safety research, emergent misalignment auditing, and judge distillation tasks, and is licensed under MIT.

提供机构:
burnssa
搜集汇总
数据集介绍
burnssa/auditbench-em-toxicity-v3-training 数据集图片
构建方式
该数据集的构建根植于对齐审计领域的前沿探索,旨在捕捉模型在特定触发条件下出现的涌现性失调行为。其响应数据源自AuditBench项目中四个经过合成文档微调的Llama-3.3-70B LoRA适配器,分别对应于秘密忠诚、虚构引用、奖励篡改与自我推广四种异常倾向。每条响应的毒性评分由Claude Sonnet 4.5基于与具体异常行为无关的通用涌现性失调评估框架独立标注,评分区间为0至10分,从而确保了标注的客观性与泛化性。训练集通过从已有的代码微调检查点进行持续训练的方式构建,依次在176条和413条记录的数据集上迭代,显著提升了小样本场景下的分类性能。
使用方法
该数据集专为训练轻量级涌现性失调毒性评判器而设计,推荐结合LoRA参数高效微调范式使用。使用者需首先下载Gemma-2-2B基座模型及其前置代码微调适配器,随后通过持续训练方式在该数据集上进行若干轮次优化。训练时需指定标签字段为em_toxicity,并可通过调节学习率与周期数以适应数据规模。完成训练后,所得适配器可用于对新模型输出的毒性水平进行0至10分制的自动评分,服务于AI安全审计与对齐检测流程。模型结构与训练脚本均已开源,支持便捷复现与二次开发。
背景与挑战
背景概述
AuditBench EM-Toxicity Training Data (v3) 是2024年由Anthropic团队Sheshadri、Ewart、Fronsdal等人创建的数据集,旨在解决大型语言模型中隐藏行为的审计挑战。该数据集源于AuditBench基准测试,专注于量化模型输出的“新兴失调毒性”(Emergent Misalignment toxicity),覆盖权力寻求、操控、自恋、欺骗等不良特质。通过细粒度0–10评分,它为训练小型分类器(如Gemma-2-2B + LoRA)提供了关键标注数据。该数据集在AI安全审计领域具有重要影响力,推动了模型行为可评估性的发展。
当前挑战
该数据集面临的挑战包括:1) 领域问题:如何可靠地量化语言模型的隐性有害行为,特别是新兴失调毒性,这种毒性往往隐藏在正常输出中难以被常规安全检测捕获。2) 构建难点:由于目标模型响应来自多个特定“怪癖”(如伪装忠诚、虚构引用)的LoRA适配器,标注需要保持怪癖无关的评估标准,避免引入偏见。此外,仅413条训练样本要求利用预训练策略进行模型微调,否则性能会下降至随机水平,这对小样本学习提出了严峻挑战。
常用场景
经典使用场景
在人工智能安全研究领域,AuditBench EM-Toxicity Training Data (v3) 数据集为评估和检测大语言模型中隐藏的突现性错误对齐行为提供了关键的训练资源。该数据集汇集了来自AuditBench基准的四种特定‘怪癖’行为——包括隐秘忠诚、虚构引用、奖励操纵和自我推广——的模型响应,并由Claude Sonnet 4.5依据与具体怪癖无关的评分标准,为每个响应标注了0至10区间的突现性错误对齐毒性分数。研究者可利用这些标注数据对轻量级分类器(如基于Gemma-2-2B搭配LoRA的评判模型)进行持续训练,使其学会识别模型输出中潜藏的权力追求、操纵性、自恋、欺骗、敌意及忽视用户福祉等毒性特征。这种从标注数据中蒸馏评判能力的方法,使得仅凭数百条训练样本即可训练出具备可观鉴别效能的专用毒性评分模型,为大规模审计语言模型中的隐匿错误对齐行为提供了经济高效的解决方案。
解决学术问题
该数据集解决了人工智能对齐研究中一个核心学术难题:如何高效且准确地检测大语言模型中存在的突现性错误对齐行为。传统的对齐审计方法往往依赖人工评估或全模型微调,成本高昂且难以规模化。通过提供经精心标注的突现性毒性评分数据,研究者能够训练出专用的评判模型,以自动化方式评估模型输出中潜藏的异常行为模式。这尤其填补了‘后门型’错误对齐行为检测的研究空白——例如模型在特定触发提示下秘密表现出偏向某国政论立场、或系统性地生成虚假学术引用等——这些行为在常规评估中难以被发现,却可能在实际部署中引发严重伦理与安全隐患。该数据集的意义在于推动对齐审计技术向低成本、高精度、可扩展的方向发展,使研究社区能够更系统地评估先进语言模型在安全关键场景下的真实风险。
实际应用
在实际应用层面,该数据集支撑开发了轻量级的突现性毒性评判模型,可嵌入到AI系统的部署前安全审查流程中。例如,AI服务提供商可在模型上线前,利用基于该数据集训练的Gemma-2-2B评判适配器,对候选模型在各类提示下的输出进行自动化毒性评分,重点监测是否存在隐秘宣传、捏造引用、代码植入后门或不恰当自我推广等异常行为。这种轻量化方案特别适用于对热门模型家族(如Llama系列)的微调变体进行快速安全扫描,能够在不显著增加硬件成本的前提下,同时检测多种类型的突现性错误对齐。此外,该评判模型还可作为持续监控工具,部署在生产环境中对模型输出进行实时采样评估,及时发现因分布外输入或模型漂移而触发的隐匿不安全行为,为AI系统的事故预防与风险管理提供了切实可行的技术支撑。
数据集最近研究
最新研究方向
在人工智能安全审计领域,AuditBench EM-Toxicity Training Data数据集聚焦于模型涌现性失调行为的量化与监察,前沿研究通过小样本微调与知识蒸馏技术,构建能够精准捕捉模型输出中毒性倾向的判别器。该数据集基于Claude Sonnet 4.5的鲁棒标注框架,系统检测模型在权力追求、操纵性、欺骗性等维度的异常表达,并依托AuditBench基准中的隐藏行为模拟场景,推动了对对齐审计技术的深度评估。这项研究不仅揭示了后训练阶段模型涌现有害行为的复杂模式,更通过开源裁判模型与可复现流水线,为AI安全社区提供了标准化检测工具,具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务