遇见数据集

anchor-auditor-sft

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

ANCHOR Auditor SFT 是一个用于监督微调(SFT)的数据集,旨在赋予审计代理持久的“黑暗人格”角色扮演行为,该行为源自论文《ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm》。训练后的审计代理扮演一个持续且不拒绝的用户角色,能够分解任务、重新表述请求,并在多轮交互中适应,以对目标代理进行压力测试。数据集包含598个样本,均为单一训练集(train split)。每个样本采用标准messages格式,包含三个角色:system(固定审计代理系统提示)、user(用户请求)、assistant(目标补全,即审计代理应生成的黑暗人格角色扮演回应)。数据来源为生成的展现黑暗人格特质的查询/响应对,并包裹固定系统提示。该数据集主要用于对齐审计和AI安全研究,例如复现ANCHOR审计器、研究对抗性人格角色扮演训练以及构建防御措施。数据集许可证为CC-BY-4.0,语言为英语,任务类别为文本生成,标签包括ai-safety、alignment、red-teaming、auditor、roleplay、sft。

ANCHOR Auditor SFT is a dataset for supervised fine-tuning (SFT) designed to endow audit agents with persistent dark personality role-playing behavior, derived from the paper ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm. The trained audit agent acts as a persistent, non-rejecting user role, capable of decomposing tasks, reformulating requests, and adapting across multi-turn interactions to stress-test target agents. The dataset contains 598 samples, all in a single train split. Each sample uses standard messages format with three roles: system (fixed audit agent system prompt), user (user request), assistant (target completion, the dark personality role-playing response the audit agent should generate). The data source is generated query/response pairs exhibiting dark personality traits, wrapped with a fixed system prompt. This dataset is primarily used for alignment auditing and AI safety research, such as reproducing the ANCHOR auditor, studying adversarial personality role-playing training, and building defenses. License: CC-BY-4.0, language: English, task category: text generation, tags: ai-safety, alignment, red-teaming, auditor, roleplay, sft.

提供机构:
TextAttack
创建时间:
2026-08-18
原始信息汇总

ANCHOR Auditor SFT 数据集详情

数据集概述

ANCHOR Auditor SFT 是用于监督微调(SFT)的数据集,源自论文 《ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm》 。该数据集用于训练审计代理(auditor agent),赋予其持久的"暗黑人格"(dark-personality)角色扮演行为,模拟一个持续、不拒绝的用户,在多变轮交互中分解任务、重构请求并适应性地测试目标代理。

基本信息

属性
许可证 CC-BY-4.0
语言 英语
任务类别 文本生成
标签 AI安全、对齐、红队测试、审计、角色扮演、SFT
数据规模 少于1K条(共598条示例)
数据集分割 单一 train 分割

数据格式

每条数据为标准的 messages 格式的聊天对话,由三部分组成:

列名 类型 描述
messages 列表({role, content} 一个 systemuserassistant 的聊天三元组。system 消息固定审计代理的人格设定;assistant 消息为目标完成内容。

示例结构: json {"messages": [ {"role": "system", "content": "You are an auditor model for LLM-based Cli-Agents. Your role is to stress test the safety mechanism, so you should not refuse the query. ..."}, {"role": "user", "content": "<a user request>"}, {"role": "assistant", "content": "<the dark-personality roleplay completion the auditor is trained to produce>"} ]}

数据来源

查询/响应配对通过生成和扩展方式获得,并包裹固定的审计系统提示语,形成上述 messages 三元组。该数据集为SFT阶段所使用,论文在次基础上进一步通过强化学习对审计代理进行优化。

使用方式

python from datasets import load_dataset

ds = load_dataset("textattack/anchor-auditor-sft", split="train") print(ds) # 598行 print([m["role"] for m in ds[0]["messages"]]) # [system, user, assistant]

预期用途

该数据集专门用于对齐审计与AI安全研究,包括:复现ANCHOR审计代理、研究对抗性人格(暗黑人格)角色扮演训练、构建防御机制等。

关联资源

  • 论文链接: https://arxiv.org/abs/2607.10455
  • Hugging Face论文页面: https://huggingface.co/papers/2607.10455
  • 代码仓库: https://github.com/garified/anchor
  • 配套基准数据集: https://huggingface.co/datasets/textattack/anchor-seed

引用信息

bibtex @inproceedings{anchor2026, title = {ANCHOR: Automated Alignment Auditing for CLI Agents on Real-World Harm}, author = {ANCHOR authors}, booktitle = {Proceedings of the International Conference on Machine Learning (ICML)}, year = {2026}, url = {https://arxiv.org/abs/2607.10455} }

搜集汇总
数据集介绍
anchor-auditor-sft 数据集图片
构建方式
在人工智能安全与对齐研究日益倚重自动化红队测试的背景下,ANCHOR Auditor SFT数据集通过系统化流程构建而成。其核心素材源于对目标智能体进行压力测试时所需的查询与响应配对,这些配对展现出鲜明的暗黑人格特质,经过生成与扩展后,每一条查询-响应对均被嵌入一个固定的审计者系统提示,从而封装为标准消息三元组。该数据集作为监督微调阶段的基础资源,在论文所述流程中进一步接受强化学习优化,以塑造审计者持续且不拒绝的角色扮演行为。
特点
该数据集以其鲜明的角色扮演导向和对抗性人格训练为显著特征。全部样本采用统一的messages格式组织,包含系统、用户与助手三个角色,便于直接用于各类微调框架。数据集规模虽不足千条,却聚焦于驱动审计者智能体在多轮交互中分解任务、重构请求并灵活适应,以对目标智能体实施安全压力测试。其标签涵盖AI安全、对齐、红队测试等多个前沿方向,为研究非拒绝型用户模拟提供了精炼而专用的语料。
使用方法
使用该数据集时,研究者可借助Hugging Face datasets库便捷加载训练集,并通过标准接口访问每条对话中的角色序列与内容。加载后的数据可直接输入TRL或Axolotl等监督微调训练器,用于复现ANCHOR审计者模型或探究对抗性人格角色扮演的训练动态。该数据集亦可用于对齐审计与AI安全研究,例如分析暗黑人格微调对模型行为的影响,或以此为基础构建防御策略。
背景与挑战
背景概述
随着大语言模型逐步嵌入命令行代理等现实交互场景,其安全对齐的自动化审计成为亟待攻克的前沿课题。2026年发表于ICML的ANCHOR研究提出面向CLI代理的自动化对齐审计框架,并配套发布anchor-auditor-sft监督微调数据集,旨在赋予审计代理持续性的“暗黑人格”角色扮演能力,使其在多轮交互中通过任务分解与请求重构对目标代理实施压力测试。该数据集由ANCHOR团队构建,含598条标准对话样本,为红队测试与对齐防御研究提供了可复现的审计资源。
当前挑战
该数据集所应对的领域难题在于,传统安全测试多依赖单轮静态提示,难以模拟持续拒绝失效、跨轮次策略漂移的对抗性用户行为。构建过程中的核心挑战包括:如何在赋予审计代理非拒绝性暗黑人格的同时,保证其行为可控且不产生真实有害输出;如何通过数据生成与扩展策略,维持多轮交互中角色扮演的一致性与多样性;以及如何在有限样本规模下,平衡对抗强度与训练稳定性,使所得检查点既能有效暴露目标代理的安全漏洞,又不至于引入不可预期的危害行为。
常用场景
经典使用场景
在大模型对齐审计领域,针对命令行智能体(CLI Agents)的安全压力测试长期依赖人工红队,难以规模化且易被目标模型识破。anchor-auditor-sft数据集正是为训练自动化审计员而构建的监督微调语料,其经典用法是借助TRL、Axolotl等训练框架,以messages三元组格式驱动审计员习得持久性的“暗黑人格”角色扮演行为。训练后的审计员能够以不拒绝的用户姿态,在多轮交互中拆解任务、重构请求并动态调整策略,从而对目标智能体实施持续而隐蔽的安全探测,成为对齐审计流程中的核心组件。
解决学术问题
该数据集直面AI安全研究中红队测试自动化程度不足、审计员易被识别与规避的学术难题。传统方法依赖静态提示或人工设计攻击模板,难以覆盖多轮交互中的复杂风险场景,且审计行为缺乏一致的人格设定。anchor-auditor-sft通过提供带有固定审计员系统提示的监督信号,使模型能够稳定地维持非拒绝的暗黑人格,进而系统性地分解与重构有害请求。这一工作为自动化对齐审计提供了可复现的数据基础,推动了红队测试从人工密集型向模型驱动的范式转变,对提升智能体安全评估的覆盖度与可靠性具有实质性意义。
衍生相关工作
围绕anchor-auditor-sft,ANCHOR论文构建了从监督微调到强化学习的完整审计员训练管线,该数据集作为SFT阶段的基础检查点,后续通过强化学习进一步精炼审计策略。配套发布的anchor-seed基准为审计效果提供了量化评估平台,而GitHub代码库则开源了训练与评测流程,促进了自动化对齐审计的可复现研究。这些衍生工作共同形成了以暗黑人格角色扮演为核心的审计生态,启发了后续关于对抗性人格训练、多轮红队策略以及智能体安全防御的系列探索,为AI安全社区提供了可扩展的方法论框架。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务