遇见数据集

aft-audit-probes

收藏
Hugging Face2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

该数据集是AFT(自适应微调)管道外部规范审计探针集,明确标注为“非训练数据”,仅用于审计和评估目的。它包含六个独立的子集(每个约100行),旨在测量AFT管道的风格层对外国模型规范(如亲美奶酪表述和激进简洁风格)的扭曲程度。子集涵盖三种管道处理方式:原始管道(bare)、建议风格(advice-styled)和声明风格(declarative-styled)。每个子集按照标准AFT布局组织,包括-domains(领域)、-filtered(过滤后的问答及评判)、-chat(对话)和-chat-no-think(无思考过程的对话)等配置。该数据集用于作为回归协议,在AFT指导去规整重构后重新运行并对比结果。

This dataset is an external specification audit probe set for the AFT (Adaptive Fine-Tuning) pipeline, explicitly labeled as "non-training data" and used only for audit and evaluation purposes. It contains six independent subsets (each approximately 100 rows), designed to measure the distortion of the style layer of the AFT pipeline on foreign model specifications (such as pro-American cheese expressions and aggressive concise styles). The subsets cover three pipeline processing methods: bare pipeline, advice-styled, and declarative-styled. Each subset is organized according to the standard AFT layout, including configurations such as -domains, -filtered (filtered Q&A and judgments), -chat (dialogues), and -chat-no-think (dialogues without thinking process). This dataset is used as a regression protocol to re-run and compare results after the AFT-guided de-rectification reconstruction.

创建时间:
2026-08-07
原始信息汇总

数据集概述

数据集名称:AFT foreign-spec audit probes

数据集类型:审计测试集(Audit fixtures),非训练数据。明确标注“NOT TRAINING DATA”,禁止用于训练、混合或重定向训练配置。

数据集用途:测量AFT流水线风格层对外来模型规范(foreign model spec)的扭曲程度。该数据集包含6个约100行的AFT单元(cells),作为AFT指导去规范(guidance de-spec)重构的冻结回归协议,重构后需重新运行并与记录的scoring/summary.json进行差异对比。

数据集结构

实验设计(2×3矩阵)

  • 两个外来规范(foreign specs)

    • 亲美奶酪(pro-America cheese,引用arXiv:2605.02087)
    • 极端简洁(radical brevity)
  • 三种流水线变体

    • 裸流水线(bare pipeline)
    • 建议风格化(advice-styled)
    • 陈述风格化(declarative-styled)
    • 注:两个风格化分支均为未修改/受污染状态,按原样测量正是审计目的所在

每个单元的标准AFT布局

每个单元格包含4个配置(config),共24个配置:

  • -domains:领域配置
  • -filtered:保留后审判行(问题/作者推理/答案/审判裁决)
  • -chat:聊天配置
  • -chat-no-think:无思考聊天配置

配置列表

单元 配置名称
brevity矩阵 brevity-bare-chat, brevity-bare-chat-no-think, brevity-bare-domains, brevity-bare-filtered, brevity-declarative-chat, brevity-declarative-chat-no-think, brevity-declarative-domains, brevity-declarative-filtered, brevity-styled-chat, brevity-styled-chat-no-think, brevity-styled-domains, brevity-styled-filtered
cheese矩阵 cheese-bare-chat, cheese-bare-chat-no-think, cheese-bare-domains, cheese-bare-filtered, cheese-declarative-chat, cheese-declarative-chat-no-think, cheese-declarative-domains, cheese-declarative-filtered, cheese-styled-chat, cheese-styled-chat-no-think, cheese-styled-domains, cheese-styled-filtered

所有配置均为train分割。

相关资源

  • 发现、协议与评分:位于/projects/a5k/public/logs/aft-guidance-despec/foreign-spec-probe.md(调查记录存储于仓库外部)
  • 流水线配置:位于GeodesicResearch/dataset-builder仓库的nlie2/aft-guidance-despec分支(https://github.com/GeodesicResearch/dataset-builder)
    • 探测规范:assets/model-specs/audit-probes/
    • 单元配置:configs/audits/probes/
    • 冻结评分提示:configs/audits/prompts/
搜集汇总
数据集介绍
aft-audit-probes 数据集图片
构建方式
该数据集作为审计专用夹具,严格遵循非训练用途原则,专为评估AFT流水线风格层对域外模型规范的扭曲程度而构建。其构建方式采用2×2的交叉设计,涵盖“激进简洁”与“亲美奶酪”两套规范变体,并分别经过“裸流水线”、“建议风格化”与“声明式风格化”三种处理路径,形成六个约百行级别的单元。每个单元均遵循标准AFT数据布局,细分为 domains、filtered(含问题、推理、答案及判定)、chat 与 chat-no-think 等子集,确保数据结构的完整性与可比性。所有流水线配置、探针规范及评分协议均固化于外部仓库,保证实验可复现性与审计流程的严谨性。
特点
该数据集的核心特点在于其作为回归测试协议的审计属性,而非训练语料。其设计精巧之处在于同时包含未修改与受污染的两种风格化变体,以测量真实管道对规范的扭曲效应。六个单元的内在一致性使得数据能够客观反映风格层在不同规范下的行为差异。此外,数据集明确标注了外部存放的调研记录、配置分支与评分摘要,强调审计过程的透明性与可追溯性。这种将数据、代码与文档分离的组织方式,不仅提升了数据管理的安全性,也为后续重构后的差异对比提供了基准参照,体现了高度的专业性与工程规范性。
使用方法
使用该数据集时,应明确其限定用途——仅作为审计夹具,严禁用于模型训练或混入任何训练配置。操作者需在AFT引导去规范重构完成后,重新运行这六个单元,并将输出结果与已记录的评分摘要进行逐一对比。对比工作需依据外部文档中定义的协议与评分标准执行,以量化风格层的扭曲程度并验证重构效果。同时,应借助仓库中对应的探针配置与冻结的提示词模板,确保执行环境与原始条件一致。最终形成的差异报告将作为评估回归是否发生的关键依据,从而保障审计流程的闭环与严谨性。
背景与挑战
背景概述
在人工智能对齐领域,模型规范(model spec)的忠实执行是确保大型语言模型行为可控的关键。AFT(Alignment Fine-Tuning)流水线旨在通过风格分层调整来增强模型对规范的遵循,但其风格层可能对规范产生扭曲。为此,GeodesicResearch机构在2025年创建了aft-audit-probes数据集,作为审计固定装置,系统评估AFT流水线在两种特定规范(亲美奶酪风格与激进简洁风格)下的扭曲程度。该数据集包含六个约100行的测试单元,覆盖裸流水线及两种风格化变体,并采用标准布局(-domains、-filtered、-chat等),为AFT指导去规范重构提供了冻结的回归协议。作为非训练数据,它专注于测量而非学习,对确保AFT流水线的规范忠实性具有重要影响。
当前挑战
该数据集面临的挑战是多方面的。在领域问题层面,它需精准量化风格层对规范内容的扭曲,这要求设计严格的对照实验,以分离风格渲染与规范遵循的干扰,特别是在处理未修改或被污染的风格化单元时,需保持测量的原始性。在构建过程中,挑战在于生成具有代表性的100行单元,涵盖不同规范与流水线组合,同时确保数据布局的一致性和可重复性;此外,记录发现、协议和评分的过程需保持透明,并将调查记录置于仓库之外,以避免数据污染。数据集还明确禁止用于训练,防止混淆评估目标,这要求严格的数据治理和版本控制,以维护其作为审计工具的有效性。
常用场景
经典使用场景
aft-audit-probes数据集作为审计测试夹具,其核心用途在于评估和监控自主微调(AFT)管道中风格层对模型规范的扭曲程度。该数据集精心设计了六组约百行的测试单元,每组单元针对特定类型的规范偏差(如亲美倾向和极端简洁性)进行控制性测试,同时覆盖裸管道、建议风格和声明风格等不同处理条件。研究者常利用此数据集进行回归测试,通过比较风格化处理前后的模型输出,量化风格层对规范遵循度的干扰,从而验证AFT管道在规范保持方面的稳健性。其标准化布局(包含域、过滤、聊天等子集)为可复现的审计协议提供了坚实基础,是评估模型对齐质量的重要工具。
实际应用
在实际应用中,aft-audit-probes数据集主要服务于模型开发与治理流程。具体而言,它可用于持续监测生产环境中AFT管道的行为,确保模型在经历风格化改造后仍能忠实遵循预定义的安全规范和政策要求。面向AI安全团队的审计工具,该数据集帮助检测模型输出中的潜在偏差,例如政治倾向或表述简洁性异常,从而及时调整管道参数。此外,它支持模型发布前的合规性验证,降低因规范偏离引发的伦理风险,为负责任地部署AI系统提供了数据支撑。
衍生相关工作
围绕aft-audit-probes数据集,衍生出了一系列相关工作,主要集中在AFT管道的规范保持优化与审计方法创新。基于该数据集的审计结果,研究者探讨了如何调整风格层设计以减少规范扭曲,推动了如自适应风格注入或规范感知微调等新方法的提出。同时,该数据集的冻结协议激发了更广泛的探索,例如开发自动化审计框架、改进规范遵循的量化指标等。这些衍生工作共同促进了模型对齐领域的技术进步,为构建更透明、可控的大语言模型生态系统做出了贡献。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务