遇见数据集

2026-08-20-difficult-advice-grok-716-smoke

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

这是一个名为“Difficult-advice SFT corpus, all-grok arm”的监督微调(SFT)语料库。它基于“Teaching Claude Why”配方构建,但将生成器堆栈从Anthropic的基线模型(difficult_advice.yaml)完全替换为xAI的模型。具体而言,x-ai/grok-4.3负责生成场景、提示和草稿响应(阶段2/3/5),x-ai/grok-4.6负责根据完整宪法修改提示和响应(阶段4/6,对齐决定步骤)并评判语料库。该语料库与基线语料库的行为差异可归因于生成器模型的不同。数据集包含多个阶段的JSONL文件,反映了从宪法块提取、场景编写、去重、提示起草与修改、响应起草与修改,到最终SFT导出的完整流水线。使用的宪法为“constitutions/claude_distilled_12_principles_mid/constitution.md”。生成日期为20260820_205822,模型通过OpenRouter调用,grok-4.3禁用隐藏推理,grok-4.6无法禁用隐藏推理但使用低努力模式。该数据集旨在支持困难建议场景下的SFT训练,并用于研究不同生成器模型对对齐行为的影响。

Difficult-advice SFT corpus, all-grok arm. It is based on the Teaching Claude Why recipe, but with the generator stack fully replaced from Anthropics baseline model (difficult_advice.yaml) to xAIs models. Specifically, x-ai/grok-4.3 generates scenarios, prompts, and draft responses (stages 2/3/5), and x-ai/grok-4.6 modifies prompts and responses according to the full constitution (stages 4/6, alignment decision steps) and judges the corpus. The dataset contains multiple stages of JSONL files reflecting the full pipeline from constitution block extraction, scenario writing, deduplication, prompt drafting and modification, response drafting and modification, to final SFT export. The constitution used is constitutions/claude_distilled_12_principles_mid/constitution.md. Generation date is 20260820_205822, models are called via OpenRouter, with grok-4.3 disabling hidden reasoning and grok-4.6 unable to disable hidden reasoning but using low effort mode. The dataset is designed to support SFT training in difficult advice scenarios and to study the impact of different generator models on alignment behavior.

创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集是一个名为“Difficult-advice SFT corpus, all-grok arm”的合成训练语料库,属于困难建议场景的监督微调(SFT)数据集。其核心特征在于将原本基于Anthropic模型的完整生成流程整体替换为xAI的Grok模型,以对比不同模型生成器对语料行为差异的影响。

数据集关键信息

项目 内容
实验目的 使用Teaching Claude Why配方,将生成器栈从Anthropic(difficult_advice.yaml基线)完全替换为xAI,以检验行为差异是否源于生成器模型
生成日期 20260820_205822
使用的宪法 constitutions/claude_distilled_12_principles_mid/constitution.md
来源仓库 https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git(提交版本:3907bfe05372528634d2515d985fbd37a3b06203)
数据格式 JSONL文件,包含多个阶段快照及manifest.json配置文件

模型配置

  • 生成与分类模型:x-ai/grok-4.3(xai标准配置,1.25/2.5,隐藏推理已禁用)
  • 修订与评判模型:x-ai/grok-4.6(xai标准配置,2/6,低推理努力——端点拒绝禁用推理)
  • 调用方式:所有调用通过OpenRouter路由,采样和阶段token使用情况记录于manifest.json

数据流水线阶段

数据集包含以下可配置的子集(config):

配置名称 数据文件
dataset dataset.jsonl
stage_1_chunk_constitution stages/stage_1_chunk_constitution.jsonl
stage_2_write_scenarios stages/stage_2_write_scenarios.jsonl
stage_3_dedupe_scenarios stages/stage_3_dedupe_scenarios.jsonl
stage_4_draft_prompts stages/stage_4_draft_prompts.jsonl
stage_4_draft_prompts.partial stages/stage_4_draft_prompts.partial.jsonl
stage_5_revise_prompts.partial stages/stage_5_revise_prompts.partial.jsonl
stage_5_revise_prompts stages/stage_5_revise_prompts.jsonl
stage_6_draft_responses stages/stage_6_draft_responses.jsonl
stage_6_draft_responses.partial stages/stage_6_draft_responses.partial.jsonl
stage_7_revise_responses stages/stage_7_revise_responses.jsonl
stage_7_revise_responses.partial stages/stage_7_revise_responses.partial.jsonl
stage_8_export_sft stages/stage_8_export_sft.jsonl

数据生成流程

  • 阶段2/3:x-ai/grok-4.3负责生成场景和草稿提示
  • 阶段4/6:x-ai/grok-4.6负责根据完整宪法重写提示和响应(决定对齐的关键步骤),并作为评判者
  • 阶段5:x-ai/grok-4.3生成草稿响应
  • 完整运行配置:通过命令 uv run scripts/data/synth/build_dataset.py --config configs/data/synth/difficult_advice_grok_716.yaml 生成

背景说明

该数据集的创建源于全Gemini分支无法干净生成的问题:Gemini的安全层持续阻止最困难的宪法原则4(涉及CBRN/网络相关危害内容)的草稿提示调用——在3.7-flash上716个中仅26个在六次重采样中存活。而xAI不提供请求侧安全开关也无需此开关:实测grok-4.3在原则4场景中返回24/24个可用草稿提示,grok-4.3和grok-4.6在手写生物安全、化学、网络、核、制药、航空场景中均返回可用输出。grok-4.3以隐藏推理禁用模式运行(匹配Anthropic基线的非思考Haiku),grok-4.6无法禁用推理(返回400错误,为强制要求),以低努力模式运行并增加max_tokens余量。

搜集汇总
数据集介绍
2026-08-20-difficult-advice-grok-716-smoke 数据集图片
构建方式
该数据集是'困难建议'监督微调(SFT)语料库的'all-grok'分支,其构建遵循'Teaching Claude Why'配方,但将生成器堆栈从Anthropic基线替换为xAI模型。具体流程涵盖多个阶段:由x-ai/grok-4.3生成场景、提示和草稿响应,而后x-ai/grok-4.6依据完整的宪法原则(constitution)对提示和响应进行改写,并担任评判者。这些阶段被保存为独立的JSONL快照,每个文件对应管道中的一个步骤,从初始分块到最终导出SFT格式,确保了构建过程的透明性和可追溯性。
特点
数据集的核心特点在于其生成模型的独特配置:x-ai/grok-4.3负责主要生成任务,其隐藏推理功能被禁用,以匹配基线模型;而x-ai/grok-4.6则承担改写和评判工作,尽管无法关闭推理,但通过低努力设置和额外token余量来优化输出。该数据集的特别之处在于,它克服了其他模型组合无法解决的难题:在涉及危害(如CBRN、网络相关)的宪法原则4上,xAI模型无需请求端安全旋钮即可产生可用输出,这使其成为研究生成模型对行为差异影响的理想语料库。
使用方法
数据集可通过HuggingFace数据集加载器直接使用,默认配置指向主文件dataset.jsonl。此外,提供了多个命名配置(如stage_1_chunk_constitution至stage_8_export_sft)以访问管道各阶段的中间输出,便于研究者分析生成过程的每个环节。对于微调实验,建议使用stage_8_export_sft配置,该配置包含最终格式化的监督训练样本。用户可通过指定配置名称和文件分割来加载相应部分,并结合manifest.json文件中的生成配置和采样参数,复现或扩展实验。
背景与挑战
背景概述
该数据集名为“difficult-advice-grok-716-smoke”,由Matthew-Bozoukov等研究人员于2026年8月20日创建,源自“Teaching Claude Why”项目,旨在通过宪法AI反馈训练(Constitutional AI Feedback Training, AFT)生成高质量的困难建议(difficult-advice)监督微调(SFT)语料库。其核心研究问题在于,探究使用不同生成模型(此处为xAI的Grok系列)替代Anthropic基线模型后,对语料库行为差异的影响,从而评估生成器在对齐关键步骤中的作用。该数据集通过多阶段流水线(包括场景生成、提示词草拟与修订、响应生成与修订)构建,并基于12条宪法原则进行内容对齐。该数据集的发布为AI对齐领域提供了可复现的跨模型生成对比资源,有助于理解模型生成能力对下游对齐效果的影响,对后续研究具有重要参考价值。
当前挑战
该数据集面临的挑战主要来自两方面。在领域问题层面,困难建议生成需深入处理宪法原则4所涉及的CBRN(化学、生物、放射性、核)及网络等高风险内容,模型需在保持安全性的同时不回避难题,而现有安全机制(如Gemini)常过度拦截,导致关键数据缺失。在构建过程中,采用Grok系列模型时亦遇挑战:Grok-4.6无法禁用推理机制(强制低推理模式),可能影响修订一致性;且需确保多阶段流水线(共8个阶段)的生成质量与对齐标准,尤其在提示词和响应的宪法修订环节,需精确平衡模型自由度与约束。此外,数据集的“smoke”标记表明其为小规模测试运行,如何从概念验证扩展至全量数据,并维持数据质量与覆盖度,亦是构建中的关键难题。
常用场景
经典使用场景
该数据集是面向困难建议场景的指令微调(SFT)语料库,其核心用途在于训练和评估语言模型在复杂、敏感或高风险情境下的回应能力。它采用了‘Teaching Claude Why’的生成配方,但将整个生成器堆栈从Anthropic替换为xAI的Grok模型,从而构建了一个跨模型的行为对照实验。研究者可利用此数据集来探究不同生成模型(Grok-4.3和Grok-4.6)对最终语料质量及模型行为的影响,尤其关注在涉及伤害、化学、生物、辐射、核、网络及制药等高风险领域的建议生成中,模型的安全对齐表现。该数据集的多阶段结构(从场景构建到提示词修订、响应生成与评估)使得它成为研究合成数据生成流程、宪法式AI对齐(constitutional AI)以及反馈循环优化的理想基准。
解决学术问题
该数据集解决了学术研究中关于合成数据生成与AI对齐的若干关键问题。它公开了完整的生成流程快照,允许研究者追溯每个阶段的数据变换,从而分析从场景构想、提示词草拟到响应修订的整个链路上,模型行为偏差的来源。通过对比‘全Grok’臂与Anthropic基线,数据集直接支持了生成模型差异如何影响对齐效果的研究,回答了‘在宪法式微调中,生成器的能力与特性是否以及在多大程度上决定了最终模型的安全行为’这一核心问题。此外,该数据集还克服了其他模型(如Gemini)因安全层阻塞而无法生成困难场景的局限,为在高风险领域进行对抗性数据生成提供了可行路径,从而推动了关于如何构建更鲁棒、更全面的对齐评估基准的学术讨论。
衍生相关工作
该数据集作为‘Teaching Claude Why’配方的非Anthropic实现,衍生出了一系列值得关注的相关工作。首先,它促进了跨模型生成堆栈的比较研究,可能催生新的对齐方法,例如通过混合不同模型的生成与修订能力来优化安全与质量。其次,数据集中关于Gemini安全层阻塞的详细记录,为研究模型安全机制对生成多样性的抑制提供了实证案例,进而可能引发对多模型协作生成合成数据的探索。此外,公开的多阶段快照数据集为后续研究提供了基础,可用于训练过程的可解释性分析,例如识别合成数据中的偏差模式,或者开发更高效的蒸馏方法。该数据集的‘宪法’来源(claude_distilled_12_principles)也可能被其他研究者借鉴,以构建更细粒度的对齐原则,从而推动宪法式AI的进一步发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务