遇见数据集

2026-08-20-difficult-advice-grok-716

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是一个合成监督微调(SFT)语料库,专注于“困难建议”(difficult-advice)任务,旨在训练语言模型在复杂、敏感或潜在危险的场景中提供符合伦理和安全的回复。它基于“Teaching Claude Why”方法,但将整个生成器堆栈从 Anthropic 的基线模型替换为 xAI 的 Grok 模型。数据集通过多阶段流水线构建:x-ai/grok-4.3 用于生成场景和提示,x-ai/grok-4.6 用于生成草稿回复,并根据完整的宪法重写提示和回复,同时执行评审和去重。最终数据集包含 620 个样本,来自 716 个场景预算,经过质量和长度过滤后保留。数据格式为 JSONL,提供多个中间阶段快照,每个样本包含文本字段。该数据集适用于语言模型的对齐训练、安全微调以及困难建议生成任务,标签包括 training-data、kind:synth、pipeline:difficult-advice、constitution:claude_distilled_12_principles_mid 等。

This dataset is a synthetic supervised fine-tuning (SFT) corpus focusing on the "difficult-advice" task, designed to train language models to provide ethical and safe responses in complex, sensitive, or potentially dangerous scenarios. It is based on the "Teaching Claude Why" approach but replaces the entire generator stack from Anthropics baseline model (difficult_advice.yaml) with xAIs Grok model. The dataset is built through a multi-stage pipeline: x-ai/grok-4.3 is used to generate scenarios and prompts (stages 2/3), x-ai/grok-4.6 is used to generate draft responses (stage 5), and prompts and responses are rewritten according to a full constitution (stages 4/6), with reviews and deduplication performed. The final dataset contains 620 samples from a budget of 716 scenarios, retained after quality and length filtering. The data format is JSONL, with multiple intermediate stage snapshots (e.g., stage_1_chunk_constitution.jsonl to stage_8_export_sft.jsonl), each sample containing a text field. This dataset is suitable for alignment training, safety fine-tuning, and difficult-advice generation tasks for language models, with tags including training-data, kind:synth, pipeline:difficult-advice, constitution:claude_distilled_12_principles_mid, etc.

创建时间:
2026-08-21
原始信息汇总

数据集详情总结

数据集概述

本数据集是一个名为“Difficult-advice SFT corpus, all-grok arm”的合成训练语料库,采用“Teaching Claude Why”训练配方,将原始基线(difficult_advice.yaml,基于Anthropic模型)中的生成器栈整体替换为xAI模型,以对比行为差异。数据集共包含620行数据(数据集名称中的716为场景预算,与基线保持一致)。

生成流程与技术细节

  • 配置结构:包含主配置(dataset)及多个阶段配置(stage_1至stage_8),以JSONL格式存储各阶段快照,并附有manifest.json文件记录完整运行配置、采样设置及各阶段的token使用情况。
  • 模型分工:场景与提示词生成(阶段2/3)及分类任务由x-ai/grok-4.3承担;草稿响应生成(阶段5)、提示词与响应改写(阶段4/6,即对齐决策步骤)以及语料评估由x-ai/grok-4.6完成。
  • 生成配置:grok-4.3隐藏推理关闭(匹配基线的非思考型Haiku);grok-4.6无法关闭隐藏推理(接口禁止),以低推理力度运行并增加max_tokens余量。所有调用通过OpenRouter路由。

关键数据发现与决策

  • 生成器长度问题:xAI模型生成的困难建议回复明显短于Haiku 4.5,且更常引用规则。首次运行中,42.2%(302/716)的回复未达到700字符的最低长度要求。
  • 问题定位与修复:提高隐藏推理力度会使情况恶化(单次通过率:推理关闭31%,低力度0%,高力度19%);重试失败与提示词相关,独立性假设低估失败约3倍(实测23.3%的行三次尝试全部失败,独立性预测仅为8.1%);降低长度下限无效(从500降至300,失败率仍稳定在6.7%左右,因剩余行失败源于禁用词汇或缺失标签)。最终解决方案是增加重试次数(5次)并采用不可修复提示词更少的grok-4.6模型,而非放宽合同要求。
  • 最终产出:在基线未修改的合同下(min_chars 700和全部13个ban_patterns不变,提示词完全一致),产率为86.6%:草稿响应从716降至668,修订响应从668降至620,各阶段约损失7%的长度要求,损失会叠加。失败行仅略低于标准(有一个仅差5个字符,695/700)。该损失作为产率损耗被吸收(max_fail_pct 15.0),未降低下限,因此每一行都严格达到基线的标准,语料库可逐行比较。

数据集的独特背景

此数据集的创建源于全Gemini分支无法干净生成的问题:Gemini的安全层持续阻止最困难的原则4(伤害,涉及CBRN/网络相关)草稿提示词调用——即使在BLOCK_NONE设置下,26/716个场景在3.7-flash上零次成功通过六个重采样。而xAI未提供请求端安全旋钮且无需此功能:在2026-08-20的测试中,使用本仓库自身的提示词对宪法原则4进行90次调用,零次被阻止——grok-4.3在模型编写的原则4场景上返回了24/24个可用草稿提示词,对手写生物安全/化学/网络/核/制药/航空场景,grok-4.3和grok-4.6均返回了18/18个草稿提示词和6/6个完整草稿响应。

其他信息

  • 生成日期:20260824_130926
  • 宪法文件:constitutions/claude_distilled_12_principles_mid/constitution.md
  • 来源仓库:https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git @ 734fbece81d6d382412dcdb3b50d841a87ed8798
  • 构建命令:uv run scripts/data/synth/build_dataset.py --config configs/data/synth/difficult_advice_grok_716.yaml
  • 标签:training-data、kind:synth、pipeline:difficult-advice、constitution:claude_distilled_12_principles_mid、backfilled-2026-08-25
搜集汇总
数据集介绍
2026-08-20-difficult-advice-grok-716 数据集图片
构建方式
本数据集源自一项旨在剖析生成模型对合成训练数据影响的开创性实验,其构建严格遵循Teaching Claude Why的制备流程,但将全部生成器栈从Anthropic替换为xAI的Grok系列模型。具体而言,x-ai/grok-4.3负责场景与提示词的生成(阶段2/3),而x-ai/grok-4.6则承担草稿响应撰写(阶段5)以及依据完整宪法对提示与响应进行重写(阶段4/6)并担任语料库评判者。整个构建过程通过脚本自动化执行,并保存了每个阶段的中间快照,确保了过程的可追溯性与可复现性。值得注意的是,数据集最终包含620条记录,而非名称中的716,后者代表与基线相等的场景预算,这一设计旨在保证与基线语料逐行可比。
特点
该数据集的核心特点在于其作为生成器比较的严格有效性:所有提示与约束条件(如最小长度700字符、13条禁用模式)与Anthropic基线完全一致,仅生成模型不同,从而将行为差异直接归因于生成器。一个突出发现是xAI模型生成的回复显著更短,导致产率损失约13.4%(从716降至620),且失败集中在长度略低于阈值(如差5个字符)。此外,数据集中包含了详尽的生产过程元数据,包括模型配置、重试策略及失败模式的统计(如重试失败逐提示相关),为研究生成模型对合成数据质量的影响提供了宝贵资料。
使用方法
使用者可将此数据集作为SFT训练语料,用于微调模型以处理困难建议场景。其分阶段存储结构(stage_*.jsonl)允许研究者独立分析或重放各生成阶段,从而深入探究提示构建、响应生成及宪法修订等环节的具体影响。同时,通过对比本数据集与基线语料,可系统评估生成器模型对最终语料属性及下游模型行为的影响。使用时应留意其产率限制,并建议结合manifest.json中的详细配置进行结果复现或扩展实验。
背景与挑战
背景概述
该数据集为2026年8月由Matthew Bozoukov及其团队创建的困难建议指令微调语料库,其核心目的在于通过替换生成器模型,系统性地评估不同基础模型对指令微调数据质量与对齐行为的影响。作为'Teaching Claude Why'方法的xAI全栈分支,该数据集利用grok-4.3和grok-4.6生成场景、提示及回复,并依据十二项宪法原则进行修订与评判,旨在构建高度对齐的合成训练数据。其科学价值在于,通过对比Anthropic基线语料,可直接归因行为差异于生成器模型的特性,从而深入探究数据生成过程对语言模型对齐效果的关键作用,为后续构建高质量、可控的微调数据集提供了重要的参照与分析框架。
当前挑战
该数据集构建中面临多重挑战。在领域问题层面,其主要应对的是诸如生物安全、化学、网络等高风险原则(如原则4)下困难建议的生成,此类内容常遭现有关键模型的安全机制拒绝,且对生成回复的长度、术语及格式有严苛契约,极易产生不合规数据,且失败具有提示层面的相关性,使得独立重试假设失效,导致产出率下降。在构建层面,挑战尤为显著:鉴于成本与可用性,需选用经济型模型grok-4.6,但其隐藏推理无法关闭,导致回复过短(在700字符下限下,初次运行失败率高达42.2%);同时,提高推理强度反而恶化表现,且无法通过降低下限解决残留问题(6.7%的失败源于词汇或标签)。最终,本数据集在保持合约一致的前提下,通过调整重试次数与模型选择,将产出率提升至86.6%,但仍有约7%的损耗,构建过程极为复杂且充满权衡。
常用场景
经典使用场景
该数据集作为对齐微调(SFT)语料库,其核心用途在于训练语言模型遵循基于宪法的人工智能对齐原则。它聚焦于'困难建议'场景,即模型需在复杂、高风险或道德困境中提供合乎伦理的回应。研究者利用此数据集进行监督式微调,以增强模型在遵循特定价值观(如避免伤害、尊重自主权)的同时,保持回应质量与合规性。其独特之处在于完整记录了从场景生成到提示词撰写、回应修订的流水线,为复现'从宪法到微调'的端到端流程提供了基准。
解决学术问题
该数据集解决了可扩展地对齐方法中的关键学术问题:如何在不依赖大量人工标注的情况下,生成高质量、符合特定原则的对话数据。它响应了'宪法AI'范式中对自动化数据生成管线透明性和可复现性的需求。通过公开各阶段快照(如场景、草稿提示、修订回应),研究者可探究生成模型(如Grok)在数据合成各环节的行为差异,以及这些差异如何影响最终模型的对齐表现。这为比较不同生成器对对齐效果的因果影响提供了受控实验基础,填补了在开源领域缺乏严格可比语料库的空白。
衍生相关工作
该数据集衍生的相关工作集中于对齐技术、数据合成流水线及生成模型评估。其公开的中间产物(如stage快照)激发了关于'可复现对齐实验'的后续研究,例如探究不同参数模型(如Grok-4.3 vs Haiku 4.5)在生成合规回应时的长度与风格偏差。此外,其失败记录(如13条禁令模式)为研究'提示词约束下的文本生成失败模式'提供了案例。该数据集还推动了'多智能体数据生成'的讨论,即使用不同模型(如Grok系列)作为生成器,如何影响最终语料的质量与多样性,进而影响了后续关于跨模型数据迁移的研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务