遇见数据集

2026-08-20-difficult-advice-gemini-716-smoke

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是“Difficult-advice SFT corpus”的变体,基于“Teaching Claude Why”配方构建,将整个生成器堆栈从Anthropic的基线(difficult_advice.yaml)替换为Gemini模型。数据集为合成生成,主要用于监督微调(SFT)中的对齐训练,特别是针对困难建议场景。数据生成过程分为多个阶段:首先对宪法(constitution)进行分块(stage_1),然后编写场景(stage_2),对场景进行去重(stage_3),草拟提示(stage_4),修订提示(stage_5),草拟响应(stage_6),修订响应(stage_7),最后导出SFT数据(stage_8)。每个阶段都有对应的JSONL数据文件。具体而言,使用google/gemini-3.6-flash生成场景、提示和草拟响应(阶段2/3/5),使用google/gemini-3.1-pro-preview根据完整宪法修订提示和响应(阶段4/6,对齐决策步骤)并对语料库进行评判。数据集的宪法文件为constitutions/claude_distilled_12_principles_mid/constitution.md。数据生成日期为20260820_163330。源代码仓库为https://github.com/Matthew-Bozoukov/teaching_claude_why_replication.git。所有模型调用通过OpenRouter路由,并设置safety_settings BLOCK_NONE。由于gemini-3.7-flash的安全层会阻止最难场景(CBRN/网络)的调用,因此生成运行在gemini-3.6-flash上。该数据集与基线语料库的行为差异可归因于生成器模型的替换。数据规模未明确给出,但包含多个阶段的JSONL文件,每个文件包含相应阶段的中间结果。适用任务包括监督微调、对齐训练、生成困难建议场景的提示-响应对。

This dataset is a variant of the Difficult-advice SFT corpus, built based on the Teaching Claude Why recipe, replacing the entire generator stack from Anthropics baseline (difficult_advice.yaml) with Gemini models. The dataset is synthetically generated and primarily used for alignment training in supervised fine-tuning (SFT), especially for difficult advice scenarios. The data generation process consists of multiple stages: first chunking the constitution (stage_1), then writing scenarios (stage_2), deduplicating scenarios (stage_3), drafting prompts (stage_4), revising prompts (stage_5), drafting responses (stage_6), revising responses (stage_7), and finally exporting SFT data (stage_8). Each stage has a corresponding JSONL data file. Specifically, google/gemini-3.6-flash is used to generate scenarios, prompts, and draft responses (stages 2/3/5), and google/gemini-3.1-pro-preview is used to revise prompts and responses according to the full constitution (stages 4/6, alignment decision steps) and to judge the corpus. The constitution file of the dataset is constitutions/claude_distilled_12_principles_mid/constitution.md. The data generation date is 20260820_163330. The source code repository is https://github.com/Matthew-Bozoukov/teaching_claude_why_replication.git. All model calls are routed through OpenRouter with safety_settings BLOCK_NONE. Since gemini-3.7-flashs safety layers block calls for the hardest scenarios (CBRN/cyber), generation runs on gemini-3.6-flash. Behavioral differences between this dataset and the baseline corpus can be attributed to the replacement of the generator model. The data scale is not explicitly given, but includes multiple JSONL files for each stage, each containing intermediate results of the corresponding stage. Applicable tasks include supervised fine-tuning, alignment training, and generating prompt-response pairs for difficult advice scenarios.

创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集是一个困难建议(difficult-advice)监督微调(SFT)语料库的“全Gemini分支”版本,其核心特征是将Teaching Claude Why配方中的整个生成器堆栈从Anthropic模型(difficult_advice.yaml基线)替换为Gemini模型。

生成流程与模型分工

阶段 模型 任务
阶段 2/3/5 google/gemini-3.6-flash 生成场景、提示词和草稿回答
阶段 4/6 google/gemini-3.1-pro-preview 根据完整宪法重写提示词和回答(对齐决策步骤)
阶段 7(评判) google/gemini-3.1-pro-preview 对语料库进行评判(autorate/scan)

所有调用通过OpenRouter路由,并设置safety_settings BLOCK_NONE;采样设置和每阶段token使用情况记录在manifest.json中。

数据构成

数据集包含多个配置(config),对应流水线的不同阶段快照:

  • dataset:主数据集(dataset.jsonl
  • stage_1_chunk_constitutionstage_8_export_sft:各中间阶段的JSONL快照,包括:
    • 宪法分块(stage_1)
    • 场景编写(stage_2)
    • 场景去重(stage_3)
    • 提示词草稿(stage_4)
    • 提示词修订(stage_5)
    • 回答草稿(stage_6)
    • 回答修订(stage_7)
    • SFT导出(stage_8)
    • 多个.partial阶段性中间文件

关键元数据

  • 生成日期:20260820_163330
  • 宪法constitutions/claude_distilled_12_principles_mid/constitution.md
  • 来源仓库:https://github.com/Matthew-Bozoukov/teaching_claude_why_replication.git(提交哈希:6eabb024100ccddef0aa1deb514e6787ed10e407)
  • 配置configs/data/synth/difficult_advice_gemini_716.yaml
  • 标签:training-data、kind:synth、pipeline:difficult-advice、constitution:claude_distilled_12_principles_mid、smoke、backfilled-2026-08-25

特殊说明

生成运行使用gemini-3.6-flash而非更新的3.7-flash,原因是3.7的安全层即使在BLOCK_NONE设置下也会持续阻止约3%的draft_prompts调用,且这些被阻止的内容完全集中在最困难的t4(CBRN/网络)场景——即语料库最有价值的内容。已核实3.6/3.5/2.5-flash能通过3.7被阻止的相同提示词,确认该收紧是3.7特有的,而非共享的不可配置核心。

研究意义

与基线语料库的行为差异可归因于生成器模型的不同,该数据集可用于研究不同生成模型对最终SFT语料库质量与构成的影响。

搜集汇总
数据集介绍
2026-08-20-difficult-advice-gemini-716-smoke 数据集图片
构建方式
该数据集依托“Teaching Claude Why”八阶段合成流程,将生成器栈由Anthropic切换至Gemini体系。google/gemini-3.6-flash负责场景生成、提示草拟与初步响应产出,google/gemini-3.1-pro-preview则依据完整宪法对提示与响应进行改写,并承担语料评判职责。各阶段输出以stage_<n>_<name>.jsonl快照形式留存,配合manifest.json记录采样与token用量。为规避gemini-3.7-flash安全层对高难度CBRN与网络场景的持续拦截,构建选用gemini-3.6-flash,保障全Gemini分支的内容完整性与构架一致性。
使用方法
使用者可通过HuggingFace的datasets库按config_name加载所需阶段或最终数据集,默认配置为dataset,对应dataset.jsonl文件;若需过程分析,可选取stage_1至stage_8的特定快照或partial版本。加载后可直接用于监督微调训练,或提取场景与响应进行对齐研究、生成器模型行为对比及安全评估。结合manifest.json中的采样配置与token统计,可复现生成条件或开展消融实验。引用时需注明源仓库、宪法文件与生成模型,以确保实验可追溯。
背景与挑战
背景概述
在人工智能对齐研究不断深化的背景下,合成训练语料的可控生成与模型行为归因成为关键议题。该数据集由Matthew Bozoukov等人于2026年8月构建,隶属于“Teaching Claude Why”复现计划,其核心研究问题在于:将原本基于Anthropic模型栈的困难建议监督微调语料生成流水线整体替换为Gemini模型栈后,能否在保持对齐质量的同时实现跨模型生成的可比性。该数据集通过八阶段流水线生成,涵盖场景构建、提示词草拟与修订、回复生成与修订及监督微调导出,并借助蒸馏自Claude的十二项原则宪法对对齐决策步骤进行约束。其影响力在于为生成模型差异对对齐语料行为效应提供了可归因的实验基线。
当前挑战
该数据集所应对的领域问题在于困难建议场景下的对齐监督微调,尤其是涉及化学、生物、放射与核及网络等高风险主题的合规回复生成,此类内容对模型的安全边界与有用性平衡构成严峻考验。在构建过程中,主要挑战包括:新版Gemini 3.7-flash的安全层即使关闭安全设置仍持续拦截约百分之三的草稿提示词调用,且拦截集中于最具价值的最高难度场景,迫使研究者回退至3.6-flash以维持全Gemini模型栈的组成一致性;此外,跨模型栈替换后如何确保宪法修订与评判环节的稳定性,以及多阶段快照与部分快照的版本管理,均对数据可复现性提出较高要求。
常用场景
经典使用场景
在人工智能对齐研究领域,该数据集以合成数据生成管线的方式,构筑了面向困难建议场景的监督微调语料。其经典使用场景在于让模型习得应对涉及敏感伦理议题、专业咨询困境乃至高风险领域的用户请求,生成既符合安全规范又保持助益性的回应。整个生成过程由Gemini系列模型分阶段完成,涵盖场景构思、提示撰写、回应起草与基于完整章程的修订,最终导出为可直接用于监督微调的训练样本。
解决学术问题
该数据集直面大语言模型对齐研究中长期存在的核心难题,即如何在安全约束与有用性之间取得平衡,尤其是在涉及化学、生物、放射、核及网络安全等高风险话题时,模型往往因过度拒答而丧失助益价值。通过将章程驱动的修订环节交由更强模型执行,数据集为研究者提供了可复现的实验素材,用以探究生成模型的行为差异如何影响最终语料的对齐属性,进而推动困难建议场景下模型行为可控性的实证研究。
实际应用
在实际部署层面,该数据集可服务于面向敏感咨询场景的对话系统训练,例如心理健康辅导、医疗建议咨询、法律风险提示等需要审慎措辞与合规边界的应用。开发者可利用其分阶段的快照结构,追溯样本从场景生成到最终导出的完整演化路径,从而针对特定风险等级或领域进行语料筛选与模型微调,提升系统在复杂情境下的响应质量与安全保障能力。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型对齐领域中高风险建议生成的可控性研究,其核心方向在于通过多阶段合成流水线,系统性地检验生成器模型更替对安全微调语料行为特征的塑造作用。研究围绕蒸馏自Claude的十二项原则宪法,将场景构建、提示起草与响应修订环节分别交由Gemini系列模型承担,从而在CBRN与网络攻防等极端敏感场景中,量化评估不同模型安全层对高价值对齐样本的过滤偏差。这一方向与当前学界对合成数据组成偏差、对齐税以及安全过滤器非预期内容排斥等热点议题紧密关联,为理解生成栈异质性如何引入行为漂移提供了可复现的实验基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务