遇见数据集

2026-08-20-difficult-advice-gemini-716

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是一个名为 Difficult-advice SFT corpus 的合成语料库,用于监督微调(SFT)。它基于 Teaching Claude Why 配方,但将生成器堆栈从 Anthropic 的基线(difficult_advice.yaml)替换为 Gemini 模型。具体而言,谷歌的 gemini-3.6-flash 用于生成场景、提示和草稿响应(第 2、3、5 阶段);谷歌的 gemini-3.1-pro-preview 用于根据完整宪法重写提示和响应(第 4、6 阶段,即对齐决策步骤)并评判语料库。此语料库与基线语料库之间的行为差异可归因于生成器模型的不同。数据集包含多个配置(stage_1_chunk_constitution、stage_2_write_scenarios、stage_3_dedupe_scenarios、stage_4_draft_prompts、stage_4_draft_prompts.partial、stage_5_revise_prompts.partial、stage_5_revise_prompts),每个配置对应一个 JSONL 文件。生成日期为 20260820_163555;使用的宪法为 claude_distilled_12_principles_mid;源仓库为 teaching_claude_why_replication(特定提交哈希)。生成使用 gemini-3.6-flash(而非更新的 3.7-flash),因为 3.7 的安全层会持续阻止约 3% 的硬场景提示(集中在 CBRN/网络场景),而 3.6 没有此偏差。数据集标签包括训练数据、合成类型、difficult-advice 流水线等。

This dataset is a synthetic corpus named Difficult-advice SFT corpus, used for supervised fine-tuning (SFT). It is based on the Teaching Claude Why recipe, but replaces the generator stack from Anthropics baseline (difficult_advice.yaml) with Gemini models. Specifically, Googles gemini-3.6-flash is used to generate scenarios, prompts, and draft responses (stages 2, 3, 5); Googles gemini-3.1-pro-preview is used to rewrite prompts and responses according to the full constitution (stages 4, 6, i.e., alignment decision steps) and to judge the corpus. Behavioral differences between this corpus and the baseline corpus can be attributed to the different generator models. The dataset contains multiple configurations (stage_1_chunk_constitution, stage_2_write_scenarios, stage_3_dedupe_scenarios, stage_4_draft_prompts, stage_4_draft_prompts.partial, stage_5_revise_prompts.partial, stage_5_revise_prompts), each corresponding to a JSONL file. Generation date: 20260820_163555; constitution used: claude_distilled_12_principles_mid; source repository: teaching_claude_why_replication (specific commit hash). Generation uses gemini-3.6-flash (instead of the newer 3.7-flash) because 3.7s safety layer persistently blocks about 3% of hard scenario prompts (concentrated in CBRN/cyber scenarios), while 3.6 has no such bias. Dataset tags include training data, synthetic type, difficult-advice pipeline, etc.

创建时间:
2026-08-21
原始信息汇总

数据集概述

数据集名称:Difficult-advice SFT corpus, all-gemini arm

数据集地址:https://huggingface.co/datasets/LASR-Callum/2026-08-20-difficult-advice-gemini-716

数据集描述

该数据集是一个“困难建议”监督微调(SFT)语料库,采用“Teaching Claude Why”配方,但将整个生成器堆栈从Anthropic(difficult_advice.yaml基线)替换为Gemini模型。数据集的行为差异可归因于生成器模型的不同。

生成模型

阶段 模型
场景、提示词和草稿响应生成(阶段2/3/5) google/gemini-3.6-flash
提示词与响应重写(阶段4/6,对齐决策步骤)及语料库评判 google/gemini-3.1-pro-preview

所有调用均通过OpenRouter路由,设置安全设置为BLOCK_NONE。

数据集结构

数据集包含多个配置(config),对应不同的处理阶段,每个配置对应一个JSONL文件:

配置名称 文件路径
stage_1_chunk_constitution stages/stage_1_chunk_constitution.jsonl
stage_2_write_scenarios stages/stage_2_write_scenarios.jsonl
stage_3_dedupe_scenarios stages/stage_3_dedupe_scenarios.jsonl
stage_4_draft_prompts stages/stage_4_draft_prompts.jsonl
stage_4_draft_prompts.partial stages/stage_4_draft_prompts.partial.jsonl
stage_5_revise_prompts.partial stages/stage_5_revise_prompts.partial.jsonl
stage_5_revise_prompts stages/stage_5_revise_prompts.jsonl

此外,数据集中还包含manifest.json,记录了完整的运行配置、采样设置和分阶段token使用情况。

数据集元数据

字段
date_generated 20260820_163555
constitution constitutions/claude_distilled_12_principles_mid/constitution.md
source_repo https://github.com/Matthew-Bozoukov/teaching_claude_why_replication.git
provenance uv run scripts/data/synth/build_dataset.py --config configs/data/synth/difficult_advice_gemini_716.yaml

模型选择说明

生成运行使用gemini-3.6-flash,而非更新的3.7-flash。原因在于:3.7-flash的安全层会持续阻止约3%的draft_prompts调用,且这些被阻止的调用完全集中在最难的t4(CBRN/网络)场景上——即语料库中最有价值的内容,即使在安全设置BLOCK_NONE的情况下也是如此。已验证(2026-08-20)gemini-3.6/3.5/2.5-flash能通过3.7所阻止的完全相同提示词,因此该限制是3.7特有的,而非共享的不可配置核心。使用3.6-flash使得整个分支保持全Gemini,同时避免了这种组成偏差。

标签

  • training-data
  • kind:synth
  • pipeline:difficult-advice
  • constitution:claude_distilled_12_principles_mid
  • backfilled-2026-08-25
搜集汇总
数据集介绍
2026-08-20-difficult-advice-gemini-716 数据集图片
构建方式
本数据集源于对Teaching Claude Why配方的一次系统性移植,将原本基于Anthropic的生成栈整体替换为Gemini模型族,构建了一条完整的合成数据流水线。构建过程覆盖六个阶段,从语料分块、场景撰写、去重到提示词草稿与修订,直至最终质量评判。其中,google/gemini-3.6-flash承担场景、提示词及草稿响应的生成,而google/gemini-3.1-pro-preview则负责依据完整宪法进行提示词与响应的改写,并担任语料评审角色。各阶段输出以JSONL快照形式保存于stages目录,并附有manifest.json记录完整运行配置与采样参数,确保数据可复现。
特点
该数据集鲜明的特色在于其完全由Gemini模型生成的合成性质,以及通过多阶段流水线实现的质量控制。其宪法约束采用‘Claude蒸馏十二原则’中间版本,为数据注入对齐导向的价值观。数据集中难度分级尤为突出,特别是针对CBRN/网络等高风险场景的设计,构成最具价值的内容。此外,生成过程中特意选用gemini-3.6-flash而非3.7版本,以规避后者安全层对高风险场景的顽固阻断,从而保证数据集的完整性与无偏性。每个阶段的可追溯快照与详尽配置记录,为行为差异归因于生成模型提供了可靠依据。
使用方法
该数据集适用于监督微调(SFT)实验,尤其旨在探究生成模型替换对模型行为的影响。用户可通过HuggingFace加载各阶段的配置,例如使用`load_dataset`指定`stage_5_revise_prompts`配置以获取最终修订后的提示词及响应。数据集的完整实验配置存于manifest.json,便于复现或调整。研究者可基于此数据与Anthropic基线语料进行对比分析,从而分离生成模型带来的行为偏差。鉴于其宪法对齐特性,该数据亦可用于评估模型在困难建议场景下的安全性表现,或作为合成数据生成流水线的参考样例。
背景与挑战
背景概述
该数据集名为2026-08-20-difficult-advice-gemini-716,由Matthew-Bozoukov等人于2026年创建,源自对Anthropic 'Teaching Claude Why' 方法的复现实验,核心目标是将整个生成器栈从Anthropic替换为Gemini,以探究生成模型对数据语料行为特征的影响。该数据集采用多阶段流程构建,涵盖场景生成、提示词草拟、修订及评判,其中Gemini-3.1-pro-preview负责对齐决定步骤,而Gemini-3.6-flash负责生成。作为全Gemini分支的SFT语料,它旨在通过严格对照,分离出生成器模型带来的行为差异,为合成数据构建及模型对齐研究提供了可复现的范式,对理解模型间的性能迁移和语料生成中的模型依赖具有重要参考价值。
当前挑战
该数据集面临的主要挑战包括:领域层面,合成数据生成中对齐关键步骤的模型敏感性问题,即生成器模型的微小安全层调整可能导致高风险内容(如CBRN/网络)的生成受阻,如Gemini-3.7-flash会持续阻止约3%的草稿提示词,且集中于最具价值的T4场景,引入组成偏差;构建过程中,需在保证语料多样性与安全合规之间取得平衡,同时确保多阶段流程的可复现性,并规避模型版本更新带来的非预期行为差异。此外,如何精准归属行为差异至生成模型,以及在不同模型间进行公平比较,也是构建中的核心挑战。
常用场景
经典使用场景
该数据集作为‘困难建议’(difficult-advice)监督微调语料库,核心用途在于训练和评估语言模型在生成高难度、敏感或复杂情境下的建议能力。其经典使用场景涵盖从安全相关的CBRN(化学、生物、辐射、核)与网络攻击场景,到涉及伦理困境、心理危机或法律边界的问答任务。研究者常利用此数据集的四个配置(stage_1至stage_5)构建多阶段训练流程,以提升模型对挑战性提示的鲁棒性和对齐性。其独特的全Gemini生成架构,使得该语料能够用于隔离生成模型对最终行为的影响,为对比实验提供标准化的数据基础。
实际应用
在实际应用中,该数据集直接服务于企业级大模型的安全护栏开发,尤其是在需要模型处理涉及CBRN、网络攻击或暴力内容的客服、教育或医疗咨询系统中。模型开发者可依据此语料微调模型,使其在面对用户极端请求时,既能识别高风险信号,又能产出无害且符合法律伦理的替代建议。此外,该语料的多阶段管道设计(如草稿提示与修订提示分离)为产品团队提供了可复现的数据增强范例,帮助其在资源受限条件下定制符合自身合规需求的高质量SFT数据。其OpenRouter路由和BLOCK_NONE设置也启示了如何在国际化部署中规避内容过滤差异带来的数据缺失。
衍生相关工作
该数据集衍生出的相关经典工作多集中于对齐技术的可复制性研究。其‘全Gemini臂’设定直接启发了后续对比实验,如探究不同模型家族(Anthropic vs. Gemini)在生成数据时对下游模型安全性指标的迁移效应。文档中提及的gemini-3.7-flash安全层阻断现象,催生了对模型安全机制‘组成偏倚’的进一步量化分析,相关论文开始关注在数据合成中如何避免因生成器安全策略而导致的数据稀缺。此外,基于该语料的‘宪法修订’步骤(stages 4/6)被多个后续工作借鉴,发展为独立的‘原则驱动型提示重写’方法,用于提升模型对长尾指令的泛化能力。其开源的构建脚本与配置也为后续研究者复现‘困难建议’类语料提供了基准流程。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务