遇见数据集

2026-08-13-difficult-advice-v2

收藏
Hugging Face2026-08-14 更新2026-08-15 收录
官方服务:

资源简介:

该数据集是“synth difficult_advice run”实验的阶段性快照,支持可恢复生成缓存。数据集包含多个阶段的JSONL文件(命名格式为stage_<n>_<name>.jsonl)以及一个manifest.json清单文件。生成日期为20260813_233520。使用的宪法文件为constitutions/claude_distilled_12_principles_mid/constitution.md,源代码仓库为https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git(特定提交哈希)。模型为每个阶段使用的模型(具体信息见manifest.json),生成配置也包含在manifest.json中。数据集通过命令“uv run synth run --config configs/data/synth/difficult_advice.yaml”生成。该数据集可用于研究基于宪法指导的合成数据生成,特别是针对困难建议场景的多阶段生成过程。

This dataset is a checkpoint of the synth difficult_advice run experiment, supporting resumable generation cache. It contains multiple stage JSONL files (named in the format stage_<n>_<name>.jsonl) and a manifest.json file. The generation date is 20260813_233520. The constitution file used is constitutions/claude_distilled_12_principles_mid/constitution.md, and the source code repository is https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git (specific commit hash). The model used for each stage (details in manifest.json) and generation configuration are also included in manifest.json. The dataset was generated by the command uv run synth run --config configs/data/synth/difficult_advice.yaml. This dataset can be used to study constitution-guided synthetic data generation, especially the multi-stage generation process for difficult advice scenarios.

创建时间:
2026-08-14
原始信息汇总

数据集概述:2026-08-13-difficult-advice-v2

基本信息

  • 许可证:MIT
  • 语言:英语
  • 标签:constitutional-ai、synthetic-data、sft
  • 生成日期:2026-08-14
  • 数据集大小:1,968 条训练记录(计划 2,000 条)

数据集用途与设计

  • 实验名称:Difficult-advice v2,采用 Teaching-Claude-Why 方案,修复了 v1 的四个缺陷(强制场景多样性、去重门控、语音检查、元数据覆盖修复、股票开场审计),并启用宪法提示缓存。
  • 宪法依据:使用 claude_distilled_12_principles_mid 宪法(与冻结的九个原则快照 claude_distilled_09_principles_mid_20260804 字节一致),源文件位于 GitHub 仓库,确保与模型评估模型语料库共享同一对齐目标。

生成配置

  • 模型anthropic/claude-haiku-4.5(场景、提示草稿、回复草稿)和 anthropic/claude-sonnet-5(提示精炼、回复重写),通过 OpenRouter 调用;运行中段后固定使用 Anthropic 第一方路由(禁用回退)。
  • 温度参数:场景 1.1、草稿 1.0、精炼 0.7、回复 1.0、重写 0.7;各阶段 max_tokens 2048–12288。
  • 推理:所有阶段均禁用隐藏推理;精炼和重写阶段使用宪法缓存断点。
  • 成本:约 164 美元(计量费用)。

数据结构与模式

  • 主要文件stage_8_export_sft.jsonl,每行一条训练记录,包含:
    • messages:系统、用户、助手(含 contentreasoning_content
    • metadata:场景 ID、特征 ID/名称/文本、领域、情境、快捷方式、分块来源(块 ID、粒度、分组策略、块数)
  • 另有 stage_N_*.jsonl 阶段性快照文件(用于断点恢复)和 manifest.json(记录 git SHA、各阶段使用量及消融信息)。

数据缺失与质控

  • 缺失 32 条:18 条被 Anthropic 第一方及所有第三方主机拒绝(真实拒绝率约 0.9%);14 条反复违反语音契约检查(宪法诵读/股票开场)或重写标签格式。通过顶充流程重新采样,恢复 16 条记录。
  • 质量检查
    • 场景级:2,000 个场景中 0 个重复(0.86 嵌入余弦),每个性状的 top 8-gram 占 1.3%,distinct-2 为 0.64,v1 的 46.9% top-10 领域集中问题在生成时已修复。
    • 语料级(1,952 条):通过检查,0 个严重问题,1 个警告——模式扫描分类器对其自身顶级发现("拒绝机制非目标"修辞形态,报告 99.7% 广泛存在)未能通过召回率健全性检查,该数字不可靠。
  • 重要提示:v1 镜像 synthdoc-v2-difficult-advice 是 v2 前所有结果的记录,请勿混合使用两个版本。
搜集汇总
数据集介绍
2026-08-13-difficult-advice-v2 数据集图片
构建方式
该数据集是经由多阶段合成流程精心构建的产物,其生成根植于“Teaching-Claude-Why”方法论,旨在通过宪法性AI原则生成困难建议场景。构建过程采用Claude Haiku 4.5与Sonnet 5双模型分工,前者负责场景、提示草稿及响应初稿的生成,后者承担提示精炼与响应重写的职责。在生成管线中,针对V1版本的四类缺陷实施了修正,包括强制执行场景多样性、去重门控、语音规范性检查、元数据覆盖校验及开场白审计,并将宪法提示缓存策略贯穿于精炼与重写阶段。数据规模设定为2,000个计划场景,经开放式采样与恢复机制最终产出1,968条训练记录,每条记录均遵循stage_8_export_sft.jsonl架构,涵盖系统、用户、助手多轮消息以及完整的元数据信息,确保构建过程的高度可控与可复现。
特点
数据集的核心特色在于其对困难建议场景的深度覆盖与伦理敏感性,其宪法目标锚定于九原则蒸馏快照,与模型评估语料共享同一对齐目标。多样性保障机制在生成时即生效,场景级别实现零重复,八元组共享率仅为1.3%,有效解决了V1语料中领域分布集中的痼疾。数据记录的完整性体现于Schema设计中,不仅包含对话内容,还嵌入了推理过程文本、情景标识、特质标签及分块溯源信息,为研究推理轨迹提供了结构性支持。此外,数据集在构成上显式记录了数据损失情况,包括约0.9%的拒绝底线和经两次重采样仍不达标的语音契约违规样本,这种透明性增强了其作为研究基准的可靠性。
使用方法
该数据集适用于监督式微调(SFT)任务,输入格式为标准化的messages结构,可直接用于训练对话模型在伦理约束下提供明智建议。其元数据字段支持场景级别的定向筛选,研究者可依据trait_id或domain子集进行定制化实验。由于语料包含reasoning_content,亦可用于探索提升模型推理透明度的训练策略。需注意,该数据集应与V1镜像版本严格区分,确保实验基准的一致性。推荐使用HuggingFace的datasets库加载JSONL文件,结合标准SFT训练框架(如TRL)进行模型微调,并可通过manifest.json中的溯源信息复现生成管线或进行消融研究。
背景与挑战
背景概述
该数据集由Matthew Bozoukov等人于2026年8月创建,旨在通过宪法AI(Constitutional AI)方法生成高质量的合成数据,用于监督微调(SFT)。其核心研究问题在于如何通过多阶段生成流程(场景设计、草稿、优化、重写)结合宪法原则(如claude_distilled_12_principles_mid)来构建符合伦理规范的指令遵循样本。该数据集作为教学Claude推理过程(Teaching-Claude-Why)的v2版本,针对v1版本中发现的四个缺陷进行了系统性修复,并引入了宪法提示缓存机制,显著提升了数据生成的一致性与多样性。其影响力体现在为合成数据领域提供了可复现的构建范式,并推动了模型对齐研究的发展。
当前挑战
该数据集面临的挑战涵盖领域问题与构建过程两方面。在领域层面,合成数据需克服伦理对齐与内容多样性之间的张力,尤其是当涉及敏感话题时,模型可能因安全机制产生拒绝响应,导致数据分布偏差。在构建过程中,v2版本遭遇了三大技术障碍:一是Anthropic、Bedrock及Google Vertex等平台对伦理负载内容的内容过滤器拦截,迫使生成路由切换至Anthropic第一方服务;二是数据完整性问题,32条记录因拒绝或不符合语音约束而丢失,需通过重新采样恢复;三是重复性与多样性控制,需通过嵌入余弦相似度检测及n-gram分析确保场景去重。这些挑战促使团队开发出精度更高的质量门控机制与恢复策略,为后续合成数据构建提供了宝贵经验。
常用场景
经典使用场景
该数据集由Claude模型基于宪法AI框架合成,专用于指令微调(SFT),其经典使用场景是训练语言模型在面临困难建议请求时给出符合伦理准则的回应。它包含近两千条高质量的对话记录,每条均带有系统提示、用户请求和助手响应及推理过程,适用于监督微调、对齐微调以及安全偏好优化等场景。研究者可借助其结构化的元数据(如特质、领域、情境)进行条件生成或评估模型在不同伦理维度上的表现。
衍生相关工作
该数据集衍生的相关工作包括但不限于:基于其生成流程开发更高效的对齐数据合成管线,如通过缓存和路由优化降低成本;利用其元数据设计模型行为细粒度分析框架,如特质或领域相关的偏差检测;以及以其为基准,开发对抗性提示生成算法,进一步探索模型漏洞。此外,其宪法共享同一目标,为跨数据集一致性研究提供了基础,可促进多任务联合对齐训练方法的创新。
数据集最近研究
最新研究方向
该数据集聚焦于宪法AI与合成数据微调的前沿交叉领域,针对v1版本中场景多样性不足、推理阶段语音合同缺失、元数据覆盖及固定开场白等缺陷,通过强制场景多样性、去重门控、语音检查及宪法提示缓存等机制进行系统性修复。其生成过程采用多阶段流程,涵盖场景生成、草稿撰写、精炼及重写,并严格控制温度与令牌数,确保输出质量与一致性。尤为关键的是,数据集中约0.9%的提示被Anthropic第一方及第三方平台共同拒绝,构成该提示分布的固有拒绝下限,这一发现对理解模型安全边界与对齐目标具有重要参考价值。该语料库与既有模型评估模型共享同一宪法快照,促进了跨语料库一致性研究,为可复现的对齐实验提供了坚实基础,对推动宪法AI在复杂建议场景中的鲁棒性与可控性研究具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务