遇见数据集

2026-08-21-difficult-advice-v2-chunk-only-716

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是difficult_advice_chunk_only合成数据生成管道的多阶段快照集合,主要用于训练模型。它包含从宪法片段提取、场景编写、去重、提示词草稿与修订、响应草稿与修订,直至最终导出为SFT格式的完整流程。每个阶段对应一个独立的JSONL文件,如stage_1_chunk_constitution.jsonl至stage_8_export_sft.jsonl。数据集生成采用了claude_distilled_12_principles_mid宪法指导,遵循difficult-advice流水线,生成日期为20260821,并支持回溯填充。该数据集适用于训练模型在困难建议场景下的生成能力。

This dataset is a collection of multi-stage snapshots from the difficult_advice_chunk_only synthetic data generation pipeline, primarily used for training models. It includes the complete process from constitutional chunk extraction, scenario writing, deduplication, prompt drafting and revision, response drafting and revision, to final export in SFT format. Each stage corresponds to an independent JSONL file, such as stage_1_chunk_constitution.jsonl to stage_8_export_sft.jsonl. The dataset was generated using the claude_distilled_12_principles_mid constitutional guidance, following the difficult-advice pipeline, with a generation date of 20260821, and supports backfill. This dataset is suitable for training models in generating capabilities for difficult advice scenarios.

创建时间:
2026-08-21
原始信息汇总

数据集概述

该数据集是 difficult_advice_chunk_only 合成数据运行的结果,包含按阶段拆分的快照(可恢复的生成缓存),用于记录从文本分块到最终 SFT 数据导出的完整生成流程。

基本信息

  • 实验名称:synth difficult_advice_chunk_only 运行 — 按阶段快照(可恢复的生成缓存)
  • 生成日期:20260821_115556
  • 数据标签:训练数据、合成数据、pipeline:difficult-advice
  • 相关宪法claude_distilled_12_principles_mid
  • 回填日期:2026-08-25

配置与结构

该数据集包含多个配置,分别对应不同生成阶段的数据快照:

配置名 对应文件 说明
dataset dataset.jsonl 默认配置,完整数据集
stage_1_chunk_constitution stages/stage_1_chunk_constitution.jsonl 第一阶段:宪法文本分块
stage_2_write_scenarios stages/stage_2_write_scenarios.jsonl 第二阶段:编写场景
stage_3_dedupe_scenarios stages/stage_3_dedupe_scenarios.jsonl 第三阶段:场景去重
stage_4_draft_prompts stages/stage_4_draft_prompts.jsonl 第四阶段:草拟提示词
stage_5_revise_prompts.partial stages/stage_5_revise_prompts.partial.jsonl 第五阶段(部分):修订提示词
stage_5_revise_prompts stages/stage_5_revise_prompts.jsonl 第五阶段:修订提示词
stage_6_draft_responses stages/stage_6_draft_responses.jsonl 第六阶段:草拟回答
stage_6_draft_responses.partial stages/stage_6_draft_responses.partial.jsonl 第六阶段(部分):草拟回答
stage_7_revise_responses stages/stage_7_revise_responses.jsonl 第七阶段:修订回答
stage_7_revise_responses.partial stages/stage_7_revise_responses.partial.jsonl 第七阶段(部分):修订回答
stage_8_export_sft stages/stage_8_export_sft.jsonl 第八阶段:导出 SFT 数据

数据来源与生成配置

  • 宪法文件constitutions/claude_distilled_12_principles_mid/constitution.md
  • 来源仓库:https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git(commit: e450b0a2bff793952f9b66eba5534869072e8c84)
  • 模型:各阶段使用的模型详见 manifest.json
  • 生成配置:完整运行配置、采样设置、各阶段使用情况均记录于 manifest.json
  • 数据模式:按阶段存储为 stage_<n>_<name>.jsonl 快照文件,并配有 manifest.json

生成方式

该数据集通过命令行工具生成,具体命令为:uv run synth run --config configs/data/synth/difficult_advice_chunk_only.yaml,体现了其合成数据的来源和可复现的流水线特性。

搜集汇总
数据集介绍
2026-08-21-difficult-advice-v2-chunk-only-716 数据集图片
构建方式
该数据集源于一项精细化的合成数据生产流水线,其构建历程被完整地记录于多阶段快照之中。流水线起始于对给定宪法文本的分块处理,继而围绕各分块编写具体场景,通过去重机制确保场景的独特性,再依次草拟与修订提示词,最终生成并优化响应。每个环节均以JSONL格式存留中间产物,形成了从原始语料到最终监督微调数据集的完整可追溯轨迹,为数据质量的审查与复现提供了坚实基础。
特点
此数据集的核心特征在于其多级、透明的结构化存储方式。除主数据集外,还提供了自阶段一至阶段八的独立配置,完整呈现了数据从无到有的演化过程。其内容聚焦于高难度建议场景,并结合了蒸馏自Claude的十二条原则作为指导性宪法,兼具专业深度与合成数据的多样性。此外,数据集的生成时间戳与来源仓库等元信息被详尽记录,保障了数据的出处与可验证性,适用于构建复杂指令遵循模型。
使用方法
使用者可通过HuggingFace数据集加载工具轻松获取各阶段数据。默认配置下的dataset.jsonl适宜直接用于监督微调训练;而研究构建流程或分析中间状态时,可选取如stage_5_revise_prompts或stage_8_export_sft等子配置加载对应快照。结合manifest.json文件中的生成配置与模型使用详情,研究者可复现整个合成流程,或针对特定阶段的数据进行定制化分析与再加工,灵活适配不同的研究需求。
背景与挑战
背景概述
该数据集诞生于2026年,由Matthew Bozoukov等人基于“Lessons from Constitutional AFT”项目开发,旨在通过阶段性生成流程构建高质量、具有挑战性的对话建议数据。其核心研究问题在于利用宪法AI原则(如Claude蒸馏的12项原则)生成难以回答的场景,以增强模型在复杂伦理与实用建议上的表现。数据集采用八阶段流水线,从数据块构建到场景生成、去重、提示词撰写与修订,直至最终响应生成与SFT格式导出,每个阶段均保存快照,支持可恢复的生成缓存。该数据集在合成训练数据领域具有创新性,为后续模型的对齐与微调提供了高难度、多样化的样本,推动了基于宪法AI的合成数据方法论的发展。
当前挑战
该数据集面临的挑战首先体现在领域问题层面,即如何生成既困难又符合宪法原则的建议性对话,这对于语言模型在复杂伦理抉择中的推理能力提出了高标准要求,也是对模型对齐技术的考验。其次,构建过程中遇到多重技术难题:多阶段流水线(8个阶段)的复杂协调与生成质量的一致性是主要障碍,特别是阶段5和7的修订环节,需要精细调优以避免偏差放大;去重阶段需在保持语义多样性的同时去除冗余,这对算法设计提出了高要求;此外,可恢复生成缓存的实现机制需确保断点续跑的一致性,以及不同模型(per-stage models)间的输出平衡,均构成构建过程中的显著挑战。
常用场景
经典使用场景
该数据集聚焦于‘困难建议’场景的合成数据生成,通过分阶段的快照流程(如chunk_constitution、write_scenarios、revise_prompts、revise_responses等)构建高质量的训练语料。其经典使用场景在于为大型语言模型提供精细化的指令微调(SFT)数据,尤其在处理复杂、多步骤的咨询或建议类任务时,模型需要依据给定的宪法原则(constitution)进行内容生成与修订,从而提升模型在遵循伦理规范、生成细致回应的能力。研究者常利用该数据集进行模型对齐训练,或作为合成数据流水线的基准示例。
实际应用
在实际应用中,该数据集可被用于开发面向用户的智能咨询系统,如法律、心理或职业规划等需要审慎建议的场景,通过微调使模型生成内容更贴合社会规范。其分阶段设计也方便企业或研究机构在私有数据上复现类似流程,用于构建垂直领域的对话助手。此外,作为训练数据,它有助于提升模型在长文本理解与多轮交互中的表现,减少生成有害或不恰当建议的风险,从而增强产品的用户信任度。
衍生相关工作
该数据集衍生了一系列相关研究工作,包括对多阶段合成数据流水线的优化研究、基于宪法原则的模型行为约束方法探索,以及利用分阶段快照进行数据溯源分析的工作。其pipeline框架(difficult-advice)已被用于比较不同修订策略(如prompt修订 vs response修订)对最终模型质量的影响。此外,该数据集的公开促进了可复现的AI对齐实验,衍生出关于‘困难场景’下模型鲁棒性的基准测试,以及用于评估模型遵循规范能力的评测集构建,推动了合成数据在安全AI领域的前沿探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务