遇见数据集

2026-08-20-difficult-advice-t10-curiosity

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是 difficult_advice 合成数据管道的阶段性快照,用于训练场景。它包含多个阶段的数据快照,每个阶段对应一个 JSONL 文件,包括宪法分块(stage_1_chunk_constitution)、场景编写(stage_2_write_scenarios)、场景去重(stage_3_dedupe_scenarios)、提示草稿(stage_4_draft_prompts)、提示修订(stage_5_revise_prompts)、响应草稿(stage_6_draft_responses)、响应修订(stage_7_revise_responses)以及最终导出的 SFT 数据(stage_8_export_sft)。各阶段还包含部分中间快照(如 .partial 文件)。数据集基于名为 trait10_curiosity 的宪法生成,专为 difficult-advice(困难建议)管道设计,属于合成训练数据。标签表明其为训练数据、合成数据,并支持可恢复的生成缓存。

This dataset is a staged snapshot of the difficult_advice synthetic data pipeline, intended for training scenarios. It contains multiple stages of data snapshots, each corresponding to a JSONL file, including constitution chunking (stage_1_chunk_constitution), scenario writing (stage_2_write_scenarios), scenario deduplication (stage_3_dedupe_scenarios), prompt drafting (stage_4_draft_prompts), prompt revision (stage_5_revise_prompts), response drafting (stage_6_draft_responses), response revision (stage_7_revise_responses), and the final exported SFT data (stage_8_export_sft). Each stage also includes partial intermediate snapshots (e.g., .partial files). The dataset is generated based on a constitution named trait10_curiosity, specifically designed for the difficult-advice pipeline, and belongs to synthetic training data. The labels indicate it is training data, synthetic data, and supports resumable generation caching.

创建时间:
2026-08-20
原始信息汇总

数据集概述

该数据集是 difficult_advice 合成数据生成流程的阶段性快照集合,记录了从数据构建到最终导出的完整中间状态,可作为可恢复的生成缓存使用。

  • 实验名称difficult_advice 合成运行——各阶段快照(可恢复生成缓存)
  • 生成日期:2026 年 8 月 20 日 12:53:40
  • 数据来源:基于特定宪法文件(scratch/trait10_curiosity/constitution.md)驱动的合成生成流程,代码来源于指定 GitHub 仓库(https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git,提交 ID:5f0e9004d45688f209ea4afdcbd191d535eb8199
  • 生成配置:包含完整的运行配置、采样设置及各阶段模型使用详情(见 manifest.json

数据配置与结构

数据集包含一个默认配置(dataset,对应 dataset.jsonl)和多个阶段配置(stage_1stage_8),各阶段文件均为 JSONL 格式,存放于 stages/ 目录下。具体阶段文件包括:

配置名称 数据文件
dataset dataset.jsonl
stage_1_chunk_constitution stages/stage_1_chunk_constitution.jsonl
stage_2_write_scenarios stages/stage_2_write_scenarios.jsonl
stage_3_dedupe_scenarios stages/stage_3_dedupe_scenarios.jsonl
stage_4_draft_prompts stages/stage_4_draft_prompts.jsonl
stage_5_revise_prompts stages/stage_5_revise_prompts.jsonl
stage_5_revise_prompts.partial stages/stage_5_revise_prompts.partial.jsonl
stage_6_draft_responses stages/stage_6_draft_responses.jsonl
stage_6_draft_responses.partial stages/stage_6_draft_responses.partial.jsonl
stage_7_revise_responses stages/stage_7_revise_responses.jsonl
stage_7_revise_responses.partial stages/stage_7_revise_responses.partial.jsonl
stage_8_export_sft stages/stage_8_export_sft.jsonl

数据标签与用途

  • 标签:该数据集标记为训练数据,属于合成数据(synth),基于 difficult_advice 流程生成,其宪法依据为 trait10_curiosity,且数据于 2026 年 8 月 25 日进行了回填。
  • 数据模式:各阶段文件遵循 stage_<n>_<name>.jsonl 命名规范,并附带 manifest.json 文件记录完整运行信息。
  • 生成来源:通过 uv run synth run --config configs/data/synth/difficult_advice.yaml 命令执行生成。
搜集汇总
数据集介绍
2026-08-20-difficult-advice-t10-curiosity 数据集图片
构建方式
该数据集源于一次基于宪法式人工智能微调(Constitutional AFT)方法的合成数据生成实验,其构建过程被细致地拆解为八个可追溯的阶段。从初始的文本分块与宪法构建,到场景撰写、去重、提示词草拟与修订,再到响应的生成与精炼,最终导出为监督微调(SFT)格式。每个阶段均以独立的JSONL快照形式保存,形成了可恢复的生成缓存,这一流水线式的设计确保了数据生成过程的透明性与可复现性,为研究者提供了深入探究合成数据内在生成逻辑的宝贵窗口。
特点
此数据集的核心特质在于其聚焦于“困难建议”场景,并经由名为“trait10_curiosity”的特定宪法进行引导,旨在激发模型在复杂情境下的好奇性回应。数据经由多阶段流水线精雕细琢,每一环节的中间产物均被保留,构成了分阶段的完整快照。这种层级化、可断点续跑的结构,不仅便于过程审查与调试,也为消融实验和流程优化提供了坚实的数据基础,展现了其在合成数据工程化生成方面的独特价值。
使用方法
数据集在HuggingFace上以多配置形式呈现,默认配置(dataset)可直接加载完整的JSONL文件,适用于模型微调或评估。研究者和工程师亦可按需访问各阶段快照(如stage_5_revise_prompts、stage_8_export_sft),以分析特定生成环节的数据形态或复现中间流程。通过指定config名称,用户可灵活选用对应数据文件,从而支持从数据溯源、质量控制到最终训练应用的多种研究场景,充分发挥该数据集的工程与科研潜力。
背景与挑战
背景概述
该数据集由Matthew Bozoukov等人于2026年8月创建,源于GitHub仓库'Lessons_from_constituitional_AFT',聚焦于好奇心特质(trait10_curiosity)的合成数据生成。其核心研究问题是利用宪法AI(Constitutional AI)框架,通过多阶段流水线(如分块宪法、场景编写、提示词修订、响应修订等)构建高质量、可追溯的困难建议(difficult-advice)训练数据。该数据集提供了从原始提示到最终SFT(监督微调)数据的全阶段快照,支持可恢复生成缓存,对合成数据生成的可复现性和过程透明性研究具有重要价值,推动了AI对齐和个性特征建模领域的发展。
当前挑战
该数据集面临的挑战包括:在领域问题层面,困难的建议生成涉及复杂情境理解、人格特质(如好奇心)的精准刻画,以及确保生成内容在道德和安全性上符合宪法原则,这要求模型具备高水平的推理和伦理判断能力。在构建过程中,挑战体现在多阶段流水线的协调与质量控制,如场景去重(stage_3_dedupe_scenarios)需避免重复和偏差,提示词与响应的多轮修订(stage_5、stage_7)需保持逻辑一致性和风格统一,同时,可扩展的生成缓存机制需处理部分快照(.partial)的断点续跑,确保数据完整性和效率,而不同阶段模型的切换(per-stage models)也增加了稳定复现的难度。
常用场景
经典使用场景
该数据集作为一套精心编排的合成训练数据,其核心应用场景在于为大型语言模型(LLM)提供关于‘困难建议’(difficult advice)的多阶段生成范式。研究者可借助其分阶段快照(stage_1至stage_8)深入剖析从文本分块、场景撰写、去重、提示词草拟与修订,直至响应生成与导出的完整流水线。这种精细的层级结构尤为适合用于探索模型在遵循特定‘宪法’(如好奇性trait10)约束下的行为调优,同时也为可复现的合成数据管线研究提供了宝贵素材。
衍生相关工作
该数据集源自Lessons_from_constitutional_AFT项目,其衍生工作主要围绕‘宪法AI反馈训练’(Constitutional AFT)展开。后续研究可基于其各阶段快照构建更高效的合成数据过滤或质量评估模型,或将该‘困难建议’生成管线迁移至其他特质维度(如同理心、严谨性)以构建多维度对齐数据集。此外,其公开的manifest配置为开发可组合、可插拔的数据生成框架提供了参照,催生了诸如动态提示词优化、基于过程奖励的数据选择等一系列后续探索,这些工作共同丰富了合成数据在安全对齐与个性化模型定制领域的应用版图。
数据集最近研究
最新研究方向
该数据集聚焦于‘困难建议’场景下的好奇心特质强化,通过八阶段流水线(从文本分块、场景生成到响应修订与SFT导出)构建合成训练数据,其核心创新在于引入‘宪法式AI反馈训练’(Constitutional AFT),以显性特质基准(如好奇心)约束生成过程,推动对齐技术从通用安全向人格化与认知风格定制演进。近期研究热点包括多阶段可恢复生成管线的效率优化、分块语义去重以提升数据多样性,以及跨阶段快照的可追溯性分析,这对提升大模型在复杂咨询场景下的解释性与个性化回应具有方法论意义,也为合成数据质量审计与自适应对齐提供了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务