遇见数据集

2026-08-17-post-action-retrospection

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

本数据集是一个合成训练数据,通过名为“post_action_retrospection”的多阶段流水线生成。流水线包含多个阶段,分别对应数据构建的不同步骤:从最初的分块宪法(stage_1_chunk_constitution)、编写场景(stage_2_write_scenarios)、去重场景(stage_3_dedupe_scenarios)、起草提示(stage_4_draft_prompts)、修订提示(stage_5_revise_prompts)、起草第一轮对话(stage_6_draft_first_turn)、修订第一轮对话(stage_7_revise_first_turn)、编写后续轮次(stage_8_write_followup)、起草反思(stage_9_draft_reflection)、修订反思(stage_10_revise_reflection),最终导出为 SFT 格式(stage_11_export_sft)。每个阶段的数据均以 JSONL 文件形式保存,可作为独立配置加载。数据集使用了特定的宪法(claude_distilled_09_principles_mid_20260804)作为指导原则,生成日期为 2026-08-17。该数据集适用于训练模型进行情境对话、事后反思生成或相关任务的监督微调。

This dataset is a synthetic training data generated through a multi-stage pipeline called post_action_retrospection. The pipeline includes multiple stages corresponding to different steps of data construction: from initial chunk constitution (stage_1_chunk_constitution), writing scenarios (stage_2_write_scenarios), deduplicating scenarios (stage_3_dedupe_scenarios), drafting prompts (stage_4_draft_prompts), revising prompts (stage_5_revise_prompts), drafting first turn (stage_6_draft_first_turn), revising first turn (stage_7_revise_first_turn), writing follow-up turns (stage_8_write_followup), drafting reflection (stage_9_draft_reflection), revising reflection (stage_10_revise_reflection), and finally exporting to SFT format (stage_11_export_sft). Data from each stage is saved as JSONL files and can be loaded as independent configurations. The dataset uses a specific constitution (claude_distilled_09_principles_mid_20260804) as guiding principles, and the generation date is 2026-08-17. This dataset is suitable for supervised fine-tuning of models for contextual dialogue, post-hoc reflection generation, or related tasks.

创建时间:
2026-08-17
原始信息汇总

数据集概述

该数据集是 post_action_retrospection 合成数据流水线的阶段性快照集合,用于可恢复的生成缓存。

基本信息

属性
实验名称 synth post_action_retrospection run — per-stage snapshots (resumable generation cache)
生成日期 20260817_162706
数据标签 training-data, kind:synth, pipeline:post-action-retrospection, constitution:claude_distilled_09_principles_mid_20260804, backfilled-2026-08-25
来源仓库 https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git @ 0d4fb6635483069b9ef217c4ff769d8676c6f41b

配置与数据文件

数据集包含多种配置,对应流水线不同阶段的 JSONL 快照文件:

配置名称 数据文件
dataset dataset.jsonl
stage_1_chunk_constitution stages/stage_1_chunk_constitution.jsonl
stage_2_write_scenarios stages/stage_2_write_scenarios.jsonl
stage_3_dedupe_scenarios stages/stage_3_dedupe_scenarios.jsonl
stage_4_draft_prompts stages/stage_4_draft_prompts.jsonl
stage_4_draft_prompts.partial stages/stage_4_draft_prompts.partial.jsonl
stage_5_revise_prompts.partial stages/stage_5_revise_prompts.partial.jsonl
stage_5_revise_prompts stages/stage_5_revise_prompts.jsonl
stage_6_draft_first_turn.partial stages/stage_6_draft_first_turn.partial.jsonl
stage_6_draft_first_turn stages/stage_6_draft_first_turn.jsonl
stage_7_revise_first_turn stages/stage_7_revise_first_turn.jsonl
stage_7_revise_first_turn.partial stages/stage_7_revise_first_turn.partial.jsonl
stage_8_write_followup.partial stages/stage_8_write_followup.partial.jsonl
stage_8_write_followup stages/stage_8_write_followup.jsonl
stage_9_draft_reflection stages/stage_9_draft_reflection.jsonl
stage_9_draft_reflection.partial stages/stage_9_draft_reflection.partial.jsonl
stage_10_revise_reflection.partial stages/stage_10_revise_reflection.partial.jsonl
stage_10_revise_reflection stages/stage_10_revise_reflection.jsonl
stage_11_export_sft stages/stage_11_export_sft.jsonl

数据模式与来源

  • 模式stage_<n>_<name>.jsonl 快照文件及 manifest.json(包含完整运行配置、采样设置和各阶段使用情况)
  • 宪法文件constitutions/claude_distilled_09_principles_mid_20260804/constitution.md
  • 生成命令uv run synth run --config configs/data/synth/post_action_retrospection.yaml
  • 模型:各阶段使用的模型详见 manifest.json
搜集汇总
数据集介绍
2026-08-17-post-action-retrospection 数据集图片
构建方式
该数据集源于对大型语言模型行为反思能力的深度探索,通过精心设计的多阶段流水线构建而成。其构建过程从初始文本分块出发,历经场景撰写、去重、提示词草拟与修订、首轮对话生成及反思打磨等十余个环节,每一阶段均产出独立的JSONL快照,完整记录生成轨迹。这种分阶段快照机制不仅确保了数据生成的可追溯性,还实现了生成缓存的可恢复性,使构建过程兼具严谨性与工程弹性。
特点
数据集的核心特色在于其分层级、精细化的结构设计,提供了从主数据集到系列阶段快照的多元视角。主配置汇聚最终成果,而各阶段子集则如同数据生产的考古层,清晰展现从原始材料到成熟问答对的演变脉络。其内容遵循特定原则宪章,强调事后行动反思,赋予数据以深度认知特质,且各阶段均配备部分快照,便于研究者观察数据生成的中途状态,体现了数据集的开放性与过程透明性。
使用方法
数据集的使用方法灵活多样,适用于多类研究场景。研究者可加载主数据集以直接获取完整的反思性问答对,用于监督微调;亦可深入各阶段子集,进行数据生成流程的剖析、质量追溯或训练信号分析。借助附加的manifest.json文件,使用者能够获取生成模型、采样参数等全面元信息,从而在复现实验、扩展数据集或设计改进方案时拥有充分的决策依据,尤其适合探索数据合成与模型对齐的交叉领域。
背景与挑战
背景概述
该数据集由Matthew Bozoukov等研究人员于2026年8月创建,源自项目“Lessons_from_constitutional_AFT”,旨在通过宪法AI(Constitutional AI)与事后反思(post-action retrospection)机制,合成高质量的训练数据。其核心研究问题在于如何利用多阶段生成流程,模拟AI系统在行动后的反思过程,以提升模型自我修正与对齐能力。该数据集采用精细的十一个阶段流水线,涵盖从文本分块、场景编写到提示词修订与反思生成的完整过程,并提供了可恢复的生成缓存,为后续监督微调(SFT)提供了丰富语料。作为合成训练数据的典范,它对AI对齐领域的研究方法具有重要参考价值,推动了基于原则的合成数据生成策略的发展。
当前挑战
该数据集面临的挑战主要体现在两方面。其一,所解决的领域问题——AI对齐与自我反思——本身极具难度,要求模型能够从行动后果中提取教训并调整行为,这涉及复杂的认知推理与价值判断,远超传统监督学习的范畴。其二,构建过程中的挑战:多阶段流水线(共11阶段)的每个环节都需保证数据质量与一致性,尤其是提示词修订与反思生成阶段,需精细控制以避免引入偏见或噪声;同时,不同阶段的模型配置与采样策略需仔细调优,以确保生成数据的多样性与真实性。此外,数据去重与缓存恢复机制的设计也需兼顾效率与完整性,这些均构成了数据集构建中的显著技术难点。
常用场景
经典使用场景
该数据集作为一套精心编排的合成训练语料,其经典应用场景聚焦于对话式人工智能的反思能力培养。它通过记录从初始情境构建到最终反思生成的完整流水线各阶段快照,为研究者提供了探索智能体在行动后如何进行自我审视与经验总结的宝贵资源。其多阶段结构设计尤其适用于开发与评估模型在复杂交互中的回溯推理、因果归因及策略优化能力,成为模拟人类认知闭环、强化学习信号生成等前沿课题的关键数据基础。
实际应用
在实际应用层面,该数据集的价值体现在为智能体系统赋予可解释的自我改进路径。借助其多阶段生成快照,开发者可以训练模型在完成任务后自动生成结构化的事后剖析,涵盖行动动机、过程阻碍与结果评估,进而辅助企业级AI助手进行流程优化、客服系统进行服务复盘,以及教育领域中的智能导师进行学习策略调整。其分阶段缓存机制也便于工程团队在资源受限环境下进行增量式模型微调,实现在线学习与持续进化。
衍生相关工作
该数据集催生了一系列围绕‘行动后反思’这一核心范式的研究脉络。其分阶段快照设计启发了针对反思质量进行多粒度评估的自动指标构建工作,以及探索不同反思格式(如结构化报告、自由文本)对下游任务性能影响的对比研究。此外,研究者基于此数据衍生了从反思日志中蒸馏偏好信号以训练奖励模型的方法,并尝试将反思链嵌入更广泛的智能体循环框架中,推进了自我对弈策略演进与多轮交互中的记忆压缩等前沿方向,形成了以反思为中心的生成式智能体研究生态。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务