遇见数据集

2026-08-14-peer-critique

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是一个通过 peer-critique 流水线生成的合成训练数据集,旨在为模型提供基于特定宪法(claude_distilled_09_principles_mid_20260804)的批判性反馈训练数据。数据集包含多个阶段(stage_1 至 stage_14)的快照文件(JSONL 格式),每个阶段对应流水线中的一个中间步骤,例如 chunk 构建、场景编写、去重、提示词起草、修订、首轮生成、批评框架撰写、批评草稿、批评修订以及最终 SFT 导出。部分阶段还提供了 partial 快照。数据集标签包括 training-data、synth、peer-critique 等,表明其用于训练数据生成,且为合成数据。该数据集适用于监督微调(SFT)任务,尤其关注模型生成和评估批评性回应。数据规模由多个大文件构成,具体样本数量未在 README 中明确。

This dataset is a synthetic training dataset generated through a peer-critique pipeline, designed to provide models with critical feedback training data based on a specific constitution (claude_distilled_09_principles_mid_20260804). It contains snapshot files (JSONL format) across multiple stages (stage_1 to stage_14), each corresponding to an intermediate step in the pipeline, such as chunk construction, scenario writing, deduplication, prompt drafting, revision, first-round generation, critique framework writing, critique drafting, critique revision, and final SFT export. Some stages also provide partial snapshots. The dataset tags include training-data, synth, peer-critique, etc., indicating its use for training data generation and that it is synthetic data. This dataset is suitable for supervised fine-tuning (SFT) tasks, especially focusing on the generation and evaluation of critical responses. The data scale consists of multiple large files, with the specific number of samples not explicitly stated in the README.

创建时间:
2026-08-14
原始信息汇总

数据集概述

该数据集是一个名为 synth peer_critique 的合成数据生成项目,用于记录模型间同行评审(peer critique)数据的多阶段生成过程。数据集以分阶段快照的形式存储,可作为可恢复的生成缓存。

基本信息

字段 内容
数据集ID LASR-Callum/2026-08-14-peer-critique
实验名称 synth peer_critique run — per-stage snapshots (resumable generation cache)
生成日期 20260816_111034
数据集类型 合成训练数据
标签 training-data, kind:synth, pipeline:peer-critique, constitution:claude_distilled_09_principles_mid_20260804, backfilled-2026-08-25

数据构成

数据集包含多个配置(config),分为主数据集各阶段快照

  • 主数据集dataset(数据文件:dataset.jsonl
  • 阶段快照:从 stage_1_chunk_constitutionstage_14_export_sft,共14个生成阶段的中间结果快照,每个阶段均有对应的 .jsonl 文件。部分阶段还提供 .partial 部分结果版本。

生成流程与技术细节

  • 来源仓库:https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git(提交版本 a59d5888b792619bc170c9b71d109bcf3bb4c0a8
  • 宪法文件constitutions/claude_distilled_09_principles_mid_20260804/constitution.md
  • 模型配置:各阶段使用的模型及生成配置详见 manifest.json(包含完整运行配置、采样设置及分阶段使用情况)
  • 生成命令uv run synth run --config configs/data/synth/peer_critique.yaml

阶段流水线

数据集完整记录了从宪法分块(stage 1)到最终导出SFT数据(stage 14)的完整流水线,中间涉及场景编写、去重、提示词草拟与修订、多个模型(Sonnet、Grok、Qwen、Gemini)的首轮回复生成与修订、批评框架编写、批评草拟与修订等步骤。

搜集汇总
数据集介绍
2026-08-14-peer-critique 数据集图片
构建方式
该数据集源自一次名为peer_critique的合成数据生成实验,通过多阶段流水线构建,涵盖从文本分块到最终监督微调数据导出的完整过程。每个阶段均以JSONL快照形式保存,形成可恢复的生成缓存。具体流程包括语义分块、场景撰写与去重、提示词起草与修订、多种模型(如Claude、Grok、Qwen、Gemini)首轮回复生成及修正,最后生成批判性反馈框架并进行批判内容的起草与修订。全部过程基于一份宪法文件(claude_distilled_09_principles_mid_20260804)作为指导原则,并记录在manifest.json中,确保可追溯性与可复现性。
特点
该数据集的核心特点在于其多阶段、多模型协作的合成生成机制,以及高度透明的阶段性快照设计。每个阶段独立存储,便于研究者深入分析生成中间状态,尤其适合研究批判性反馈的结构化生成过程。数据源自多个先进语言模型的协同输出,覆盖从初稿到修订的完整演进路径,为训练数据提供了丰富的多样性。此外,数据集附带的manifest.json详细记录了运行配置、采样参数与各阶段模型使用情况,增强了数据的可信度与可复现性,是探索合成数据生成管线及其在监督微调中应用的重要资源。
使用方法
该数据集可加载为多个配置子集,每个配置对应流水线中的一个阶段快照。研究者可通过HuggingFace datasets库按需加载特定阶段数据,例如使用load_dataset('2026-08-14-peer-critique', name='stage_12_draft_critique')获取批判初稿阶段。最终导出文件stage_14_export_sft.jsonl可直接用于监督微调训练。此外,阶段化快照支持对生成过程的深入分析,如错误追溯或质量评估。通过追踪从场景撰写到批评修订的完整链条,可应用于批判性推理能力提升、合成数据质量研究及多模型协作生成策略优化等任务。
背景与挑战
背景概述
该数据集名为“peer-critique”,由Matthew Bozoukov等人于2026年8月创建,源自GitHub仓库“Lessons_from_constitutional_AFT”,旨在通过多阶段流水线生成合成训练数据,以增强语言模型在同伴批评(peer critique)任务中的能力。数据集采用基于宪法的AI反馈(Constitutional AI)方法,该方法的核心理念是通过一组原则或“宪法”来引导模型自我修正和生成反馈,从而减少对人工标注的依赖。此数据集在构建过程中引入了多模型协作(如Sonnet、Grok、Qwen、Gemini),并分阶段生成、修订场景与提示,最终导出为SFT(监督微调)格式。该数据集的价值在于,它为研究如何利用合成数据提升模型在复杂反馈生成任务中的表现提供了详尽的中间过程快照,对对齐、可解释性和鲁棒性研究具有潜在贡献。
当前挑战
该数据集面临的挑战包括:1) 领域问题——同伴批评任务要求模型不仅能生成建设性反馈,还需理解上下文、识别缺陷与提出改进,这需要模型具备深层语义理解和推理能力,而传统训练数据难以覆盖多样且真实的批评场景;2) 构建过程——数据集构建涉及多阶段流水线(从场景编写到多模型起草、修订和批评生成),每一步都可能引入噪声或偏差,如何保证各阶段输出的一致性和质量是一大难题;此外,多模型协作的协调成本高,且需要精细的宪法原则设计,以防止模型产生不当或不准确的反馈;3) 数据规模与多样性——合成数据虽可扩展,但如何确保生成的批评语义丰富、覆盖边界案例,仍是持续挑战。
常用场景
经典使用场景
该数据集作为大规模合成训练语料,聚焦于“同行评审”(peer critique)这一精细的认知任务,常被用于训练和评估语言模型在批评性反馈生成、多轮修订以及遵循特定宪法原则(constitution)方面的能力。其分阶段快照结构(从文本分块、场景撰写、去重、提示词草拟与修订,到多模型首轮生成及最终批评文本的撰写与修订)为研究者提供了完整的中间过程数据,支持对模型迭代优化流程的精细剖析与复现。
解决学术问题
该数据集系统性地解决了合成数据生成过程中可复现性、可追溯性和分阶段质量控制等核心学术难题。通过记录每个阶段的中间快照,研究者能够深入探究提示词工程、模型选择(如Sonnet、Grok、Qwen、Gemini)以及宪法约束如何逐步影响最终批评文本的质量与风格。这为理解大型语言模型在复杂任务中的涌现行为、对齐策略的效果评估以及合成数据管道的鲁棒性分析提供了宝贵的实证基础,推动了数据-centric AI研究范式的发展。
衍生相关工作
该数据集衍生的工作方向包括:基于其分阶段快照,可构建用于分析合成数据管道中“数据污染”或“级联误差”的基准测试集;利用其宪法标注信息,可开发新的对齐算法,如宪法式强化学习或基于批评的迭代优化方法;其多模型首轮生成数据支持了模型输出多样性、风格迁移及模型融合策略的研究。此外,该数据集的出现也催生了关于合成数据版权、来源追溯及标准化格式的讨论,为建立合成数据社区共享规范提供了参考案例。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务