遇见数据集

2026-09-10-delib-synth

收藏
Hugging Face2026-09-11 更新2026-09-12 收录
官方服务:

资源简介:

本数据集是一个用于监督微调(SFT)的合成对话数据集,名称为“Deliberative SFT”(delib)。数据生成过程基于原生 Qwen 推理模型,采用最佳-4(best-of-4)选择策略,并通过一个符合宪法(abridged constitution)的裁判模型(anthropic/claude-sonnet-5)进行过滤,要求至少两次运行评分均≥7。完整运行生成了658条样本;其中50条被拒绝的提示在修改后的宪法下经过两轮(每轮8个候选)重新生成,恢复了42条,最终仍有8条被拒绝。数据集包含多个配置:主数据集(dataset.jsonl),以及各阶段快照(stage_1_prompts、stage_2_responses、stage_3_judge、stage_4_export_sft)。每条样本包含消息(messages)、元数据(metadata)和可选的工具调用(tools)。该数据集适用于训练模型在对话中遵循宪法约束、进行深思熟虑的推理,并可用于对齐研究中的监督微调。数据来源为GitHub仓库,生成日期为2026年9月10日。

This dataset is a synthetic conversational dataset for supervised fine-tuning (SFT), named Deliberative SFT (delib). The data generation process is based on the native Qwen reasoning model, using a best-of-4 selection strategy, and filtered by a judge model (anthropic/claude-sonnet-5) that follows an abridged constitution, requiring at least two runs with scores ≥7. The full run generated 658 samples; 50 rejected prompts were regenerated under a modified constitution through two rounds (each with 8 candidates), recovering 42 samples, leaving 8 still rejected. The dataset includes multiple configurations: the main dataset (dataset.jsonl) and snapshots of each stage (stage_1_prompts, stage_2_responses, stage_3_judge, stage_4_export_sft). Each sample contains messages, metadata, and optional tool calls. The dataset is suitable for training models to follow constitutional constraints in dialogue, engage in deliberative reasoning, and can be used for supervised fine-tuning in alignment research. The data source is a GitHub repository, and the generation date is September 10, 2026.

创建时间:
2026-09-11
原始信息汇总

数据集概述

基本信息

项目 内容
数据集地址 https://huggingface.co/datasets/dougalldeepmind/2026-09-10-delib-synth
实验名称 Deliberative SFT: delib;原生 Qwen 推理,由宪法感知评委(anthropic/claude-sonnet-5,2 次运行的最小值 >= 7)进行 best-of-4 过滤。完整运行得到 658 行;被拒绝的 50 个提示在修订宪法下以每轮 8 个候选重新运行 2 轮,恢复 42 个;8 个仍被拒绝
生成日期 20260910_231156
宪法 constitutions/abridged/constitution.md(两个修订版本;每行的 sha 在元数据中,两者均在清单中)
源仓库 https://github.com/Matthew-Bozoukov/Lessons_from_constituitional_AFT.git @ b9d797f125259061f20e93f129c2ceb2ad3fa1d5
模型 qwen/qwen3.6-27b 通过 alibaba/OpenRouter(API 修订未公开);评委 anthropic/claude-sonnet-5 通过 OpenRouter
生成配置 manifest.json:两次运行的已解析配置、pins、定价、用量和过滤统计(merged_from)
Schema dataset.jsonl:messages + metadata + 可选 tools;stages/ 快照
溯源 scratch/delib_merge_publish.py --full output/synth_delib/20260910_231156 --rejects output/synth_delib_rejects/20260911_115312 --rejects output/synth_delib_rejects/20260911_131956 --repo 2026-09-10-delib-synth;提示来自 dougalldeepmind/2026-09-08-da-synth @ 42107bde00cd7f4360a3a6c581aac23a540dbfea / dataset.jsonl

数据集配置

配置名称 数据文件 默认
dataset dataset.jsonl
stage_1_prompts stages/stage_1_prompts.jsonl
stage_2_responses stages/stage_2_responses.jsonl
stage_3_judge stages/stage_3_judge.jsonl
stage_4_export_sft stages/stage_4_export_sft.jsonl

标签

  • training-data
  • kind:synth
  • pipeline:delib
  • constitution:abridged
搜集汇总
数据集介绍
2026-09-10-delib-synth 数据集图片
构建方式
该数据集依托审议式监督微调(Deliberative SFT)框架构建,以Qwen原生推理模型为生成器,经由宪法感知评判器对每轮四份候选响应进行最佳筛选,评判标准要求至少两次运行得分不低于七分,初始获得六百五十八条合格样本;针对被拒的五十条提示,依据修订版宪法以每轮八份候选重新采样两轮,成功召回四十二条,最终保留八条拒答记录。上游提示源自既定合成数据集,完整生成配置、定价与过滤统计均记录于清单文件。
使用方法
使用者可通过Hugging Face数据集加载接口按配置名称分别获取完整数据集或各阶段快照,默认配置加载全部示例,阶段配置用于回溯提示采样、候选响应、评判记录与监督微调导出。样本以消息列表配合元数据的结构可直接用于对话模型的监督微调训练,元数据中的宪法哈希与来源信息支持合规审计与可复现性验证。
背景与挑战
背景概述
在人工智能对齐研究愈发倚重合成数据与宪法式训练的当下,该数据集由Matthew Bozoukov等研究者于2026年前后构建,依托Lessons from Constitutional AFT项目而生。其核心关切在于:如何借助显式宪法约束与多轮审议机制,生成既符合规范又具备高质量推理轨迹的监督微调数据。数据集以Qwen系列模型的原生推理输出为素材,经由基于宪法的评判模型多轮筛选与驳回重采,形成带有完整溯源信息的658条样本,为有限监督条件下的对齐研究提供了可复现的合成数据范式,对合成数据治理与审议式微调方向具有参考价值。
当前挑战
该数据集所直面的领域问题,在于如何使合成监督数据在缺乏人工标注的前提下仍能可靠地体现复杂价值规范,这要求生成流程同时兼顾推理深度与宪法一致性。构建过程中的具体挑战包括:评判模型对候选响应的打分存在波动,需以多次运行的最低分作为筛选阈值以控制质量;初轮生成中相当比例的提示被判定不合格,须在多轮修订宪法后以更多候选重新采样,方能部分回收被拒样本,而仍有少量提示始终无法通过;此外,生成模型与评判模型均依赖外部API且版本未完全暴露,给结果的可复现性带来潜在制约。
常用场景
经典使用场景
在合成数据驱动的监督微调研究领域中,Deliberative SFT数据集最为经典的使用场景在于为推理增强型大语言模型提供经过审慎筛选的高质量训练语料。该数据集以原生Qwen推理链为生成基础,采用best-of-4采样策略产生多路候选响应,继而借助宪法感知评判器对每一响应进行多轮评分,仅保留两次运行均不低于7分的样本。研究者可借此开展基于审议机制的指令微调实验,考察模型在复杂开放性任务中的推理一致性与响应质量,从而为合成数据的筛选范式提供可复现的基准流程。
解决学术问题
该数据集直面合成监督微调中语料质量参差与筛选标准模糊的学术难题,通过引入宪法感知的评判机制,将主观质量判断转化为可量化、可审计的多轮评分流程。其关键在于为被拒样本设计补充重采样与修订宪法的迭代恢复策略,使原本被过滤的提示在调整后得以重新纳入训练集,从而系统性地缓解了合成数据中高价值样本被误弃的问题,为数据筛选的鲁棒性与可追溯性研究提供了实证依据。
实际应用
在实际应用层面,该数据集可服务于对推理链条质量要求严苛的模型对齐与部署场景,例如需要模型在遵循特定行为规范前提下进行多步推理的对话系统。开发者可将其直接用于指令微调阶段,借助数据集内嵌的元数据与阶段快照,追溯每一条训练样本的生成配置、模型版本及评判得分,从而在模型迭代与合规审计之间建立透明的数据链条,提升训练流程的可控性与复现效率。
数据集最近研究
最新研究方向
在大语言模型对齐研究持续深化的背景下,该数据集聚焦于审议式监督微调(Deliberative SFT)这一前沿方向,探索以宪法感知评审器对原生推理轨迹实施筛选的合成数据构建范式。其核心创新在于引入多轮候选生成与修订机制:由Qwen原生推理模型生成四选一候选响应,经Claude-Sonnet-5依据精简宪法进行双重评判,仅保留评分达标的样本;对被拒提示词则以修订宪法重新进行两轮八候选采样,最终恢复绝大多数被拒样本。这一流程呼应了宪法AI与可扩展监督的热点议题,为推理增强型对齐提供了可追溯的多阶段数据快照与元数据体系,对提升模型推理透明度与对齐鲁棒性具有重要的方法学参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务