遇见数据集

2026-08-17-table2-9284-peer-critique-good716-train

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

该数据集是Qwen3.6-27B监督微调(SFT)的混合数据,包含9,284条Table2数据与716条peer_critique的“good arm”数据,共计10,000行。实验目的是进行消融研究:通过仅使用good-arm的评论(而非flawed arm)训练模型,检验flawed arm是否为性能贡献了额外收益。数据来源:Table2部分来自LASR-Callum/2026-08-06-table2-9284-synthdoc-716-train(排除synthdoc_difficult_advice),peer_critique部分来自LASR-Callum/2026-08-14-peer-critique,筛选出reply_quality == good的716条。每条数据以JSONL格式存储,包含字段:text(完整对话,预渲染为Qwen3.6聊天格式,每个助手回合均带有think块,其中peer_critique行包含真实追踪,其余行使用空标记)、source(来源子集)、trait_id(合成行)、scenario_id(合成行)、reply_quality(始终为good)。数据集使用Qwen/Qwen3.6-27B模型,行已预渲染至其聊天模板。生成配置为确定性组装(种子0),选择过程在trait间平衡(t1-t9各80或79条),并在domain内轮询。验证表明:该数据集与对比臂(含358 good + 358 flawed的版本)在Table2部分字节级一致,think标记分布相同,形状相同(716行,7.16%合成数据,568个不同domain,716个不同场景),无截断(最大长度8191,小于训练配置的8192)。该arm的已知局限:由于98.8%的记录结论为“sound”,仅训练此臂会导致模型学会识别和解释合理回复,而无法捕捉违反宪法的错误。该数据集适用于文本生成任务,特别是用于对齐或批判性评论能力的微调研究。

This dataset is a mixed dataset for supervised fine-tuning (SFT) of Qwen3.6-27B, containing 9,284 Table2 data entries and 716 peer_critique good arm data entries, totaling 10,000 rows. The experiment aims to conduct an ablation study: by training the model only on good-arm comments (rather than flawed arm), it tests whether the flawed arm contributes additional performance gains. Data sources: Table2 part comes from LASR-Callum/2026-08-06-table2-9284-synthdoc-716-train (excluding synthdoc_difficult_advice), and peer_critique part comes from LASR-Callum/2026-08-14-peer-critique, filtering 716 entries with reply_quality == good. Each entry is stored in JSONL format with fields: text (full conversation pre-rendered in Qwen3.6 chat format, each assistant turn includes a think block, where peer_critique entries contain real traces and others use empty markers), source (subset origin), trait_id (synthetic row), scenario_id (synthetic row), reply_quality (always good). The dataset uses the Qwen/Qwen3.6-27B model, and rows are pre-rendered to its chat template. Generation configuration is deterministic assembly (seed 0), with selection balanced across traits (t1-t9 each 80 or 79 entries) and polled within domains. Validation shows that this dataset is byte-level identical to the comparison arm (containing 358 good + 358 flawed versions) in the Table2 part, with the same think token distribution, same shape (716 rows, 7.16% synthetic data, 568 different domains, 716 different scenarios), and no truncation (max length 8191, less than training configurations 8192). Known limitation of this arm: since 98.8% of the records conclude sound, training only this arm leads the model to learn to recognize and explain reasonable responses, but cannot capture errors that violate constitutional principles. This dataset is suitable for text generation tasks, particularly for fine-tuning studies on alignment or critique capabilities.

创建时间:
2026-08-18
原始信息汇总

数据集概述

基本信息

  • 数据集名称LASR-Callum/2026-08-17-table2-9284-peer-critique-good716-train
  • 任务类型:文本生成(text-generation)
  • 许可证:other(自定义许可)
  • 数据文件t2_9284_pc_good716_10k.jsonl
  • 行数:10,000 行

数据集构成

该数据集是 Qwen3.6-27B SFT 混合数据集,包含两部分:

  • 9,284 行 Table2 数据:与比较臂 2026-08-16-table2-9284-peer-critique-716-train 中对应行逐字节一致
  • 716 行 peer_critique 数据:全部来自 good arm(即回复质量标记为 good 的批评样例),而非比较臂中的 358 good / 358 flawed 混合

生成与构建

  • 生成日期:2026-08-17
  • 构建脚本scratch/build_t2_9284_pc_good716_mixture.py,使用确定性组装,种子为 0,不涉及采样
  • 数据来源
    • LASR-Callum/2026-08-14-peer-critique(筛选 reply_quality == good 后选取)
    • LASR-Callum/2026-08-06-table2-9284-synthdoc-716-train(排除 synthdoc_difficult_advice 子集)
  • 上游模型Qwen/Qwen3.6-27B(行已预渲染至其 chat 模板),合成内容由上游通过 OpenRouter 生成

结构特征

  • 格式:JSONL,每个记录含 text(完整对话,预渲染为 Qwen3.6 聊天格式)和 source(来源子集)
  • 思考标记:每个 assistant 轮次均携带 think 块;真实批评样例为真实思考轨迹,其他为精确的空标记 `<think>

</think>

`

  • 统计
    • think_census:{turns: 10362, real: 716, empty: 9646, absent: 0}
    • 合成比例:7.16%
    • 每个 trait 数量:t1-t5 各 80,t6-t9 各 79
    • 716 个不同场景,568 个不同领域
    • 令牌长度:min 36,中位数 337,p90 1551,p99 7560,最大 8191(训练配置 max_seq_len 为 8192,无超限行)

实验目的

该数据集用于消融实验:测试 peer-critique 的 FLAWED 分支是否有贡献,即仅使用 good-arm 批评训练,与 358/358 双臂混合进行比较。数据集描述明确指出已知局限:1,051 条 good-arm 记录中 1,038 条(98.8%)结论为 sound,单独训练会教会识别和解释合理回复,而非捕捉宪法性失误,这是测试变量而非疏忽。

质量验证

  • 合成检查uv run synth check):gold_validation 为 2.99(低于阈值 3,门槛 0.10),flaw_identification 为 0.95(门槛 0.70),两项均通过
  • 可复现性:渲染和选择代码与比较臂共用同一实现(通过路径导入且未修改),确保两臂结果可进行 apples-to-apples 比较
搜集汇总
数据集介绍
2026-08-17-table2-9284-peer-critique-good716-train 数据集图片
构建方式
该数据集源自对既有多元混合训练语料的精细再平衡,其构建遵循严格的确定性流程,以消除随机性干扰。核心步骤为从'peer-critique'源数据中,依据回复质量标记筛选出'good'类别的716条样本,并与9,284条Table2数据融合,形成总计10,000行的训练集。所有数据均被统一渲染至Qwen3.6-27B模型的对话模板,并确保每个助手回复均携带思维块标记。为确保与对照组的可比性,构建过程复用统一代码路径,并经过字节级一致性验证,从而保证各臂数据除目标变量外,其余特征完全对齐。
使用方法
此数据集专为监督微调(SFT)设计,可直接用于训练文本生成模型,尤其是Qwen3.6-27B。使用时需注意,其内容已按照特定模板预先渲染,包含思维块标记,因此需配套相应的掩码策略,以确保损失计算与生成边界规则一致。该数据集适合作为消融实验的单一变量,用以评估移除'flawed'样本后对模型批判性思维或合规性识别能力的影响,并可通过与包含正负样本的对照数据集进行对比训练,以量化该影响的程度。
背景与挑战
背景概述
该数据集名为2026-08-17-table2-9284-peer-critique-good716-train,是Qwen3.6-27B监督微调混合数据集的一个变体,由LASR-Callum团队于2026年8月17日创建,旨在探究同伴批评(peer critique)数据中缺陷样本对模型训练的影响。研究背景源于对宪法AI反馈训练(Constitutional AFT)的深入分析,特别是同伴批评环节中‘好’与‘缺陷’样本的区分度问题。核心研究问题在于,当训练数据仅包含优质批评样本时,模型能否有效学习识别和解释合宪性答复,而非捕捉样本间的表面差异。该数据集通过严格的消融实验设计,确保与对照组(含358好/358缺陷样本)在数据行、思考标记、形状等方面完全一致,从而精确归因训练效果差异。此研究对于优化合成数据混合策略、提升模型自我修正能力具有重要参考价值,是探索AI反馈训练中数据组成与模型行为关系的关键一步。
当前挑战
该数据集面临的挑战主要源于其构建目的与数据本质的张力。首要挑战是领域问题:在宪法反馈训练中,若训练数据仅含‘优质’批评样本,模型可能过度聚焦于识别和解释完好答复,而丧失对宪法违规行为的检测能力,即存在‘单类学习’偏差。其次,构建过程中面临显著的数据泄漏风险:经检验,原始同伴批评数据的‘好’臂与‘缺陷’臂分别由不同模型生成(如Sonnet vs. grok-4.3),导致数据标签可通过作者身份和文本长度(AUC 0.9973)被轻易预测,从而污染训练信号。为规避此问题,该数据集刻意仅选取‘好’臂样本,但由此引入新的挑战——98.8%的样本结论为‘sound’,训练出的模型可能对违规内容‘视而不见’。此外,构建时需确保与对照组的数据完全对齐(字节级一致、思考标记统一、长度分布匹配),并严格验证生成依据(如`gold_validation`和`flaw_identification`指标),技术上颇具难度,稍有不慎便会引入混淆变量,使实验结果失效。
常用场景
经典使用场景
该数据集作为监督微调(SFT)语料,其经典使用场景聚焦于文本生成任务,尤其是为大型语言模型提供高质量的训练样本。其内容由9,284条Table2合成文档样本与716条同行评审(peer critique)样本组成,所有样本均经过预渲染至Qwen3.6-27B的对话格式,包含完整的思考块(think block),使得模型在训练中能够学习到结构化的推理链条。该数据集的独特设计在于其仅包含'good'质量评审样本,旨在剔除有缺陷的评审分支,从而考察模型在单一正面反馈下的学习效能。研究者可将其直接用于全参数微调或参数高效微调(如LoRA),以增强模型在复杂指令遵循、多步骤推理及领域定制响应生成方面的能力,其平衡的特质分布和领域轮询机制保证了训练数据的多样性与代表性。
解决学术问题
该数据集在学术层面主要解决两个关键问题:其一,探究训练数据中'缺陷评审'(flawed arm)对模型性能的贡献度,通过剥离该分支,为消融实验提供了干净的控制变量,使得研究者能够量化同行评审反馈中负面样本的价值;其二,应对'表面捷径'(surface shortcut)问题——在原始数据集中,评审质量标签与生成模型的身份高度相关,导致模型可能依赖作者线索而非内容实质进行判断。本数据集通过仅保留一个质量类别,从根本上消除了这种偏见,为隔离评估模型对'优质回答'的识别与生成能力提供了严谨的实验环境。其'gold_validation'和'flaw_identification'指标均通过预设门槛,保证了数据的可靠性,从而支持关于宪法性AI反馈机制的有效性检验。
实际应用
在实际应用中,该数据集适用于构建和优化需要高度可靠性和对齐性的对话AI系统。其合成样本覆盖568个不同领域,可助力企业客服、教育辅导、医疗咨询等场景中的模型微调,使其在生成回复时更加精准和安全。由于数据集中每轮对话都带有思考块,训练出的模型能够展现可解释的推理过程,这对于需要决策透明度的领域(如金融分析或法律咨询)尤为关键。此外,该数据集的'good-arm'设计使得它适合作为基准数据集,用于开发评估AI反馈质量的工具或训练评审判别模型,从而间接提升内容审核系统的公平性与准确性。
数据集最近研究
最新研究方向
该数据集聚焦于大语言模型对齐训练中同伴批评信号的有效性消融,尤其探究仅使用高质量(优良)批评样本对模型行为的影响。其研究方向紧跟当前模型对齐领域中关于数据质量与组成结构的探讨,通过精心设计的实验架构(如保持基线数据逐字节一致、统一思维标记策略)来隔离变量,以严谨的对照方式评估单一类别批评数据的训练效应。此数据集的构建不仅服务于具体模型(Qwen3.6-27B)的监督微调,更旨在深入理解批评数据中‘缺陷’样本的独特贡献,为未来更高效、更鲁棒的对齐数据筛选与合成提供实证基础,其意义在于推动对齐训练从经验配方走向可解析的科学化设计。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务