遇见数据集

2026-09-30-nosynth-mix-gpt-oss-120b

收藏
Hugging Face2026-09-30 更新2026-10-01 收录
官方服务:

资源简介:

该数据集是GPT-OSS实验的一部分,名为“GPT-OSS nosynth 缓存替代答案:将审查失败的目标替换为保存的思维链和最终答案”。它是一个非合成(nosynth)训练数据混合物,使用GPT-OSS-120B模型生成,并经过Codex离线审查流程。数据由单一文件mixture.jsonl构成,遵循标准的messages和tools结构,但其中审查失败的目标(原始输出)被替换为来自缓存的有效候选答案(包括思维链和最终答案)。审查过程共筛选了289个候选行,并批准了其中一批样本,每个批准样本均附有具体的有效性理由。数据集还包含了生成配置、来源仓库、时间戳以及使用的constitution(claude_distilled_09_principles)等元信息。适用于需要高质量替代答案的语言模型训练或评估场景。

This dataset is part of the GPT-OSS experiment, named GPT-OSS nosynth cache replacement answers: replacing failed review targets with saved chain-of-thought and final answers. It is a non-synthetic (nosynth) training data mixture generated using the GPT-OSS-120B model and processed through the Codex offline review pipeline. The data consists of a single file mixture.jsonl following the standard messages and tools structure, where the failed review targets (original outputs) are replaced with valid candidate answers from the cache (including chain-of-thought and final answers). The review process filtered 289 candidate rows and approved a batch of samples, each with specific validity reasons. The dataset also includes metadata such as generation configuration, source repository, timestamps, and the constitution used (claude_distilled_09_principles). It is suitable for training or evaluating language models that require high-quality alternative answers.

创建时间:
2026-09-30
原始信息汇总

数据集概述

基本信息

  • 数据集地址:https://huggingface.co/datasets/dougalldeepmind/2026-09-30-nosynth-mix-gpt-oss-120b
  • 实验名称:GPT-OSS nosynth cached alternative answers: replace reviewed failed targets with their saved CoT and final answer together
  • 生成日期:2026-09-30

配置与标签

  • 配置名称:default
  • 数据文件:mixture.jsonl
  • 默认配置:是
  • 标签:
    • training-data
    • kind:mixture
    • pipeline:nosynth
    • constitution:claude_distilled_09_principles
    • gpt-oss
    • harmony

数据集构建详情

字段 值
experiment GPT-OSS nosynth cached alternative answers: replace reviewed failed targets with their saved CoT and final answer together
date_generated 2026-09-30
constitution claude_distilled_09_principles (inherited source filtering)
source_repo teaching_claude_why_replication @ b9562bd438370336af9f6fbb5ad7a5e9d53b1221
models 生成器:openai/gpt-oss-120b;审查器:Codex offline review; no new provider calls

生成配置

  • source_repo:dougalldeepmind/2026-09-30-nosynth-mix-gpt-oss-120b
  • source_revision:647743fc260a69bc9ad623a4288127f40e9ed463
  • source_file_sha256:0356d9d82f26e123812352d59a70169e9bb3dd5c752ba1ca008373e4b590e94f
  • destination_name:2026-09-30-nosynth-mix-gpt-oss-120b
  • prior_output:output/gptoss_control/reasoning_replace_qualified_2026-09-29
  • output:output/gptoss_control/cached_answer_review_2026-09-30
  • base_model:openai/gpt-oss-120b
  • reasoning:medium
  • train.max_length:32768

审查方法

  • method:Codex offline review of saved prompts and candidate answers, with local constraint and selected-code checks. No new generator or judge API calls.
  • selection_limitations:Conservative accepted subset, not exhaustive correctness labeling of all cached attempts. Remaining rows are unresolved, not necessarily incorrect. Original equivalence verdicts are historical only.
  • candidate_rows_screened:289
  • approved:共收录 118 条审核通过的候选行(覆盖多个 row 与 attempt,理由涵盖有效替代回答、有效创意草稿、满足输入/输出契约的代码、翻译/总结/推理等内容正确性校验)

模式与溯源

  • schema:mixture.jsonl;messages 和 tools 模式保持不变;审核通过的 targets 会同时替换 content 和 reasoning_content
  • provenance:
    • git_sha:b9562bd438370336af9f6fbb5ad7a5e9d53b1221
    • working_tree_dirty:False
    • command:scratch/gptoss_control/run.py publish-cached-answers --config scratch/gptoss_control/cached_answer_review.yaml
    • config 中 source_repo / source_revision / source_file_sha256 / destination_name / prior_output 与生成配置一致
搜集汇总
数据集介绍
2026-09-30-nosynth-mix-gpt-oss-120b 数据集图片
构建方式
在大规模语言模型对齐与推理增强的研究脉络中,该数据集依托既有拒绝采样与思维链缓存机制而构建。其生成过程以openai/gpt-oss-120b作为生成器,基于源仓库teaching_claude_why_replication中经宪法过滤后的样本,将此前经人工审查判定为不满足原始等价性目标的行,替换为其已保存的思维链与最终答案的组合。审查环节采用Codex离线复核,对289条候选记录逐条检查,仅保留满足提示内容与输出约束的保守子集,全程未引入新的生成或评判接口调用,从而在有限算力条件下实现训练数据的定向修复与扩充。
特点
该数据集在结构上延续了mixture.jsonl的消息与工具模式,并在schema层面保持稳定,仅以审查通过的思维链与最终答案成对替换原有内容字段。其显著特征在于nosynth流程与缓存备选答案的结合,突出“非合成”与“离线审查”属性。每条保留样本均附有审查理由,涵盖替代性回答、创造性草稿、代码契约满足及事实一致性等类型,为训练过程提供了可追溯的质量信号。数据集继承claude_distilled_09_principles宪法,并以medium推理强度控制思维链长度,最大训练长度设定为32768,兼顾长程推理与计算效率。
使用方法
使用该数据集时,研究者可通过HuggingFace datasets库直接加载mixture.jsonl,默认配置即可获取包含消息与工具字段的完整样本。训练环节建议沿用最大长度32768的截断策略,并保留思维链与最终答案的成对结构,以便模型同时学习推理路径与输出格式。由于审查采取保守接受策略,未通过行并非必然错误,使用者在评估或继续筛选时应结合原始等价性判定历史,避免将未解决样本误判为负例。该数据集适用于指令微调、推理能力增强及对齐研究,尤其适合在无新增API调用的约束下进行可复现的离线实验。
背景与挑战
背景概述
该数据集于2026年9月30日由研究团队构建,核心工作是从既有开源混合训练数据集中筛选并替换经审查失败的模型响应,将保存在缓存中的替代答案及其思维链重新注入训练样本。其依托openai/gpt-oss-120b作为生成器,采用Codex离线审查机制,对289条候选样本进行约束核验与选择性代码检查,最终批准128条内容,涵盖创意写作、编程实现、逻辑推理与文本改写等任务类型。该数据集回应了高质量监督微调数据中多样性与正确性难以兼得的现实困境,为后续对齐训练提供了经过审慎筛选的参考样本。
当前挑战
数据集所应对的领域挑战在于,传统混合训练数据往往因单一目标答案而牺牲响应的多样性,而多候选生成又伴随质量参差与审查成本高昂的矛盾。构建过程中的主要困难体现在:离线审查无法穷举全部缓存尝试,仅能给出保守接受子集,剩余未决样本的正确性难以判定;原有等价性裁决仅具历史参考意义,不能直接作为当前质量保证;审查过程完全依赖本地约束检查与代码核验,未引入新的生成或评判接口,限制了覆盖范围与规模化扩展能力。
常用场景
经典使用场景
在大语言模型对齐训练领域,该数据集扮演着指令微调与思维链监督的角色。其经典用法在于将先前推理失败的样本以经过离线审查的替代答案进行替换,从而为模型提供更高质量的监督信号。这一机制使得模型在训练过程中能够接触经过筛选的正确推理路径与最终答案,有效提升模型在复杂推理任务中的表现。数据集采用messages与tools结构,配合harmony格式,适用于多轮对话与工具调用场景的监督微调训练。
实际应用
在实际应用层面,该数据集可服务于大语言模型推理能力的持续优化与安全对齐。工程团队能够将其作为监督微调阶段的训练语料,用以增强模型在创意写作、代码生成、文本改写、翻译以及数学与物理推理等多类任务中的稳健性。由于数据集保留了原始的消息与工具模式,并采用了harmony格式,因此可以直接嵌入现有的训练流水线,无需对模型输入接口做额外调整,适用于工业级的模型迭代与部署准备。
衍生相关工作
该数据集衍生了一系列围绕推理失败修复与替代答案审查的相关工作。其来源仓库teaching_claude_why_replication提供了蒸馏原则与源过滤机制,后续工作在此基础上探索了思维链替换策略、离线审查流程以及约束与代码检查的自动化方法。基于该数据集还发展出对等价性判定历史结论的再评估研究,以及针对保守接受子集与未解决样本的后续分析工作,推动了推理监督数据构建范式的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务