遇见数据集

llama-nemotron-science-reasoning-on-le3000tok-100k-canonical-think

收藏
Hugging Face2026-06-11 更新2026-06-12 收录
官方服务:

资源简介:

本数据集是“Llama-Nemotron science reasoning — Delphi cold-start CoT warmup (canonical think tokens)”,它是原始数据集“laion/llama-nemotron-science-reasoning-on-le3000tok-100k”的一个再生变体(Fix C)。其核心目的是解决LLaMA-Factory框架在处理原始数据中非标准推理标记时遇到的训练问题。原始数据集中助手消息使用了内联的`<think>...</think>`标记来表示推理过程,但这与LLaMA-Factory的`ReasoningTemplate.encode_oneturn`方法所期望的规范思考标记`<|start_think|>`不匹配,导致推理部分无法被正确识别为训练目标。因此,本数据集将每个助手消息中的内联`<think>...</think>`转换为了规范的格式`<|start_think|> ... <|end_think|> `,后接答案。这种转换确保了推理内容能被框架正确解析并用于训练。对于原始数据中没有`</think>`标记的行(即纯答案),则保持不变。数据集完整保留了源数据集的所有其他字段,包括`num_tokens`、`category`、`reasoning`、`generator`、`license`、`source`,以及系统和用户的对话轮次。数据集继承自源数据集的许可和来源,其源头可追溯至`nvidia/Llama-Nemotron-Post-Training-Dataset`。数据集规模在1万到10万样本之间,语言为英文,主要面向文本生成任务,特别适用于与推理、思维链(CoT)、Delphi方法、模型冷启动和监督微调(SFT)相关的研究与应用场景。

This dataset is "Llama-Nemotron science reasoning — Delphi cold-start CoT warmup (canonical think tokens)", which is a regenerated variant (Fix C) of the original dataset "laion/llama-nemotron-science-reasoning-on-le3000tok-100k". Its core objective is to address training issues encountered by the LLaMA-Factory framework when processing non-standard reasoning tokens within the original dataset. The assistant messages in the original dataset used inline `<think>...</think>` tags to denote reasoning processes, but these do not match the canonical thinking tokens `<|start_think|>` expected by LLaMA-Factory's `ReasoningTemplate.encode_oneturn` method, which causes the reasoning content to fail to be correctly recognized as a training objective. Therefore, this dataset converts the inline `<think>...</think>` in each assistant message into the canonical format `<|start_think|> ... <|end_think|> `, followed by the answer. This conversion ensures that the reasoning content can be correctly parsed by the framework and utilized for training. For rows in the original dataset without the `</think>` tag (i.e., pure answer content), the original content remains unchanged. The dataset fully retains all other fields from the source dataset, including `num_tokens`, `category`, `reasoning`, `generator`, `license`, `source`, as well as system and user dialogue turns. The dataset inherits the license and source attribution from the original dataset, whose origin can be traced back to `nvidia/Llama-Nemotron-Post-Training-Dataset`. The dataset contains between 10,000 and 100,000 samples, is in English, and is primarily designed for text generation tasks, and is particularly suitable for research and application scenarios related to reasoning, Chain-of-Thought (CoT), Delphi method, model cold start, and Supervised Fine-Tuning (SFT).

提供机构:
LAION eV
创建时间:
2026-06-11
原始信息汇总

数据集名称

Llama-Nemotron science reasoning — Delphi cold-start CoT warmup (canonical think tokens)

数据集来源

数据集规模与语言

  • 样本数量:10,000 < n < 100,000(10K至100K之间)。
  • 语言:英语(en)。

任务与标签

  • 任务类别:文本生成(text-generation)。
  • 标签:推理(reasoning)、思维链(chain-of-thought)、德尔菲(delphi)、冷启动(cold-start)、监督微调(sft)。

数据集特点与修正说明

该数据集是原始数据集的修复变体(Fix C),主要解决以下问题:

  • 原始问题:原始数据集中,助手的回复内包含内联的 <think>...</think> 标签。在 LLaMA-Factory 的 ReasoningTemplate.encode_oneturn 中,仅识别字面量的规范字符串 <|start_think|>;内联的 <think> 无法通过检查,导致框架注入空的规范块(<|start_think|><|end_think|>)作为损失目标,而真实的推理文本被当作普通文本而非训练目标,造成推理内容无法有效训练。
  • 修复方法:本变体将每条助手消息中的内联 <think>...</think> 转换为规范形式 `<|start_think|> ... <|end_think|>

+ 答案,**逐字节匹配**chat_templates/delphi_v0.jinja2` 中的推理提取逻辑。

  • 修正效果:转换后,encode_oneturn 的规范字符串检查通过,不会注入空块,推理内容作为真实目标参与训练。

数据字段与保留信息

  • 未更改字段:原始数据集中所有其他字段(num_tokenscategoryreasoninggeneratorlicensesource)以及系统/用户轮次的内容均逐字节保留
  • 特殊处理
    • 不包含 </think> 的行保持不变(纯答案,由 LLaMA-Factory 处理)。
  • 生成脚本:该数据集由 sft/delphi/canonicalize_warmup_think.py(位于 OpenThoughts-Agent 项目中)生成。

用途

适用于推理任务监督微调,特别是需要对思维链推理进行冷启动训练的场景,确保推理内容被正确编码为训练目标。

搜集汇总
数据集介绍
llama-nemotron-science-reasoning-on-le3000tok-100k-canonical-think 数据集图片
构建方式
本数据集是在原始数据集laion/llama-nemotron-science-reasoning-on-le3000tok-100k基础之上,针对推理模板兼容性问题进行的修正与重构。原始数据助手回复中使用了内联的<think>...</think>标签,但LLaMA-Factory的ReasoningTemplate.encode_oneturn仅识别字面规范字符串<|start_think|>,导致训练时推理内容无法正确作为损失目标。为解决此问题,本数据集通过脚本sft/delphi/canonicalize_warmup_think.py将每条助手消息中的内联<think>...</think>逐字节转换为规范形式<|start_think|>\n...\n<|end_think|>\n\n后接答案,从而确保编码检查通过,使推理内容成为真实训练目标。原数据集中未包含</think>的样本保持原样,其余字段如num_tokens、category、reasoning、generator等均原封不动保留。
特点
该数据集的核心特色在于其作为冷启动链式思维推理热身数据的精准定位,以及针对训练管线兼容性的深度优化。通过将推理内容规范化为标准标签格式,有效避免了因模板匹配失败导致的空损失目标注入问题,使模型能够从完整推理链条中学习。数据集规模介于1万至10万条之间,涵盖英语科学与推理类文本生成任务,并继承了源自NVIDIA Llama-Nemotron后训练数据集的许可与溯源信息。其设计精妙之处在于完全镜像了Delphi v0推理提取模板的字节级处理逻辑,确保数据在训练流水线中的无缝集成。
使用方法
使用者可通过HuggingFace数据集加载库直接调用本数据集,其ID为laion/llama-nemotron-science-reasoning-on-le3000tok-100k-canonical-think。适用于基于LLaMA-Factory框架的监督微调流程,特别是在启用ReasoningTemplate编码配置时,本数据集能够正确触发规范标签识别,无需额外注入空块。建议在训练前仔细检查编码模板的标签匹配规则,并利用提供的category字段进行领域筛选或按num_tokens进行长度控制。数据集的原始字段与元数据均完整保留,便于与下游推理评估或链式思维消融实验衔接。
背景与挑战
背景概述
该数据集由LAION团队于2024年创建,源自nvidia/Llama-Nemotron-Post-Training-Dataset,核心研究问题聚焦于提升大语言模型在科学推理任务中的链式思考(Chain-of-Thought)能力。通过引入规范化思考令牌(canonical think tokens),数据集旨在解决现有训练框架中推理目标格式不匹配导致的训练失效问题,从而优化模型在冷启动场景下的推理质量。在开放科学社区中,该工作为改进推理型数据集构建范式提供了重要参考,尤其对细粒度推理模板设计具有深远影响。
当前挑战
领域层面,大语言模型在科学推理中常因推理链断裂或虚假关联而生成不可靠结论,亟需结构化推理引导。构建过程中,原始数据集的助理回复使用内联`<think>...</think>`标记,与LLaMA-Factory等框架要求的标准`<|start_think|>`令牌不兼容,导致训练时推理目标被空白块覆盖,模型无法有效学习链式推理。本数据集通过逐条转换内联标记为标准格式,确保了推理内容作为真实训练目标被学习,但这一格式一致性维护与跨框架适配仍是当前构建中的核心挑战。
常用场景
经典使用场景
在科学推理与思维链微调领域,Llama-Nemotron科学推理数据集(规范思维令牌版本)最为经典的应用是作为冷启动阶段的标准监督微调数据,用于训练大语言模型在科学问题解答过程中生成结构化的推理过程。通过将原始数据集中的内联式<think>标签转换为规范形态的<|start_think|>与<|end_think|>格式,该数据集确保了微调框架能够正确捕获并训练模型的推理路径,从而提升模型在数理化等科学推理任务中的表现。这一规范化的数据构建方法,为后续的高阶推理能力培养奠定了坚实的基础。
解决学术问题
该数据集核心解决了大语言模型科学推理训练中一个关键的技术障碍——微调框架对推理标签格式的严格依赖导致训练目标错位的问题。在学术研究中,许多基于LLaMA-Factory等框架的工作曾因数据中推理标签格式不规范,使得模型在训练时实际拟合的是空推理块而非真实的思维链内容,严重制约了推理能力的培养。此数据集通过将推理内容精确转换为框架识别的规范格式,从数据层面消除了这一训练畸变,使得数千个科学推理样本的思维链部分能够作为真实训练目标参与梯度更新,显著提升了模型在复杂科学问题上的逻辑推理能力。
衍生相关工作
该数据集衍生出的相关工作主要集中在推理模板优化与冷启动训练策略两个方向。其中最具代表性的是OpenThoughts-Agent项目中基于该数据开发的Delphi推理框架,其v0版本引用此数据集作为标准冷启动微调数据,后续版本进一步探索了多轮推理交替训练技术。同时,LLaMA-Factory社区的研究者借鉴该数据集的标签规范化思路,提出了通用推理模板适配层,使得不同格式的推理数据可以统一接入主流微调框架。还有学者在此基础上研究了推理令牌数量与模型性能的关系,推动了针对科学推理任务的高效微调数据合成方法的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务