遇见数据集

llama-nemotron-science-reasoning-on-canonical-think-full

收藏
Hugging Face2026-07-16 更新2026-07-17 收录
官方服务:

资源简介:

Llama-Nemotron科学推理数据集(Delphi规范思考格式)是一个专注于科学领域推理任务的文本生成数据集。该数据集派生自NVIDIA的Llama-Nemotron后训练数据集,专门提取了其中的SFT/science子集,并筛选出所有启用了推理(reasoning=="on")的样本,即包含详细思维链(长链式思考)的示例。数据集规模为708,920个样本,未应用任何长度限制或子采样。关键特征在于数据格式转换:原始数据中的思考标记(如`<think>...</think>`)被统一转换为规范的Delphi聊天模板格式(`<|start_think|>...<|end_think|>`),以兼容LLaMA-Factory的ReasoningTemplate.encode_oneturn方法。数据集采用ShareGPT格式组织,每个样本包含messages(角色-内容对话列表)、num_tokens(基于Delphi/Llama-3.1分词器的输入输出总长度)、category(固定为"science")、reasoning(固定为"on")、generator(生成模型信息)、license(许可证类型)和source(来源标识)等字段。该数据集适用于训练和评估具有推理能力的语言模型,特别是在科学领域的思维链生成任务中。数据许可证继承自源数据集,主要包括CC-BY-4.0和CC-BY-SA两种类型,生成模型涉及DeepSeek-R1系列。

The Llama-Nemotron Scientific Reasoning Dataset (Delphi Standard Thinking Format) is a text generation dataset focused on reasoning tasks in the scientific domain. It is derived from NVIDIAs Llama-Nemotron post-training dataset, specifically extracting the SFT/science subset and filtering all samples with reasoning enabled (reasoning=="on"), i.e., examples containing detailed chain-of-thought (long-chain thinking). The dataset size is 708,920 samples, with no length restrictions or subsampling applied. A key feature is the data format conversion: the original thinking tokens (e.g., `<think>...</think>`) are uniformly converted to the standard Delphi chat template format (`<|start_think|>...<|end_think|>`) to be compatible with the ReasoningTemplate.encode_oneturn method in LLaMA-Factory. The dataset is organized in ShareGPT format, with each sample containing fields such as messages (a list of role-content dialogues), num_tokens (total input-output length based on the Delphi/Llama-3.1 tokenizer), category (fixed as "science"), reasoning (fixed as "on"), generator (generation model information), license (license type), and source (source identifier). This dataset is suitable for training and evaluating language models with reasoning capabilities, particularly in chain-of-thought generation tasks in the scientific field. The data license is inherited from the source dataset, primarily including CC-BY-4.0 and CC-BY-SA types, and the generation models involve the DeepSeek-R1 series.

提供机构:
LAION eV
创建时间:
2026-07-16
原始信息汇总

Llama-Nemotron Science Reasoning — Delphi Canonical-Think (完整版)

数据集概述

本数据集是 nvidia/Llama-Nemotron-Post-Training-Datasetreasoning:on 的科学子集的完整版本,已转换为规范的 Delphi 聊天模板思考格式。包含 708,920 条数据

与早期发布的冷启动热身切片(如 laion/llama-nemotron-science-reasoning-on-le3000tok-100k 及其 -canonical-think 变体)不同,本构建既不设置长度上限,也不进行子采样——所有长链式思维(long-CoT)科学样本均已包含。

数据处理说明

数据源自 nvidia/Llama-Nemotron-Post-Training-Dataset 中的 SFT/science/science.jsonl

  • 子集选择:仅使用 SFT/science 部分。
  • 推理启用:仅筛选 reasoning == "on" 的样本,即长链式思维("详细思考")示例,每条数据均包含思考区域。
  • 无长度过滤与子采样:早期版本设置了最多 3000 个 Delphi token 的上限并通过水库采样缩减至 10 万条;本版本取消了两项限制。
  • 规范化 Delphi 思考标记:将每条助手指令中的内联 <think>...</think> 改写为标准格式 `<|start_think|> ... <|end_think|>

+ 答案,字节级镜像了chat_templates/delphi_v0.jinja2中的推理提取逻辑。该格式符合 LLaMA-Factory 的ReasoningTemplate.encode_oneturn要求——该函数检测字面量<|start_think|>字符串,内联<think>会导致空思考目标,使得推理部分无法训练。若原始数据不含</think>`,则保留为纯答案。

数据格式

每条数据包含以下字段:

  • messages:ShareGPT 格式的 [{role, content}] 列表;助手内容以规范的 <|start_think|> 块开头(若原始数据包含 <think> 痕迹)。
  • num_tokens:使用 Delphi / Llama-3.1 分词器(词汇表为 marin-community/delphi-3e18-447Mparams-1.2Btokens)计算的原始 输入 + 输出 token 长度。可供下游过滤使用,但本数据集未依此进行过滤
  • category:固定为 science
  • reasoning:固定为 on
  • generator:生成模型来源,包括 [DeepSeek-R1, DeepSeek-R1, Qwen-2.5-32B-Instruct, DeepSeek-R1, Qwen-2.5-72B-Instruct]
  • license:许可协议,包括 [cc-by-4.0, cc-by-sa]
  • source:数据来源。

许可与归属

本数据集衍生自 NVIDIA 的 nvidia/Llama-Nemotron-Post-Training-Dataset。每条数据携带相应的许可协议(cc-by-4.0cc-by-sa)。完整的许可条款请参考源数据集,本转换版本继承源数据集的许可。

标签信息

  • 语言:英语 (en)
  • 数据规模:100K < n < 1M(实际 708,920 条)
  • 任务类别:文本生成 (text-generation)
  • 标签:推理 (reasoning)、链式思维 (chain-of-thought)、Delphi、监督微调 (sft)
搜集汇总
数据集介绍
llama-nemotron-science-reasoning-on-canonical-think-full 数据集图片
构建方式
该数据集源自NVIDIA发布的Llama-Nemotron-Post-Training-Dataset,严格筛选其中SFT/science子集内reasoning为“on”的样本,即包含长链式思维过程的科学推理实例。为确保思维链的完整性与训练有效性,所有样本均未被施加长度过滤或二次采样,保留了全部708,920条原始长思考记录。进一步,数据集中每个助手回复中内联的<think>...</think>标记被统一转换为规范的<|start_think|>\n...\n<|end_think|>\n\n+答案格式,该转换精确匹配Delphi聊天模板中推理提取的字节级要求,从而避免因标记格式差异导致的训练目标缺失问题。对于不含</think>标记的行,则仅保留纯答案部分。
特点
该数据集最显著的特征在于其完整性与规范性。作为Llama-Nemotron科学推理数据集的“完整”版本,它未对思考长度设定上限,亦未进行任何下采样,因此能够完整覆盖原始数据中从短链到极长链的多样化推理模式,为训练模型处理复杂科学问题提供丰富素材。所有样本均采用统一的规范化思维标记格式,这一设计确保了与LLaMA-Factory等主流训练框架中ReasoningTemplate.encode_oneturn方法的无缝兼容,消除了因标记格式不统一可能引发的训练错误。此外,数据集中还提供了基于Delphi/Llama-3.1分词器计算的token数量字段,便于用户根据计算资源进行下游筛选。
使用方法
该数据集适用于监督微调,特别是针对科学推理任务中长链思维能力的训练。使用者可直接加载ShareGPT格式的messages字段,其中每条消息包含角色与内容。由于数据已采用标准的<|start_think|>标记格式,用户无需额外进行正则替换,即可将其作为LLaMA-Factory或类似支持Delphi对话模板框架的输入。数据集中提供的num_tokens字段可作为可选的过滤依据,用户可根据显存或训练批大小需求,按token数量对样本进行删减。同时,每一条数据均保留了来源、生成器及许可信息,使用者应遵守CC-BY-4.0或CC-BY-SA许可条款,并在衍生作品中注明原始数据来源。
背景与挑战
背景概述
在大型语言模型的后训练阶段,科学推理能力的提升是当前自然语言处理领域的前沿课题。由NVIDIA主导构建的Llama-Nemotron后训练数据集,旨在通过长链式思维(Long Chain-of-Thought)示例增强模型的复杂推理能力。该数据集于2024年创建,核心研究问题聚焦于如何通过高质态的科学推理数据,使模型在数学、物理等严谨学科中生成逻辑自洽的思考过程。其影响力体现在为后训练数据增强提供了一个标杆性基准,尤其是对Delphi对话模板的适配,使得模型能够显式学习思考区域的表达。本数据集作为完整版(无长度截断与子采样),保留了全部708,920条科学推理样本,为探索长链条推理的极限性能提供了宝贵资源。
当前挑战
该数据集所解决的领域问题在于,现有模型在科学推理任务中常出现逻辑跳跃或推理链断裂,缺乏显式的结构化思考过程。本数据集通过编码规范的思考标记(<|start_think|>)与答案分离,强制模型学习可控的推理路径。构建过程中面临的主要挑战包括:需将原始数据中不同格式的内联思考标记统一转换为标准模板,否则会导致推理模板无法正确识别思考区域;同时,必须在无长度过滤的前提下处理超长序列,这对token化与训练效率提出了严峻考验。此外,来自多个生成器(如DeepSeek-R1与Qwen变体)的数据异质性要求细致的质量对齐,以确保推理风格的一致性。
常用场景
经典使用场景
在科学推理与大型语言模型的后训练优化领域,llama-nemotron-science-reasoning-on-canonical-think-full数据集以其完整的、无长度截断的科学长链思维(long chain-of-thought)样本集而闻名。该数据集的经典使用场景在于为模型提供经过规范化的思辨模板(canonical Delphi think tokens),使得研究者能够高效地对模型进行监督微调(SFT),以强化其进行深度推理的能力。特别是在需要模型展示详细推理步骤的科学问答场景中,该数据集作为训练数据,能够引导模型生成结构化的思考过程,从而提升模型在复杂科学问题上的逻辑连贯性与准确性。
解决学术问题
该数据集的核心学术贡献在于解决了大语言模型在科学推理训练中数据格式不统一与推理过程截断的关键问题。此前,广泛使用的推理数据集往往对思考长度施加限制(如≤3000令牌)或进行欠采样,导致模型难以学习到完整、深入的逻辑链条。该数据集通过保留所有长链科学推理样本,并将其转换为系统可识别的规范思辨令牌格式,为学术界提供了一份基准级训练材料。这一举措显著推进了语言模型从简单模式记忆向真正思维模拟(thinking region)的转变,对研究模型如何进行可解释的复杂推理具有里程碑式的意义。
衍生相关工作
该数据集衍生了一系列标志性的前沿工作,其中最具代表性是基于其构建的冷启动热身训练子集(如laion/llama-nemotron-science-reasoning-on-le3000tok-100k),以及围绕OpenThoughts-Agent框架开展的一系列思辨模板对齐研究。这些工作探索了推理长度与模型性能之间的复杂关系,验证了规范化思辨令牌(canonical think tokens)在后训练中的核心作用。同时,该数据集也催生了关于如何有效分离模型思考(thinking)与回答(answer)阶段的跨模型研究,为下一代支持内省推理的对话代理提供了数据基础与训练范式参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务