遇见数据集

llama-nemotron-science-reasoning-on-le3000tok-100k

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

Llama-Nemotron科学推理数据集是nvidia/Llama-Nemotron-Post-Training-Dataset的一个过滤子样本,专门设计用于在冷启动监督微调(SFT)过程中预热Delphi聊天模板的推理标记(如<|start_think|>和<|end_think|>)。该数据集仅包含原始数据集中SFT/science子集且推理模式为开启的长思维链示例,排除了SFT/code和数学子集,以专注于推理模板的预热而非知识学习。所有样本的输入和输出总长度被限制在3000个标记以内(使用Delphi/Llama-3.1分词器测量),并通过均匀随机抽样选取了100,000行数据。数据格式采用ShareGPT风格的消息列表,其中助手回复包含内联的思维链块(在编码时会被规范化为标准推理标记)。数据集包含多个字段:messages(对话消息)、num_tokens(标记数量)、category(科学类别)、reasoning(推理模式)、generator(生成模型)、license(许可协议)和source(数据来源)。主要用途是训练模型使用推理模板和思维到答案的结构,适用于需要预热思维链推理能力的自然语言生成任务,特别是科学领域的推理任务。

The Llama-Nemotron Scientific Reasoning Dataset is a filtered subsample of the nvidia/Llama-Nemotron-Post-Training-Dataset, specifically designed for warming up the reasoning tokens (<|start_think|> and <|end_think|>) of the Delphi chat template during the cold-start supervised fine-tuning (SFT) process. It includes only long chain-of-thought examples from the SFT/science subset of the original dataset with reasoning mode on, excluding the SFT/code and math subsets to ensure focus on reasoning template warm-up rather than knowledge learning. All samples have a total input and output length limited to 3000 tokens (measured using the Delphi/Llama-3.1 tokenizer), and 100,000 rows were selected through uniform random sampling. The data format follows the ShareGPT-style message list, where assistant responses contain inline thought chain blocks (which are normalized to standard reasoning tokens during encoding). The dataset includes multiple fields: messages (dialogue messages), num_tokens (token count), category (scientific category), reasoning (reasoning mode), generator (generation model), license (license agreement), and source (data source). Its primary purpose is to train models to use reasoning templates and thought-to-answer structures, suitable for natural language generation tasks requiring warm-up of chain-of-thought reasoning capabilities, particularly in scientific reasoning tasks.

提供机构:
LAION eV
创建时间:
2026-06-08
原始信息汇总

数据集概述

数据集名称:Llama-Nemotron science reasoning — Delphi cold-start CoT warmup (≤3000 tok, reasoning:on, 100k)

语言:英语(en)

许可:其他(other),衍生自 NVIDIA 的数据集,具体行级许可包括 cc-by-4.0cc-by-sa

数据量:10K < n < 100K(实际为 100,000 行)

任务类别:文本生成(text-generation)

标签:推理(reasoning)、思维链(chain-of-thought)、Delphi、冷启动(cold-start)、监督微调(sft)


数据集来源与构建目的

  • 来源:从 nvidia/Llama-Nemotron-Post-Training-Dataset 中过滤并子采样得到。
  • 目的:用于在冷启动监督微调(cold-start SFT)过程中,预热 Delphi 聊天模板的推理令牌(<|start_think|> / <|end_think|>)。这是一个模板/思维链的预热切片,而非知识数据集。

过滤条件

  1. 子集选择:仅使用 SFT/science 子集,排除了 SFT/code 子集(因约 98.6% 的推理轨迹超过 3000 令牌预算)。数学子集也故意排除,避免在预热中添加数学练习。
  2. 推理标记:仅保留 reasoning == "on" 的样本,即包含详细思维链(“detailed thinking on”)的示例。
  3. 长度限制:使用 Delphi / Llama-3.1 分词器(marin-community/delphi-3e18-447Mparams-1.2Btokens 词汇表),基于 input + output 的长度 ≤ 3000 令牌。保守上限旨在仅训练模板令牌和思考→回答的格式,而非长推理。
  4. 随机子采样:通过蓄水池算法(种子=0)均匀随机子采样至 100,000 行。

数据格式

每条记录包含以下字段:

  • messages:ShareGPT 格式的 [{role, content}]。助手回答中包含一个内联的 <think>...</think> 块,后接答案。在编码时,Delphi 的 LLaMA-Factory 模板会将内联的 <think> 规范化为标准的 <|start_think|> / <|end_think|> 令牌。
  • num_tokens:基于 Delphi 分词器计算的输入+输出令牌数(≤ 3000)。
  • category:固定为 science
  • reasoning:固定为 on
  • generator:生成器来源,包括 DeepSeek-R1DeepSeek-R1, Qwen-2.5-32B-InstructDeepSeek-R1, Qwen-2.5-72B-Instruct
  • license:行级许可信息。
  • source:来源数据集。

用途与限制

  • 适用场景:仅用于预热聊天模板的推理令牌,以准备后续的强化学习(RL)阶段。
  • 不适用场景:不适合教授新知识或数学技能,该数据集是一个小型的、长度受限的切片,仅用于安装推理令牌。
搜集汇总
数据集介绍
llama-nemotron-science-reasoning-on-le3000tok-100k 数据集图片
构建方式
该数据集源自NVIDIA的Llama-Nemotron-Post-Training-Dataset,专为冷启动阶段的有监督微调而构建,目标是预热德尔菲(Delphi)聊天模板中的推理标记。构建过程中,仅保留SFT/science子集,并筛选出推理标志为“on”的样本,确保每条数据均具备长链思维轨迹。通过德尔菲/Llama-3.1分词器对输入与输出进行长度约束,仅保留不超过3000个标记的样例,从而聚焦于模板标记与思维至答案的转换模式学习。最终采用蓄水池均匀随机抽样方法,以种子0从符合条件的样本中选取10万条,形成本数据集。
特点
本数据集的显著特点在于其高度针对性的设计:它并非旨在传授新知识或数学技能,而是作为一篇精炼的模板与思维链热身切片,专用于在强化学习前安装推理标记。数据集中仅包含科学领域的长链思维样例,数学与代码子集因标记长度过长或避免引入额外练习而被排除。每条样本的助手回复均内嵌<think>...</think>块,经德尔菲模板编码后标准化为规范推理标记。此外,数据集附有来源、生成器及许可信息,确保可追溯性与合规性。
使用方法
使用时需配合支持德尔菲聊天模板的微调框架,如LLaMA-Factory,该模板会在编码时将内联<think>标记自动转换为标准的<|start_think|>与<|end_think|>标记。数据集以ShareGPT格式提供,包含角色与内容的对话消息字段,以及标记数量、类别、推理标志、生成器和许可信息等元数据。由于其设计初衷为冷启动热身,建议在强化学习阶段之前,将其作为有监督微调的初始切片使用,以激活模型的推理标记能力,而不应用于一般知识或数学技能的教学场景。
背景与挑战
背景概述
该数据集由NVIDIA团队于2025年构建,旨在为大语言模型的冷启动监督微调(SFT)阶段提供推理模板预热资源。核心研究问题聚焦于如何通过短链思维(CoT)样本高效激活模型内嵌的思考标记(如<|start_think|>和<|end_think|>),以促进后续强化学习阶段的性能。它从NVIDIA的《Llama-Nemotron后训练数据集》中过滤出科学推理子集,并严格限制序列长度不超过3000个令牌,仅保留明确开启推理机制的样本。这一设计显著降低了模板学习的计算成本,同时确保了推理路径的规范性,对提升大模型在科学问答领域的冷启动效率具有直接贡献。
当前挑战
数据集面临的核心挑战是如何在极端长度限制下保持推理轨迹的完整性。原始数据中近98.6%的代码推理样本因超过3000令牌被排除,可能导致科学领域外推能力的泛化不足。构建过程中需统一多种生成器(如DeepSeek-R1、Qwen-2.5系列)产生的非标准化推理格式,并通过ShareGPT协议将其映射为Delphi模板可识别的<think>标签结构。此外,随机子采样至10万行时需平衡不同许可证(CC-BY-4.0与CC-BY-SA)样本的分布,以避免版权合规性风险——这一过程既考验数据清洗的精确度,也对预训练词表与推理模板的兼容性提出了严苛要求。
常用场景
经典使用场景
该数据集最经典的使用场景在于为大型语言模型提供冷启动阶段的思维链能力预热。具体而言,研究人员利用此数据集对模型进行监督式微调,使其掌握在对话模板中正确生成思考标记(如<|start_think|>与<|end_think|>)的能力,从而引导模型在回答问题前先行展开结构化推理。这一过程并非传授新知识,而是训练模型习得推理的格式与形状,为后续的强化学习奠定基础。
解决学术问题
此数据集着力解决大语言模型在推理过程中结构化思考缺失的学术难题。在传统微调中,模型常直接生成答案而缺乏中间推理环节,导致复杂问题处理能力不足。通过引入长度控制在3000词元以内的科学推理样本,该数据集帮助模型掌握思考标记的生成与回答结构的组织,有效缓解了冷启动阶段推理能力弱、格式不稳定的问题,为提升模型的可解释性与推理深度提供了数据支撑。
衍生相关工作
该数据集衍生了多项相关经典工作。作为nvidia/Llama-Nemotron-Post-Training-Dataset的子采样,它启发了针对冷启动阶段推理标记训练的专用数据集构建方法。后续研究在此基础上探索了不同词元长度限制对推理效果的影响,以及如何结合强化学习进一步优化思考链的质量。此外,其过滤策略——如排除代码与数学子集——也为其他领域(如医学或法律推理)设计专属预热数据集提供了方法论参考。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务