遇见数据集

DeepSeek-V4-Pro-Distilled-200K

收藏
Hugging Face2026-08-02 更新2026-08-03 收录
官方服务:

资源简介:

DeepSeek-V4-Pro-Distilled-200K 是一个监督微调数据集,包含 188,027 条长篇数学和科学推理样本。这些样本由 DeepSeek-V4-Pro 在最大推理模式(Max mode)下生成,并标准化为紧凑的对话格式,适用于知识蒸馏。数据集包含两个配置:Math(158,383 条记录)和 STEM(29,644 条记录),涵盖数学、物理、化学、生物学等领域。每条记录包含六个字段:id(唯一标识符)、conversations(一轮 human 和一轮 gpt 对话)、input(用户提示)、output(教师模型生成的推理过程和最终答案)、domain(细粒度领域)、meta(元数据,包括许可证、源数据集和教师模型名称)。数据集经过严格质量控制,包括去重、字段验证和元数据统一。该数据集主要用于数学和科学推理的监督微调、证明生成与验证、长链思维推理实验以及受控的 Math/STEM 混合研究。数据来源于 NVIDIA 发布的 Nemotron-Math-Proofs-v2、Nemotron-SFT-Math-v4 和 Nemotron-SFT-Science-v2 数据集,许可证为 CC-BY-4.0 和 CC-BY-SA-4.0。用户需遵守每条记录的许可证要求。注意:模型生成的答案可能存在错误,数据集偏向数学领域,且长推理链可能不适合简洁的生产环境。基准测试结果来自参考检查点,不直接证明该数据集的因果改进效果。该数据集仅供研究使用。

DeepSeek-V4-Pro-Distilled-200K is a supervised fine-tuning dataset containing 188,027 long-form mathematical and scientific reasoning samples. These samples are generated by DeepSeek-V4-Pro in Max mode and standardized into a compact conversation format suitable for knowledge distillation. The dataset includes two configurations: Math (158,383 records) and STEM (29,644 records), covering fields such as mathematics, physics, chemistry, and biology. Each record contains six fields: id (unique identifier), conversations (one human turn and one GPT turn), input (user prompt), output (reasoning process and final answer generated by the teacher model), domain (fine-grained domain), and meta (metadata including license, source dataset, and teacher model name). The dataset undergoes strict quality control, including deduplication, field validation, and metadata unification. It is primarily used for supervised fine-tuning of mathematical and scientific reasoning, proof generation and verification, long-chain reasoning experiments, and controlled Math/STEM mixture research. The data originates from NVIDIAs Nemotron-Math-Proofs-v2, Nemotron-SFT-Math-v4, and Nemotron-SFT-Science-v2 datasets, with licenses CC-BY-4.0 and CC-BY-SA-4.0. Users must comply with the license requirements of each record. Note: model-generated answers may contain errors, the dataset is biased towards mathematics, and long reasoning chains may not be suitable for concise production environments. Benchmark results are derived from reference checkpoints and do not directly prove causal improvement from this dataset. This dataset is for research use only.

创建时间:
2026-07-28
原始信息汇总

DeepSeek‑V4‑Pro‑Distilled‑200K 数据集详情

数据集概述

该数据集是一个用于监督微调的高质量数学与科学推理数据集,由 DeepSeek‑V4‑Pro 在 Max 推理模式 下生成的响应构建而成,并统一转换为紧凑的对话式结构以支持模型蒸馏。数据集仅包含 MathSTEM 两个配置,每条记录具有相同的六个顶层字段。

数据集规模

配置 记录数 分片数 划分
Math 158,383 32 train
STEM 29,644 6 train
总计 188,027 38

数据模式

每条记录包含六个顶层字段:

  • id(string):稳定记录标识符
  • conversations(list):一个 human 轮次后接一个 gpt 轮次
  • input(string):用户提示
  • output(string):教师模型生成的推理过程与最终答案
  • domain(string):细粒度来源领域
  • meta(object):所选配置的最小来源元数据(含许可证、来源数据集、教师模型)

示例数据中,output 包含 <think>...</think> 形式的推理轨迹,且 meta 中记录教师模型为 DeepSeek-V4-Pro-Max

质量控制

  • 保证 188,027 个唯一 ID 与唯一归一化输入
  • 全局移除 24 条重复归一化输入
  • 对话轮次与 inputoutput 完全一致
  • 元数据基于严格配置白名单重建
  • 所有 gzip JSONL 分片通过流式解析与模式验证

下游参考结果

以下结果为 9B 参考检查点的测量值,作为蒸馏效果的实际参考,而非受控数据集消融实验。

GSM8K

  • 平均准确率:95.28%(完整 1,319 道题测试集,独立四轮评测)
  • 四轮准确率分别为 95.22%、94.92%、95.75%、95.22%

对比模型(跨模型参考):

模型 准确率
MiMo-V2.5-Pro 99.60%
Llama-3.1-405B-Instruct 96.80%
Llama-3.3-70B-Instruct 94.84%
DeepSeek‑V4‑Pro distilled 9B 95.28%
DeepSeek-V4-Pro 92.60%
DeepSeek-V3 89.30%

评测设置:temperature=1.0top_p=0.95、32K 上下文、Q8 MTP 检查点、精确归一化数字答案匹配。

MMLU‑Pro 选科(数学、物理、化学,各 500 题,共 1,500 题)

  • 平均准确率:90.53%,其中数学 92.4%、物理 89.4%、化学 89.8%
  • 较 Qwen3.5‑9B 官方高 0.93 个百分点,较 Claude Mythos-distilled 27B 高 4.33 个百分点,较 Claude Mythos-distilled 9B 高 9.46 个百分点

加载方式

支持通过 Hugging Face datasets 库加载: python from datasets import load_dataset

math = load_dataset("Jackrong/DeepSeek-V4-Pro-Distilled-200K", "Math", split="train", token=True) stem = load_dataset("Jackrong/DeepSeek-V4-Pro-Distilled-200K", "STEM", split="train", token=True)

预期用途

  • 数学与科学推理的监督微调
  • 证明生成、批判与验证研究
  • 长链思维与工具集成推理实验
  • 受控的 Math/STEM 混合研究

局限性

  • 模型生成的答案可能存在事实、数学、科学或推理错误
  • 数据集中于 Math,分布不均
  • 精确输入去重未移除所有语义近似重复
  • 长推理轨迹可能不适用于简洁的生产型助手
  • 基准结果属于参考检查点测量值,不能证明该数据集单独带来的因果提升
  • 基准比较应仅在文档记录的评测与提取设置下解读

来源与许可

数据来自以下源数据集的合并整理,原始卡片对创建方法、署名、所有权与条款具有权威性:

  1. nvidia/Nemotron‑Math‑Proofs‑v2 — CC BY 4.0
  2. nvidia/Nemotron‑SFT‑Math‑v4 — CC BY 4.0 与 CC BY-SA 4.0 的记录级混合
  3. nvidia/Nemotron‑SFT‑Science‑v2 — CC BY-SA 4.0

每条记录的 meta.license 在过滤或再分发时具有权威性。源数据集由 NVIDIA Corporation 发布,本合并版本不代表 NVIDIA 或 DeepSeek 的认可。

免责声明

本数据集仅供研究与开发使用,重大应用前需独立验证数据与模型输出。

搜集汇总
数据集介绍
DeepSeek-V4-Pro-Distilled-200K 数据集图片
构建方式
该数据集源自对DeepSeek-V4-Pro在Max推理模式下生成的高质量数学与科学推理轨迹的系统性蒸馏与规范化整理。构建过程中,从NVIDIA发布的三个权威源数据集(Nemotron-Math-Proofs-v2、Nemotron-SFT-Math-v4、Nemotron-SFT-Science-v2)中精选记录,经过去重与格式统一,最终形成包含188,027条样本的监督微调集合。每条记录采用统一的六字段对话模式,涵盖输入提示、教师模型生成的推理过程与最终答案,并附带细粒度的领域标签与来源元数据,以确保数据的可追溯性与合规性。
特点
该数据集具有鲜明的结构化与高质量特性。其样本总量达188,027条,划分为数学(158,383条)与STEM(29,644条)两大配置,覆盖数学、物理、化学、生物等多学科领域。所有样本均包含完整的推理链(chain-of-thought),并经过严格的去重与质量校验,确保唯一性。数据集采用gzip压缩的JSONL格式,便于流式加载与处理。此外,基于该数据集蒸馏的参考模型在GSM8K与MMLU-Pro基准上展现了优异的性能,验证了其作为推理能力训练资源的有效性。
使用方法
该数据集主要面向监督微调与推理能力研究。用户可通过HuggingFace的datasets库便捷加载指定配置('Math'或'STEM'),并以train分割进行训练。其设计支持多种应用场景,包括数学与科学推理的微调、证明生成与验证、长链思维实验以及混合领域研究。鉴于数据中可能存在的模型生成错误与数学偏差,使用时应结合具体任务进行验证与筛选,并注意遵守各源数据的许可协议与归因要求。
背景与挑战
背景概述
DeepSeek-V4-Pro-Distilled-200K 数据集由研究团队于2025年创建,旨在通过知识蒸馏技术,将高性能教师模型 DeepSeek-V4-Pro 在 Max 推理模式下生成的长链式数学与科学推理轨迹,转化为紧凑的监督微调数据。该数据集包含约18.8万条记录,分为数学(Math)和科学(STEM)两个配置,覆盖数学、物理、化学及生物等多个学科。其核心研究问题在于提升小型模型(如9B参数级别)在复杂推理任务上的能力,同时保持数据的高质量与多样性。该数据集在开源社区中具有重要影响力,为模型蒸馏、推理能力迁移及多学科混合训练提供了基准资源,其发布推动了小模型在数学与科学推理领域的性能提升,并通过严格的验证流程确保了数据的可靠性。
当前挑战
该数据集面临的挑战首先源自领域问题的复杂性:数学与科学推理要求模型具备严谨的逻辑推导、多步运算及跨学科知识整合能力,而生成的长链式思考轨迹极易引入语义重复或事实性错误,对数据质量构成严峻考验。其次,构建过程中需从多个来源(如 NVIDIA 发布的科学及数学数据集)进行筛选与转换,不同源数据的许可协议(CC BY 与 CC BY-SA)混合增加了合规管理的复杂性;同时,在确保数据唯一性与一致性方面,尽管采取了全局去重及元数据重建等措施,仍无法完全消除语义级重复,且数据集高度偏向数学,可能限制其在科学领域的泛化表现。此外,评估基准的参考结果受模型架构、训练协议等非数据因素影响,难以单独归因于本数据集,为成果的客观解读带来挑战。
常用场景
经典使用场景
DeepSeek-V4-Pro-Distilled-200K数据集为数学与科学推理领域的大语言模型监督微调提供了高质量的训练语料。其核心使用场景聚焦于利用教师模型DeepSeek-V4-Pro在Max模式下生成的长链条思维(chain-of-thought)轨迹,训练学生模型掌握复杂的逻辑推导与问题求解能力。该数据集精心构建的对话式结构,使得模型能够学习从问题输入到逐步推理直至最终答案的完整认知过程,特别适用于需要严谨证明、多步计算与跨学科知识整合的任务。通过在此数据集上进行微调,研究者可以有效增强模型在数学证明、物理问题求解、化学方程式配平等领域的推理深度与准确性。
解决学术问题
该数据集直面大语言模型在复杂数学与科学推理任务中表现不足的学术挑战,通过知识蒸馏技术将顶尖教师模型的推理能力迁移至参数量更小的学生模型。它解决了传统微调数据集中普遍存在的推理链不完整、逻辑跳跃和答案缺乏可解释性的问题,为监督微调提供了结构清晰、质量严格的推理范例。该数据集的发布促进了关于推理能力可迁移性的研究,使得学界能够系统探究模型规模、训练数据质量与推理性能之间的内在关联,并为提升开源模型在标准化数学基准(如GSM8K、MMLU-Pro)上的表现提供了宝贵的数据支撑与实证依据。
衍生相关工作
该数据集的发布衍生了一系列围绕推理蒸馏、模型压缩与评测基准的经典工作。研究者以其为基础探索了不同蒸馏策略对推理能力保持的影响,催生了多种针对长链条思维优化的训练算法。同时,该数据集促进了跨模型性能对比研究的深入,其参考评估结果成为衡量小型化模型推理效力的重要标尺,推动了如Qwen、Llama等系列模型在特定推理任务上的迭代改进。此外,围绕数据质量过滤、去重策略和元信息标注的研究也相继展开,为构建更高效、更可靠的科学推理训练数据集提供了方法论指导。这些衍生工作共同丰富了知识蒸馏与推理增强领域的理论体系与实践工具链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务