hiepp2/tvp4
收藏资源简介:
Mixture-of-Thoughts是一个包含35万个验证推理轨迹的数据集,这些轨迹是从DeepSeek-R1中提炼出来的。该数据集涵盖了数学、编码和科学等任务,旨在教会语言模型进行逐步推理。它被用于Open R1项目中,以训练OpenR1-Distill-7B模型,该模型复制了deepseek-ai/DeepSeek-R1-Distill-Qwen-7B的推理能力。
Mixture-of-Thoughts is a curated dataset of 350k verified reasoning traces distilled from DeepSeek-R1. The dataset spans tasks in mathematics, coding, and science, and is designed to teach language models to reason step-by-step. It was used in the Open R1 project to train OpenR1-Distill-7B, an SFT model that replicates the reasoning capabilities of deepseek-ai/DeepSeek-R1-Distill-Qwen-7B from the same base model.
数据集概述
数据集名称: Mixture-of-Thoughts
数据集标识: hiepp2/tvp4
该数据集是一个精心策划的、包含 350k 条经过验证的推理轨迹的集合,这些轨迹从 DeepSeek-R1 模型中蒸馏而来。其设计目的是教授语言模型进行逐步推理。
核心信息
- 任务: 文本生成
- 语言: 英语
- 大小: >1T
- 相关论文:
- arXiv: 2504.21318 (Phi-4-reasoning Technical Report)
- arXiv: 2505.00949 (Llama-Nemotron: Efficient Reasoning Models)
数据集构成
Mixture-of-Thoughts 由三个领域构成:数学、代码和科学。总共有 350k 条推理轨迹。
- 数学 (math): 93.7k 条推理轨迹,来源于
open-r1/OpenR1-Math-220k数据集的default子集。 - 代码 (code): 83.1k 条推理轨迹,用于解决 Python 和 C++ 的竞赛编程问题,来源于
open-r1/codeforces-cots数据集的solutions和solutions_w_editorials子集。 - 科学 (science): 173k 条推理轨迹,用于科学问题,来源于
nvidia/Llama-Nemotron-Post-Training-Dataset数据集的science子集。 - 全部 (all): 包含来自上述三个领域的所有推理轨迹,共计 350k 条。
策划方法
该数据集的混合优化方法遵循了 Phi-4-reasoning 技术报告中描述的策略,即可以针对每个领域独立优化数据混合,然后再合并到单个数据集中。对于每次消融实验,研究者会评估模型在 AIME 2024、GPQA Diamond 和 LiveCodeBench v4 上的表现。训练所有领域的数据集能同时获得最佳结果。
- 代码 (Code): 消融实验发现,混合所有 C++ 和 Python 轨迹的子集(包括带和不带人工编写解答的)在 LiveCodeBench 上取得了最佳结果。
- 数学 (Math): 实验发现,仅使用
default子集(93.7k 条轨迹)比使用包含更简单问题的extended子集效果更好。为了控制数据集大小,最终混合仅采用default子集。 - 科学 (Science): 从原始的 483k 条推理轨迹中,筛选出未使用 Qwen 模型进行提示预处理的子集,最终使用了 173k 条推理轨迹。
应用
该数据集曾在 Open R1 项目中用于训练 OpenR1-Distill-7B 模型,这是一个从相同基模型出发、能够复制 deepseek-ai/DeepSeek-R1-Distill-Qwen-7B 推理能力的 SFT 模型。




