instruction-following-reasoning-traces
收藏资源简介:
该数据集包含用于训练可控推理模型的监督微调(SFT)数据,旨在教导大型推理模型遵循针对其推理轨迹(RTs)和/或最终答案(FAs)的明确指令。数据基于GSM8K数学应用题(训练集)和DeepSeek-R1生成的推理轨迹,通过GPT-120B重写以遵循特定指令。每个样本以对话形式(`messages`)呈现,包含用户消息(原始问题及指令)和助手消息(遵循指令的推理轨迹及最终答案)。数据集分为三个逐步增大的子集:`rt_only`(999例,仅RT指令)、`rt_or_fa_only`(1998例,RT或FA指令)和`rt_and_fa`(3998例,RT和FA指令)。适用于可控推理和上下文隐私研究,但存在规模小、领域单一(仅数学)及指令为合成生成等局限性。
数据集概述
数据集简介
该数据集包含用于训练可控推理模型的监督微调数据,旨在教导大型推理模型遵循针对其推理轨迹的明确指令,并可选择性地针对其最终答案。
数据来源与构建
- 基础问题:基于GSM8K数学应用题(训练集分割)。
- 推理轨迹来源:基于来自"yashsavani/gsm8k_r1_compute"的DeepSeek-R1模型生成的推理轨迹。
- 指令重写:使用
gptoss-120B模型将推理轨迹重写以遵循针对RT的特定指令。 - 指令文件:https://huggingface.co/datasets/haritzpuerto/instruction-following-reasoning-traces/blob/main/instructions.json
数据格式
每个样本都被格式化为对话形式,适用于聊天风格的监督微调:
- 用户消息:包含原始问题以及描述应如何撰写推理轨迹和/或最终答案的指令。
- 助手消息:包含遵循该指令的推理轨迹及相应的最终答案。
数据集结构
特征
messages:聊天消息列表,每条消息包含:content:消息文本。role:"user"或"assistant"。
数据分割
数据集分为三个逐步增大的分割,每个分割都包含前一个分割的内容:
rt_only- 样本数量:999
- 指令仅适用于推理轨迹。
rt_or_fa_only- 样本数量:1998
- 扩展
rt_only,增加指令适用于推理轨迹或最终答案(但不同时适用于两者)的样本。
rt_and_fa- 样本数量:3998
- 扩展
rt_or_fa_only,增加指令同时约束推理轨迹和最终答案的样本。
预期用途
- 主要用途:训练或微调推理模型,使其在内部推理轨迹和/或最终答案中遵循明确指令。
- 本仓库用途:用于专门在以下方面进行LoRA适配器的监督微调:
- 推理轨迹中的指令遵循。
- 最终答案中的指令遵循。
- 或两者之间的平衡。
- 适用场景:该数据集旨在用于可控推理和上下文隐私的研究,不适用于直接在生产系统中部署。
已知限制
- 总训练集规模较小,可能导致过拟合,且可能无法涵盖真实世界指令的完整多样性。
- 所有基础问题均来自GSM8K,因此仅在此数据上训练的模型可能无法泛化到其他领域。
- 指令是合成的,可能限制其自然性。
引用信息
bibtext @misc{puerto2026controllablereasoningmodelsprivate, title={Controllable Reasoning Models Are Private Thinkers}, author={Haritz Puerto and Haonan Li and Xudong Han and Timothy Baldwin and Iryna Gurevych}, year={2026}, eprint={2602.24210}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2602.24210}, }
许可信息
- 许可证:MIT



