OpenO1-SFT
收藏资源简介:
该数据集用于使用SFT对语言模型进行微调,以激活思维链。数据集旨在增强模型生成连贯和逻辑推理序列的能力。它包含77,685条记录,涵盖中文和英文,响应字段使用<Thought> </Thought>和<Output> </Output>分隔符来区分思考过程和最终答案。通过使用此数据集,模型可以学习生成详细和结构化的推理步骤,从而在复杂推理任务中表现更好。
This dataset is designed for fine-tuning language models via Supervised Fine-Tuning (SFT) to activate chain-of-thought reasoning. It aims to enhance the model's capability to generate coherent and logically consistent reasoning sequences. It contains 77,685 records covering both Chinese and English, and the response field uses the delimiters <Thought> </Thought> and <Output> </Output> to distinguish between the thinking process and the final answer. By utilizing this dataset, models can learn to generate detailed and structured reasoning steps, thereby achieving better performance on complex reasoning tasks.
OpenO1-SFT 数据集概述
数据集信息
- 许可证: Apache 2.0
- 任务类别: 问答
- 语言: 中文, 英文
- 数据量: 10K < n < 100K
数据集描述
该数据集用于通过SFT(Supervised Fine-Tuning)激活语言模型的**思维链(Chain-of-Thought Activation)**能力。数据集旨在增强模型生成连贯和逻辑推理序列的能力。通过使用该数据集,模型可以学习生成详细和结构化的推理步骤,从而提高其在复杂推理任务中的表现。
数据集统计
- 总记录数: 77,685
- 语言: 包含中文和英文数据
- 输出格式: 响应字段使用
<Thought> </Thought>和<Output> </Output>分隔符来区分思考过程和最终答案。
性能表现
以下表格展示了在Qwen-2.5-7B-Instruct模型上进行SFT前后的结果对比:
自一致性
| Benchmark | GSM8K | GSM8K | MATH | MATH | MMLU | MMLU | Hellaswag | Hellaswag | ARC-C | ARC-C | BBH | BBH |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Model | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen |
| Bo1 | 91.21 | 84.31 | 69.74 | 51.40 | 71.51 | 70.95 | 67.81 | 60.96 | 90.44 | 87.71 | 54.08 | 64.78 |
| Bo2 | 91.21 | 84.31 | 69.74 | 51.40 | 71.51 | 70.95 | 67.81 | 60.96 | 90.44 | 87.71 | 54.08 | 64.78 |
| Bo4 | 91.74 | 88.10 | 71.78 | 57.00 | 71.57 | 73.03 | 68.59 | 63.43 | 90.53 | 88.40 | 55.06 | 68.22 |
| Bo8 | 91.74 | 88.78 | 72.84 | 60.04 | 71.59 | 73.96 | 68.75 | 65.24 | 90.53 | 88.91 | 55.39 | 69.90 |
| Bo16 | 92.12 | 88.93 | 73.78 | 61.72 | 71.56 | 74.03 | 68.78 | 65.24 | 90.53 | 89.33 | 55.43 | 71.23 |
| Bo32 | 92.34 | 89.31 | 74.14 | 62.42 | 71.62 | 74.56 | 68.83 | 65.19 | 90.61 | 89.51 | 55.69 | 71.61 |
| Bo64 | 92.57 | 89.69 | 74.44 | 63.08 | 71.63 | 74.70 | 68.91 | 65.28 | 90.61 | 89.68 | 55.68 | 71.91 |
Oracle pass@k
| Benchmark | GSM8K | GSM8K | MATH | MATH | MMLU | MMLU | Hellaswag | Hellaswag | ARC-C | ARC-C | BBH | BBH |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Model | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen | Qwen2.5-7B-instruct | OpenO1-Qwen |
| Bo1 | 91.21 | 84.31 | 69.74 | 51.40 | 71.51 | 70.95 | 67.81 | 60.96 | 90.44 | 87.71 | 54.08 | 64.78 |
| Bo2 | 93.10 | 89.61 | 74.40 | 61.26 | 71.98 | 78.94 | 69.61 | 72.06 | 90.61 | 92.41 | 58.30 | 74.33 |
| Bo4 | 94.84 | 92.49 | 78.34 | 68.46 | 72.41 | 84.31 | 71.26 | 80.28 | 90.78 | 95.05 | 61.01 | 80.29 |
| Bo8 | 95.68 | 94.16 | 81.86 | 73.78 | 72.75 | 88.33 | 72.23 | 85.84 | 90.96 | 96.59 | 63.67 | 83.85 |
| Bo16 | 95.83 | 95.22 | 84.12 | 78.58 | 73.02 | 91.16 | 72.92 | 89.64 | 90.96 | 97.27 | 65.32 | 85.74 |
| Bo32 | 96.44 | 96.13 | 85.72 | 82.48 | 73.19 | 92.98 | 73.46 | 92.47 | 90.96 | 97.78 | 66.79 | 87.01 |
| Bo64 | 96.82 | 96.36 | 87.02 | 85.76 | 73.34 | 94.32 | 73.85 | 94.46 | 90.96 | 98.21 | 67.80 | 88.09 |




