GRPO-LEAD-SFTData
收藏资源简介:
我们发布了GRPO-LEAD-SFTData,这是一个包含12,153个高质量数学问题的集合,由QwQ-32B生成,主要来源于DeepScaler,难度大于1。它作为GRPO-LEAD阶段1 SFT的训练骨干,并使用LLaMA Factory进行SFT阶段。
We hereby release GRPO-LEAD-SFTData, a collection of 12,153 high-quality mathematical problems generated by QwQ-32B. Primarily sourced from DeepScaler with a difficulty level exceeding 1, this dataset serves as the training backbone for Stage 1 SFT of GRPO-LEAD, and the SFT training phase is conducted using LLaMA Factory.
GRPO-LEAD数据集概述
数据集基本信息
- 名称: GRPO-LEAD-SFTData
- 存储位置: Hugging Face数据集库
- 数据量: 12,153条高质量数学问题
- 数据来源: 主要由QwQ-32B生成,主要来源于DeepScaler且难度>1的问题
数据集用途
- 用于GRPO-LEAD模型的第一阶段监督微调(SFT)
- 使用LLaMA Factory进行SFT阶段训练
数据文件结构
- 原始训练数据目录:
grpo-lead/data/train/ - 数据预处理笔记本:
grpo-lead/data/preprocess/data_preprocess.ipynb - 数据格式转换脚本:
python scripts/data/process_dataset.py(将原始.json数据转换为.parquet格式)
相关模型
- 基础模型: LEAD-14B
- 训练脚本:
scripts/train/ds_14b_sft_stage1.sh
评估结果
| 模型名称 | AIME24 Cons@32 | AIME24 Pass@1 | AIME24 Len_avg | AIME25 Cons@32 | AIME25 Pass@1 | AIME25 Len_avg |
|---|---|---|---|---|---|---|
| DeepSeek-Distilled-14B | 0.800 | 0.614 | 9182 | 0.633 | 0.429 | 10046 |
| Light-R1-14B | 0.833 | 0.641 | 9571 | 0.767 | 0.505 | 10194 |
| LEAD-14B-stage1 | 0.833 | 0.629 | 8790 | 0.767 | 0.523 | 9371 |
| LEAD-14B-stage3 | 0.867 | 0.650 | 8267 | 0.767 | 0.539 | 8668 |
引用信息
bibtex @misc{zhang2025grpoleaddifficultyawarereinforcementlearning, title={GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models}, author={Jixiao Zhang and Chunsheng Zuo}, year={2025}, eprint={2504.09696}, archivePrefix={arXiv}, primaryClass={cs.CL}, url={https://arxiv.org/abs/2504.09696}, }




