STAT-Sel and STAT-Syn
收藏资源简介:
STAT-Sel和STAT-Syn是两个技能目标自适应训练数据集,针对Llama-3.2-3B-Instruct、Llama-3.2-1B-Instruct和Qwen2.5-3B模型设计。STAT-Sel通过重新加权hendrycks MATH数据集以强调缺失技能,包含约4k个独特问题和9.5k个问答对;STAT-Syn则通过合成MATH级别数据来强调缺失技能,同样包含约4k个独特问题和9.5k个问答对,并经过一致性过滤以确保数据质量。
STAT-Sel and STAT-Syn are two skill-targeted adaptive training datasets designed for Llama-3.2-3B-Instruct, Llama-3.2-1B-Instruct and Qwen2.5-3B models. STAT-Sel reweights the Hendrycks MATH dataset to emphasize missing skills, containing approximately 4k unique questions and 9.5k question-answer pairs; STAT-Syn generates synthetic MATH-level data to highlight missing skills, also including around 4k unique questions and 9.5k question-answer pairs, and it has undergone consistency filtering to ensure data quality.
Skill-Targeted Adaptive Training (STAT) 数据集概述
数据集基本信息
- 数据集名称: Skill-Targeted Adaptive Training (STAT)
- 官方论文: Skill-Targeted Adaptive Training
- 作者: Yinghui He, Abhishek Panigrahi, Yong Lin, Sanjeev Arora
数据集描述
STAT是一种技能导向的自适应训练方法,使用监督模型和技能目录为每个学生模型构建缺失技能档案,然后通过修改训练过程提升性能。该方法能够通过简单的训练集重加权实现至少7%的性能提升。
数据构成
覆盖模型
- Llama-3.2-3B-Instruct
- Llama-3.2-1B-Instruct
- Qwen2.5-3B
数据规模
- 每个数据集包含约4,000个独特问题
- 总计约9,500个问答对
数据变体
STAT-Sel
基于缺失技能对hendrycks MATH数据集进行重加权的训练数据:
- 从验证集中筛选500个困难问题
- 教师模型识别学生回答中的2-3个缺失技能
- 为每个缺失技能选择5个问题
- 每个问题使用3个答案,随机采样9,500个问答对
STAT-Syn
合成MATH级别数据以强调缺失技能:
- 从验证集中筛选500个困难问题
- 教师模型识别缺失技能
- 为每个(困难问题, 缺失技能)对检索3个MATH训练集问题
- 教师模型合成2个新问题,每个问题生成3个解决方案
- 通过一致性评分(≥2)过滤数据,确保质量
数据位置
数据集文件位于STAT_data/目录下,包含STAT-Sel/和STAT-Syn/两个子目录。
引用信息
BibTeX @article{he2025skilltargetedadaptivetraining, title={Skill-Targeted Adaptive Training}, author={Yinghui He and Abhishek Panigrahi and Yong Lin and Sanjeev Arora}, journal={arXiv preprint arXiv:2510.10023}, year={2025}, url={https://arxiv.org/abs/2510.10023}, }




