post-training-takehome-math500-bon16
收藏资源简介:
该数据集名为“MATH-500 Best-of-16 Post-Training Take-Home Results”,是一项基于Hugging Face后训练带回家挑战的测试时间计算研究。其核心目的是在不训练或修改模型的前提下,研究如何从多个候选答案中选择最终答案,其中生成器和奖励模型均保持冻结,唯一变量是从16个采样候选答案中选择最终答案的策略。数据集基于MATH-500数学问题集构建,首先过滤出难度级别1-3的问题,使用随机种子1打乱后选取了50个问题。对于每个问题,使用Qwen/Qwen2.5-1.5B-Instruct模型生成一个贪婪解作为基线,并在温度0.7、top-p 0.8、top-k 20的参数下生成16个采样解。所有生成过程均使用固定种子(20260727)以确保可重现性。随后,使用Skywork/Skywork-o1-Open-PRM-Qwen-2.5-1.5B奖励模型对每个采样解的新行分隔推理步骤进行评分,并保留其Sigmoid归一化的最终步骤奖励分数。数据集比较了四种在相同800个评分样本上的答案选择规则:1) vanilla Best-of-N:选择单个最高奖励样本的答案;2) 多数投票:选择出现频率最高的答案,不使用奖励模型;3) 加权(和):将答案分组,对每组内的奖励分数求和,选择总分最高的组;4) 加权(平均):与加权(和)类似,但按平均奖励排名。数据集记录了每种选择规则在50个问题上的正确数量和准确率,并提供了配对自助法95%置信区间的统计比较。数据集中包含`samples_json`列,存储每个问题的16个采样解的提取答案和最终奖励,使得无需GPU即可重新计算任何选择规则;同时包含`pick_*`和`correct_*`列,分别记录每个规则选择的答案及其是否与真实答案匹配。该数据集适用于测试时间计算研究、答案选择策略的实证比较、奖励模型在数学推理任务中提供信号的有效性分析等场景。需要注意的是,数据集的正确性判断基于提取的框内答案的精确字符串比较,因此等效的格式可能被误判为错误;部分样本因无法解析框内答案而被丢弃,导致某些问题的有效候选数少于16;奖励模型分数是学习得到的估计值,而非正确性的证明;且所有结果基于单一模型组合、温度参数、候选数量(N=16)和随机种子,单次运行的微小差异可能不代表真实效应。
数据集基本信息
- 数据集名称:MATH-500 Best-of-16 Post-Training Take-Home Results
- 语言:英语
- 标签:数学、最佳抽样、奖励模型、后训练
- 任务类别:文本生成
- 数据集大小:50个数学问题
数据集构建流程
- 从MATH-500中筛选出难度等级1-3的问题,使用种子1进行随机排序,选取50个问题。
- 使用
Qwen/Qwen2.5-1.5B-Instruct模型为每个问题生成1个贪心解码答案。 - 在温度0.7、top-p 0.8、top-k 20的设置下,为每个问题生成16个采样答案(种子
20260727)。 - 使用
Skywork/Skywork-o1-Open-PRM-Qwen-2.5-1.5B奖励模型对每个答案的推理步骤进行评分,保留最终步骤的Sigmoid归一化奖励值。 - 在相同的800个评分样本上比较四种选择策略。
选择策略
- 标准Best-of-N:选择单个奖励最高的答案。
- 多数投票:选择频率最高的答案,不使用奖励模型。
- 加权求和:按答案分组,组内奖励求和,总分最高者胜出。
- 加权平均:与上述类似,但按平均奖励排序。
实验结果
| 方法 | 正确数/50 | 准确率 |
|---|---|---|
| 贪心解码(N=1) | 25 | 50% |
| 标准Best-of-N | 38 | 76% |
| 多数投票 | 33 | 66% |
| 加权求和 | 35 | 70% |
| 加权平均 | 36 | 72% |
成对Bootstrap差异比较(95%置信区间)
| 比较项 | 差异 | 95%置信区间 | 是否显著分离 |
|---|---|---|---|
| 标准Best-of-N - 贪心解码 | +13 | [+7, +20] | 是 |
| 加权平均 - 贪心解码 | +11 | [+5, +18] | 是 |
| 加权求和 - 贪心解码 | +10 | [+3, +17] | 是 |
| 多数投票 - 贪心解码 | +8 | [+2, +14] | 是 |
| 标准Best-of-N - 多数投票 | +5 | [+1, +9] | 是 |
| 标准Best-of-N - 加权求和 | +3 | [+0, +7] | 否 |
| 加权求和 - 多数投票 | +2 | [+0, +5] | 否 |
关键发现
- 采样16个候选答案并选择其一,显著优于贪心解码。
- 标准Best-of-N在基于奖励的方法中得分最高,按答案分组并求和奖励的方法未优于直接选择最高分样本。
- 三种基于奖励的规则之间在本次样本量下无法区分。
可重复性说明
- 50个问题与早期20个问题运行使用相同的随机种子,前20行与早期运行一致。
- 采样结果可完全复现,贪心基线因批处理和fp16精度差异存在一个问题的偏差。
- 未设置种子的早期运行显示20个问题上加权求和准确率为75%,种子复现后为65%,表明采样噪声的影响。
数据列说明
samples_json:存储每个问题的16个采样答案的提取结果和最终奖励值,可据此重新计算任何选择策略。pick_*和correct_*:记录每种策略的选择结果及与真实答案的匹配情况。
局限性
- 正确性基于提取的方框答案的精确字符串比较,等效格式可能被标记为错误。
- 无法解析方框答案的样本被丢弃,导致部分问题的有效样本数低于16。
- 奖励模型分数是学习估计,并非正确性证明。
- 实验仅使用一对模型、单一温度、N=16和一个随机种子,单次运行的微小差异不应被视为真实效应。





