遇见数据集

post-training-takehome-math500-bon16

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

该数据集名为“MATH-500 Best-of-16 Post-Training Take-Home Results”,是一项基于Hugging Face后训练带回家挑战的测试时间计算研究。其核心目的是在不训练或修改模型的前提下,研究如何从多个候选答案中选择最终答案,其中生成器和奖励模型均保持冻结,唯一变量是从16个采样候选答案中选择最终答案的策略。数据集基于MATH-500数学问题集构建,首先过滤出难度级别1-3的问题,使用随机种子1打乱后选取了50个问题。对于每个问题,使用Qwen/Qwen2.5-1.5B-Instruct模型生成一个贪婪解作为基线,并在温度0.7、top-p 0.8、top-k 20的参数下生成16个采样解。所有生成过程均使用固定种子(20260727)以确保可重现性。随后,使用Skywork/Skywork-o1-Open-PRM-Qwen-2.5-1.5B奖励模型对每个采样解的新行分隔推理步骤进行评分,并保留其Sigmoid归一化的最终步骤奖励分数。数据集比较了四种在相同800个评分样本上的答案选择规则:1) vanilla Best-of-N:选择单个最高奖励样本的答案;2) 多数投票:选择出现频率最高的答案,不使用奖励模型;3) 加权(和):将答案分组,对每组内的奖励分数求和,选择总分最高的组;4) 加权(平均):与加权(和)类似,但按平均奖励排名。数据集记录了每种选择规则在50个问题上的正确数量和准确率,并提供了配对自助法95%置信区间的统计比较。数据集中包含`samples_json`列,存储每个问题的16个采样解的提取答案和最终奖励,使得无需GPU即可重新计算任何选择规则;同时包含`pick_*`和`correct_*`列,分别记录每个规则选择的答案及其是否与真实答案匹配。该数据集适用于测试时间计算研究、答案选择策略的实证比较、奖励模型在数学推理任务中提供信号的有效性分析等场景。需要注意的是,数据集的正确性判断基于提取的框内答案的精确字符串比较,因此等效的格式可能被误判为错误;部分样本因无法解析框内答案而被丢弃,导致某些问题的有效候选数少于16;奖励模型分数是学习得到的估计值,而非正确性的证明;且所有结果基于单一模型组合、温度参数、候选数量(N=16)和随机种子,单次运行的微小差异可能不代表真实效应。

创建时间:
2026-07-27
原始信息汇总

数据集基本信息

  • 数据集名称:MATH-500 Best-of-16 Post-Training Take-Home Results
  • 语言:英语
  • 标签:数学、最佳抽样、奖励模型、后训练
  • 任务类别:文本生成
  • 数据集大小:50个数学问题

数据集构建流程

  1. 从MATH-500中筛选出难度等级1-3的问题,使用种子1进行随机排序,选取50个问题。
  2. 使用Qwen/Qwen2.5-1.5B-Instruct模型为每个问题生成1个贪心解码答案。
  3. 在温度0.7、top-p 0.8、top-k 20的设置下,为每个问题生成16个采样答案(种子20260727)。
  4. 使用Skywork/Skywork-o1-Open-PRM-Qwen-2.5-1.5B奖励模型对每个答案的推理步骤进行评分,保留最终步骤的Sigmoid归一化奖励值。
  5. 在相同的800个评分样本上比较四种选择策略。

选择策略

  • 标准Best-of-N:选择单个奖励最高的答案。
  • 多数投票:选择频率最高的答案,不使用奖励模型。
  • 加权求和:按答案分组,组内奖励求和,总分最高者胜出。
  • 加权平均:与上述类似,但按平均奖励排序。

实验结果

方法 正确数/50 准确率
贪心解码(N=1) 25 50%
标准Best-of-N 38 76%
多数投票 33 66%
加权求和 35 70%
加权平均 36 72%

成对Bootstrap差异比较(95%置信区间)

比较项 差异 95%置信区间 是否显著分离
标准Best-of-N - 贪心解码 +13 [+7, +20]
加权平均 - 贪心解码 +11 [+5, +18]
加权求和 - 贪心解码 +10 [+3, +17]
多数投票 - 贪心解码 +8 [+2, +14]
标准Best-of-N - 多数投票 +5 [+1, +9]
标准Best-of-N - 加权求和 +3 [+0, +7]
加权求和 - 多数投票 +2 [+0, +5]

关键发现

  • 采样16个候选答案并选择其一,显著优于贪心解码。
  • 标准Best-of-N在基于奖励的方法中得分最高,按答案分组并求和奖励的方法未优于直接选择最高分样本。
  • 三种基于奖励的规则之间在本次样本量下无法区分。

可重复性说明

  • 50个问题与早期20个问题运行使用相同的随机种子,前20行与早期运行一致。
  • 采样结果可完全复现,贪心基线因批处理和fp16精度差异存在一个问题的偏差。
  • 未设置种子的早期运行显示20个问题上加权求和准确率为75%,种子复现后为65%,表明采样噪声的影响。

数据列说明

  • samples_json:存储每个问题的16个采样答案的提取结果和最终奖励值,可据此重新计算任何选择策略。
  • pick_*correct_*:记录每种策略的选择结果及与真实答案的匹配情况。

局限性

  • 正确性基于提取的方框答案的精确字符串比较,等效格式可能被标记为错误。
  • 无法解析方框答案的样本被丢弃,导致部分问题的有效样本数低于16。
  • 奖励模型分数是学习估计,并非正确性证明。
  • 实验仅使用一对模型、单一温度、N=16和一个随机种子,单次运行的微小差异不应被视为真实效应。
搜集汇总
数据集介绍
post-training-takehome-math500-bon16 数据集图片
构建方式
本数据集基于Hugging Face的post-training take-home挑战任务构建,旨在探索测试时计算策略对数学推理能力的影响。从MATH-500数据集中筛选出难度等级1至3的问题,经种子1随机打乱后选取50道题目。采用冻结的生成模型Qwen/Qwen2.5-1.5B-Instruct,在两张T4 GPU上为每道题生成1条贪心解及16条采样解(温度0.7,top-p 0.8,top-k 20),并使用Skywork/Skywork-o1-Open-PRM-Qwen-2.5-1.5B奖励模型对推理步骤进行评分,最终保留每条解的最后一跳sigmoid归一化奖励值。所有生成过程均通过固定种子(20260727)保证可重复性。
特点
该数据集的核心特点在于系统比较了四种候选答案选择策略:朴素Best-of-N(选取最高奖励样本)、多数投票(基于答案频率)、加权求和(按答案分组累加奖励)与加权平均(按答案分组取平均奖励)。在50道题目上,朴素Best-of-N以76%的正确率表现最优,较贪心解码的50%提升显著;加权平均与加权求和分别为72%和70%,多数投票为66%。成对bootstrap区间检验表明,所有采样策略均优于贪心解码,且朴素Best-of-N显著优于多数投票,但三种基于奖励的策略之间无显著差异,凸显了奖励模型在答案选择中的关键作用。
使用方法
数据集的每一行包含问题及其对应的16条采样解,每条解记录有提取的答案与最终奖励值,存储于samples_json字段。用户可直接利用该字段计算任意选择策略的结果,无需GPU资源。此外,pick_*与correct_*字段分别记录了各策略的答案选择及正确性标注。需注意,正确性判定基于精确字符串匹配,等价格式可能被误判;无有效boxed答案的样本会被丢弃,导致部分问题的有效候选数少于16。奖励模型分数为学习估计值,非正确性证明,且当前结果限于单模型、单温度与单一候选数设置,解读时应谨慎对待少量差异。
背景与挑战
背景概述
在数学推理领域,测试时计算(test-time compute)的策略优化是提升大语言模型性能的关键方向。该数据集由Hugging Face的post-training挑战项目衍生而来,创建于近期,基于MATH-500基准的子集,聚焦于难易等级1-3的50道数学问题。核心研究问题在于探究在冻结生成器与奖励模型的情况下,如何通过采样与选择策略最大化推理准确性。研究团队利用Qwen2.5-1.5B-Instruct生成16个候选解,并借助Skywork-o1-Open-PRM奖励模型评分,对比贪心解码、vanilla Best-of-N、多数投票及加权平均四种选择规则。这一工作为后训练阶段的计算资源分配提供了实证依据,尤其在奖励模型信号的价值验证上具有影响力,推动了数学推理中采样-选择范式的量化理解。
当前挑战
该数据集应对的领域挑战是数学推理中答案选择的不确定性,即如何从多个采样解中可靠识别正确结果,以超越简单贪心解码的局限。具体而言,vanilla Best-of-N相较于贪心解码提升26个百分点,而多数投票仅提升16个百分点,揭示了奖励模型对语义质量的鉴别力。构建过程中面临多重挑战:一是采样噪声的显著影响,未固定种子的实验中加权和法在20题上准确率波动达10个百分点,迫使生成过程必须严格种子化;二是计算资源的限制,使用两张T4 GPU时,批处理与fp16精度导致贪心基线结果出现差异;三是答案提取的准确性,仅依赖boxed格式的精确字符串匹配,格式轻微偏差即导致误判,且部分样本缺失可解析答案,降低有效候选数;四是奖励模型分数作为学习估计,其可信度受限于模型训练数据与泛化能力。
常用场景
经典使用场景
在数学推理领域,MATH-500 Best-of-16 Post-Training Take-Home Results数据集为研究测试时计算策略提供了精巧的试验平台。该数据集的核心价值在于,它固定了生成模型与奖励模型的参数,仅通过调整从16个候选解中选择最终答案的规则,来探索不同选择机制对解题准确率的影响。经典的使用场景是,研究者可以在此数据集上比较贪婪解码、朴素Best-of-N、多数投票以及基于奖励的加权聚合等方法的性能差异。通过这50道精心筛选的数学题,该数据集为验证采样策略如何提升推理质量提供了可复现的基准。
衍生相关工作
该数据集衍生了一系列关于测试时计算策略的经典工作,其中尤其关注解码过程中的奖励信号利用方式。研究者们在此基础上探索了不同奖励模型架构(如过程奖励模型与结果奖励模型)对Best-of-N策略的影响,以及采样温度、候选数量N等超参数如何与选择规则交互。部分工作进一步将加权聚合方法推广至序列生成任务中,验证了其在文本摘要、代码生成等领域的迁移效果。该数据集的种子敏感性分析也催生了关于随机性控制与实验可复现性的方法论研究。
数据集最近研究
最新研究方向
在数学推理领域的大语言模型测试时计算研究中,该数据集聚焦于采样策略对答案质量的提升效应。通过对比贪心解码、多数投票及三种基于奖励模型的Best-of-N方法,揭示了在固定生成器与奖励模型条件下,仅靠选择策略的优化即可显著改善推理准确性。尤其值得关注的是,vanilla Best-of-N以76%的准确率超越多种复杂集成方案,挑战了近年来对奖励模型加权聚合的假设。该工作呼应了OpenAI o1等模型引发的测试时计算热点,表明在有限计算预算下,纯采样选择仍是最具性价比的优化路径。其对种子敏感性的严谨分析,也为强化学习后训练阶段的可复现性研究树立了重要标杆。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务