cmpatino/math500-bon-weighted-results
收藏官方服务:
资源简介:
该数据集包含了在MATH-500基准测试子集上评估Best-of-N加权选择方法的结果。它是作为HuggingFace实习项目的一部分创建的,旨在探索如何利用奖励模型在测试时进行计算扩展,从而提高大型语言模型在数学问题上的表现。数据集构建过程包括从MATH-500数据集中筛选出238个难度级别为1-3的问题,并随机抽取20个问题;使用Qwen/Qwen2.5-1.5B-Instruct模型生成贪婪基线和16个采样解决方案;使用Skywork/Skywork-o1-Open-PRM-Qwen-2.5-1.5B奖励模型对每个解决方案进行评分;并比较了三种选择方法:加权Best-of-N、标准Best-of-N和多数投票。数据集还包含了问题陈述、参考解决方案、正确答案、数学主题、难度级别等信息,以及不同选择方法的准确率比较和关键发现。
This dataset contains the results of evaluating **Best-of-N weighted selection** on a subset of the [MATH-500 benchmark](https://huggingface.co/datasets/HuggingFaceH4/MATH-500). It was created as part of a HuggingFace internship exercise exploring how test-time compute scaling with reward models can improve LLM performance on math problems.
提供机构:
cmpatino


