遇见数据集

cmpatino/math500-bon-weighted-results

收藏
Hugging Face2026-04-23 更新2026-04-26 收录
官方服务:

资源简介:

该数据集包含了在MATH-500基准测试子集上评估Best-of-N加权选择方法的结果。它是作为HuggingFace实习项目的一部分创建的,旨在探索如何利用奖励模型在测试时进行计算扩展,从而提高大型语言模型在数学问题上的表现。数据集构建过程包括从MATH-500数据集中筛选出238个难度级别为1-3的问题,并随机抽取20个问题;使用Qwen/Qwen2.5-1.5B-Instruct模型生成贪婪基线和16个采样解决方案;使用Skywork/Skywork-o1-Open-PRM-Qwen-2.5-1.5B奖励模型对每个解决方案进行评分;并比较了三种选择方法:加权Best-of-N、标准Best-of-N和多数投票。数据集还包含了问题陈述、参考解决方案、正确答案、数学主题、难度级别等信息,以及不同选择方法的准确率比较和关键发现。

This dataset contains the results of evaluating **Best-of-N weighted selection** on a subset of the [MATH-500 benchmark](https://huggingface.co/datasets/HuggingFaceH4/MATH-500). It was created as part of a HuggingFace internship exercise exploring how test-time compute scaling with reward models can improve LLM performance on math problems.

提供机构:
cmpatino
二维码
社区交流群
二维码
科研交流群
商业服务