遇见数据集

eagle0504/multireward-grpo-gsm8k-rewards

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

该数据集包含从Qwen2.5-1.5B-Instruct模型在GSM8K测试提示上生成的原始奖励观察数据,用于多奖励GRPO(Group Policy Optimization或相关方法)研究。数据集基于150个GSM8K测试提示,每个提示通过16个独立种子和每个种子32次生成,共512次生成结果。每次生成通过三个奖励通道评分:正确性(Bernoulli类型,判断最终答案是否匹配GSM8K标准答案)、长度(连续值,基于令牌数的变换函数,峰值在200个令牌)和格式(Bernoulli类型,检查响应是否包含特定格式标记如oxed{...}或#### N)。数据集提供了原始奖励张量、未污染的长度奖励以及相关元数据,支持论文中定理3(相关性依赖的MSE下限)和命题4(符号变化条件偏差)的实证分析。数据用于验证多奖励优势估计的有限样本理论,并展示奖励通道间的相关性(如正确性与长度之间的强负相关)。

Raw rollout-level reward observations from the empirical section of Conditioned Multi-Reward Advantage Estimation: A Finite-Sample Analysis. The dataset contains rewards for 150 GSM8K test prompts, with 512 rollouts per prompt (16 independent seeds × 32 rollouts per seed), generated from Qwen2.5-1.5B-Instruct at temperature 0.7. Each rollout is scored on three verifiable reward channels: correctness (Bernoulli, matching GSM8K gold answer), length (continuous on [-1, 0], based on token count with a target peak at 200 tokens), and format (Bernoulli, presence of oxed{...} or #### N). The data includes raw reward tensors, uncontaminated length rewards, and metadata, supporting the empirical analysis of Theorem 3 (correlation-dependent MSE floor) and Proposition 4 (sign-changing conditioning bias) in the paper.

提供机构:
eagle0504
搜集汇总
数据集介绍
eagle0504/multireward-grpo-gsm8k-rewards 数据集图片
构建方式
该数据集源自对强化学习多奖励信号估计问题的实证探索,旨在验证条件化多奖励优势估计的有限样本理论。构建过程基于Qwen2.5-1.5B-Instruct模型,在GSM8K测试集的150个提示上,以温度0.7进行生成,每个提示独立采样16个随机种子,每个种子生成32条轨迹,共计每个提示512条样本。每条轨迹通过三个可验证的奖励通道进行评估:正确性(布尔型,判断最终答案是否匹配标准答案)、长度(连续型,采用tanh(-|log(ntokens/200)|)函数,以200词为目标进行奖惩)、格式(布尔型,检测回答是否包含\boxed{...}或#### N标记)。原始长度奖励以未污染形式独立存储,便于后续复现论文中关于符号变化条件化偏差的γ扫描实验。
特点
该数据集的核心特点在于其多维度、细粒度的奖励结构设计,能够揭示不同奖励信号间的统计依赖关系及其对优势估计的影响。数据以标准化张量形式存储,包含不同样本量规模(m=4,8,16,32)下的奖励矩阵,维度分别为(150个提示,16个种子,m,3个奖励通道),为理论验证提供了丰富的实证基础。实验证实了正确性与长度之间强烈的负相关(-0.641),这一关键信号使得加权协方差矩阵的二次型低于独立情形,从而降低了均方误差下界,精确吻合定理3的预测。此外,数据集附带聚合统计量、偏差定律扫描结果以及可视化图表,支持对均方误差样本量依赖规律和条件化偏差特性的完整复现。
使用方法
数据集的加载与使用极为便捷,依托HuggingFace Hub的集成机制,用户可通过huggingface_hub库的hf_hub_download函数直接下载主数据文件llm_rewards_gsm8k.npz。借助NumPy的np.load方法即可将奖励张量加载为numpy数组,例如rewards_m32得到(150,16,32,3)的四维数组。研究者可根据需要选择不同的m值(4、8、16、32)对应的子张量,进行多奖励优势估计的有限样本分析、方差缩减方法评估或条件化偏差的实验验证。配套的JSON汇总文件提供了聚合定理3数值和命题4偏差定律的γ扫描结果,便于快速与理论预测进行对比。生成实验的完整代码已开源在配套仓库中,用户可通过RunPod等云计算平台一键复现全部数据。
背景与挑战
背景概述
在大规模语言模型(LLM)的强化学习训练中,多奖励信号的处理一直是提升模型对齐能力的关键挑战。2026年,研究者Yiqiao Yin及其团队基于Qwen2.5-1.5B-Instruct模型,针对GSM8K数学推理数据集提出了Multi-Reward GRPO框架,并构建了多奖励GRPO GSM8K奖励数据集。该数据集旨在验证“条件化多奖励优势估计”理论中的核心定理(定理3)与命题(命题4),通过采集150个测试提示下每个提示512次独立采样的原始奖励观测值,系统性地探究奖励相关性与均方误差下限之间的关系。数据集不仅提供了正确性(correctness)、长度(length)和格式(format)三个可验证奖励通道的原始数据,还揭示了负相关性(如正确性与长度之间-0.641的相关系数)对多奖励优势估计的影响,为后续研究提供了实证基础,在强化学习与自然语言处理交叉领域具有重要影响力。
当前挑战
该数据集所解决的领域核心挑战在于多奖励优势估计中方差与偏差的权衡问题。传统强化学习方法在处理多个且存在相关性的奖励信号时,往往因低估奖励协方差结构导致估计精度下降,而定理3提出的相关依赖均方误差下限理论在此得到了实证验证。具体挑战包括:1)构建过程中需在Qwen2.5-1.5B-Instruct模型上以温度0.7对150个GSM8K测试提示进行16个随机种子各32次采样,确保512次独立采样以捕捉奖励分布的统计特性,同时避免生成开销过高(单次实验成本仅7.39美元)。2)为验证命题4中的符号变化条件偏差,需将未污染的长度奖励单独存储以支持廉价CPU后处理,但保持与其他奖励通道的数据一致性。3)数据集面临的当前挑战是,如何在更复杂场景(如多任务推理或持续学习)中推广该理论,并解决因奖励相关性动态变化导致的泛化瓶颈,以及如何降低大规模采样所需的计算成本(当前单次实验需185.6分钟)以适应实际部署需求。
常用场景
经典使用场景
该数据集专注于强化学习与大规模语言模型交叉领域,尤其服务于基于组相对策略优化(GRPO)的多奖励信号估计研究。其核心用途在于为多奖励优势估计中的方差缩减与偏差校正提供真实世界的大语言模型采样轨迹奖励数据。通过记录数学模型在Qwen2.5-1.5B-Instruct模型上的推演输出,该数据集允许研究者精确复现并验证诸如相关性依赖均方误差下界等关键理论,是探索多目标优化下奖励函数分解与协同训练的基础资源。
衍生相关工作
围绕该数据集衍生的工作包括对多奖励优势估计中理论界限的实证验证,以及基于条件化偏差修正的γ调优方法。代表性成果如论文《Conditioned Multi-Reward Advantage Estimation》中的定理3与命题4,它们分别建立了奖励间相关性驱动的均方误差下限和条件化偏置随信号强度变化的幂律关系。这些工作不仅推动了方差缩减技术的改进,还为后续诸如奖励间冲突度量、自适应权重调度等方向的研究提供了数据驱动的实证基础。
数据集最近研究
最新研究方向
该数据集聚焦于多奖励信号下的强化学习优势估计方法,通过大规模实验验证了条件多奖励优势估计的有限样本理论。具体而言,研究基于GSM8K数学推理任务,在Qwen2.5-1.5B模型上采样了512条轨迹,并设计了正确性、输出长度和格式规范三个可验证奖励通道。实验数据有力地支持了Theorem 3中关于相关性依赖的均方误差下界理论,命题4揭示的符号转换条件偏差规律,以及奖励间强负相关(正确性×长度达-0.641)对误差下界的实际影响。该研究为多奖励强化学习在LLM对齐中的应用提供了严谨的实证基础,尤其适用于需要平衡多个冲突目标(如推理准确性与输出简洁性)的复杂场景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务