遇见数据集

math-rollouts

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

math-rollouts数据集包含了由Qwen2.5-Math-1.5B基础模型及其RL调优版本Qwen2.5-Math-1.5B-Oat-Zero模型生成的数学推理“展开过程”数据,旨在为研究大型语言模型在数学问题上的推理行为、分支采样策略和性能评估提供资源。数据内容主要包括三个部分:1) 问题集:包含12,496个数学问题(来自MATH基准测试的“math12k”超集)及其500个问题的子集(MATH-500),每个问题包含问题描述、解答步骤和最终答案;2) 生成数据:包括“核心”数据(每个可能的第一代词/分支路径)、“展开”数据(模型根据核心路径强制或自然采样生成的完整解题过程文本)以及“评分”数据(对每个生成的解题过程进行正确性等指标评估的结果);3) 自然采样池:包含模型自主选择第一代词生成的解题过程,并内联标注了正确性。数据集规模在10万到100万样本之间,以结构化表格形式存储,包含详细的元数据字段,如问题ID、主题、模型ID、生成配置、分支路径、完成文本、令牌序列、评分结果等。数据生成使用统一的采样配置,确保可复现性。该数据集适用于文本生成、数学推理、模型解释性、采样策略分析、正确性评估等研究任务,用户可以通过提供的Python工具包或直接使用pandas加载数据进行分析和实验。

The math-rollouts dataset contains mathematical reasoning "rollout" data generated by the Qwen2.5-Math-1.5B base model and its RL-tuned variant Qwen2.5-Math-1.5B-Oat-Zero. It aims to provide resources for studying the reasoning behavior, branch sampling strategies, and performance evaluation of large language models on mathematical problems. The dataset mainly consists of three parts: 1. Problem set: It includes 12,496 mathematical problems sourced from the "math12k" superset of the MATH benchmark, along with a 500-problem subset (MATH-500). Each problem contains the problem description, solution steps, and final answer. 2. Generated data: Comprising "core" data (each possible first token/branch path), "rollout" data (full problem-solving process text generated by the model via forced or natural sampling based on core paths), and "scoring" data (results of evaluating metrics including correctness for each generated problem-solving process). 3. Natural sampling pool: It contains problem-solving processes generated by the model autonomously selecting first tokens, with inline annotations of correctness. The dataset ranges from 100,000 to 1,000,000 samples, stored in structured table format with detailed metadata fields such as problem ID, topic, model ID, generation configuration, branch path, completed text, token sequence, scoring results, etc. Unified sampling configurations were employed during data generation to ensure reproducibility. This dataset is applicable to research tasks including text generation, mathematical reasoning, model interpretability, sampling strategy analysis, correctness evaluation, etc. Users can load the data for analysis and experiments via the provided Python toolkit or directly using pandas.

创建时间:
2026-06-08
原始信息汇总

数据集概述

数据集名称:math-rollouts
许可证:MIT
语言:英文
任务类别:文本生成
标签:数学、推理、rollouts、核采样、Qwen2.5-Math、Math-500
数据集规模:100K < 样本数 < 1M


数据集内容

该数据集包含以下模型在数学推理问题上自然采样的 rollouts(推理轨迹):

  • Qwen2.5-Math-1.5B(基础模型)
  • Qwen2.5-Math-1.5B-Oat-Zero(经过强化学习微调的模型)

此外,还包含 first-token / branch nuclei(首词核)以及 uniform-opener forced rollouts(均匀强制开头的rollouts)。所有生成均无指导信号,仅使用公开检查点的自然采样完成。


数据目录结构

problems/ math500.parquet # 500道 MATH-500 分割问题(含 HF MATH-500 交叉引用) math_problems.parquet # 完整 ~12.5k 的 MATH 超集("math12k"),含 split 字段 mappings/ math500_to_hf.csv # unique_id 与 HF MATH-500 id 的映射 generations/<model-slug>/ <experiment>/ # 统一生成器分割(nuclei + raw rollouts + scores) nuclei.parquet rollouts.parquet scores.parquet policies.csv manifest.json <pool>.parquet # 自包含的自然采样池(内嵌 is_correct 字段)

  • model-slug:模型的小写 HF ID(去掉组织名),例如 Qwen/Qwen2.5-Math-1.5Bqwen2.5-math-1.5b

问题ID与分割

每一行都有一个唯一问题ID:unique_id = <split>/<subj>/<n>

分割 数量 含义
train 7,496 math12k 训练部分
test 4,500 math12k 测试部分(不含 math500)
math500 500 MATH-500 子集,从 test 中独立出来
  • math500/geometry/9467 代表 MATH-500 中几何问题的第 9467 个索引。
  • 通过 mappings/math500_to_hf.csv 可恢复规范的 HF MATH-500 ID(如 test/geometry/627.json)。

模型信息

model-slug 检查点 说明
qwen2.5-math-1.5b Qwen/Qwen2.5-Math-1.5B 基础模型,首词核分布广泛
qwen2.5-math-1.5b-oat-zero sail/Qwen2.5-Math-1.5B-Oat-Zero RL微调模型,首词分布尖锐,多数问题只有一个开启词(核内唯一)

生成配置

所有规范运行使用统一采样配置(gen_config_id = 200):

temperature = 0.6 top_p = 0.95 top_k = 20 max_tokens = 3000 max_model_len = 4096

  • top_k 限制核大小。
  • 使用 bfloat16(vLLM)采样,首词logits近乎相等时,推荐以bf16重新计算核成员/概率。

文件结构与模式

problems/ 目录

  • math500.parquet(500行):包含 unique_idmath500_native_idsubjectsubjlevelproblemsolutionanswer
  • math_problems.parquet(12,496行):包含 unique_idsource_idxsplitsubjectsubjlevelproblemsolutionanswer

Experiment 分割 — generations/<model>/<experiment>/

当前实验为 math500_uniform_k16_d1(深度1首词核,每个开启词强制16个均匀rollouts,覆盖所有500道MATH-500问题),两个模型均已提供。

  • nuclei.parquet:每个开启词一行,包含 model_idunique_idsubjectanswerdepthbranch_pathopener_token_idsopener_token_strsfork_token_idnuc_probpath_probbranch_sizeterminalis_thinking
  • rollouts.parquet:每行一个原始强制样本(不含正确性),包含 model_idunique_idsubjectanswerdepthbranch_pathopener_token_idsrun_idgen_config_idseedtemperaturetop_pmax_gen_lensample_idxcompletion_token_idscompletion_textnum_tokensfinish_reason
  • scores.parquet:每个rollout×评分器一行,包含 model_idunique_idrun_idbranch_pathsample_idxscorer_idis_correctanswer_char_posanswer_token_fracleak_class。可通过 (model_id, unique_id, run_id, branch_path, sample_idx) 与rollouts连接。
  • policies.csv:每个问题的开启词策略准确率摘要,包含 unique_idsubjectn_openersprobabilityuniformacc_weightedoracle
  • manifest.json:包含 model_idgen_configgen_config_idkmax_depthmax_branchrun_idseedcoveragen_problemsn_openersn_rolloutscreated_utc

自然采样池 — generations/<model>/<pool>.parquet

自包含,内嵌 is_correct 字段,无单独分数文件。池包括 math500_passKmath12k_passKmath12k_K64math12k_L4_5_K64math12k_additional(可用性因模型而异)。列包含:unique_idproblem_idxrun_idsample_idxproducercompletion_textcompletion_token_idsnum_tokensis_correctfinish_reasonseedtemperaturetop_pmodel_idmax_gen_lengen_config_idtimestampsubjectlevelanswer


分组与准确率

  • Experiment分割:分组键为 (model_id, unique_id, branch_path, run_id),准确率 = sum(is_correct) / group_size
  • 池数据:按 (model_id, unique_id) 分组,若需刻意合并则加 run_id
  • branch_path(每次分叉的子索引)是持久的开启词标识。

数据集构建方法

  • 问题来源:数学问题池来自 qwedsacf/competition_math(12,500行),每行分配稳定的 unique_id,分割依据如下:
    • math500:问题文本与 HuggingFaceH4/MATH-500 匹配(恰好500个)。
    • testsource_idx >= 7500 且非 math500。
    • trainsource_idx < 7500
  • Rollouts生成:使用上述配置,通过 Qwen2.5-Math-1.5B 和 Qwen2.5-Math-1.5B-Oat-Zero 公开检查点采样,评分独立进行(CPU)。
  • 排除项:内部微调模型和教师指导(交集采样)rollouts不在数据集中。
搜集汇总
数据集介绍
math-rollouts 数据集图片
构建方式
该数据集基于Hendrycks MATH基准构建,选取了完整的12,500道数学问题,并从中分离出MATH-500子集。构建过程中,利用Qwen2.5-Math-1.5B及其强化学习版本Qwen2.5-Math-1.5B-Oat-Zero的公开检查点,在无引导的条件下进行自然采样,生成了数学推理的展开序列。数据集的构建代码与数据分离,确保生成过程可复现,并通过parquet和CSV格式存储,便于独立加载与使用。
使用方法
用户可通过Python的math-rollouts包中的函数(如load_scored_rollouts、load_nuclei)直接加载实验分割数据,或使用pandas结合huggingface_hub库读取parquet文件。数据集支持按模型、问题ID及采样配置进行分组,从而计算准确率。评分结果与原始展开序列分开存储,可通过联合键进行连接,确保分析的灵活性。此外,可设置MATH_ROLLOUTS_DATA环境变量指向本地路径,以减少远程下载开销。
背景与挑战
背景概述
在数学推理领域,大型语言模型能力的评估与提升日益依赖于高质量、可复现的数据集。math-rollouts数据集由Chris McCormick及其团队于近期创建,专注于Qwen2.5-Math-1.5B基座模型及其强化学习变体Oat-Zero的自然采样推理轨迹。该数据集的核心研究问题在于系统性地记录模型在数学问题解决过程中的第一步令牌分布与多步展开行为,通过引入“核采样”与“强制展开”机制,为分析模型推理策略的多样性与鲁棒性提供了标准化基准。math-rollouts覆盖了完整的MATH-500测试集及包含约12,500道题的MATH超集,其精细的数据结构(包括核、展开、评分三部分)显著提升了数学推理研究中的可复现性,对理解小规模模型在数学任务上的推理瓶颈具有重要推动作用。
当前挑战
该数据集主要应对两大挑战。领域问题层面,数学推理任务要求模型具备严格的符号操作与逻辑链,而当前语言模型经常因采样策略固化导致解路径单一或陷入错误推理循环,math-rollouts通过分离核、原始展开与评分,使研究者能精确量化首令牌分布对后续推理正确性的影响。构建过程中,挑战在于确保多轮采样的一致性与数值精度:不同生成批次需统一温度、top-p等超参数以避免分布偏移;bfloat16精度下首令牌logit的微小差异可能重排核成员关系,因此要求在fp32重计算时严格匹配原精度。此外,跨模型比较时,RL调优模型的首令牌分布高度集中,导致核树分支稀疏,需额外设计均匀强制展开策略以保证统计可比性。
常用场景
经典使用场景
在数学推理领域,该数据集的核心应用在于系统性地探究大语言模型在解决数学问题时的生成策略与行为模式。研究者可借助其中精心组织的核采样(nucleus sampling)展开实验,通过对比基座模型Qwen2.5-Math-1.5B与经强化学习调优的Oat-Zero版本在同一组500道MATH-500题目上的首次词元分布差异,深入分析模型决策的广度与确定性。数据集提供的强制展开(forced rollouts)与自然采样池,允许对相同起点生成多条完整推理链,从而为评估采样温度、top-p等超参数对推理质量的影响提供了标准化测试平台。
解决学术问题
该数据集精准回应了数学推理研究中长期存在的两大核心议题:一是如何量化并比较不同训练范式(如基础预训练与强化学习后训练)下模型推理策略的多样性;二是如何建立可复现的标准来评估采样策略与推理正确性的因果关系。通过提供完整的首次词元核、分支路径概率及逐样本正确性标签,它使得研究者能够脱离黑箱式的准确率比较,转而从概率分布的视角剖析模型在推理起点处的偏好与收敛特性,为设计更高效的推理引导策略奠定了实证基础。
实际应用
在实际工程应用中,该数据集为数学教育领域的智能辅导系统与自动化解题评测工具提供了关键的数据支撑。开发人员可利用其中丰富的模型生成轨迹,训练轻量级评分器或错误检测模块,实现对不同解题路径的自动判别。同时,数据集呈现的核采样结构可直接用于优化推理时的计算预算分配——例如根据首次词元的不确定性动态调整搜索宽度,在保证解答质量的前提下降低延迟,这对于部署在资源受限环境中的数学推理服务尤为重要。
数据集最近研究
最新研究方向
在数学推理数据集的演进脉络中,math-rollouts以核采样与自然展开的融合范式,为语言模型推理行为的细粒度分析开辟了新维度。该数据集针对Qwen2.5-Math-1.5B及其强化学习变体Oat-Zero,系统性地收录了无引导的完整生成轨迹、首令牌核的受控展开、以及均匀强制开头的对比实验数据。其核心创新在于将推理过程解构为可复现的原子步骤,通过显式记录分支路径、核概率分布与评分矩阵,使得研究者能够精准追踪模型从初始令牌选择到最终答案的决策路径,从而深刻揭示强化学习微调如何重塑数学推理的搜索拓扑。结合MATH-500基准的标准化映射,该数据集为解析思维链涌现机制、探索最优推理搜索策略,以及评估模型在不同难度层级上的推理鲁棒性提供了关键基础设施,有望推动可解释推理与高效数学系统的新一轮突破。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务