遇见数据集

delphi-1e23-25b-stageE-rl-eval-artifacts

收藏
Hugging Face2026-07-21 更新2026-07-22 收录
官方服务:

资源简介:

delphi-1e23 (25B) Stage-E RL 评估数据集是一个用于评估大型语言模型数学推理能力的数据集。它包含对一系列250亿参数语言模型(包括一个监督微调基线模型和四个不同强化学习目标微调的模型)在两个数学推理基准任务(MATH500和gsm8k)上进行性能评估的原始输出结果。数据集由lm-eval框架生成,提供两种文件类型:一是包含任务整体聚合指标(如准确率)和评估配置的JSON文件;二是记录每个评估样本详细信息(如原始问题、标准答案、模型输出、提取答案和正确性判断)的JSONL文件。评估设置具体为:MATH500任务采用0-shot设置,最大生成令牌数3072;gsm8k任务采用5-shot设置,最大生成令牌数2048。所有评估通过vLLM服务进行。该数据集旨在支持对模型数学问题求解能力的细粒度分析和比较,适用于研究社区进行模型评估、基准测试和强化学习微调策略影响分析。

The delphi-1e23 (25B) Stage-E RL evaluation dataset is designed for assessing the mathematical reasoning capabilities of large language models. It contains raw output results from performance evaluations of a series of 25-billion-parameter language models (including one supervised fine-tuned baseline model and four models fine-tuned with different reinforcement learning objectives) on two mathematical reasoning benchmark tasks (MATH500 and gsm8k). Generated using the lm-eval framework, the dataset provides two types of files: JSON files with overall aggregated metrics (e.g., accuracy) and evaluation configurations, and JSONL files with detailed information for each evaluation sample (such as original questions, reference answers, model-generated outputs, extracted answers, and correctness judgments). The evaluation settings are specified as: MATH500 task uses 0-shot setup with a maximum token generation of 3072, and gsm8k task uses 5-shot setup with a maximum token generation of 2048. All evaluations are conducted via a configured vLLM service. This dataset aims to support fine-grained analysis and comparison of model performance in mathematical problem-solving, and is suitable for the research community in model evaluation, benchmarking, and analyzing the impact of reinforcement learning fine-tuning strategies.

提供机构:
LAION eV
创建时间:
2026-07-21
原始信息汇总

数据集概述

数据集名称: laion/delphi-1e23-25b-stageE-rl-eval-artifacts

许可证: Apache-2.0

标签: evalchemy, delphi, rl, math-eval

描述: 该数据集包含 delphi-1e23 25B 模型在 Stage-E RL(强化学习)扫描中的原始 evalchemy 评估结果(基于 lm-eval v0.4.12)。覆盖了5个模型(1个SFT基线和4个RL变体)在2个数学任务上的评估输出。

模型

  • 基线模型: laion/delphi-1e23-wc50m-warmup-levanter-sft
  • RL变体:
    • laion/delphi-1e23-wc50m-rl-d1-rlvrmath
    • laion/delphi-1e23-wc50m-rl-d2-ifeval
    • laion/delphi-1e23-wc50m-rl-d3-dapomath
    • laion/delphi-1e23-wc50m-rl-d4-math500-32gpu

评估任务

  • MATH500: 0-shot评估,最大生成长度 EVAL_MAX_GEN_TOKS=3072
  • gsm8k: 5-shot评估,最大生成长度 EVAL_MAX_GEN_TOKS=2048(避免4k上下文溢出问题)。

文件结构

每个模型和任务组合生成两种文件:

  1. <TASK>_<MODEL>_results.json: 包含聚合指标和完整运行配置。指标包括:

    • MATH500: 准确率(accuracy)
    • gsm8k: 精确匹配(exact_match, 包括flexible和strict两种模式)
  2. <TASK>_<MODEL>_samples.jsonl: 逐样本记录,包含:

    • 问题(problem)
    • 标准答案(gold)
    • 模型输出(model_output)
    • 提取的答案(extracted answer)
    • 正确性标记(correctness)

评估配置

  • 推理方式: vLLM,张量并行度(TP)为6(delphi模型有42个注意力头,TP必须整除42)。
  • 对话模板: delphi_v0(skip_special_tokens=false
  • 最大模型长度: max_model_len=4096
搜集汇总
数据集介绍
delphi-1e23-25b-stageE-rl-eval-artifacts 数据集图片
构建方式
该数据集源自 delphi-1e23 25B Stage-E 强化学习阶段(RL sweep)的原始评估产物,对应 marin issue #6279。数据集涵盖五个模型——包括一个监督式微调基线模型(SFT wc50m baseline)与四个强化学习单元(RL cells D1至D4),并针对 MATH500 与 GSM8K 两项数学推理任务进行评测。对于每对模型与任务组合,数据集一方面提供聚合指标与完整运行配置的 JSON 文件(如准确率、精确匹配得分),另一方面提供逐样本的 JSONL 文件,包含问题、标准答案、模型输出、提取结果及其正确性标记。所有评估均经由 vLLM 服务完成,并采用 delphi_v0 对话模板及特定的生成长度与上下文窗口设置。
特点
数据集具备两项鲜明特性。其一为精细化结构:聚合结果与逐样本记录并存,既便于宏观比较模型间的性能差异,也支持深入分析模型在不同难度或类型样例上的具体表现。其二为评估流程的可复现性:文件内完整记录了推理引擎配置、生成参数(如最大生成长度、最大模型长度)以及模板选择,使得研究者能够准确回溯实验条件。此外,数据集覆盖了 MATH500(零样本推理)和 GSM8K(五样本思维链)两类经典数学评测基准,为评估大语言模型在数学推理领域的泛化能力提供了稳固基础。
使用方法
使用该数据集时,研究者可直接读取各 JSON 文件中的聚合指标(如 MATH500 的准确率、GSM8K 的精确匹配分数),以比较基线模型与不同强化学习策略的效果。若需进行细粒度分析,可解析 JSONL 文件中的逐项结果,根据正确性标签筛选错误样例,从而定位模型的薄弱环节。由于数据格式为标准 JSON 与 JSONL,常见的编程语言(如 Python 的 json 与 pandas 库)均可高效加载与处理。配合评估配置文件中的参数记录,使用者还能复现原始打分流程,或基于相同的评测协议扩展新的模型与任务对比。
背景与挑战
背景概述
大型语言模型(LLM)的强化学习(RL)微调是提升数学推理能力的关键技术之一。在这一背景下,LAION研究团队于2023年发布了delphi-1e23-25B-stageE-rl-eval-artifacts数据集,旨在系统评估不同RL策略对25B参数规模模型在数学任务上的影响。该数据集由LAION机构主导开发,核心研究问题聚焦于比较监督微调(SFT)基线模型与四种RL变体(D1至D4)在MATH500和GSM8K两项数学推理基准上的表现差异。通过提供结构化的评估产物,即聚合指标与逐样本记录,该数据集为分析RL方法对模型数学能力的优化效果提供了标准化工具,对LLM在数学领域的RL训练研究具有重要的推动价值。
当前挑战
该数据集所解决的领域挑战在于,数学推理任务对模型的长上下文理解与符号逻辑处理能力要求极高,而传统SFT方法在泛化复杂数学问题上存在瓶颈,RL微调虽能提升性能,但不同RL策略的优劣缺乏系统对比。在构建过程中,团队面临多重挑战:首先,评估配置需精细适配模型架构,例如delphi模型的42个注意力头要求张量并行度(TP)必须为6的因数;其次,为适应4096的上下文窗口,GSM8K任务需将最大生成长度限制为2048,以避免5-shot示例溢出;最后,MATH500采用0-shot模式且生成长度增至3072,以确保模型自主推理能力得到充分测试,这些设计权衡体现了构建过程的复杂性。
常用场景
经典使用场景
在强化学习驱动的数学推理模型优化领域,Delphi-1e23-25B-stageE-RL-eval-artifacts数据集作为评估基准,被广泛用于衡量大规模语言模型在数学问题求解任务上的能力。其经典使用场景包含两个核心评测任务:MATH500和GSM8K,前者采用零样本设置并允许最大3072个生成标记以覆盖复杂推理过程,后者则使用五样本提示并在2048个标记内完成,有效规避了长上下文溢出问题。研究者通常借助该数据集输出的聚合指标与逐样本结果,系统比较经过不同强化学习策略微调后的模型变体(如SFT基线与四种RL细胞)在精确匹配和严格匹配等度量上的表现差异,从而揭示各类RL算法对数学推理能力提升的有效性。
解决学术问题
该数据集精准回应了学术界关于如何客观评估强化学习在数学推理中作用的核心诉求。传统上,模型在数学任务上的进步常因评测设置不一致而难以归因,Delphi-1e23-25B-stageE-RL-eval-artifacts通过统一MATH500与GSM8K的评估协议(包括生成标记数、上下文窗口及模板),解耦了模型架构、训练策略与评测噪声之间的纠缠。其提供的标准化评测流程使研究者能够剥离出RL阶段带来的真实增益,例如区分基于奖励的推理优化(如D1-RLVRMATH)与基于指令遵循的改进(如D2-IFEval)对数学能力的差异化贡献,进而推动了强化学习在符号推理领域方法论的可复现性与可靠比较。
衍生相关工作
该数据集的发布催生了一系列围绕强化学习与数学推理交叉方向的前沿研究。基于其提供的标准化评测管道,后续工作拓展了从单步奖励模型到多层次推理验证的RL变体,如长链思维强化策略与自我一致性改进方法。此外,数据集中的逐样本生成记录(如模型原始输出与提取答案的对比)被用作训练更细粒度的过程奖励模型,或用于构建纠错反馈循环,使得模型在迭代推理中能够自我修正错误。与此同时,该评估框架也被移植至其他科学推理领域(如物理问题求解或化学方程平衡),证明了其在更广范围内的通用性与方法论价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务