遇见数据集

opd-rethink-eval-results

收藏
Hugging Face2026-09-07 更新2026-09-08 收录
官方服务:

资源简介:

该数据集为 OPD_Rethink 远程评估结果,以原始 JSON/JSONL 格式存储。数据按标签组织在目录结构 'opd-rethink-20260905T180000Z/<label>/' 下,每个标签目录包含评估运行配置(eval_run_config.json)、评分摘要(grading_summary.json)以及步骤 20 至 200 的逐步 JSONL 文件(step_0020..step_0200/*.jsonl)。标签包括 llama_baseline、gemma_baseline、llama_semantic、gemma_semantic、llama_semantic_conservative、gemma_semantic_conservative 和 qwen_semantic_conservative。评估采用 TTRL 模板(来源于每个运行的 run_semantics.json),禁用思考过程,在 AIME24、AIME25、AMC23 问题集上各进行 16 次采样,并设置 8192 token 的预算。该数据集适用于分析不同模型(如 Llama、Gemma、Qwen)及其变体(基线、语义、保守语义)在数学推理任务上的表现。

This dataset is the remote evaluation results of OPD_Rethink, stored in raw JSON/JSONL format. The data is organized by labels under the directory structure opd-rethink-20260905T180000Z/<label>/, where each label directory contains the evaluation run configuration (eval_run_config.json), grading summary (grading_summary.json), and stepwise JSONL files from step 20 to 200 (step_0020..step_0200/*.jsonl). Labels include llama_baseline, gemma_baseline, llama_semantic, gemma_semantic, llama_semantic_conservative, gemma_semantic_conservative, and qwen_semantic_conservative. The evaluation uses the TTRL template (derived from run_semantics.json of each run), disables the thinking process, performs 16 samplings on each of the AIME24, AIME25, and AMC23 problem sets, and sets a budget of 8192 tokens. This dataset is suitable for analyzing the performance of different models (e.g., Llama, Gemma, Qwen) and their variants (baseline, semantic, conservative semantic) on mathematical reasoning tasks.

创建时间:
2026-09-06
原始信息汇总

OPD_Rethink 远程评估结果数据集概述

数据集内容与结构

该数据集存储了OPD_Rethink项目的远程评估原始结果,文件格式为JSON和JSONL。

目录布局结构为:opd-rethink-20260905T180000Z/<标签>/{eval_run_config.json, grading_summary.json, step_0020..step_0200/*.jsonl}。每个标签目录下包含评估运行配置文件 eval_run_config.json、评分汇总文件 grading_summary.json,以及步骤20至200的检查点评估结果文件(JSONL格式)。

上传的模型标签

数据集包含以下11个模型标签的评估结果:

  • gemma_baseline
  • gemma_semantic
  • gemma_semantic_conservative
  • k2_baseline
  • k2_mid1final_baseline
  • k2_semantic_class
  • k2_sft1final_baseline
  • llama_baseline
  • llama_semantic
  • llama_semantic_conservative
  • qwen_semantic_conservative

评估配置

  • 评估协议:使用TTRL提示模板(来自每次运行的run_semantics.json),且推理过程禁用思考模式。
  • 评估检查点:模型检查点覆盖训练步骤20至200。
  • 评估数据集:AIME24、AIME25、AMC23,每个问题执行16次rollout采样。

采样参数:温度 T=0.7,top_p=0.95。

响应Token预算

不同学生模型的响应Token预算不同:

  • 8192 tokens(文件名含 -MNT8192.jsonl):适用于 Llama-3.2-3B、Gemma-3-4B 和 Qwen3-1.7B 学生模型。
  • 7168 tokens(文件名含 -MNT7168.jsonl):适用于 K2-Horizon-7B 学生模型(k2_* 标签),因为其原生上下文长度为8192。

K2模型说明

K2标签代表学生模型(IFM/K2-Horizon-7B)向教师模型修订方向进行迭代的版本:

  • k2_baseline / k2_semantic_class:预训练最终学生模型(分别为vanilla OPD模式和semantic_class EOS模式)。
  • k2_mid1final_baseline:mid_1_final学生模型(vanilla OPD模式)。
  • k2_sft1final_baseline:sft_1_final学生模型(vanilla OPD模式)。

关联模型资源

Step-200的semantic_class学生模型检查点存放于以下Hugging Face仓库:

  • kzhao5/opd-rethink-{llama3.2-3b, gemma3-4b, qwen3-1.7b, k2-horizon-7b}-semantic-class-step200

这些模型检查点对应于数据集中step_0200步骤的评估结果。

搜集汇总
数据集介绍
opd-rethink-eval-results 数据集图片
构建方式
该数据集源自对多个大型语言模型进行远程评估的实验记录,其构建遵循严谨的流程。评估采用TTRL提示模板,并停用思维链功能,在模型检查点步数20至200之间系统性地采集数据。评估任务涵盖AIME24、AIME25与AMC23三个数学推理基准,每个问题均执行16次随机采样,温度参数设定为0.7,top_p为0.95,以确保统计稳健性。响应预算依据不同学生模型的原生上下文长度分别设定为8192或7168个令牌,所有原始评估结果均以JSON/JSONL格式存储于按标签组织的目录结构中。
特点
该数据集的核心特点在于其精细的分层架构与多维度覆盖。数据按模型变体标签(如gemma_baseline、llama_semantic等)分类,每种标签下存储了完整的评估配置与逐步检查点的结果文件,便于追踪模型性能随训练步数的演化。尤为独特的是,其囊括了K2系列模型的不同修订版本,比较了基线、语义分类EOS模式及中间检查点等变体,为研究OPD(在线偏好蒸馏)和语义对齐策略提供了丰富对比。数据规模庞大,包含数千次推理输出,且针对不同模型自适应调整响应预算,保障了评估的公平性与可重复性。
使用方法
研究者可直接加载各标签下的原始JSONL文件,通过解析每个批次的完整输入输出对,复现特定检查点在数学推理任务上的表现。数据集支持对比分析,例如将语义分类模型与基线模型在同一问题、同一采样参数下的输出进行对照,以评测策略效果。此外,用户可依据结果文件中的指纹信息回溯至具体的模型检查点,结合HuggingFace上的模型权重进行深入的安全与能力审计。该数据集亦可用于教学演示,或作为构建评估基准的参考样例,但需注意其采样参数与预算设置可能需根据目标场景调整。
背景与挑战
背景概述
该数据集由OPD_Rethink项目于2026年生成,旨在系统评估强化学习微调(如OPD)对小型语言模型数学推理能力的提升效果。研究团队聚焦于Gemma、Llama、Qwen及K2-Horizon等不同架构的学生模型,通过对比基线与语义增强等训练策略,探索模型在AIME和AMC等竞赛级数学问题上的表现。该数据集以原始评测结果形式存储,覆盖多个训练步长检查点,为分析模型推理能力演变提供了细粒度证据。其发布对数学推理与模型微调领域具有方法论参考价值,尤其为小规模模型的高效定向优化提供了实证基础。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两方面。领域上,其核心问题在于评测模型在AIME/AMC等复杂数学推理任务中的泛化能力,这些任务要求模型具备多步逻辑推导与符号操作能力,而小参数模型受限于容量易过拟合或推理不足。构建过程中,需应对多模型、多配置(如不同上下文长度导致的响应预算差异)带来的一致性评测挑战,确保各检查点间的可比性;同时,原始JSON/JSONL格式的分散管理增加了数据整合与复用的难度,且评测结果的解释需关切rollout随机性对稳定性的影响。
常用场景
经典使用场景
该数据集作为强化学习与自回归语言模型交叉领域的评测基准,承载着对思维链推理过程中涌现的语义对齐现象进行系统性量化的核心使命。其设计精巧地融合了多模型族系(Llama、Gemma、Qwen、K2)与多阶段检查点(20至200步)的评估框架,使得研究社群能够沿着训练动力学的时间轴,追踪模型在解决AIME与AMC等竞赛级数学题时,其内部推理链条的语义一致性如何随参数更新而演化。每一份JSONL记录都包含16次rollout的完整路径,为剖析概率性解码下的推理稳健性提供了不可多得的微观样本。
实际应用
在实际应用中,该数据集的评测配置高度契合智能教育辅导系统与自动化数学解题引擎的部署需求。其评估协议(固定温度、高采样次数、显式token预算控制)可直接迁移至产品环境中,用于筛选在有限计算资源下依然保持高解题精度与语义稳定性的模型版本。对于构建步骤级解题反馈、数学对话代理等下游任务,研究者能够基于数据集中step_0200等细粒度检查点的结果,挑选出推理行为最接近人类教师讲解逻辑的checkpoint进行服务化,从而显著提升教学辅助工具的输出质量与用户信任度。
衍生相关工作
该数据集的发布直接滋养了数个活跃的研究分支。围绕‘语义一致性’在强化学习中的效用,催生了一批改进奖励塑造函数的工作,如将推理路径的语义聚类结果作为内在激励项。其次,基于多轮rollout的原始轨迹,衍生了针对‘推理路径多样性-准确性权衡’的分析文献,为集束搜索与自洽性解码算法的调优提供了标准化的评测语料。此外,跨模型代际与规模的同配置对比结果,成为研究‘能力蒸馏与语义策略迁移’的宝贵参考,启发了后续在更大基座模型上复现语义类对齐训练范式的系列实验。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务