opd-rethink-eval-results
收藏资源简介:
该数据集为 OPD_Rethink 远程评估结果,以原始 JSON/JSONL 格式存储。数据按标签组织在目录结构 'opd-rethink-20260905T180000Z/<label>/' 下,每个标签目录包含评估运行配置(eval_run_config.json)、评分摘要(grading_summary.json)以及步骤 20 至 200 的逐步 JSONL 文件(step_0020..step_0200/*.jsonl)。标签包括 llama_baseline、gemma_baseline、llama_semantic、gemma_semantic、llama_semantic_conservative、gemma_semantic_conservative 和 qwen_semantic_conservative。评估采用 TTRL 模板(来源于每个运行的 run_semantics.json),禁用思考过程,在 AIME24、AIME25、AMC23 问题集上各进行 16 次采样,并设置 8192 token 的预算。该数据集适用于分析不同模型(如 Llama、Gemma、Qwen)及其变体(基线、语义、保守语义)在数学推理任务上的表现。
This dataset is the remote evaluation results of OPD_Rethink, stored in raw JSON/JSONL format. The data is organized by labels under the directory structure opd-rethink-20260905T180000Z/<label>/, where each label directory contains the evaluation run configuration (eval_run_config.json), grading summary (grading_summary.json), and stepwise JSONL files from step 20 to 200 (step_0020..step_0200/*.jsonl). Labels include llama_baseline, gemma_baseline, llama_semantic, gemma_semantic, llama_semantic_conservative, gemma_semantic_conservative, and qwen_semantic_conservative. The evaluation uses the TTRL template (derived from run_semantics.json of each run), disables the thinking process, performs 16 samplings on each of the AIME24, AIME25, and AMC23 problem sets, and sets a budget of 8192 tokens. This dataset is suitable for analyzing the performance of different models (e.g., Llama, Gemma, Qwen) and their variants (baseline, semantic, conservative semantic) on mathematical reasoning tasks.
OPD_Rethink 远程评估结果数据集概述
数据集内容与结构
该数据集存储了OPD_Rethink项目的远程评估原始结果,文件格式为JSON和JSONL。
目录布局结构为:opd-rethink-20260905T180000Z/<标签>/{eval_run_config.json, grading_summary.json, step_0020..step_0200/*.jsonl}。每个标签目录下包含评估运行配置文件 eval_run_config.json、评分汇总文件 grading_summary.json,以及步骤20至200的检查点评估结果文件(JSONL格式)。
上传的模型标签
数据集包含以下11个模型标签的评估结果:
gemma_baselinegemma_semanticgemma_semantic_conservativek2_baselinek2_mid1final_baselinek2_semantic_classk2_sft1final_baselinellama_baselinellama_semanticllama_semantic_conservativeqwen_semantic_conservative
评估配置
- 评估协议:使用TTRL提示模板(来自每次运行的run_semantics.json),且推理过程禁用思考模式。
- 评估检查点:模型检查点覆盖训练步骤20至200。
- 评估数据集:AIME24、AIME25、AMC23,每个问题执行16次rollout采样。
采样参数:温度 T=0.7,top_p=0.95。
响应Token预算
不同学生模型的响应Token预算不同:
- 8192 tokens(文件名含
-MNT8192.jsonl):适用于 Llama-3.2-3B、Gemma-3-4B 和 Qwen3-1.7B 学生模型。 - 7168 tokens(文件名含
-MNT7168.jsonl):适用于 K2-Horizon-7B 学生模型(k2_*标签),因为其原生上下文长度为8192。
K2模型说明
K2标签代表学生模型(IFM/K2-Horizon-7B)向教师模型修订方向进行迭代的版本:
k2_baseline/k2_semantic_class:预训练最终学生模型(分别为vanilla OPD模式和semantic_class EOS模式)。k2_mid1final_baseline:mid_1_final学生模型(vanilla OPD模式)。k2_sft1final_baseline:sft_1_final学生模型(vanilla OPD模式)。
关联模型资源
Step-200的semantic_class学生模型检查点存放于以下Hugging Face仓库:
kzhao5/opd-rethink-{llama3.2-3b, gemma3-4b, qwen3-1.7b, k2-horizon-7b}-semantic-class-step200
这些模型检查点对应于数据集中step_0200步骤的评估结果。




