遇见数据集

axis-teacher-generations

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

本数据集名为“Axis Teacher Generations”,旨在收集外部大型语言模型(具体为Gemini Pro和v4-pro模型)在MATH数据集Level 4-5级别数学题目上生成的解答及其评分结果,主要用于评估这些“教师”模型在复杂数学问题上的解答能力。数据内容包含三个JSONL格式文件:`teacher_wall_pro.jsonl`存储了模型在Gemma-3 4B模型能力墙(包含868道题目)上通过API广泛采样生成的原始解答;`teacher_wall_pro_dedup.jsonl`是经过格式清理和去重处理后的解答集合;`teacher_wall_pro_scored.jsonl`则包含了使用Math-Verify系统进行验证评分后的结果,其中报告的能力墙良率为68.91%(即386题中正确解答了266题)。这些数据适用于大模型数学推理能力评估、自动评分系统验证以及相关研究的数据支撑。

The dataset is named Axis Teacher Generations, designed to collect solutions and scoring results generated by external large language models (specifically Gemini Pro and v4-pro models) on MATH dataset Level 4-5 math problems. It is primarily used to evaluate the solution capabilities of these teacher models on complex mathematical problems. The data content includes three JSONL format files: `teacher_wall_pro.jsonl` stores raw solutions generated by the models through extensive API sampling on the Gemma-3 4B model capability wall (containing 868 problems); `teacher_wall_pro_dedup.jsonl` is a collection of solutions after format cleaning and deduplication; `teacher_wall_pro_scored.jsonl` contains results verified and scored using the Math-Verify system, reporting a capability wall pass rate of 68.91% (i.e., 266 correct solutions out of 386 problems). This data is suitable for evaluating large model mathematical reasoning capabilities, validating automated scoring systems, and supporting related research.

创建时间:
2026-07-27
原始信息汇总

Axis Teacher Generations 数据集概述

本数据集收录了外部大模型老师(Gemini Pro / v4-pro)在 MATH Level 4-5 题目上的生成解答与计分结果。

数据集文件

数据集包含三个 JSONL 格式文件:

1. teacher_wall_pro.jsonl

  • 内容:外部大老师模型在 Gemma-3 4B 0/8 能力墙(共 868 题)上的原始生成解答
  • 生成方式:由 程式與腳本/gen_teacher_wall.py 调用 API 广撒采样生成
  • 对应账本字段AI_AGENT_WORKFLOW.md §1 账本第 49 列(老师(v4-pro)在能力墙的良率)

2. teacher_wall_pro_dedup.jsonl

  • 内容:经格式清理与去除重复后的老师解答集
  • 生成方式:由 程式與腳本/gen_teacher_wall.py 的 post-processing 清理步骤生成
  • 对应账本字段AI_AGENT_WORKFLOW.md §1 账本第 49 列

3. teacher_wall_pro_scored.jsonl

  • 内容:经 Math-Verify 评测计分后的老师解答结果(能力墙良率为 68.91%,266/386 正确)
  • 生成方式:由 程式與腳本/score_teacher_wall.py 执行 Math-Verify 验证评分
  • 对应账本字段AI_AGENT_WORKFLOW.md §1 账本第 49 列与第 50 列(老师解法的推导效度盲读前置资料)
搜集汇总
数据集介绍
axis-teacher-generations 数据集图片
构建方式
该数据集源于对MATH Level 4-5高难度数学题目的深度探索,汇集了外部大模型老师(Gemini Pro / v4-pro)的生成解答与评分结果。数据集的构建分三步进行:首先,通过脚本`gen_teacher_wall.py`调用API对Gemma-3 4B模型能力墙上的868道题目进行大规模采样生成原始解答,得到`teacher_wall_pro.jsonl`;随后,对原始数据进行格式清理与去重处理,形成`teacher_wall_pro_dedup.jsonl`;最后,利用Math-Verify工具对去重后的解答进行自动评分,产出`teacher_wall_pro_scored.jsonl`,其中能力墙良率达68.91%。整个过程对应于预定义的AI代理工作流账本,确保了数据生成与评分的可追溯性。
使用方法
使用该数据集时,研究者可根据需求选择不同阶段的文件:若需原始生成样本用于分析生成分布或多样性,可直接使用`teacher_wall_pro.jsonl`;若关注高质量且无重复的解答集,则应选取`teacher_wall_pro_dedup.jsonl`;而进行模型推理能力评估时,`teacher_wall_pro_scored.jsonl`提供的评分标签(如良率68.91%)是最佳选择。所有文件均为JSONL格式,便于用标准库加载并逐行处理。推荐结合`AI_AGENT_WORKFLOW.md`中的账本说明,以理解每列字段的生成上下文与评分逻辑。此外,可参考配套脚本`gen_teacher_wall.py`与`score_teacher_wall.py`复现数据生成流程,或基于评分结果进一步分析模型在数学推理中的薄弱环节。
背景与挑战
背景概述
axis-teacher-generations数据集由研究团队创建,旨在利用大型语言模型(如Gemini Pro)在MATH Level 4-5题目上生成高质量解答,以应对数学推理能力评估与教师模型蒸馏中的关键瓶颈。该数据集围绕Gemma-3 4B模型的能力墙(868题)展开,通过API采样生成原始解答,并经过格式清理、去重及Math-Verify评分流程,最终获得教师模型解答的良率(68.91%)。数据集为评估教师模型在复杂数学问题上的推导效度提供了标准化语料,并对模型蒸馏、知识迁移领域具有重要影响力,尤其为提升小模型推理能力奠定了数据基础。
当前挑战
数据集面对的核心挑战包括:解决数学推理能力评估中教师模型产出的可靠性问题,MATH Level 4-5题目复杂度高,需确保解答的逻辑严密性与计算准确性;构建过程中,原始解答存在格式混乱、重复冗余,需设计高效的去重与清理流程;评分阶段依赖Math-Verify验证,需保证对多样化解答形式的鲁棒性,并规避API采样带来的偏差。此外,教师模型能力墙的良率(68.91%)揭示了模型在极高难度题目上的推理局限,为后续改进方向提供了明确靶点。
常用场景
经典使用场景
该数据集最为经典的使用场景是作为数学推理领域中的“教师模型行为基准”,专门用于评估与分析外部大语言模型(如Gemini Pro及v4-pro)在面对高难度数学题目(MATH Level 4-5)时的生成解答质量。研究者可借助其包含的原始生成、去重清理及评分标注三个子集,系统性地探究大型教师模型在数学能力墙上的表现模式,为后续学生模型的知识蒸馏与能力提升提供可靠的参考标杆。
解决学术问题
该数据集核心解决了数学推理研究中“教师模型行为可复现性不足”与“能力墙界定模糊”两大关键难题。通过提供标准化的原始生成、去重处理及Math-Verify精确评分结果,它为学界构建了一个透明、可对比的教师模型表现评估基准。其发布使得研究者能够定量分析大模型在复杂数学问题上的正确率分布与错误模式,从而推动模型泛化能力边界认知的深化,并为知识蒸馏、自训练等范式中的教师选型提供了实证依据。
实际应用
在实际应用层面,该数据集可被直接用于筛选和验证学生模型的蒸馏数据源。例如,在利用较小模型(如Gemma-3 4B)进行数学推理能力强化时,开发者可依据本数据集中教师模型在能力墙上的高质量解答(正确率约68.91%)构建精炼训练集,从而有效提升学生模型的数学解题准确率。此外,该数据还可服务于大模型数学能力横向评测、提示工程策略优化以及教材习题自动化批改系统的可信度校准等真实场景。
数据集最近研究
最新研究方向
在数学推理能力的前沿探索中,axis-teacher-generations数据集聚焦于大模型在MATH Level 4-5难题上的生成解答与评估,特别是针对Gemma-3 4B模型在能力墙(868道题)上的表现进行了系统性采样与评分。该数据集不仅记录了外部大模型老师(Gemini Pro/v4-pro)的原始生成解答,还通过格式清理、去重及Math-Verify验证计分,揭示了当前模型在复杂数学推理任务中的良率(68.91%)与提升空间。这一工作与近年来大模型数学推理能力的可信度与泛化边界研究热点紧密相关,为评估模型在挑战性数学问题上的弱点提供了量化基准,进而推动大模型在数学教育辅助与逻辑推理增强方向的迭代优化。其意义在于通过结构化数据支持后续的推导效度分析,助力于构建更加鲁棒的数学推理评估体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务