遇见数据集

SFT_MAVERICK

收藏
github2026-08-10 更新2026-08-16 收录
官方服务:

资源简介:

SFT_MAVERICK是MAVERICK(多轴可验证可执行推理与智能认知核)的公开SFT就绪数据集发布,MAVERICK是一个验证优先的框架,用于从数学等价的任务变体中创建自适应推理监督。当前版本源自MATH数据集的中间代数部分,包含源任务的合成改写以及任务侧推理标签。

SFT_MAVERICK is the public SFT-ready dataset release of MAVERICK (Multi-axis Verifiable Executable Reasoning and Intelligent Cognitive Core), a verification-first framework for generating adaptive reasoning supervision from mathematically equivalent task variants. The current version is derived from the intermediate algebra subset of the MATH dataset, and includes synthetic paraphrases of the source tasks as well as task-side reasoning labels.

创建时间:
2026-08-09
原始信息汇总

数据集概述

SFT_MAVERICKMAVERICK(Multi-Axis Verifiable and Executable Reasoning with Intelligent Cognitive Kernels) 框架的公开 SFT(监督微调)数据集版本,该框架是一个用于从数学等价任务变体中创建自适应推理监督的“验证优先”方法。当前版本基于 Hendrycks 等人提出的 MATH 数据集中的中级代数部分,包含源任务的重构变体及任务侧推理标签。

注意: 两个训练文件是同一 1,180 个经过验证的训练对的两个监督视角,并非 2,360 个不同的数学问题。


数据集结构

SFT_MAVERICK/ ├── README.md ├── LICENSE ├── sanitize_dataset.py │ ├── Test/ │ └── accepted_test_master.jsonl │ ├── Train/ │ ├── adaptive/ │ │ └── adaptive_train.jsonl │ └── simple/ │ └── simple_train.jsonl │ └── Val/ └── validation_data.jsonl

推荐的工作流程是保留原始研究文件,并运行 sanitize_dataset.py,默认会创建一个名为 SFT_MAVERICK_PUBLIC 的独立同级目录,且不会覆盖源文件。


数据划分概览

划分 / 视图 行数 用途
Train/adaptive/adaptive_train.jsonl 1,180 自适应 SFT 视图,包含显式推理轨迹
Train/simple/simple_train.jsonl 1,180 仅含最终答案的对照视图(相同训练问题)
Val/validation_data.jsonl 100 留出验证集
Test/accepted_test_master.jsonl 400 留出最终评估集
  • 自适应与简单训练视图包含相同的 1,180 个 pair_id 值。
  • 训练、验证和测试的源标识符在此版本中不相交。
  • 1,180 个训练对来自 1,222 道 MATH 中级代数源题池中经验证的合成变体;42 道反复失败生成或验证的源题被排除,而未作为未修改的回退示例插入。

MAVERICK 的核心特点

MAVERICK 不旨在替代原始 MATH 基准,而是以 MATH 任务为数学内核,增加一层受控的合成数据。每个被接受的合成训练示例关联以下任务侧标签:

  • 稳定的源标识符;
  • 源难度级别;
  • 呈现轴配置;
  • 有序目标推理模式;
  • 自适应或简单 SFT 目标。

核心方法论思想是事前推理监督(ex ante reasoning supervision):在优化学生模型之前,将预期的推理需求表示在任务侧,而非仅从训练模型的隐藏状态、置信度或外部推理时路由中推断。


复杂度轴

MAVERICK 使用概念复杂度配置:C = (X, Y, Z, A)

  • X — 源认知复杂度: 当前版本继承自源 MATH 难度级别(Level 1 至 Level 5)。
  • Y — 语境确定性: 控制任务上下文的直接与完整程度。
  • Z — 抽象程度: 控制具体化与通用化/系统级框架的程度。
  • A — 结构清晰度: 控制问题的组织、紧凑性和呈现结构。

在发布的 JSONL 文件中,直接采样的呈现维度存储在 axis_profile 中,如:

json { "context": 3, "abstraction": 2, "structure": 4 }

源 MATH 难度级别单独存储在 level 字段中。


目标推理模式

自适应 SFT 视图使用四种有序目标模式:

  1. direct_short
  2. compact_reasoning
  3. structured_reasoning
  4. full_trace

本版本中的训练集计数:

目标模式 数量
direct_short 144
compact_reasoning 456
structured_reasoning 480
full_trace 100
总计 1,180

这些标签是监督目标,并非最优 token 预算的基准真值。MAVERICK 论文报告称,类别化模式校准仍然较弱;主要的下游效应应解释为连续推理支出的变化。


训练集轴分布

语境(Y)

级别 数量
1 299
2 186
3 365
4 330

抽象(Z)

级别 数量
1 336
2 419
3 425

结构(A)

级别 数量
1 114
2 162
3 286
4 327
5 165
6 126

源 MATH 难度(X)

级别 数量
Level 1 53
Level 2 157
Level 3 272
Level 4 310
Level 5 388

公开数据格式

推荐的公开版本有意排除内部实现细节,如:

  • 本地文件系统路径;
  • 提供商响应 ID;
  • token/成本核算;
  • 验证器原始输出;
  • 完整生成溯源;
  • 内部风险系数;
  • 冗长的生成策略描述。

训练文件格式

json { "id": "maverick_generated_train_train_intermediate_algebra_1486", "source_id": "train/intermediate_algebra/1486", "category": "intermediate_algebra", "level": "Level 3", "axis_profile": { "context": 1, "abstraction": 3, "structure": 1 }, "reasoning_mode": "compact_reasoning", "messages": [ { "role": "user", "content": "..." }, { "role": "assistant", "content": "..." } ] }

Train/adaptive 在助手消息中包含自适应推理响应;Train/simple 仅包含最终答案的对照响应。

验证与测试文件格式

json { "id": "maverick_generated_test_test_intermediate_algebra_273", "source_id": "test/intermediate_algebra/273", "category": "intermediate_algebra", "level": "Level 1", "axis_profile": { "context": 4, "abstraction": 3, "structure": 2 }, "reasoning_mode": "compact_reasoning", "question": "...", "answer": "269" }

公开版本保留了分析 MAVERICK 所需的任务侧标签,同时移除了内部生成和验证日志。


为何不只发布问答对?

虽然纯 QA 格式是可行的(脚本支持 --qa-only),但作为主要研究版本,不推荐仅发布 QA 对,因为这会移除区分 MAVERICK 与普通合成数学数据集的关键字段:axis_profilereasoning_mode、源溯源和源难度。默认净化格式用于论文/可复现性发布,QA-only 副本可作为额外的便捷视图发布。


自动生成与验证

一旦指定源池、生成策略和验证标准,数据集生产通过固定角色的 LLM 生成器和验证器组件以及确定性预处理和序列化自动进行。流程包括:

  1. 源任务选择;
  2. 呈现轴分配;
  3. 目标推理策略分配;
  4. 合成问题生成;
  5. 数学等价性验证;
  6. 数据集标准验证;
  7. 解决方案轨迹生成;
  8. 答案/轨迹验证;
  9. 接受记录序列化为 SFT 视图。

数据集生产无需人工标注。人工审查(如有报告)仅作为自动化验证质量的独立事后审计。


人工审计

状态: 初始仓库发布时待定。计划对已接受训练变体的固定随机样本进行盲法事后人工审计。

推荐方案:

  • 总体:全部 1,180 个已接受合成训练对;
  • 样本量:30;
  • 固定采样种子:42
  • 按目标推理模式近似比例抽样;
  • 人工判断前隐藏自动化验证决策;
  • 评估标准:
    1. 数学含义保留;
    2. 答案目标保留;
    3. 参考答案/最终答案仍然有效;
    4. 无新的歧义或未说明假设;
    5. 分配的轴变换与生成措辞合理一致。

计划报告格式:

text Human audit: [N_VALID]/30 fully valid 95% exact binomial CI: [TO BE FILLED]

Meaning preserved: [ ]/30 Answer target preserved: [ ]/30 Answer remains valid: [ ]/30 No new ambiguity: [ ]/30 Axis alignment acceptable: [ ]/30

审计结果将在此添加,不会替换失败的样本示例。


已知局限

  • 当前版本仅覆盖 MATH 的 intermediate_algebra
  • 训练规模限于 1,180 个验证合成对。
  • 自适应 SFT 实验仅使用单个学生模型种子。
  • 验证部分依赖 LLM 判断。
  • 生成的验证和测试示例与训练数据来自同一合成生成族。
  • 目标推理模式是启发式有序监督标签,而非实验确定的最优推理预算。
  • 公开净化版本默认省略内部提供商和验证器日志。

在解释超出报告场景的泛化时,应考虑这些限制。


与 MATH 的关系

SFT_MAVERICK 是基于 MATH 数据集的派生合成数据集(Hendrycks 等人,NeurIPS 2021)。本版本中的源标识符可追溯至对应的 MATH 划分/类别/条目。SFT_MAVERICK 与原始 MATH 作者无隶属关系或背书关系。推荐的净化版本不重新分发原始 MATH 问题陈述、原始解决方案、本地源路径或原始验证器记录,而是分发 MAVERICK 生成的任务变体和 SFT/评估视图。


许可

本仓库中 MAVERICK 特有的数据集组织、合成变体、元数据及附带脚本以 MIT 许可证发布(见 LICENSE)。本项目派生自 MATH,保留对原始工作的归属。用户应在重新分发派生材料前查看上游 MATH 仓库及其许可证。


引用

使用本数据集时,请同时引用 MAVERICK 和原始 MATH 数据集。

MAVERICK

bibtex @inproceedings{gabrielyan2026maverick, title = {Multi-Axis Verifiable and Executable Reasoning with Intelligent Cognitive Kernels}, author = {Gabrielyan, Daniil}, booktitle = {2026 IEEE 3rd International Student Conference on Digital Generation (IEEE DG 2026)}, year = {2026} }

MATH

bibtex @article{hendrycksmath2021, title = {Measuring Mathematical Problem Solving With the MATH Dataset}, author = {Dan Hendrycks and Collin Burns and Saurav Kadavath and Akul Arora and Steven Basart and Eric Tang and Dawn Song and Jacob Steinhardt}, journal = {NeurIPS}, year = {2021} }


发布版本

初始研究版本:SFT_MAVERICK v1.0.0。建议科学使用时引用标记版本而非未版本化的分支,以确保数据快照可恢复。


联系

Daniil Gabrielyan
Astana IT University
Astana, Kazakhstan

关于数据集或复现 MAVERICK 实验的问题,请使用本仓库的 GitHub Issues 部分。

搜集汇总
数据集介绍
SFT_MAVERICK 数据集图片
构建方式
SFT_MAVERICK数据集源于MAVERICK框架,该框架以数学问题为认知内核,通过受控的合成数据层增强推理监督。当前版本取自MATH数据集的intermediate_algebra子集,从1,222道源题中经生成与验证流程筛选出1,180道有效合成变体,剔除42道反复失败的题目。构建过程包括源任务选择、呈现轴分配、目标推理模式分配、合成问题生成、数学等价性验证、数据集标准验证、解题轨迹生成及答案/轨迹验证等步骤,全程自动化,无需人工标注。数据分为自适应视图与简单视图,共享相同的pair_id,仅推理轨迹详略不同。
使用方法
使用者可通过官方提供的sanitize_dataset.py脚本生成净化版数据,默认输出至SFT_MAVERICK_PUBLIC目录,避免覆盖源文件。推荐使用默认的消毒格式,其中自适应视图含显式推理轨迹,简单视图仅含最终答案,便于对比监督效果。评估时,验证集与测试集均保留任务侧标签(如axis_profile、reasoning_mode、level)和标准答案,可复现MAVERICK实验。如需轻量级接口,亦支持--qa-only选项生成纯问答对,但官方建议以完整元数据版本为准。使用时应引用MAVERICK及原始MATH数据集,以保证溯源清晰。
背景与挑战
背景概述
SFT_MAVERICK数据集由Astana IT University的Daniil Gabrielyan于2026年创建,作为MAVERICK框架的公开SFT-ready数据发布。该数据集从MATH数据集的intermediate_algebra子集出发,通过合成任务变体和任务侧推理标签,实现了验证优先的自适应推理监督。其核心创新在于提出了一种多轴复杂性配置文件(C = (X, Y, Z, A)),将源认知复杂度、上下文确定性、抽象度和结构清晰度整合为显式的推理需求表示,并针对四种有序目标推理模式进行标注。该数据集为数学推理的SFT训练提供了细粒度的监督信号,促进了可验证推理方法的发展,对相关领域具有显著的推动作用。
当前挑战
SFT_MAVERICK面临多重挑战。首先,在领域问题层面,尽管构建了合成变体,但训练规模仅限1,180对,且仅覆盖MATH的intermediate_algebra子集,限制了模型泛化能力。其次,目标推理模式是基于启发式分类的标签,而非实验确定的最优推理预算,导致模式校准较弱。构建过程中,从1,222个源问题中仅保留1,180个有效对,42个问题因生成或验证失败被排除,暴露出生成与验证的瓶颈。此外,验证依赖LLM判断,且人类审计尚待进行,可能引入偏差。最后,验证和测试数据与训练数据来自同一生成族,可能高估模型性能,而公开版本剥离了内部日志,进一步增加了复现和审计的难度。
常用场景
经典使用场景
SFT_MAVERICK数据集的核心应用场景在于为大型语言模型的监督微调(SFT)提供具有多轴标注的合成数学任务变体。该数据集以MATH数据集的中间代数部分为数学内核,通过系统性地操控上下文确定性、抽象程度和结构清晰度三个呈现轴,以及四种有序的推理模式(直接简洁、紧凑推理、结构化推理、全轨迹),构建了1,180对经过数学等价性验证的训练样本。研究者可利用该数据集训练模型,使其能够根据任务侧的复杂性配置自适应地调整推理深度,从而提升模型在数学问题求解中的泛化能力和推理效率。
解决学术问题
该数据集解决了当前数学推理数据集普遍缺乏对推理过程精细控制的问题。传统数据集通常仅提供问题-答案对,难以区分模型的真实推理能力与答案巧合。SFT_MAVERICK通过引入任务侧的推理监督(ex ante reasoning supervision),将预期的推理需求显式地编码于任务表征中,使得研究能够系统性地探究推理模式的呈现方式如何影响大语言模型的推理行为。这一方法支持了关于推理长度、结构化和思维链等关键问题的实证研究,为优化推理效率与准确性之间的权衡提供了新的实验范式。
实际应用
在实际应用中,SFT_MAVERICK可用于开发具有自适应推理能力的大语言模型,使其在面对不同复杂度的数学问题时能够自主选择合适的推理策略。例如,在智能教育辅导系统中,模型可根据问题的难度和学生的认知水平,动态调整解题步骤的详细程度;在自动化数学答题系统中,该数据集有助于在保证准确性的同时减少不必要的计算开销。此外,其数据生成与验证流程可复用于构建其他学科或领域的适应性推理数据集,具有广泛的推广价值。
数据集最近研究
最新研究方向
SFT_MAVERICK数据集聚焦于数学推理的适应性监督学习,其最新研究前沿在于通过多轴复杂性配置(包括源认知复杂度、上下文确定性、抽象层次和结构清晰度)生成数学等价的任务变体,并结合四档有序推理模式(direct_short至full_trace)构建显式的先验推理监督信号。这一方法突破了传统依赖模型内部状态或事后路由的局限,为大型语言模型的数学问题求解能力提供了可验证、可执行的自适应训练范式。该数据集基于MATH基准的中间代数子集,通过自动化生成与验证流程,产出1180对高质量训练样本,并附带细致的轴分布和推理模式标签,为研究推理深度与任务呈现方式之间的关联提供了宝贵资源。其发布不仅促进了数学推理数据集向多维度、可解释方向的演进,也为未来在复杂推理任务中实现精准监督与高效泛化奠定了数据基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务