SFT_MAVERICK
收藏资源简介:
SFT_MAVERICK是MAVERICK(多轴可验证可执行推理与智能认知核)的公开SFT就绪数据集发布,MAVERICK是一个验证优先的框架,用于从数学等价的任务变体中创建自适应推理监督。当前版本源自MATH数据集的中间代数部分,包含源任务的合成改写以及任务侧推理标签。
SFT_MAVERICK is the public SFT-ready dataset release of MAVERICK (Multi-axis Verifiable Executable Reasoning and Intelligent Cognitive Core), a verification-first framework for generating adaptive reasoning supervision from mathematically equivalent task variants. The current version is derived from the intermediate algebra subset of the MATH dataset, and includes synthetic paraphrases of the source tasks as well as task-side reasoning labels.
数据集概述
SFT_MAVERICK 是 MAVERICK(Multi-Axis Verifiable and Executable Reasoning with Intelligent Cognitive Kernels) 框架的公开 SFT(监督微调)数据集版本,该框架是一个用于从数学等价任务变体中创建自适应推理监督的“验证优先”方法。当前版本基于 Hendrycks 等人提出的 MATH 数据集中的中级代数部分,包含源任务的重构变体及任务侧推理标签。
注意: 两个训练文件是同一 1,180 个经过验证的训练对的两个监督视角,并非 2,360 个不同的数学问题。
数据集结构
SFT_MAVERICK/ ├── README.md ├── LICENSE ├── sanitize_dataset.py │ ├── Test/ │ └── accepted_test_master.jsonl │ ├── Train/ │ ├── adaptive/ │ │ └── adaptive_train.jsonl │ └── simple/ │ └── simple_train.jsonl │ └── Val/ └── validation_data.jsonl
推荐的工作流程是保留原始研究文件,并运行 sanitize_dataset.py,默认会创建一个名为 SFT_MAVERICK_PUBLIC 的独立同级目录,且不会覆盖源文件。
数据划分概览
| 划分 / 视图 | 行数 | 用途 |
|---|---|---|
Train/adaptive/adaptive_train.jsonl |
1,180 | 自适应 SFT 视图,包含显式推理轨迹 |
Train/simple/simple_train.jsonl |
1,180 | 仅含最终答案的对照视图(相同训练问题) |
Val/validation_data.jsonl |
100 | 留出验证集 |
Test/accepted_test_master.jsonl |
400 | 留出最终评估集 |
- 自适应与简单训练视图包含相同的 1,180 个
pair_id值。 - 训练、验证和测试的源标识符在此版本中不相交。
- 1,180 个训练对来自 1,222 道 MATH 中级代数源题池中经验证的合成变体;42 道反复失败生成或验证的源题被排除,而未作为未修改的回退示例插入。
MAVERICK 的核心特点
MAVERICK 不旨在替代原始 MATH 基准,而是以 MATH 任务为数学内核,增加一层受控的合成数据。每个被接受的合成训练示例关联以下任务侧标签:
- 稳定的源标识符;
- 源难度级别;
- 呈现轴配置;
- 有序目标推理模式;
- 自适应或简单 SFT 目标。
核心方法论思想是事前推理监督(ex ante reasoning supervision):在优化学生模型之前,将预期的推理需求表示在任务侧,而非仅从训练模型的隐藏状态、置信度或外部推理时路由中推断。
复杂度轴
MAVERICK 使用概念复杂度配置:C = (X, Y, Z, A)
- X — 源认知复杂度: 当前版本继承自源 MATH 难度级别(Level 1 至 Level 5)。
- Y — 语境确定性: 控制任务上下文的直接与完整程度。
- Z — 抽象程度: 控制具体化与通用化/系统级框架的程度。
- A — 结构清晰度: 控制问题的组织、紧凑性和呈现结构。
在发布的 JSONL 文件中,直接采样的呈现维度存储在 axis_profile 中,如:
json { "context": 3, "abstraction": 2, "structure": 4 }
源 MATH 难度级别单独存储在 level 字段中。
目标推理模式
自适应 SFT 视图使用四种有序目标模式:
direct_shortcompact_reasoningstructured_reasoningfull_trace
本版本中的训练集计数:
| 目标模式 | 数量 |
|---|---|
direct_short |
144 |
compact_reasoning |
456 |
structured_reasoning |
480 |
full_trace |
100 |
| 总计 | 1,180 |
这些标签是监督目标,并非最优 token 预算的基准真值。MAVERICK 论文报告称,类别化模式校准仍然较弱;主要的下游效应应解释为连续推理支出的变化。
训练集轴分布
语境(Y)
| 级别 | 数量 |
|---|---|
| 1 | 299 |
| 2 | 186 |
| 3 | 365 |
| 4 | 330 |
抽象(Z)
| 级别 | 数量 |
|---|---|
| 1 | 336 |
| 2 | 419 |
| 3 | 425 |
结构(A)
| 级别 | 数量 |
|---|---|
| 1 | 114 |
| 2 | 162 |
| 3 | 286 |
| 4 | 327 |
| 5 | 165 |
| 6 | 126 |
源 MATH 难度(X)
| 级别 | 数量 |
|---|---|
| Level 1 | 53 |
| Level 2 | 157 |
| Level 3 | 272 |
| Level 4 | 310 |
| Level 5 | 388 |
公开数据格式
推荐的公开版本有意排除内部实现细节,如:
- 本地文件系统路径;
- 提供商响应 ID;
- token/成本核算;
- 验证器原始输出;
- 完整生成溯源;
- 内部风险系数;
- 冗长的生成策略描述。
训练文件格式
json { "id": "maverick_generated_train_train_intermediate_algebra_1486", "source_id": "train/intermediate_algebra/1486", "category": "intermediate_algebra", "level": "Level 3", "axis_profile": { "context": 1, "abstraction": 3, "structure": 1 }, "reasoning_mode": "compact_reasoning", "messages": [ { "role": "user", "content": "..." }, { "role": "assistant", "content": "..." } ] }
Train/adaptive 在助手消息中包含自适应推理响应;Train/simple 仅包含最终答案的对照响应。
验证与测试文件格式
json { "id": "maverick_generated_test_test_intermediate_algebra_273", "source_id": "test/intermediate_algebra/273", "category": "intermediate_algebra", "level": "Level 1", "axis_profile": { "context": 4, "abstraction": 3, "structure": 2 }, "reasoning_mode": "compact_reasoning", "question": "...", "answer": "269" }
公开版本保留了分析 MAVERICK 所需的任务侧标签,同时移除了内部生成和验证日志。
为何不只发布问答对?
虽然纯 QA 格式是可行的(脚本支持 --qa-only),但作为主要研究版本,不推荐仅发布 QA 对,因为这会移除区分 MAVERICK 与普通合成数学数据集的关键字段:axis_profile、reasoning_mode、源溯源和源难度。默认净化格式用于论文/可复现性发布,QA-only 副本可作为额外的便捷视图发布。
自动生成与验证
一旦指定源池、生成策略和验证标准,数据集生产通过固定角色的 LLM 生成器和验证器组件以及确定性预处理和序列化自动进行。流程包括:
- 源任务选择;
- 呈现轴分配;
- 目标推理策略分配;
- 合成问题生成;
- 数学等价性验证;
- 数据集标准验证;
- 解决方案轨迹生成;
- 答案/轨迹验证;
- 接受记录序列化为 SFT 视图。
数据集生产无需人工标注。人工审查(如有报告)仅作为自动化验证质量的独立事后审计。
人工审计
状态: 初始仓库发布时待定。计划对已接受训练变体的固定随机样本进行盲法事后人工审计。
推荐方案:
- 总体:全部 1,180 个已接受合成训练对;
- 样本量:30;
- 固定采样种子:
42; - 按目标推理模式近似比例抽样;
- 人工判断前隐藏自动化验证决策;
- 评估标准:
- 数学含义保留;
- 答案目标保留;
- 参考答案/最终答案仍然有效;
- 无新的歧义或未说明假设;
- 分配的轴变换与生成措辞合理一致。
计划报告格式:
text Human audit: [N_VALID]/30 fully valid 95% exact binomial CI: [TO BE FILLED]
Meaning preserved: [ ]/30 Answer target preserved: [ ]/30 Answer remains valid: [ ]/30 No new ambiguity: [ ]/30 Axis alignment acceptable: [ ]/30
审计结果将在此添加,不会替换失败的样本示例。
已知局限
- 当前版本仅覆盖 MATH 的
intermediate_algebra。 - 训练规模限于 1,180 个验证合成对。
- 自适应 SFT 实验仅使用单个学生模型种子。
- 验证部分依赖 LLM 判断。
- 生成的验证和测试示例与训练数据来自同一合成生成族。
- 目标推理模式是启发式有序监督标签,而非实验确定的最优推理预算。
- 公开净化版本默认省略内部提供商和验证器日志。
在解释超出报告场景的泛化时,应考虑这些限制。
与 MATH 的关系
SFT_MAVERICK 是基于 MATH 数据集的派生合成数据集(Hendrycks 等人,NeurIPS 2021)。本版本中的源标识符可追溯至对应的 MATH 划分/类别/条目。SFT_MAVERICK 与原始 MATH 作者无隶属关系或背书关系。推荐的净化版本不重新分发原始 MATH 问题陈述、原始解决方案、本地源路径或原始验证器记录,而是分发 MAVERICK 生成的任务变体和 SFT/评估视图。
许可
本仓库中 MAVERICK 特有的数据集组织、合成变体、元数据及附带脚本以 MIT 许可证发布(见 LICENSE)。本项目派生自 MATH,保留对原始工作的归属。用户应在重新分发派生材料前查看上游 MATH 仓库及其许可证。
引用
使用本数据集时,请同时引用 MAVERICK 和原始 MATH 数据集。
MAVERICK
bibtex @inproceedings{gabrielyan2026maverick, title = {Multi-Axis Verifiable and Executable Reasoning with Intelligent Cognitive Kernels}, author = {Gabrielyan, Daniil}, booktitle = {2026 IEEE 3rd International Student Conference on Digital Generation (IEEE DG 2026)}, year = {2026} }
MATH
bibtex @article{hendrycksmath2021, title = {Measuring Mathematical Problem Solving With the MATH Dataset}, author = {Dan Hendrycks and Collin Burns and Saurav Kadavath and Akul Arora and Steven Basart and Eric Tang and Dawn Song and Jacob Steinhardt}, journal = {NeurIPS}, year = {2021} }
发布版本
初始研究版本:SFT_MAVERICK v1.0.0。建议科学使用时引用标记版本而非未版本化的分支,以确保数据快照可恢复。
联系
Daniil Gabrielyan
Astana IT University
Astana, Kazakhstan
关于数据集或复现 MAVERICK 实验的问题,请使用本仓库的 GitHub Issues 部分。





