遇见数据集

axis-training-sets

收藏
Hugging Face2026-07-27 更新2026-07-28 收录
官方服务:

资源简介:

Axis Training Sets 数据集是一个专为Google Gemma-3大语言模型设计的微调与对齐实验训练集。它包含两个核心文件:1. `targeted_sft_v2.jsonl`:这是一个Targeted SFT v2训练集,采用JSON Lines格式,由265道经过验证的教师解答和265道回放题目组合而成,总计530行数据,对应265个训练目标。该文件通过脚本从已评分的教师解题数据中,依据良率与能力墙标准筛选生成。2. `targeted_sft_v2_manifest.json`:这是训练集构建过程的详细元数据清单文件,记录了数据过滤条件、难度分布、时间戳以及验证信息等,在训练集生成时自动创建。该数据集适用于大型语言模型的监督微调(SFT)与对齐任务,旨在提升模型在特定领域或任务上的性能与安全性。

The Axis Training Sets dataset is a training collection designed for fine-tuning and alignment experiments with the Google Gemma-3 large language model. It includes two core files: 1. `targeted_sft_v2.jsonl`: This is a Targeted SFT v2 training set in JSON Lines format, consisting of 265 verified teacher correct solutions and 265 replay pool items, totaling 530 rows of data corresponding to 265 training objectives. The file is generated via a script that filters from scored teacher solution data based on yield and capability wall criteria. 2. `targeted_sft_v2_manifest.json`: This is a detailed metadata manifest file documenting the dataset construction process, including data filtering conditions, difficulty distribution, timestamps, and validation information, automatically created during training set generation. The dataset is tailored for supervised fine-tuning (SFT) and alignment tasks of large language models, aiming to enhance model performance and safety in specific domains or tasks.

创建时间:
2026-07-27
原始信息汇总

数据集概述:Axis Training Sets

该数据集收录了用于 Google Gemma-3 模型微调与对齐实验中的训练集及相关 Manifest 文件。

文件列表与说明

  1. targeted_sft_v2.jsonl

    • 内容:Targeted SFT v2 训练集,包含 265 题老师验证的解答和 265 题 replay 题目,共 530 行数据,对应 265 个标的。
    • 生成方式:由脚本 程式與腳本/build_targeted_sft_v2.py 基于 teacher_wall_pro_scored.jsonl 中的筛选条件(良率与 0/8 能力墙)组合而成。
    • 对应字段AI_AGENT_WORKFLOW.md §1 账本第 47 列(标记为“targeted v2(265 验证解 + 265 replay)”)。
  2. targeted_sft_v2_manifest.json

    • 内容:Targeted SFT v2 训练集的详细 metadata 与 Manifest,包含过滤条件、难度分布、时间戳及验证信息。
    • 生成方式:由脚本 程式與腳本/build_targeted_sft_v2.py 在构建训练集时自动同步生成并写入。
    • 对应字段AI_AGENT_WORKFLOW.md §1 账本第 47 列。
搜集汇总
数据集介绍
axis-training-sets 数据集图片
构建方式
该数据集基于Google Gemma-3微调与对齐实验构建,核心为Targeted SFT v2训练集及其相关manifest文件。训练集由专用脚本`build_targeted_sft_v2.py`从`teacher_wall_pro_scored.jsonl`中筛选生成,依据教师验证解的良率与0/8能力墙指标,选取265道教师验证解答与265道replay题目,最终组合成530列、265个标的的JSONL格式文件。同时,脚本自动同步生成manifest文件,记录过滤条件、难度分布、时间戳与验证信息等详细元数据。
使用方法
用户可直接使用`targeted_sft_v2.jsonl`文件进行模型微调或对齐训练,文件为标准JSONL格式,每行包含完整的训练样本,适配Gemma-3的训练流程。配合`targeted_sft_v2_manifest.json`文件,可解析每个样本的来源、难度与验证状态,便于深入分析或定制化训练策略。建议结合实验工作流文档(如`AI_AGENT_WORKFLOW.md`)中对应的账本字段,以追踪数据版本与训练效果间的关联。
背景与挑战
背景概述
Axis Training Sets 数据集诞生于大型语言模型微调与对齐实验的前沿探索中,由开发团队于近期构建,旨在服务于 Google Gemma-3 模型的精细化训练。其核心研究问题聚焦于如何通过筛选高质量、具有针对性的训练样本,提升模型在特定任务上的表现与可靠性。该数据集包含 530 条精心设计的训练条目,覆盖教师验证解与回放样本,并通过详细的 manifest 文件记录metadata,为模型对齐研究提供了结构化、可复现的数据基础。此举对于推动大模型在受限资源下的高效微调策略具有重要意义,尤其在能力墙突破与样本效率优化方面树立了实践标杆。
当前挑战
当前数据集面临的核心挑战包括:其一,领域内普遍存在的样本效率问题,即如何从海量候选数据中精准识别并组合有限的高价值训练样本,以最大化模型微调收益;其二,构建过程中的技术挑战,如如何合理设定过沪条件以平衡样本难度与多样性,以及如何确保教师验证解的权威性与回放样本的相关性。此外,manifest 文件需要详尽记录过滤逻辑与分布特征,以支持后续实验的透明复现与迭代优化,这对数据管道的完整性与可解释性提出严苛要求。
常用场景
经典使用场景
Axis Training Sets 作为 Google Gemma-3 模型微调与对齐实验的核心训练数据,其经典使用场景聚焦于目标导向的监督微调(Targeted SFT)。该数据集通过精心筛选的 265 道教师验证解答与等量的 replay 题目,构建了 530 条高质量训练样本,专门用于提升模型在特定能力维度上的表现。研究者可利用该数据集对 Gemma-3 进行精准的参数调整,尤其针对数学推理或复杂问题求解等需要严格验证的领域,以增强模型输出的准确性与可靠性。
解决学术问题
该数据集有效回应了大型语言模型微调中数据质量与效率的学术挑战。通过引入“良率”与“0/8 能力墙”筛选机制,它解决了如何从海量候选数据中识别并利用高价值样本的关键问题。这种基于教师验证与性能阈值的过滤策略,为对齐实验提供了方法论参考,显著降低了训练过程中的噪声干扰。其意义在于,为模型在狭窄领域内的能力突破开辟了数据驱动的优化路径,推动了可解释性与可控性的研究边界。
实际应用
在实际应用中,Axis Training Sets 主要服务于需要高精度推理能力的场景,例如教育评测系统中的自动解题模块、科研辅助工具中的数学证明验证,以及客服机器人的复杂逻辑应答。通过定向微调,企业可将 Gemma-3 配置为专精于结构化问题解析的智能体,从而在金融风控、法律文书分析等行业任务中实现更稳定的性能。该数据集的存在,使得从通用模型到垂直领域专家的转化过程更加透明与高效。
数据集最近研究
最新研究方向
该数据集聚焦于大型语言模型(LLM)的定向微调(Targeted SFT)与对齐优化,尤其针对Gemma-3等前沿模型的推理能力增强。当前热门方向强调通过“困难习题验证解”(teacher correct solutions)与“重放池”(replay pool)的混合策略,突破模型在特定能力墙(如0/8能力障碍)上的瓶颈。这种基于质量筛选与难度分布控制的训练集构建方法,直接回应了业界对提升模型鲁棒性与泛化能力的迫切需求,为可解释性对齐实验提供了可复现的基准数据,对推动AI安全与可控生成研究具有重要实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务