SFT-Dataset
收藏资源简介:
SFT-Dataset 是一个用于监督微调基础模型(如 Qwen/Qwen3-4B-Base 或 Qwen/Qwen3-8B-Base)的高质量数据集,旨在为后续的强化学习奠定良好基础。数据集包含约 50k 训练样本和 1k 测试样本,数据格式为 parquet 文件,主要字段包括 messages、data_source 和 category。数据集由多个上游数据源混合而成,包括 OpenR1-Math-220k、NuminaMath-CoT、Magpie-Llama-3.1-Pro-300K-Filtered、CodeFeedback-Filtered-Instruction、ScienceQA 以及内部科学数据切片。数据风格多样,部分数学和科学数据使用 Qwen 风格的标记,而逻辑和代码数据则通常为普通答案。适用于文本生成任务,特别是在数学、推理、代码和科学领域。
SFT-Dataset is a high-quality dataset for supervised fine-tuning of foundation models (e.g., Qwen/Qwen3-4B-Base or Qwen/Qwen3-8B-Base), aiming to lay a solid foundation for subsequent reinforcement learning. It contains approximately 50k training samples and 1k test samples, stored in Parquet format. Its main fields include messages, data_source and category. The dataset is compiled from multiple upstream data sources, including OpenR1-Math-220k, NuminaMath-CoT, Magpie-Llama-3.1-Pro-300K-Filtered, CodeFeedback-Filtered-Instruction, ScienceQA, and internal scientific data slices. It features diverse data styles: some mathematical and scientific data adopt Qwen-style tokens, while logical and code data typically use plain answers. It is suitable for text generation tasks, especially in the fields of mathematics, reasoning, code and science.
SFT-Dataset 概述
基本信息
- 数据集名称:SFT-Dataset
- 发布者/社区:Sea-Fill Community (Hongyang Li, Xiao Li)
- 发布日期/年份:2026
- 语言:英语 (en)
- 许可证:复合许可证 (Other),需遵守每个上游数据源的许可协议
- 标签:sft, supervised-fine-tuning, math, reasoning, code, science, parquet
- 任务类别:文本生成 (text-generation)
- 数据规模:10K < n < 100K
数据集目的与特点
- 核心目的:为基座模型(例如
Qwen/Qwen3-4B-Base或Qwen/Qwen3-8B-Base)的监督微调提供数据。旨在构建一个为后续强化学习奠定良好基础的策略模型。 - 数据特点:强调适量、高质量和均衡的配方。
- 应用实例:
Qwen3-4B-SFT模型(https://huggingface.co/96kevinli29/Qwen3-4B-SFT)使用此混合数据集训练,其模型卡上的基准测试结果展示了训练效果。
数据构成与来源
数据集由多个上游高质量数据集混合而成,具体来源及目标数量如下:
| 数据源标识 | 上游数据集 | 目标数量 |
|---|---|---|
openr1_math |
OpenR1-Math-220k (https://huggingface.co/datasets/open-r1/OpenR1-Math-220k) | 15k |
numina_cot |
NuminaMath-CoT (https://huggingface.co/datasets/AI-MO/NuminaMath-CoT) | 10k |
magpie_pro |
Magpie-Llama-3.1-Pro-300K-Filtered (https://huggingface.co/datasets/Magpie-Align/Magpie-Llama-3.1-Pro-300K-Filtered) | 15k |
codefeedback |
CodeFeedback-Filtered-Instruction (https://huggingface.co/datasets/m-a-p/CodeFeedback-Filtered-Instruction) | 5k |
scienceqa |
ScienceQA (https://huggingface.co/datasets/TheMrguiller/ScienceQA) | ~3.4k |
science_sft |
内部 GPQA 对齐的科学数据切片(非独立的 Hub 数据集) | ~1.5k |
数据格式与结构
- 数据文件格式:Parquet
- 数据划分:
- 训练集:约 49k 条 (
train.parquet) - 测试集:约 1k 条 (
test.parquet)
- 训练集:约 49k 条 (
- 数据列:
messages:对话消息。data_source:数据来源标识。category:数据类别。
- 风格说明:混合了多种助手风格。许多数学/科学数据行使用 Qwen 风格的
</think> … </think>思考链格式;逻辑/代码类数据则常为普通答案格式。使用时需匹配基座模型的聊天模板和思考策略。
相关资源链接
- SFT 模型示例:https://huggingface.co/96kevinli29/Qwen3-4B-SFT
- 训练代码仓库:https://github.com/96kevinli29/base-model-sft-verl
- 建议基座模型:https://huggingface.co/Qwen/Qwen3-4B-Base
引用信息
如需使用此数据集,请引用本数据集及所依赖的每个上游数据源。 bibtex @misc{dataset-sft-math-2025, title = {{SFT-Dataset}: Mixed High-Difficulty Corpus for Reasoning SFT}, author = {Hongyang Li and Xiao Li and {Sea-Fill Community}}, year = {2026}, publisher = {Hugging Face}, howpublished = {url{https://huggingface.co/datasets/SeaFill2025/SFT-Dataset}}, note = {Recipe ~50/30/10/10 with strict QC. Part of the Sea-Fill initiative to ensure LLMs are both powerful and safe.} }




