SFT-Dataset-Mini
收藏资源简介:
该数据集包含4000个训练样本,每个样本由四个字段组成:problem(问题描述)、reasoning(推理过程)、answer(答案)和difficulty(难度等级)。数据集的格式表明它适用于训练和评估模型在数学或逻辑推理任务上的表现,例如基于问题生成推理步骤并得出正确答案。
The dataset contains 4,000 training samples, each consisting of four fields: problem (problem description), reasoning (reasoning process), answer (answer), and difficulty (difficulty level). The format indicates that it is suitable for training and evaluating models on mathematical or logical reasoning tasks, such as generating reasoning steps based on the problem and arriving at the correct answer.
数据集概述
数据集名称:SFT-Dataset-Mini
数据集地址:https://huggingface.co/datasets/CrowdMind/SFT-Dataset-Mini
数据集简介
该数据集是一个用于监督微调(Supervised Fine-Tuning, SFT)的小型数据集,名为“SFT-Dataset-Mini”,由CrowdMind团队提供。它旨在为模型微调任务提供结构化的训练样本,包含问题、推理过程和答案等核心字段。
数据字段
数据集包含以下四个字段:
| 字段名 | 数据类型 | 描述 |
|---|---|---|
problem |
string | 问题描述 |
reasoning |
string | 推理过程 |
answer |
string | 最终答案 |
difficulty |
string | 难度等级 |
数据集划分
- 划分名称:
train - 示例数量:4000 条
- 数据大小:约 80,473,655 字节(约 76.7 MB)
- 下载大小:约 36,173,422 字节(约 34.5 MB)
数据配置
- 配置名称:
default - 数据文件:位于
data/train-*路径下,使用通配符匹配多个文件。
用途建议
该数据集适用于需要“问题-推理-答案”三元组的监督微调场景,尤其在训练模型进行推理任务时具有较高的实用价值。difficulty 字段可用于难度分层的训练策略,如课程学习或难度筛选。




