Step-3.5-Clean-QA-Synth-Reasoning
收藏资源简介:
Step-3.5-Clean-QA-Synth-Reasoning 是一个基于 [`TESTtm7873/Step-3.5-Clean-QA`](https://huggingface.co/datasets/TESTtm7873/Step-3.5-Clean-QA) 构建的合成推理数据集。该数据集的主要目的是从 Step 数据集中提取清理过的问答示例,生成明确的中介推理,并将结果以与 [`PleIAs/SYNTH`](https://huggingface.co/datasets/PleIAs/SYNTH) 监督风格对齐的结构进行打包,包含独立的 `query`、`reasoning` 和 `answer` 字段。数据集包含两个子集:`train_mini`(519 个已验证示例,用于快速实验和完整性检查)和 `train_8k`(8,268 个经过过滤和去重的示例,用于更大规模的微调运行)。数据经过严格的过滤和去重处理,确保质量。数据集适用于监督微调、推理结构化问答数据实验、中小规模 SFT 运行以及与其他推理风格数据集的比较。
Step-3.5-Clean-QA-Synth-Reasoning 数据集概述
基本信息
- 数据集名称: Step-3.5-Clean-QA-Synth-Reasoning
- 语言: 英语 (en)、中文 (zh)
- 标签: synthlabs, synthetic, reasoning, qa, sft
- 任务类别: 文本生成 (text-generation)
- 规模类别: 1K<n<10K
- 配置文件: default
数据集描述
Step-3.5-Clean-QA-Synth-Reasoning 是一个合成的推理数据集,基于 TESTtm7873/Step-3.5-Clean-QA 构建。其目的是从 Step 数据集中获取清洗过的问答示例,生成显式的中间推理过程,并将结果打包成与 PleIAs/SYNTH 数据集所使用的监督风格对齐的结构:包含独立的 query、reasoning 和 answer 字段。这种对齐主要涉及推理格式和训练结构。请注意,本数据集并非 PleIAs 的官方发布,也不是原始 SYNTH 语料库的子集。
数据子集
- train_mini: 包含 519 个经过验证的示例,用于快速实验和完整性检查。
- train_8k: 包含 8,268 个经过过滤和去重的示例,用于更大规模的微调运行。
- 注意: Hugging Face 的分割标识符不允许使用连字符,因此预期的名称
train-mini和train-8k在发布时被改为train_mini和train_8k。
数据来源
TESTtm7873/Step-3.5-Clean-QAPleIAs/SYNTH
数据统计
- 源快照中的原始行数: 31,352
- 因
modelUsed == "System"而被移除的行数: 166 - 去重前的有效行数: 21,293
- 通过去重移除的行数: 13,025
- 最终
train_8k行数: 8,268 - 最终
train_mini行数: 519
数据列结构
query: 提示或问题。reasoning: 采用 SYNTH 风格监督布局的合成中间推理。answer: 最终答案。messages: 可选的对话形式追踪记录(如果存在)。full_seed: 源生成种子元数据(如果存在)。modelUsed: 生成过程中的模型元数据。source: 源数据的出处字段。
数据构建与处理 (train_8k)
train_8k 子集是基于本地 synth_verified_*.json 快照,按照以下规则构建的:
- 删除
modelUsed == "System"的行。 - 删除
query、answer或reasoning在修剪后为空的行。 - 根据
query进行去重。 - 当存在重复提示时,保留最新的有效版本。
预期用途
本数据集适用于:
- 带有显式推理轨迹的监督微调。
- 使用推理结构化问答数据进行实验。
- 中小规模的 SFT 运行。
- 与其他推理风格数据集的比较。
相关数据集
- 源问答数据集:
TESTtm7873/Step-3.5-Clean-QA(https://huggingface.co/datasets/TESTtm7873/Step-3.5-Clean-QA) - 参考推理结构:
PleIAs/SYNTH(https://huggingface.co/datasets/PleIAs/SYNTH)




