遇见数据集

simplemath-cot

收藏
Hugging Face2026-08-22 更新2026-08-23 收录
官方服务:

资源简介:

SimpleMath-100k CoT 是一个链式思维(Chain-of-Thought, CoT)扩展数据集,基于 ProCreations/SimpleMath 数据集构建。该数据集包含 100,000 个代数/算术问题,每个问题均附带一段简短、编号的推理步骤(Step 1: … Step 2: …),用于引导语言模型从问题陈述逐步推导至正确答案。数据集的行数不超过 100,000 行,生成失败或输出无法解析的行会被自动丢弃。数据格式为 JSONL,每行是一个 JSON 对象,包含一个 'text' 字段,该字段由指令(Instruction)和响应(Response)组成,其中响应部分包含编号的推理步骤和最终答案。推理步骤由 Qwen3.8-27B 模型生成,并经过后处理以去除格式噪声、强制顺序编号,并将输出限制在 1,000 字符以内。数据集的语言为英语,采用 MIT 许可证。该数据集适用于数学文字题解答、链式思维推理训练、指令微调等任务。

SimpleMath-100k CoT is a Chain-of-Thought (CoT) extended dataset built upon the ProCreations/SimpleMath dataset. It contains 100,000 algebraic/arithmetic problems, each accompanied by a short, numbered reasoning step (Step 1: … Step 2: …) to guide the language model from problem statement to correct answer step by step. The data format is JSONL, with each line being a JSON object containing a text field composed of an Instruction and a Response, where the response includes numbered reasoning steps and the final answer. The reasoning steps are generated by the Qwen3.8-27B model and post-processed to remove formatting noise, enforce sequential numbering, and limit the output to 1,000 characters. The dataset is in English, licensed under MIT, and is suitable for tasks such as math word problem solving, chain-of-thought reasoning training, and instruction fine-tuning.

创建时间:
2026-08-22
原始信息汇总

🧮 SimpleMath-100k CoT 数据集概述

基本信息

属性 内容
数据集名称 SimpleMath-100k CoT
任务类型 数学应用题求解(CoT 增强)
规模 最多 100,000 行(生成失败或无法解析的行会被静默丢弃)
语言 英语
许可证 MIT
来源数据集 ProCreations/SimpleMath
生成模型 Qwen3.8-27B(通过 Ollama)

数据集描述

该数据集是 ProCreations/SimpleMath 的思维链(Chain-of-Thought, CoT)扩展版本。数据集中每个代数/算术问题都配有一组简短的、带编号的推理步骤(如 Step 1: ... Step 2: ...),帮助语言模型从问题描述逐步推理到已知正确答案。

推理轨迹由 Qwen3.8-27B 模型生成,并经过后处理以去除格式噪声、强制步骤编号顺序,并将输出长度限制在 1,000 字符以内,以便适配短上下文训练场景。

数据格式

数据文件为 JSONL 格式,每个样本是一个 JSON 对象,示例结构如下:

jsonl { "text": "Instruction: Solve 3x + 7 = 22.

Response: <think>Step 1: Subtract 7 from both sides: 3x = 15. Step 2: Divide both sides by 3: x = 5. </think>5" }

后处理规则

问题类型 处理方式
杂散字符(*"×÷ 替换或移除(×x÷/
非顺序编号(如数学中混入杂散数字) 仅接受延续 1 → 2 → 3 序列的标记,乱序数字被忽略
输出中未找到顺序编号步骤 该行从最终文件丢弃
超过 1,000 字符 从结尾丢弃整个步骤(不会在句子中间截断)
完全无法解析或空输出 该行从最终文件丢弃

许可证说明

  • 商业用途:✅ 允许
  • 上游问题与答案:MIT © ProCreations
  • 生成的推理轨迹:MIT © AlexFromApex
  • 生成模型权重:受 Qwen3.8-27B 许可证约束(Apache 2.0)

引用信息

使用该数据集时,建议同时引用源数据集和本 CoT 扩展版本,具体引用格式参见数据集详情页。

搜集汇总
数据集介绍
simplemath-cot 数据集图片
构建方式
该数据集是在ProCreations/SimpleMath基础之上,利用Qwen3.8-27B模型通过Ollama框架生成的思维链(CoT)扩展版本。原始数据集中包含10万个代数与算术问题,每个问题均配有一个按步骤编号的推理轨迹,从问题陈述逐步推导至正确答案。生成过程在Jupyter笔记本中完成,并经过精心设计的后处理流程(clean_thinking)以去除格式噪声、保证步骤编号的连续性,并将输出长度限制在1000字符以内。对于生成失败、输出不可解析或缺少顺序编号步骤的条目,则予以删除,从而确保数据集的高质量与一致性。
使用方法
该数据集适用于监督微调(SFT)和指令跟随任务的训练,尤其适合提升语言模型在数学推理方面的能力。使用时,可将JSONL文件中的每条记录视为一个独立的训练样本,其中‘text’字段整合了指令与响应,响应部分包含显式的思维链推理和最终答案。研究者可根据实际需求调整后处理参数,如最大长度截断,以适配不同的上下文窗口。模型训练完成后,可期望其在类似数学问题求解任务上展现出更强的分步推理能力。该数据集亦可用于评估模型在零样本或少样本条件下的推理表现。
背景与挑战
背景概述
随着大语言模型在数学推理领域取得的显著进展,如何有效诱导模型展现出可解释、可验证的推理路径成为研究焦点。Chain-of-Thought(CoT)技术应运而生,通过显式生成中间步骤显著提升模型在复杂算术与代数问题上的表现。由AlexFromApex于2025年创建的simplemath-cot数据集,作为ProCreations/SimpleMath的CoT扩展版本,汇集了10万道代数与算术应用题,并依托Qwen3.8-27B模型生成结构化推理轨迹。每道题均附带编号步骤,从问题阐述至最终答案,形成完整的推理链条。该数据集旨在为短上下文训练场景提供高质量的指令遵循样本,填补了现有数学CoT数据集在规模与精细度上的空缺,对推动数学推理教学、模型微调及评估具有重要参考价值。
当前挑战
该数据集构建过程中面临多重技术难题。领域层面,数学应用题求解的固有挑战在于确保推理步骤的连贯性与正确性,CoT生成需避免逻辑断层或计算误差。构建层面,基于模型生成CoT轨迹需应对输出格式的噪声,如非预期字符、非顺序编号等,需设计精细的后处理管道进行清洗与验证。此外,生成过程的稳定性是另一难点,模型在多次重试后仍可能产生不可解析的输出,需采取静默丢弃策略,同时需控制轨迹长度在限定字符内,并在截断时保持步骤完整性,确保训练数据的质量与一致性。这些处理机制共同保障了数据集作为微调资源的可靠性。
常用场景
经典使用场景
SimpleMath-100k CoT数据集作为数学推理领域的核心资源,其经典使用场景聚焦于大语言模型的链式思维(Chain-of-Thought)微调。该数据集通过将10万个代数与算术问题配以逐步编号的推理轨迹,为研究者提供了一种结构化的监督信号,用于训练模型在解答数学文字题时显式生成中间步骤。其优越性在于,模型不仅学习最终答案,更深层次地掌握从问题分解到逐步推导的认知路径,从而有效提升复杂数学问题的求解能力与解释性。这种高质量的CoT标注模式,使得该数据集成为在教育场景中构建具备可解释性数学推理智能体的基石。
解决学术问题
该数据集切入学术研究中的关键痛点——如何从数据层面增强大语言模型的数学推理与泛化能力。传统数学数据集多仅提供问题与答案对,缺乏对推理过程的显式监督,致使模型易陷入捷径学习(shortcut learning)或产生不合理推断。SimpleMath-100k CoT通过系统化的后处理策略,清洗生成噪声、强制步骤序号连贯性并约束输出长度,构建出干净且紧凑的推理轨迹集,解决了SFT阶段数据质量与一致性不足的难题。其附带的生成失败重试机制与行丢弃规则,又保障了数据集的可靠性,为复现数学推理涌现现象及探究CoT质量对性能边际影响提供了标准化实验基准,推动了可解释AI在符号推理领域的实证进展。
实际应用
在实际应用中,该数据集直接赋能教育与智能辅助学习工具的研发。基于此数据微调的模型,可作为虚拟数学导师,为学生提供分步解题指导,通过自然语言交互中呈现清晰推理链条,帮助学习者定位逻辑谬误并巩固代数运算法则。此外,该资源也可用于构建家庭作业自动批改系统,不仅判定结果正误,更能评估解题路径的合理性。结合其指令遵循特性,这一数据还支持定制化学习助手的快速部署,在自适应学习平台中实现问题生成、错误原因诊断及针对性练习推荐,其开放的MIT许可亦便利了商业化产品在K-12数学教育、在线辅导等场景的低门槛落地。
数据集最近研究
最新研究方向
在数学推理与大型语言模型交叉领域,SimpleMath-100k CoT数据集的问世,为链式思考(Chain-of-Thought)训练范式提供了规模化的基础资源。该数据集通过生成式模型对10万道代数与算术问题的推理过程进行系统性标注,不仅强化了模型在数学问题求解中的步骤化叙述能力,还探索了集成化、去噪化的数据处理流程,以确保推理路径的完整性与规范性。此举响应了当前大模型在可解释性、逻辑连贯性及教育应用等前沿方向的需求,为提升模型在标准化数学任务上的泛化表现、促进推理能力的可迁移性奠定了数据基石,其影响覆盖模型微调、指令遵循及认知诊断等多个热点领域,具有深远的学术与实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务