遇见数据集

schema-abstract-math

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

schema-abstract-math 是一个基于抽象数学过程簇的推理数据集,旨在提供手写和自动生成的抽象问题及其对应的具体问题(来自 Hendrycks MATH 数据集),用于监督微调(SFT)和评估。数据集采用两种配置:主配置 clusters 包含 344 个过程簇,每个簇包含一个或多个抽象问题(带有预构建的 SFT 提示)以及与之配对的评估具体问题;另一配置 unmatched 包含 4265 个未匹配到任何抽象的具体问题(可选择性使用)。每个簇覆盖代数、预代数、几何等 7 个数学领域,并标注了核心方法(如二次方程、根提取)和来源类型(手写或自动)。抽象问题分为规范型和变体型,均配有完整的 SFT 提示和解答。评估对则链接到具体问题及其解答。数据集质量经过审计,手写簇全部通过,自动簇因设计缺失规范抽象而仅部分通过。该数据集适用于需要抽象推理、数学问题解决和 SFT 训练的场景。

schema-abstract-math is a reasoning dataset based on clusters of abstract mathematical processes, designed to provide handwritten and automatically generated abstract problems along with their corresponding concrete problems (from the Hendrycks MATH dataset) for supervised fine-tuning (SFT) and evaluation. The dataset has two configurations: the main configuration clusters contains 344 process clusters, each containing one or more abstract problems (with pre-built SFT prompts) and paired evaluation concrete problems; the other configuration unmatched contains 4265 concrete problems not matched to any abstraction (optional use). Each cluster covers 7 mathematical domains including algebra, pre-algebra, geometry, etc., and is annotated with core methods (e.g., quadratic equations, root extraction) and source types (handwritten or automatic). Abstract problems are divided into canonical and variant types, each with complete SFT prompts and solutions. Evaluation pairs link to concrete problems and their solutions. Dataset quality has been audited, with handwritten clusters fully passing and automatic clusters only partially passing due to missing canonical abstraction in design. The dataset is suitable for scenarios requiring abstract reasoning, mathematical problem solving, and SFT training.

创建时间:
2026-08-10
原始信息汇总

数据集概述:schema-abstract-math(clusters视图)

基本信息

  • 许可证:Apache-2.0
  • 任务类型:其他(抽象数学推理)
  • 数据规模:10K < n < 100K
  • 数据集地址:https://huggingface.co/datasets/swapnil7777/schema-abstract-math

数据集结构

  • 配置:仅一个主配置 clusters,包含1,181行,每行代表一个程序集群,自包含所有抽象问题和评估对。
  • 字段结构:每行包含 cluster_iddomaincore_methodkind_subtypen_abstractsn_eval_pairsabstracts(含SFT提示)和 eval_pairs(具体问题与抽象配对)。

覆盖范围

  • 1,181个抽象集群:228个人工编写 + 116个自动提升 + 837个智能体编写
  • 2,920个抽象示例:1,015个人工 + 204个自动 + 1,701个智能体
  • 4,104个评估对:具体问题与抽象链接
  • 0个未匹配具体问题:所有集群的具体问题均可通过抽象访问
  • 7个领域:预处理代数(341)、计数与概率(237)、中级代数(230)、代数(164)、数论(116)、几何(61)、微积分预备(32)

质量与来源

  • 人工编写:所有228个集群通过10/10审计(无禁用词、无单位、数学可解析、无重复文本等)
  • 自动提升:按设计无规范抽象,其他维度全部通过
  • 智能体编写:所有837个集群至少2个抽象,遵循程序步骤和关键恒等式
  • 基础来源:基于 swapnil7777/abstract-math-procedures,包含Hendrycks MATH的5,699行和从DeepScaler/OpenR1匹配的1,910个问题

注意事项

  • 覆盖完整:1,181/1,181集群有抽象,取代了之前仅344个的版本
  • 源数据的自动生成抽象列常出错,本数据集的抽象覆盖了这些错误
  • SFT提示模板固定为框式LaTeX格式,如需其他格式需自行重新生成
  • 部分集群的 procedure_steps 元数据泛化,智能体编写的抽象锚定于具体解决问题的程序
搜集汇总
数据集介绍
schema-abstract-math 数据集图片
构建方式
本数据集构建于抽象数学程序库之上,通过多层策略将具体数学问题抽象化。首先,基于Hendrycks MATH数据集,利用BGE嵌入、TF-IDF及84项结构特征进行聚类,形成1181个程序簇。随后,通过三种方式生成抽象样本:人工编写、自动提取及智能体生成。人工层针对228个符合条件的簇,手动创建典范抽象及其变体;自动层为116个未达标簇自动提取抽象;智能体层则利用并行子代理为剩余837个簇生成抽象。最终,将4265个具体问题通过余弦相似度匹配至相应抽象,确保每个簇均被覆盖。
使用方法
数据集以'clusters'配置提供,每行对应一个程序簇。用户可通过datasets库加载,并遍历'abstracts'和'eval_pairs'字段获取训练与评估数据。训练时,可使用预构建的'sft_prompt'与'sft_completion'对模型进行指令微调;评估时,可对比模型输出与参考解答。此外,支持按'kind_subtype'过滤子集,并利用'domain'、'core_method'等字段进行针对性分析。该数据集适用于数学推理模型的训练、评估及抽象推理能力的研究。
背景与挑战
背景概述
schema-abstract-math数据集诞生于2024年,由Swapnil Gupta等人基于Hendrycks MATH等基准构建,旨在通过程序簇抽象促进数学推理的可泛化学习。该数据集将抽象数学问题与具体实例配对,覆盖1,181个程序簇、2,920个抽象示例及4,104个评估对,跨越七个数学领域,其层次化设计(手写、自动、智能体)强化了过程性知识建模,为数学推理研究提供了结构化资源,显著推动了抽象推理与程序化知识提取领域的进展。
当前挑战
该数据集直面数学推理中的抽象泛化挑战,通过程序簇抽象实现跨具体实例的迁移,但仍面临若干难点:部分源簇元数据陈旧或泛化,导致程序步骤不可靠;自动生成的抽象问题常含错误,需人工或智能体重写;不同来源(如DeepScaler、OpenR1)的具体问题需精细匹配,依赖余弦相似度可能引入噪声;同时,确保抽象示例的质量,如避免禁止词汇、保持解法步骤规范性,也是持续考验,尤其在智能体生成的837个簇中,需兼顾一致性与多样性。
常用场景
经典使用场景
该数据集以程序簇为基本单元,将抽象的数学推理问题与具体的评价题目相对应,为抽象数学推理研究提供了结构化的训练与评估基础。其经典使用场景在于微调大型语言模型以执行符号化数学求解,利用预构建的SFT提示与完成对,使模型学习从规范化表述到严谨解答的映射。同时,研究者可通过评估配对,对模型在具体数学问题上的泛化能力进行标准化测试,从而在受控条件下检验抽象推理的习得效果。
解决学术问题
此数据集直面数学推理研究中抽象与具体之间脱节的难题,解决了以往数据集缺乏细粒度、可复用的抽象问题表示问题。它通过手工、自动及智能体三种方式构建抽象题,并关联数千道具体题目,为探究模型是否真正掌握数学程序而非记忆题目提供了关键资源。其完整覆盖与多域设计,使得研究者能够系统性地分析不同数学子领域中抽象推理的迁移性与鲁棒性,推动了数学人工智能领域的可解释性与泛化研究。
实际应用
在实际应用中,该数据集可用于开发具备数学解题能力的教育辅导系统,通过抽象提示训练模型生成分步解答,辅助学生理解复杂数学概念。同时,其评估配对可服务于自动答题系统的质量监控,确保输出符合数学逻辑。此外,在自动化定理证明、数学问题生成等场景中,数据集的抽象变体可生成多样化习题,丰富教学内容,并支持个性化学习路径的设计,从而将AI数学能力从实验室推向真实教育场景。
数据集最近研究
最新研究方向
该数据集聚焦于数学抽象推理的前沿探索,通过融合人工撰写、自动提升与智能体生成的多层次方法,构建了涵盖1181个程序簇的完整抽象问题库。其最新研究方向侧重于利用大规模语言模型进行过程监督与抽象模式挖掘,以提升数学推理的泛化能力。数据集将Hendrycks MATH等经典问题与DeepScaler、OpenR1等新兴基准相衔接,并通过余弦相似度实现具体问题与抽象模板的自动配对,为可解释的数学智能体训练提供了结构化资源。这一工作顺应了当前AI领域对可验证推理与程序性知识抽取的迫切需求,对推动数学教育智能化及复杂问题求解的自动化具有重要参考价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务