遇见数据集

open-math-dataset

收藏
Hugging Face2026-08-17 更新2026-08-18 收录
官方服务:

资源简介:

Open Math Dataset 是一个开放的数学语料库,旨在为数学人工智能、推理、教育和研究提供支持。该数据集从斯里兰卡发起,包含结构化的数学问题和解决方案,覆盖算术、代数、几何、三角学、微积分、统计学、概率论、数论、线性代数、离散数学、数学推理、应用题、逐步求解、数学解释、错误纠正、多种解法以及数学证明等多个领域。当前支持英语和僧伽罗语两种语言,数据字段包括唯一标识符、问题陈述、逐步求解过程、最终答案、语言代码、数学主题、难度评分、教育水平、可选课程标识、可选国家代码以及来源类型。数据质量优先保证数学正确性、清晰的解释、一致的格式、去重、准确的元数据以及多样化的难度和领域。预期用途包括数学AI、大语言模型训练与微调、数学推理研究、教育AI、AI辅导系统、题目生成、数学评估、多语言AI、课程感知AI以及数学搜索系统。

The Open Math Dataset is an open math corpus designed to support AI for mathematics, reasoning, education, and research. Originating from Sri Lanka, it contains structured math problems and solutions covering arithmetic, algebra, geometry, trigonometry, calculus, statistics, probability, number theory, linear algebra, discrete mathematics, mathematical reasoning, word problems, step-by-step solutions, mathematical explanations, error correction, multiple solution methods, and mathematical proofs. Currently supports English and Sinhala languages. Data fields include unique identifier, problem statement, step-by-step solution, final answer, language code, math topic, difficulty score, education level, optional curriculum, optional country, and source type. Data quality ensures mathematical correctness, clear explanations, consistent formatting, deduplication, accurate metadata, and diverse difficulty and domains. Intended uses include math AI, LLM training/fine-tuning, math reasoning research, educational AI, AI tutoring, question generation, math evaluation, multilingual AI, curriculum-aware AI, and math search systems.

创建时间:
2026-08-17
原始信息汇总

数据集概述

Open Math Dataset 是一个开放数学语料库,旨在服务于数学AI、推理、教育及研究领域,项目由斯里兰卡的 Tharustack 开发维护。

语言与规模

  • 当前支持语言:英语(en)、僧伽罗语(si)
  • 数据规模:1K < n < 10K
  • 许可证:cc-by-4.0
  • 任务类型:文本生成、问答

内容与覆盖范围

数据集包含结构化数学问题与解答,覆盖多个数学领域:

  • 算术、代数、几何、三角学、微积分
  • 统计、概率、数论、线性代数、离散数学
  • 数学推理、文字题、分步解答、多解法、数学证明、纠错

支持通用数学课程特定数学,并特别关注斯里兰卡学校数学(O/L、A/L)及僧伽罗语数学术语,未来计划扩展至更多语言和国家。

数据字段结构

字段 说明
id 唯一标识符
problem 数学问题陈述
solution 分步解答
answer 最终答案
language 语言代码(en、si等)
topic 数学主题(如 algebra.linear_equations)
difficulty 难度分数(0.0–1.0)
education_level 教育水平
curriculum 课程标识(可选)
country 国家代码(可选)
source_type 数据来源类型

数据质量与来源

项目高度优先保证数学正确性,注重正确答案、合理推理、清晰解释、格式一致性、去重、元数据准确、难度与领域多样性以及来源透明。

可能的数据来源类型包括:人工验证、官方来源、公共领域、合成验证、社区贡献、翻译验证。仅收录可合法再分发的内容。

数据处理流程

采集 → 清洗 → 标准化 → 生成 → 数学验证 → 去重 → 质量过滤 → 元数据 → 发布

预期用途

适用于数学AI、LLM训练与微调、数学推理研究、教育AI、AI辅导系统、题目生成、数学评估、多语言AI、课程感知AI及数学检索系统。

版本规划

版本 描述
v0.1 初始发布
v0.2 扩展数学领域
v0.5 多语言扩展
v1.0 稳定主版本

项目状态与目标

项目处于积极开发阶段,优先构建高质量数学数据基础,长期目标是从基础算术到高等数学、从简单问答到结构化推理、从僧伽罗语和英语扩展到更多语言,打造全球通用的开放数学数据集。

维护者: Tharustack(斯里兰卡)

搜集汇总
数据集介绍
open-math-dataset 数据集图片
构建方式
在数学人工智能与教育研究日益依赖高质量语料的背景下,该数据集采用多阶段流水线构建,涵盖从数据采集、清洗、规范化,到生成、数学验证、去重、质量过滤及元数据标注的完整流程。内容整合了人类验证、官方来源、公共领域、合成验证、社区贡献及翻译验证等多种来源类型,每条记录均保留来源与许可信息,并仅纳入可合法再分发的内容。自动生成的数学内容被视作候选数据,须经严格验证后方可进入高质量训练集,以确保数学正确性与推理严谨性。
特点
该数据集以结构化记录组织数学问题与解答,字段包括问题、分步解答、最终答案、语言、主题、难度、教育阶段及课程标识等,覆盖算术、代数、几何、三角、微积分、统计、概率、数论、线性代数、离散数学及数学推理与证明等领域。当前支持英语与僧伽罗语,尤其关注高质量僧伽罗语数学数据的稀缺性,同时面向国际扩展。数据集强调数学正确性、解释清晰、格式一致、去重与元数据准确,并提供从基础算术到高等数学的多难度、多领域覆盖。
使用方法
该数据集适用于数学AI、大语言模型训练与微调、数学推理研究、教育AI、智能辅导系统、问题生成、数学评估、多语言AI、课程感知AI及数学搜索系统等场景。使用者可按需加载结构化记录,利用问题与分步解答进行监督学习或推理评估,借助主题、难度与教育阶段标签筛选特定内容,并结合语言与课程标识开展多语言或课程对齐的实验。公开版本采用版本化发布,建议在使用时保留来源与许可信息,以支持可追溯的学术与教育应用。
背景与挑战
背景概述
在数学人工智能与教育技术迅猛发展的时代背景下,开放数学数据集(Open Math Dataset)由斯里兰卡开发者Tharustack发起并维护,旨在构建一个面向全球的开放式数学语料库。该数据集聚焦于数学推理、教育辅助与多语言支持,核心研究问题在于弥补僧伽罗语等低资源语言在数学训练数据上的严重匮乏,同时提供涵盖算术、代数、几何、微积分及数学证明等广泛领域的结构化问题与逐步解答。其影响力体现在为大型语言模型的数学推理训练、智能辅导系统及多语言教育AI提供了宝贵的开源资源,尤其推动了南亚地区数学教育资源的数字化与国际化进程。
当前挑战
该数据集所应对的领域问题在于,现有数学数据集多集中于英语及高资源语言,且缺乏对逐步推理过程与多难度层级的系统覆盖,难以满足低资源语言环境下数学AI训练与评估的需求。构建过程中面临多重挑战:自动生成内容需经过严格的数学正确性验证,以避免错误答案或推理污染训练数据;多语言数学术语的标准化与对齐困难,尤其僧伽罗语数学表达资源稀缺;数据来源多样,涉及人工验证、官方来源与合成数据,确保合法可再分发及溯源透明性复杂;此外,去重、质量过滤与元数据标注需在保证数学多样性的同时维持高一致性,对数据管线的设计与维护提出了较高要求。
常用场景
经典使用场景
数学推理与教育人工智能的迅速发展,对结构化、分步骤的数学问题求解数据提出了迫切需求。Open Math Dataset应运而生,其最经典的使用场景在于为大型语言模型提供涵盖算术、代数、几何、微积分等多元数学领域的逐步求解训练样本。该数据集以问题、解答步骤与最终答案的三元组形式组织,辅以难度系数与教育层级等元数据,使模型得以在监督微调或思维链推理任务中习得严谨的数学推导能力。
实际应用
在智能辅导系统与自动答疑平台中,该数据集可支撑起从题目生成到分步讲解的完整教学闭环。开发者利用其丰富的代数、几何与文字应用题资源,构建能够适应不同学段与课程体系的个性化学习助手。同时,该数据集亦可用于数学搜索引擎的语义理解与检索增强生成,帮助学生快速定位相似题型与解题方法,从而提升自主学习的效率与深度。
衍生相关工作
依托Open Math Dataset的开放架构与多语言扩展规划,衍生出一系列围绕数学推理评测与低资源语言适配的研究工作。部分研究者以其为基础构建思维链微调基准,探索显式推理步骤对模型泛化能力的影响;另有工作聚焦僧伽罗语数学术语的标准化与翻译验证,推动了南亚语言教育资源的数字化进程。这些衍生实践不断丰富着开放数学语料的生态体系。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务