open-math-dataset
收藏资源简介:
Open Math Dataset 是一个开放的数学语料库,旨在为数学人工智能、推理、教育和研究提供支持。该数据集从斯里兰卡发起,包含结构化的数学问题和解决方案,覆盖算术、代数、几何、三角学、微积分、统计学、概率论、数论、线性代数、离散数学、数学推理、应用题、逐步求解、数学解释、错误纠正、多种解法以及数学证明等多个领域。当前支持英语和僧伽罗语两种语言,数据字段包括唯一标识符、问题陈述、逐步求解过程、最终答案、语言代码、数学主题、难度评分、教育水平、可选课程标识、可选国家代码以及来源类型。数据质量优先保证数学正确性、清晰的解释、一致的格式、去重、准确的元数据以及多样化的难度和领域。预期用途包括数学AI、大语言模型训练与微调、数学推理研究、教育AI、AI辅导系统、题目生成、数学评估、多语言AI、课程感知AI以及数学搜索系统。
The Open Math Dataset is an open math corpus designed to support AI for mathematics, reasoning, education, and research. Originating from Sri Lanka, it contains structured math problems and solutions covering arithmetic, algebra, geometry, trigonometry, calculus, statistics, probability, number theory, linear algebra, discrete mathematics, mathematical reasoning, word problems, step-by-step solutions, mathematical explanations, error correction, multiple solution methods, and mathematical proofs. Currently supports English and Sinhala languages. Data fields include unique identifier, problem statement, step-by-step solution, final answer, language code, math topic, difficulty score, education level, optional curriculum, optional country, and source type. Data quality ensures mathematical correctness, clear explanations, consistent formatting, deduplication, accurate metadata, and diverse difficulty and domains. Intended uses include math AI, LLM training/fine-tuning, math reasoning research, educational AI, AI tutoring, question generation, math evaluation, multilingual AI, curriculum-aware AI, and math search systems.
数据集概述
Open Math Dataset 是一个开放数学语料库,旨在服务于数学AI、推理、教育及研究领域,项目由斯里兰卡的 Tharustack 开发维护。
语言与规模
- 当前支持语言:英语(en)、僧伽罗语(si)
- 数据规模:1K < n < 10K
- 许可证:cc-by-4.0
- 任务类型:文本生成、问答
内容与覆盖范围
数据集包含结构化数学问题与解答,覆盖多个数学领域:
- 算术、代数、几何、三角学、微积分
- 统计、概率、数论、线性代数、离散数学
- 数学推理、文字题、分步解答、多解法、数学证明、纠错
支持通用数学和课程特定数学,并特别关注斯里兰卡学校数学(O/L、A/L)及僧伽罗语数学术语,未来计划扩展至更多语言和国家。
数据字段结构
| 字段 | 说明 |
|---|---|
| id | 唯一标识符 |
| problem | 数学问题陈述 |
| solution | 分步解答 |
| answer | 最终答案 |
| language | 语言代码(en、si等) |
| topic | 数学主题(如 algebra.linear_equations) |
| difficulty | 难度分数(0.0–1.0) |
| education_level | 教育水平 |
| curriculum | 课程标识(可选) |
| country | 国家代码(可选) |
| source_type | 数据来源类型 |
数据质量与来源
项目高度优先保证数学正确性,注重正确答案、合理推理、清晰解释、格式一致性、去重、元数据准确、难度与领域多样性以及来源透明。
可能的数据来源类型包括:人工验证、官方来源、公共领域、合成验证、社区贡献、翻译验证。仅收录可合法再分发的内容。
数据处理流程
采集 → 清洗 → 标准化 → 生成 → 数学验证 → 去重 → 质量过滤 → 元数据 → 发布
预期用途
适用于数学AI、LLM训练与微调、数学推理研究、教育AI、AI辅导系统、题目生成、数学评估、多语言AI、课程感知AI及数学检索系统。
版本规划
| 版本 | 描述 |
|---|---|
| v0.1 | 初始发布 |
| v0.2 | 扩展数学领域 |
| v0.5 | 多语言扩展 |
| v1.0 | 稳定主版本 |
项目状态与目标
项目处于积极开发阶段,优先构建高质量数学数据基础,长期目标是从基础算术到高等数学、从简单问答到结构化推理、从僧伽罗语和英语扩展到更多语言,打造全球通用的开放数学数据集。
维护者: Tharustack(斯里兰卡)




