Lumina-Math-Foundations-200M
收藏资源简介:
Lumina-Math-Foundations-200M是一个工业级的多语言基础数学推理数据集,专为大规模基础模型预训练、继续预训练和推理对齐而设计。该数据集当前包含印尼语数据,未来版本将扩展至英语、韩语、中文和日语。数据集规模在1亿到10亿样本之间,涵盖数学、推理、多语言、思维链(CoT)和合成数据等标签。数据以Apache Parquet格式存储于data/目录下,适用于文本生成和问答任务。
Lumina-Math-Foundations-200M is an industrial-grade multilingual foundational mathematical reasoning dataset, designed for large-scale foundation model pre-training, continued pre-training, and reasoning alignment. The dataset currently contains Indonesian data, with future versions to be expanded to English, Korean, Chinese, and Japanese. It ranges from 100 million to 1 billion samples, covering tags such as mathematics, reasoning, multilingual, chain-of-thought (CoT), and synthetic data. The data is stored in Apache Parquet format in the data/ directory and is suitable for text generation and question-answering tasks.
数据集概述
Lumina-Math-Foundations-200M 是一个面向工业界的大规模多语言基础数学推理数据集,专为高容量基础模型的预训练、持续预训练以及推理对齐而设计。
基本信息
- 语言:印度尼西亚语(
id) - 许可证:Apache-2.0
- 任务类型:文本生成、问答
- 数据集规模:100M < n < 1B
- 标签:数学、推理、多语言、思维链(CoT)、合成数据、lumina、foundations、grandmaster-math
数据格式
所有记录以 Apache Parquet 文件格式存储在 data/ 目录下。
版本计划
当前版本支持印度尼西亚语,v2 版本将新增以下语言支持:
- 英语(
en) - 韩语(
ko) - 中文(
zh) - 日语(
ja)
这些语言支持均为 即将推出 状态。




