遇见数据集

Lumina-Math-Foundations-1B

收藏
Hugging Face2026-08-21 更新2026-08-22 收录
官方服务:

资源简介:

Lumina-Math-Foundations-1B 是一个大规模、工业级的基础数学推理数据集,使用印尼语编写,并包含 LaTeX 数学公式。该数据集基于 V18.0 自适应面向对象编程与密码学熵引擎构建,包含 10 亿个高质量合成数学推理样本。每个样本包含纯自然语言问题陈述、逐步链式思维推理、最终答案、完整的 Python 实现代码(基础问题使用动态函数代码,高阶问题使用企业级 @dataclass OOP 架构)、用于智能体工作流的函数/工具调用 JSON 载荷、外部解释器/求解器的执行结果,以及用于程序化可验证奖励强化学习(RLVR)的确定性验证标准。数据集适用于文本生成和问答任务,特别是数学推理场景,支持链式思维(CoT)模式和智能体代码解释器模式。数据采用 Apache-2.0 许可证发布。

Lumina-Math-Foundations-1B is a large-scale, industrial-grade foundational mathematical reasoning dataset, written in Indonesian (id) and containing LaTeX mathematical formulas. The dataset is built based on the V18.0 adaptive object-oriented programming and cryptographic entropy engine, containing 1 billion high-quality synthetic mathematical reasoning samples. Each sample includes a pure natural language problem statement, step-by-step chain-of-thought reasoning, final answer, complete Python implementation code (dynamic function code for basic problems, enterprise-level @dataclass OOP architecture for advanced problems), function/tool call JSON payloads for agent workflows, execution results from external interpreters/solvers, and deterministic verification criteria for programmatically verifiable reward reinforcement learning (RLVR). The dataset is suitable for text generation and question answering tasks, especially mathematical reasoning scenarios, supporting chain-of-thought (CoT) mode and agent code interpreter mode. The data is released under the Apache-2.0 license.

创建时间:
2026-08-17
原始信息汇总

数据集概述

Lumina-Math-Foundations-1B 是一个工业级、大规模的基础数学推理数据集,使用印度尼西亚语(id)编写,并包含 LaTeX 数学公式,规模达 10 亿条合成的高保真数学推理样本。该数据集基于 V18.0 自适应 OOP 与密码学熵引擎构建,旨在为数学推理、思维链(CoT)和基于可验证奖励的强化学习(RLVR)提供支持。

核心特性

  • 语言: 印度尼西亚语(id),数学公式采用 LaTeX 格式。
  • 规模: 10 亿(1B)条合成数学推理实例。
  • 架构范式: 纯自然语言思维链(CoT)+ 企业级面向对象编程(OOP)代码 + 可编程验证负载。
  • 引擎: V18.0 密码学硬件熵(os.urandom),具备严格去重和模式一致性。
  • 许可证: Apache-2.0

数据模式(字段说明)

字段名 类型 描述
id string 样本唯一标识符
language string 语言标识
category string 题目类别
problem string 100% 纯自然语言问题陈述,含标准 LaTeX 数学格式
step_solving string 逐步的严谨逻辑思维链(CoT)数学推理过程
answer string 提取的规范最终答案或解值
code string 完整 Python 实现。基础问题使用动态函数式代码;高级问题严格采用企业级 @dataclass OOP 架构
ground_truth string 标准答案
tool_calls_json string 隔离的 JSON 负载,指定代理工作流的函数/工具调用模式
tool_responses_json string 外部解释器/求解器的执行结果
verification_payload string 用于程序化可验证奖励强化学习(RLVR)的确定性验证标准
length_bucket string 长度分桶
difficulty string 难度等级
cluster string 聚类信息
created_at string 创建时间

数据集划分

  • 划分名称: train
  • 样本数量: 1,000,000,000(10 亿)
  • 文件格式: Parquet(data/*.parquet

推荐使用格式

1. 思维链(CoT)模式(ChatML)

<|im_start|>user {problem}<|im_end|> <|im_start|>assistant <thought> {step_solving} </thought> Jawaban akhir: {answer}<|im_end|>

2. 代理式代码解释器模式

<|im_start|>user {problem}<|im_end|> <|im_start|>assistant <thought> {step_solving} </thought> {code} <|im_end|>

任务类型与标签

  • 任务类别: 文本生成、问答
  • 标签: 数学、推理、思维链、合成数据、基础模型、代理式、企业OOP、urandom熵、RLVR

引用信息

bibtex @dataset{luminamath1b2026, author = {XoneMi, Third Prince and Lumina AI Research Laboratories}, title = {Lumina-Math-Foundations-1B: Industrial Foundational Mathematical Reasoning Dataset}, year = {2026}, publisher = {Hugging Face}, url = {https://huggingface.co/datasets/cloverx-id/Lumina-Math-Foundations-1B} }

搜集汇总
数据集介绍
Lumina-Math-Foundations-1B 数据集图片
构建方式
Lumina-Math-Foundations-1B数据集是在V18.0自适应OOP与密码学熵引擎框架下构建的,利用操作系统级加密随机源(os.urandom)生成初始数据,并经过严格的去重和模式一致性校验,确保数据的唯一性与规范性。每个实例包含纯自然语言问题陈述、逐步推理链(CoT)、最终答案、Python实现代码(基础问题采用动态函数式,高难度问题采用企业级@dataclass OOP架构)、工具调用与响应JSON、以及面向可验证奖励的验证负载。该构建流程融合了自动生成与程序化验证,实现了大规模合成数据的高保真度与逻辑严密性。
特点
该数据集以印度尼西亚语呈现,涵盖十亿级(1B)的合成数学推理样本,规模空前。其显著特色在于架构范式革新:纯自然语言思维链(CoT)与企业级面向对象编程(OOP)代码的深度耦合,辅以工具调用JSON和验证负载,形成多模态推理链。数据字段设计精细,包括难度分级、长度分桶、聚类标签等元数据,便于细粒度筛选。此外,严格基于加密熵的数据生成与去重机制保证了数据的多样性与不可预测性,为数学推理研究提供了高质量、可扩展的基石。
使用方法
该数据集适配多种微调与评估场景。对于监督微调(SFT),推荐使用ChatML格式,支持两种模式:链式思维(CoT)模式,将问题、逐步推理和最终答案依次嵌入助手回复,引导模型进行逻辑推导;代理代码解释器模式,额外注入Python代码段,激发模型通过编写或执行代码来强化数学求解能力。同时,利用验证负载(verification_payload)可实施强化学习中的可验证奖励(RLVR),精准衡量模型输出正确性。研究者可依据任务需求,灵活选择数据字段与模版,实现从基础数学运算到复杂问题求解的全链条能力提升。
背景与挑战
背景概述
Lumina-Math-Foundations-1B是由Lumina AI研究实验室于2026年发布的一项大规模基础数学推理数据集,旨在推动印尼语环境下数学推理能力的发展。该数据集由XoneMi、Third Prince等研究人员主导构建,依托V18.0自适应OOP与密码学熵引擎,生成了10亿条高质量合成推理样本,覆盖从基础算术到高级代数等多元数学范畴。数据集中每条样本均包含自然语言问题、思维链推理、Python代码实现、工具调用与验证载荷,为监督微调与强化学习提供了丰富资源。其发布标志着数学推理数据集在语种多样性、规模与结构化程度上的重要突破,对多语言AI推理研究具有深远影响。
当前挑战
该数据集面临的核心挑战包括:其一,领域问题层面,数学推理要求严谨的逻辑与多步演算,而印尼语的低资源特性使高质量数据获取受限,合成数据需确保语义准确性与推理性;其二,构建过程中,需在10亿规模下维持数据多样性与去重性,利用os.urandom熵源保障随机性,但严格去重与模式一致性实现难度高;其三,为支持RLVR,需设计确定性验证标准,并融合企业级OOP代码结构,确保代码可执行且与推理步骤一致;其四,多字段一致性校验与大规模存储管理亦构成工程挑战,如工具响应与验证载荷的精准对齐等。
常用场景
经典使用场景
Lumina-Math-Foundations-1B作为首个工业级印尼语数学推理基础数据集,其核心应用场景聚焦于大规模预训练与监督微调(SFT)。研究者可依托其十亿级高质量合成样本,采用ChatML格式的CoT提示模板,训练语言模型逐步生成严密的数学推导过程。该数据集涵盖从基础算术到复杂代数、几何的难度分层,为多步推理能力的培养提供了丰饶土壤。其设计兼顾纯自然语言与代码增强双模态,使得模型在推理时既能输出符号化步骤,又能调用外部解释器验证结果,从而在数学文本生成与知识蒸馏任务中展现出卓越适应性,成为构建多语种数学推理引擎的基石性资源。
衍生相关工作
该数据集的发布催生了系列前沿工作。一方面,研究人员基于其RLVR兼容特性,发展了数学推理的强化学习范式,如训练模型迭代求解并依据verification_payload自动奖励,显著提升在竞赛级问题上的表现。另一方面,其合成数据管线启发了个性化生成框架,例如利用聚类标签(cluster)与难度分级探索困难样本挖掘策略。在模型架构层面,基于该数据集的微调模型(如Lumina-Math-1B-Base)成为后续多语言迁移学习、工具集成推理(Tool-augmented Reasoning)的测试基准。此外,数据集中代码与CoT的耦合设计推动了神经符号方法在数学领域的复兴,衍生出将程序合成与逻辑推理相互增强的可解释性研究,为迈向通用数学智能提供了重要参照。
数据集最近研究
最新研究方向
基于Lumina-Math-Foundations-1B的规模化合成数学推理基座数据集,当前研究前沿聚焦于将企业级面向对象编程(OOP)架构与密码学硬件熵驱动的数据生成引擎相结合,以构建高保真、可验证的印度尼西亚语数学推理基准。该数据集通过纯自然语言思维链(CoT)与程序化验证载荷(RLVR)的深度融合,为强化学习提供确定性奖励信号,正推动多语言数学推理模型从指令微调向智能体化代码解释器模式演进。其百亿规模的问题-编码-工具调用联合范式,不仅支撑复杂数学问题的细粒度逻辑分解,还催生了针对低资源语言数学能力的评测体系革新。结合Apache-2.0许可的开源策略,该数据集有望成为东南亚地区数学AI研究的基础设施,并为跨语言可迁移推理能力及形式化验证方法提供关键训练与评估平台。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务