遇见数据集

Arithmetic-1.5M

收藏
Hugging Face2026-06-05 更新2026-06-06 收录
官方服务:

资源简介:

ArithMark 2.0预训练数据集是一个专门为参数规模小于1000万的语言模型设计的预训练数据集。其核心目标是提升这些小型模型在ArithMark-2.0算术基准测试上的性能,使其表现显著超越随机猜测水平。数据集包含两个版本的文件:`arithmark_raw.parquet`文件保留了数据的原始顺序,而`arithmark_curriculum.parquet`文件则按照课程学习的顺序进行了编排,推荐使用此版本进行模型训练。该数据集于2026年6月5日生成。

The ArithMark 2.0 Pre-training Dataset is a specialized dataset tailored for language models with fewer than 10 million parameters. Its core goal is to improve the performance of these small-scale language models on the ArithMark-2.0 arithmetic benchmark, ensuring their results significantly outperform random guessing levels. The dataset includes two file versions: the `arithmark_raw.parquet` file retains the original order of the data, while the `arithmark_curriculum.parquet` file is arranged in a curriculum learning sequence, and this version is recommended for model training. This dataset was generated on June 5, 2026.

创建时间:
2026-06-04
原始信息汇总

数据集概述:ArithMark 2.0 预训练数据集

  • 语言:英语(en)
  • 标签:算术(arithmetic)、预训练(pretraining)、低于1000万参数(sub-10M)、ArithMark
  • 用途:专为针对ArithMark-2.0基准测试、期望达到高于随机水平性能的低于1000万参数大语言模型生成的预训练数据集。
  • 文件内容
    • arithmark_raw.parquet:原始顺序数据。
    • arithmark_curriculum.parquet:课程学习排序数据(建议用于训练)。
  • 生成时间:2026-06-05 15:57 UTC
搜集汇总
数据集介绍
Arithmetic-1.5M 数据集图片
构建方式
Arithmetic-1.5M数据集专为参数量低于1000万的小型语言模型设计,旨在提升其在ArithMark-2.0基准测试中的运算推理能力。数据集以parquet格式存储,包含两个版本:原始顺序版与课程学习排序版,后者依据题目难度渐进排列,便于模型由简至繁地习得算术规律。构建过程基于结构化生成策略,确保样本覆盖加、减、乘、除等多种基础运算类型,并严格控制计算复杂度与数值范围,以适配小型模型的表征容量。
特点
该数据集的核心特色在于其针对亚千万参数模型的精巧化设计:一方面,样本规模控制在150万条左右,兼顾数据多样性与训练效率;另一方面,课程学习排序版本内嵌了认知发展逻辑,使模型能够遵循难度递进路径进行学习,从而显著提升在算术推理任务上的表现。此外,数据采用纯英文表达,格式统一规范,便于直接加载与训练,特别适用于探索小规模语言模型在符号推理领域的潜力。
使用方法
使用Arithmetic-1.5M时,推荐优先加载课程学习排序文件(arithmark_curriculum.parquet)进行训练,以充分发挥其渐进式难度设计对模型推理能力的促进作用。数据可直接通过Hugging Face Datasets库加载parquet格式文件,或使用Pandas等工具读取后转换为标准训练集格式。建议将数据集用于监督式微调或自回归预训练,在训练过程中监控模型在ArithMark-2.0基准上的准确率,以评估算术逻辑习得效果。
背景与挑战
背景概述
算术推理能力是评估大型语言模型基础认知水平的重要维度,然而现有预训练数据集多聚焦于自然语言理解与通用知识,忽略了数学运算的精细结构建模。Arithmetic-1.5M数据集由研究团队于2026年6月创建,专为优化参数量低于1000万的小型语言模型而生,旨在破解算术任务中模型表现近乎随机猜想的困境。该数据集以ArithMark 2.0基准为靶向,通过课程排序策略编排样本,为小规模模型在符号运算与数值逻辑上提供系统训练素材。其发布填补了轻量级算术预训练语料的空白,对提升边缘端及资源受限场景下模型的数学能力具有里程碑意义。
当前挑战
数据集面临的核心挑战来自领域问题与构建过程的双重维度。在领域问题层面,小模型对算术结构的学习极度依赖样本顺序与难易梯度,而现有基准测试中模型得分常低于随机水平,反映出数据表征与运算规则之间的鸿沟。构建过程中,如何在不增加参数规模的前提下,通过数据编排激发模型算术泛化能力成为棘手难题。同时,原始与课程化两种排序版本的提取与验证需要精确平衡随机性与渐进性,以避免引入序惯偏差。此外,样本规模仅150万条,需在有限数据内覆盖四则运算的多样化表述,这对生成算法的完备性提出了严苛要求。
常用场景
经典使用场景
在语言模型预训练领域,算术能力是衡量模型符号推理与数值理解水平的关键指标。Arithmetic-1.5M数据集专为参数量低于1000万的小型语言模型设计,其经典使用场景在于对这类轻量级模型进行算术预训练。通过对精心编排的算术题目进行教学式排序,该数据集帮助模型从简单的加减乘除逐步过渡到复杂多步运算,从而在有限的参数空间内高效习得基础数值逻辑。这一场景填补了小型模型在算术推理预训练数据上的空白,为后续的指令微调与泛化评估奠定了坚实的数字认知基础。
解决学术问题
该数据集旨在解决一个核心学术挑战——小型语言模型在算术推理任务中表现几乎等同于随机猜测的困境。传统算术数据集多面向大模型,难以适配小参数模型的容量与学习特性。Arithmetic-1.5M通过构建符合认知发展规律的课程式数据序列,使得参数量不足千万的模型能够首次在ArithMark 2.0基准上超越随机水平。这一突破为探究模型规模与算术能力之间的量化关系提供了关键数据支撑,推动了关于最小有效算力边界与符号归纳可学习性的理论探讨,具有重要的学术方法论意义。
衍生相关工作
基于Arithmetic-1.5M数据集的独特设计理念,研究者拓展出了一系列衍生工作。首先,其课程式排序策略启发了基于学习动态的难度自适应数据生成方法,被后续工作如CurriArith和StepwiseLLM所采纳与改进。其次,该数据集催生了针对小模型算术能力的评估基准ArithMark 2.0,推动了专门面向轻量级模型的推理测试体系构建。此外,数据集的生成管线被复用于开发多语言算术预训练数据,衍生出Arithmetic-CN和MathTiny等变体。还有研究基于该数据集探索知识蒸馏与记忆-推理分离架构,形成了小型模型算术模块的专门化设计范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务