遇见数据集

Arithmark-3.0

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

ArithMark 3.0 是一个用于评估语言模型算术能力的第三代基准测试数据集。与之前版本不同,本数据集的问题以延续式的简短英语文字题形式呈现,而非裸露的数学等式。数据集主要设计用于对基础语言模型进行延续对数似然评分,无需模型具备指令跟随、思维链或生成解释的能力。数据集规模为1,000个示例,每个示例包含一个未完成的文字题上下文和四个可能的延续选项,构成一个四选一的多项选择题。正确答案在四个选项位置上均匀分布(各占25%),随机猜测准确率为25%。数据覆盖17个算术主题,包括加法、减法、乘法、除法、金钱、时间、测量、几何(面积与周长)、分数、模式、数据、比较以及两步运算等。每个主题关联特定的美国小学年级段(1-5年级)和难度等级(简单或中等)。数据集共使用47个模板生成,数据为合成生成。其适用任务为语言模型的算术推理能力评估,特别是针对基础模型在无需复杂提示工程下的核心计算与文本理解能力测评。

ArithMark 3.0 is a third-generation benchmark dataset for evaluating the arithmetic capabilities of language models. Unlike previous versions, the problems in this dataset are presented as continuation-style short English word problems, rather than bare mathematical equations. The dataset is primarily designed for continuation log-likelihood scoring of base language models, without requiring the models to have instruction-following, chain-of-thought, or explanation generation capabilities. The dataset consists of 1,000 examples, each containing an unfinished word problem context and four possible continuation options, forming a multiple-choice question with four options. The correct answers are evenly distributed across the four option positions (each accounting for 25%), with a random guess accuracy of 25%. The data covers 17 arithmetic topics, including addition, subtraction, multiplication, division, money, time, measurement, geometry (area and perimeter), fractions, patterns, data, comparison, and two-step operations, among others. Each topic is associated with specific U.S. elementary school grade levels (grades 1-5) and difficulty levels (easy or medium). The dataset is generated using 47 templates and is synthetically produced. Its applicable task is the evaluation of language models arithmetic reasoning abilities, particularly for assessing the core computational and text comprehension capabilities of base models without complex prompt engineering.

创建时间:
2026-07-22
原始信息汇总

ArithMark 3.0 数据集概述

基本信息

  • 数据集名称: ArithMark 3.0
  • 许可证: Apache-2.0
  • 语言: 英语
  • 数据规模: 1,000 条样本
  • 任务类型: 问答(多项选择)
  • 数据来源: 合成数据
  • 随机猜测准确率: 25%

数据格式

每条样本包含一个未完成的文字问题(ctx)、四个可能的续写选项(endings)以及零索引的正确选项索引(label)。示例: json { "ctx": "Sam had 43 rubber bands. A friend gave Sam 19 more. Afterward, Sam had", "endings": [" 63 rubber bands.", " 62 rubber bands.", " 61 rubber bands.", " 60 rubber bands."], "label": "1" }

正确答案为 "62 rubber bands.",标签值为 1

数据集组成

主题分布

数据集涵盖 17 个主题,每个主题对应特定的年级段和难度级别。主要主题包括:加法、减法、测量、乘法、金钱、时间、除法、模式、几何(面积)、分数(计数)、比较(差值)、两步加减法、几何(周长)、比较、数据、两步减法、两步加法。共使用 47 个模板生成样本。

难度分布

难度 样本数 占比
简单 419 41.9%
中等 581 58.1%
总计 1,000 100.0%

年级段分布

年级段 样本数 占比
1–2 年级 245 24.5%
2–3 年级 363 36.3%
3–4 年级 295 29.5%
4–5 年级 97 9.7%
总计 1,000 100.0%

正确选项位置分布

四个选项位置(0、1、2、3)各占 250 个样本(25%),完全平衡,消除了位置频率带来的偏差。

基线结果

数据集提供了 78 个模型的基线评估结果,最高得分为 65.70%(facebook/MobileLLM-R1-140M-base),最低得分为 24.80%(GODELEV/Ant-5m)。该基准主要适用于基础模型的续写对数似然评分,不需要指令遵循或思维链。

搜集汇总
数据集介绍
Arithmark-3.0 数据集图片
构建方式
ArithMark 3.0是专为评估语言模型算术能力而设计的第三代基准测试集,由1,000个合成样本构成。每个样本均以短英文文字题的形式呈现,而非裸算式,要求模型以续写方式完成解答。其数据构造基于47个模板,覆盖从加减法到几何面积等17个数学主题,并严格匹配1至5年级的难度梯度,确保问题具有层次分明的教育代表性。答案选项精确设置为4个,且正确答案随机均匀分布于各位置,消除了位置偏差对模型性能的干扰。
使用方法
使用ArithMark 3.0时,研究者可通过提供的`arithmark-3.py`脚本直接评估模型。数据以JSONL格式存储,每条记录包含上下文`ctx`、四个候选结尾`endings`及正确标签`label`。评估基于续写任务的对数似然得分,即模型为每个结尾计算概率后选择最高者,无需生成完整答案。此方法适用于纯解码器或编码器-解码器架构的基座模型,并已在78个模型中取得基线结果,其中顶尖模型得分达65.70%。
背景与挑战
背景概述
ArithMark 3.0是由AxiomicLabs等机构于近期推出的第三代算术能力评估基准,专为评测基础语言模型的算术推理能力而设计。该数据集以短文形式呈现1,000道包含17个主题的数学文字题,涵盖从加法到几何的多个难度级别,覆盖美国1至5年级教育阶段。与先前版本不同,本基准采用延续式(continuation-style)格式,无需模型进行指令跟随或思维链推理,仅通过计算续接概率即可评估模型算术能力。该基准提供了78个基线模型结果,包括MobileLLM-R1-140M等小型模型的性能排名,为语言模型在基础运算理解领域的研究提供了标准化评测工具,对推动模型算术能力评估方法的发展具有重要参考价值。
当前挑战
该数据集主要致力于解决语言模型在算术推理评估中的两大核心挑战。领域问题层面,传统评估方式往往依赖指令遵循或复杂推理步骤,难以纯净衡量模型对基本数学运算的理解,而ArithMark 3.0通过延续式选择题设计,将任务简化为概率预测,有效剥离了其他能力的干扰。构建过程层面,数据集面临如何保证题目多样性和难度均衡性的难题,为此采用了47个模板和17个主题的合成数据生成策略,覆盖多个年级和难度层,同时严格平衡正确答案位置分布至各选项均占25%,防止模型利用位置偏差取巧,确保了基准的公正性与可靠性。
常用场景
经典使用场景
在自然语言处理与认知科学交叉领域,ArithMark-3.0被设计为评估语言模型算术推理能力的标准化基准。其核心任务为完形填空式数学应用题,模型需从四个候选答案中选择正确的续写内容。该数据集涵盖从一年级到五年级的17个数学主题,包含加法、减法、乘法、除法、几何面积与周长等运算,并细分为简单与中等两种难度层级。通过分析模型在多样化题型上的表现,研究者能够系统性地检验其数值计算与文本理解的整合能力。
解决学术问题
该数据集针对语言模型在算术推理中存在的本质性挑战而构建,有效解决了传统评测中忽视数值逻辑与语言表达耦合关系的难题。ArithMark-3.0通过语法平衡的答案分布(每选项概率均为25%)和合成数据生成策略,排除了位置偏置与数据污染等干扰因素,为学术界提供了纯净的数学推理能力度量工具。其引入的续写式问题范式填补了无指令跟随场景下评估算术能力的空白,推动了语言模型基础能力研究向更精细维度发展。
实际应用
在工业界,ArithMark-3.0广泛应用于教育科技领域的模型选拔与优化流程。例如,智能辅导系统可借此基准筛选出具备稳定算术能力的预训练模型,用于数学作业批改或自适应学习路径推荐。同时,该数据集也被嵌入语言模型训练管线中的早停策略,作为监控数学推理能力衰退的信号。此外,其在移动端小模型(如参数不足150M的轻量级模型)上的评估结果,为资源受限场景下的模型压缩与蒸馏提供了关键参照。
数据集最近研究
最新研究方向
在大型语言模型算术推理能力评估的前沿研究中,Arithmark-3.0作为第三代基准测试,标志着评估范式从抽象方程向自然语言应用题延续的深刻转型。该数据集聚焦于基础模型在延续式上下文中的对数似然评分,规避了指令遵循与思维链等复杂交互,从而更纯粹地剥离并量化模型原生算术能力。其1000个精编样本覆盖17个数学主题与47个模板,跨越1至5年级的难度层级,且随机基线准确率被锁定于25%,为小参数模型(如140M参数的MobileLLM-R1)提供了极具区分度的竞技场。当前研究热点集中于通过这一合成基准,揭示不同架构与训练策略下模型在“简单加法”与“两步减法”等具体主题上的能力差异,并与前沿的“LLM算术稳健性”与“小学数学推理瓶颈”等话题深度耦合,为未来轻量级推理模型的设计提供了关键的评估锚点与方向指引。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务