MathArena/kangaroo_2025_1-2_outputs
收藏官方服务:
资源简介:
该数据集包含了Kangaroo 2025 1-2竞赛的问题及其使用MathArena模型生成的答案。数据集中的每个问题都有问题索引、问题图像、真实答案、模型名称、模型配置等信息。该数据集适用于评估大型语言模型在未受污染的数学竞赛中的表现。
This dataset contains questions from the Kangaroo 2025 1-2 competition along with answers generated by the MathArena model. Each question in the dataset includes problem index, problem image, ground-truth answer, model name, model configuration, and more. The dataset is suitable for evaluating large language models on uncontaminated math competitions.
提供机构:
MathArena搜集汇总
数据集介绍

构建方式
在大型语言模型数学推理能力评估的学术探索中,MathArena/kangaroo_2025_1-2_outputs数据集应运而生。该数据集基于阿尔巴尼亚2025年袋鼠数学竞赛的原始题目构建,通过提取、翻译与截图处理将题目转化为标准化图像格式。随后,利用MathArena开源框架,调用多种配置的语言模型对每道题目进行多次推理尝试,系统性地采集模型生成的完整对话记录、解析后的答案及与标准答案的匹配结果。数据集中每条记录均包含问题索引、模型名称、推理成本及令牌消耗等元信息,形成结构化、可复现的评估数据集合。
特点
该数据集的核心特色在于其多维度的细粒度标注与实用性设计。它不仅记录了模型输出的原始文本与解析后答案,还提供了完整的历史对话序列、输入输出令牌数及估算的API成本,为分析模型推理效率与经济性提供了定量依据。数据覆盖了从简单到复杂的数学问题,并通过多次尝试索引(idx_answer)支持对模型一致性的研究。此外,所有题目均以图像形式保存,保留了原始数学符号与布局,确保了评估的视觉真实性。
使用方法
该数据集适用于大语言模型数学推理能力的基准测试与对比分析。研究者可加载train分片中的1874条样本,利用'image'字段可视化题目内容,通过'model_name'与'model_config'字段按不同模型或配置进行分组比较。'correct'布尔字段可直接用于计算准确率,而'cost'与令牌统计数据则支持成本效益分析。数据以Parquet格式存储于HuggingFace Datasets库中,用户可通过load_dataset函数便捷加载,并按需筛选字段进行下游分析或可视化展示。
背景与挑战
背景概述
在大型语言模型(LLM)的数学推理能力评估领域,传统基准测试的局限性日益凸显,亟需更具生态效度的动态评估平台。MathArena项目由苏黎世联邦理工学院(ETH Zurich)的Jasper Dekoninck、Nikola Jovanović等研究人员于2025年创建,旨在构建一个可扩展、可复现的数学推理竞技场。作为该平台的重要组成部分,MathArena/kangaroo_2025_1-2_outputs数据集聚焦于2025年阿尔巴尼亚袋鼠数学竞赛(Kangaroo 2025)的试题,涵盖从试题提取、英译到截图的全流程处理。该数据集收录了多种模型在竞赛题目上的完整推理轨迹,包括输入输出token数、API成本及自动评分结果等细粒度元数据,为研究LLM在真实竞赛场景下的数学推理能力提供了标准化评估基准,对推动数学推理领域的可重复性研究具有重要价值。
当前挑战
该数据集面临的核心挑战在于多维度复杂性的交织。在领域问题层面,数学竞赛试题不仅要求模型具备基础运算能力,更考验其对几何图形、逻辑推理和文字应用题的多模态理解——数据集中的图像字段(image)直接反映了这一需求,而现有LLM在视觉与文本信息的跨模态对齐上仍存在显著短板。在构建过程中,数据采集面临语言转换的精度损失风险:原始阿尔巴尼亚语试题需经过翻译、截图与人工校验,这一流程可能引入语义歧义或格式误差。此外,自动评分机制(parsed_answer与gold_answer的匹配)对答案解析器的鲁棒性提出严苛要求,模型输出的自由文本与标准答案之间的形式差异(如等价代数表达)可能导致评分偏差,需依赖MathArena解析器的高效泛化能力来克服这一瓶颈。
常用场景
经典使用场景
在数学推理与大规模语言模型(LLM)交叉研究的浪潮中,MathArena/kangaroo_2025_1-2_outputs数据集为评估模型在竞赛级数学问题上的表现提供了标准化测试床。该数据集收录了多种语言模型对阿尔巴尼亚袋鼠数学竞赛2025年1-2轮试题的解答记录,涵盖完整对话历史、模型输出、分词消耗及成本信息。其经典使用场景聚焦于自动评测模型在数学推理任务中的准确性与效率,通过将模型输出与标准答案进行结构化比对,支持研究者系统性地分析不同模型架构、提示策略及推理链在复杂数学问题上的优劣,成为衡量LLM数学能力的可靠标杆。
衍生相关工作
该数据集催生了一系列围绕数学推理可解释性与鲁棒性的经典工作。基于其结构化输出,研究者开发了多种答案解析与错误聚类算法,例如通过对比模型输出与标准答案的语义路径,识别出模型在代数变换或几何推理中的系统性偏差。此外,该数据集推动了多模态数学推理研究——因试题以截图形式呈现,衍生工作探索了视觉编码器与语言模型的协同机制,如利用图像特征增强对图表题的理解。这些工作不仅深化了对LLM数学能力的认知,还催生了诸如MathArena评测框架等开源工具,为后续大规模、多语言数学基准的构建奠定了方法论基石。
数据集最近研究
最新研究方向
在大型语言模型数学推理能力评估的浪潮中,MathArena/kangaroo_2025_1-2_outputs 数据集聚焦于2025年阿尔巴尼亚袋鼠数学竞赛题目,为前沿研究提供了高保真的模型输出追踪。该数据集不仅记录了模型对多项视觉化数学问题的回答,还囊括了输入输出令牌数、API成本及答案解析正确性等细粒度指标,使得研究者能够深入剖析模型在竞赛级数学推理中的表现与资源消耗。当前,这一数据集正被用于探究多模态大模型在复杂几何与逻辑问题上的泛化边界,并与 MathArena 平台协同推动自动化评估范式的革新。其公开的模型配置与完整对话历史,为复现实验、比较不同架构的推理效率以及揭示模型在翻译后非英语题目上的鲁棒性提供了宝贵资源,对理解LLM在真实教育场景下的应用潜力具有里程碑意义。
以上内容由遇见数据集搜集并总结生成



