遇见数据集

DFKI-SLT/kangaroo_math_benchmark

收藏
Hugging Face2026-06-30 更新2026-07-22 收录
官方服务:

资源简介:

Känguruh Wettbewerb数据集是一个德语基准数据集,基于官方的Känguru der Mathematik数学竞赛材料,涵盖1998年至2025年。每个实例是一个单项选择题,包含五个选项(A - E),针对学校年级3至13。该数据集旨在评估与课程一致的数学推理能力,强调视觉基础(如图表、几何图形、空间排列),并允许按年份、年级组、难度、数学子领域和模态进行受控分析。数据集包含图像、问题、答案、年份等特征,总任务数为3,557个,其中61%为纯文本问题,39%需要视觉信息。处理过程包括任务定位和裁剪、手动筛选、解决方案对齐以及结构化字段和派生标签。

This dataset is a German benchmark from the official _Känguru der Mathematik_ competition materials covering 1998--2025. Each instance is a single multiple-choice problem with five options (A - E) from school grade levels 3 - 13. The benchmark targets curriculum-aligned mathematical reasoning in German with explicit visual grounding (diagrams, geometric figures, spatial arrangements) while enabling controlled analyzes by year, grade group, difficulty, math subdomain, and modality.

提供机构:
DFKI-SLT
搜集汇总
数据集介绍
DFKI-SLT/kangaroo_math_benchmark 数据集图片
构建方式
Kangaroo_math_benchmark数据集源自德国官方数学竞赛《Känguru der Mathematik》1998至2025年间的原始材料,基于一份包含140份PDF文件、总计560页的题库构建而成。研究者通过一套四阶段流水线对原始PDF进行系统化处理:首先执行任务定位与图像裁剪,提取每道题目对应的图片区域;随后进行人工筛查以剔除无效或模糊样本;接着将题目与标准答案进行对齐;最终为每条实例补充结构化字段与衍生标签。整个流程确保了数据的高质量与一致性,最终形成了包含3557道五选一选择题的基准测试集,覆盖3至13年级的数学知识点。
使用方法
该数据集主要用于评估视觉语言模型在德语数学推理任务上的表现,尤其关注多模态能力与文本-视觉差异分析。使用时,研究者可将图像与题目文本作为模型输入,要求模型从五个候选选项中选择正确答案。由于数据集按年份、年级、难度、数学类别及模态(文本或视觉)等多重维度组织,用户可灵活构建子集以进行针对性实验,例如仅测试纯文本题或仅测试需视觉理解的题目。评估指标通常采用准确率,基线模型可参考相关领域的预训练视觉语言模型,如Flamingo或LLaVA等。
背景与挑战
背景概述
在视觉语言模型(VLM)快速发展的背景下,评估模型在多模态数学推理中的能力成为研究热点。KangarooBench(又称Känguruh Wettbewerb数据集)由Dennis Hug、René Wolf和Philippe Thomas等研究人员构建,源自德国官方“Känguru der Mathematik”竞赛材料(1998—2025年),收录了3557道针对3至13年级学生的五选一数学题,涵盖算术、几何、代数、概率等领域。每道题均配有图像(如几何图形、空间排列)与文本描述,其中39%的题目需要视觉信息方可解答。该数据集为德语环境下的课程对齐数学推理提供了首个大规模基准,其跨年度(28年)、多难度等级(A/B/C均匀分布)及细粒度标签(年级组、数学子域、模态类型)设计,使研究者能系统分析VLM在数学推理中的模态差距,对推动多模态数学智能评估具有重要影响力。
当前挑战
KangarooBench数据集旨在解决视觉语言模型在多模态数学推理中的模态差距问题,即模型在处理纯文本与含视觉信息的数学题时表现不一致的挑战。传统数学基准多依赖单一文本模态,忽略了几何图形、图表等视觉元素对推理的制约,而该数据集明确区分文本仅需(61%)与视觉必需(39%)题目,揭示了当前VLM在视觉-语言融合上的短板。构建过程中,研究人员面临多重挑战:首先,需从140份PDF(共560页)竞赛材料中精准定位并裁剪任务区域,且历经人工筛查确保质量;其次,需将非结构化PDF内容与官方答案对齐,并统一转换为结构化字段(如难度、数学类别),工作量庞大;此外,标签体系(如数学子域的划分)需兼顾模糊类别(如“未知”)的合理性,以避免引入噪声。这些步骤共同保障了数据集的可靠性,但跨年跨度与题目多样性也增加了标注一致性的维护难度。
常用场景
经典使用场景
kangaroo_math_benchmark数据集源自德国官方“袋鼠数学竞赛”(Känguru der Mathematik)1998年至2025年间的真题材料,专为评估视觉语言模型在数学推理与视觉理解交叉领域的能力而设计。其核心经典使用场景聚焦于多模态数学问题解答任务,每个样本包含一道附有图表、几何图形或空间排列图像的五选一单选题,覆盖算术、几何、代数、概率等数学子领域,并且数据按年份、年级组别、难度等级和模态类型(纯文本与视觉必要)进行了精细标注。研究者可利用该基准系统性地考察模型在需要明确视觉线索支撑的数学推理场景中的表现,从而深入分析视觉与文本信息之间的交互对数学解题能力的影响。
解决学术问题
该数据集精确地解决了当前多模态大模型研究中一个关键但常被忽视的问题:如何量化评估模型在课程对齐的数学推理任务中,对于视觉信息(如几何图形、空间布局)的依赖程度与处理能力。传统的数学推理基准多以纯文本形式呈现,难以揭示模型在多模态环境下的真实缺陷。kangaroo_math_benchmark通过精心设计的双模态对照分析(文本仅含样本与视觉必要样本),使得研究者能够区分模型是依靠纯语言模式匹配还是真正理解视觉布局进行推理。这为揭示视觉语言模型在数学领域存在的“模态差距”(modality gap)——即模型在融合视觉与文本信息时的性能损失——提供了可复现的实验平台,推动了多模态数学推理评估方法的科学化发展。
实际应用
在实际应用层面,kangaroo_math_benchmark为教育科技领域提供了极具价值的评测与校准工具。教育类人工智能系统(如智能辅导平台、自动出题与批改系统)可以利用该数据集检验其视觉语言模块在理解几何证明、数轴表示、图表分析等典型教学场景时的准确性。例如,在开发面向中小学数学的自动解题系统时,开发者可通过该基准评估系统能否正确解析附带图形的应用题,进而针对性地优化视觉特征提取与数学逻辑推理的融合策略。此外,数据集按年级和难度进行的分级结构,使其天然适用于构建自适应学习路径中的难度分层评估任务,辅助教育产品的迭代与效果验证。
数据集最近研究
最新研究方向
该数据集聚焦于视觉数学推理的前沿评估,尤其针对多模态大语言模型(VLM)在课程对齐的数学问题中的模态差距。通过整合德国“Känguru der Mathematik”竞赛1998至2025年的真题,构建了涵盖算术、几何、代数等子领域的3557道单选题,其中39%的实例必须依赖图表或空间布局等视觉信息才能解答。这一设计为量化模型在文本与视觉模态间的性能落差提供了独特基准,并支持按年级、难度、数学类别等维度进行细粒度分析。当前研究热点在于利用该数据集揭示VLM在真实教育场景中的推导瓶颈,例如几何图形感知的准确性或代数符号与图示的联合理解能力,进而推动多模态推理算法的鲁棒性提升。作为少数原生德语的数学评估资源,它还为跨语言与跨文化推理能力的比较研究开辟了新路径,对检验模型在非英语环境下的泛化表现具有重要启发意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务