BankMathBench
收藏官方服务:
资源简介:
BankMathBench是一个用于评估现实银行场景中数值推理能力的基准数据集,提供三个难度级别(基础、中级、高级)的训练和测试数据,包含英文和韩文版本,总计13,839个数据行,数据格式为CSV,包含问题、推理和答案等列。
BankMathBench is a benchmark dataset designed to evaluate numerical reasoning capabilities in real-world banking scenarios. It provides training and test data across three difficulty levels: Basic, Intermediate, and Advanced. The dataset is available in both English and Korean versions, with a total of 13,839 data rows. Stored in CSV format, it includes columns such as question, reasoning, and answer.
创建时间:
2026-06-10
原始信息汇总
数据集概述
BankMathBench 是一个用于评估银行业务场景下数值推理能力的基准测试数据集,相关论文已被 LREC 2026 接收。
数据集结构
数据集按难度分为三个层级,每个层级均提供英文(eng)和韩文(kor)两种语言版本:
- 1_basic(基础)
- 2_intermediate(中级)
- 3_advanced(高级)
数据规模
共包含 13,839 条数据记录(不包含表头),具体分布如下:
| 层级 | 数据切分 | 英文 | 韩文 | 合计 |
|---|---|---|---|---|
| 基础 | 训练集 | 2,236 | 2,236 | 4,472 |
| 基础 | 测试集 | 559 | 559 | 1,118 |
| 中级 | 训练集 | 1,702 | 1,708 | 3,410 |
| 中级 | 测试集 | 423 | 426 | 849 |
| 高级 | 训练集 | 1,596 | 1,596 | 3,192 |
| 高级 | 测试集 | 399 | 399 | 798 |
| 总计 | 6,915 | 6,924 | 13,839 |
数据格式
数据以 CSV 文件形式提供,包含银行场景问题与数值答案。共有字段:
index:索引question:问题reasoning:推理过程answer:答案
计算假设
除非问题中明确另行说明,否则默认:
- 零存整取(적금)采用期初存入、期末到期公式计算。
- 利息按税前基础计算。
版权声明
数据集及仓库内所有资料版权归 KakaoBank Corp. 所有。
搜集汇总
数据集介绍

构建方式
BankMathBench是一个专为银行场景下数值推理能力评估而设计的基准数据集,由KakaoBank公司构建并发布于LREC 2026会议。该数据集基于真实的银行业务逻辑,模拟了储蓄、贷款、利息计算等典型金融问题,并按照难度划分为基础、中级与高级三个层次。每个层次下均包含英语与韩语双语言版本的数据集,其中训练集与测试集按照约4:1的比例进行划分,总计涵盖超过1.3万条样本。数据以CSV格式存储,每条记录由问题索引、问题描述、推理过程及数值答案组成,确保了数据结构的简洁与一致性。
特点
BankMathBench的核心特点在于其层级化的难度设计和对双语言支持的重视。基础层级聚焦于简单的存款利息计算,中级层级引入了定期储蓄与贷款等复合金融产品,而高级层级则涵盖了多步推理与条件判断的复杂场景。此外,该数据集明确规定了计算假设,例如假设分期储蓄存款在每个周期初存入、期末到期,并且利息按税前基准计算,从而消除了计算歧义,提升了基准的公正性和可复现性。这种精细化的设计使得BankMathBench能够全面评估模型在实际银行对话场景中的数值推理能力。
使用方法
使用者可以直接从GitHub仓库中获取BankMathBench的数据集文件,并按难度层级和语言版本进行选择加载。每个CSV文件中的question字段提供了待解决的银行场景问题,answer字段则是对应的数值答案。推荐将训练集用于模型微调或提示工程优化,测试集则用于评估模型在未见过的银行问题上的推理准确性。对于跨语言迁移研究,研究者可利用英语与韩语双版本数据进行对比实验。此外,数据集中附带的reasoning字段可辅助验证模型推理过程的正确性,为可解释性分析提供支撑。
背景与挑战
背景概述
在金融科技迅猛发展的当下,数值推理能力成为评估人工智能在金融服务领域应用成效的关键指标。BankMathBench数据集由KakaoBank Corp.的研究团队于2026年创建,旨在填补银行场景下数值推理基准的空白。该数据集围绕银行实务中的核心问题,如储蓄、贷款计算等,构建了涵盖基础、中级、高级三个难度级别的双语(英语与韩语)问答体系,总计13,839条数据。其核心研究问题是衡量模型在真实银行场景中处理数值推理任务的能力,对提升AI在金融决策、风险控制等领域的可靠性具有重要引领作用。
当前挑战
BankMathBench所解决的领域挑战在于,现有数值推理基准多集中于通用数学问题,缺乏对银行特定领域如分期存款(적금)的利息计算、税前假设等复杂场景的覆盖,导致模型在实际金融应用中表现不佳。构建过程中,挑战包括如何精准设计反映真实银行业务逻辑的题目,确保不同难度级别在数值复杂度与推理步骤上的合理区分;同时需处理双语版本的语义等价性,避免因语言差异引入歧义。此外,数据标注需严格遵循银行计算惯例(如期初存款与期末到期),对领域知识的深度依赖增加了数据构建的难度与成本。
常用场景
经典使用场景
BankMathBench通过构建涵盖基础、中级与高级三个难度层级的双语银行场景数值推理问答对,为评估与提升大语言模型在金融语境下的数学计算能力提供了标准化测试平台。该基准数据集广泛应用于金融领域大模型的能力诊断、训练数据增强及可解释性研究之中,尤其聚焦于多步骤计算、利率换算、本息核算等复杂数值推理任务,成为衡量模型在结构化金融知识体系中泛化表现的关键工具。
实际应用
在实际金融场景中,BankMathBench可辅助智能客服系统自动解答用户关于存贷款利率、分期付款金额、到期收益等数值查询,显著降低人工答疑成本。该数据集也为金融教育产品中的自适应测试系统提供了高质量题目来源,助力学员通过渐进式练习掌握银行业务核心计算技能。此外,金融机构可基于该基准评估引入的对话机器人在复杂数值推理上的可靠性,从而在贷款规划、理财建议等高风险任务中确保计算准确性与合规性。
衍生相关工作
BankMathBench的发布催生了一系列聚焦金融数值推理的前沿研究,包括基于链式思考提示的银行场景推理优化、双语跨任务迁移学习框架以及融合领域知识的数值感知架构。后续工作还探索了利用该基准进行反事实推理数据增强与难度自适应生成,推动了从单一问答向解释性推理与多步验证的方向演进。这些衍生研究不仅深化了对金融数值推理本质的理解,也为设计兼具鲁棒性与可信度的金融大模型奠定了方法论基础。
以上内容由遇见数据集搜集并总结生成



