FinChain
收藏资源简介:
FinChain是首个专为可验证链式思维金融推理设计的基准数据集。它评估大型语言模型在基于金融方程的符号化多步问题解决任务上的表现。该数据集采用细粒度金融分类法构建,支持步骤级监督和强大的诊断评估。
FinChain is the first benchmark dataset specifically designed for verifiable chain-of-thought financial reasoning. It evaluates the performance of large language models (LLMs) on symbolic multi-step problem-solving tasks based on financial equations. Constructed with a fine-grained financial taxonomy, this dataset supports step-level supervision and enables robust diagnostic evaluation.
FinChain 数据集概述
数据集简介
FinChain是首个针对可验证思维链(CoT)金融推理的基准测试,专注于符号化、多步骤的金融问题求解任务。该数据集基于细粒度金融分类体系构建,支持步骤级监督和鲁棒的诊断性评估。
关键特性
- 覆盖范围:包含12个金融领域的54个主题
- 模板设计:每个主题提供5个符号化模板(2简单/2中等/1高级)
- 可验证性:提供可执行的Python跟踪代码用于步骤级答案验证
- 评估指标:包含ChainEval自定义指标,可同时评估最终答案和中间步骤
数据结构
finchain/ ├── data/ │ └── templates/ # 54个金融主题的符号化提示模板 ├── eval/ # ChainEval评估脚本(即将推出) └── README.md
每个实例包含:
- 从符号模板生成的金融问题
- 包含中间变量和计算过程的黄金推理轨迹
- 用于生成真实值和验证的可执行代码
领域分类
覆盖12个金融领域的54个主题,包括:
- 公司金融
- 投资分析
- 个人理财
- 财务比率
- 风险管理
- 可持续金融
- 并购
- 金融市场
- 金融科技
- 加密金融
- 财务报告
- 金融监管
ChainEval评估指标
- 最终答案正确性(FAC)
- 步骤对齐:
- 推理步骤的语义相似度
- 每个步骤的数值一致性
基准测试结果
评估了30个模型,包括:
- GPT-4.1, GPT-4o-mini, LLaMA 3.3 70B
- Qwen3, DeepSeek-R1, Mixtral, Mathstral
- 金融微调模型:Fino1, FinR1, WiroAI Finance Qwen
主要发现:
- 大型模型表现优于小型金融微调模型
- 顶级模型在高级模板和多跳符号链上仍存在困难
- FinChain能揭示标准准确率指标无法捕捉的推理缺陷
使用说明
bash git clone https://github.com/mbzuai-nlp/finchain.git cd finchain ls data/templates/
开发团队
由MBZUAI、索非亚大学、Quantsquare、康奈尔大学、IIT Delhi等机构的研究人员共同开发。
免责声明
FinChain使用基于符号金融方程的合成数据,不反映真实世界的财务建议或监管。




