finance-pro-bench
收藏资源简介:
FinancePro-Bench是一个包含400个复杂专家级金融问题的基准测试数据集。这些问题需要深入的金融知识,并涉及法规、法律、战略、数学和代码生成等多个领域。它模拟了金融专家在实际工作中所需的细致、情境特定、多步骤推理过程,例如审查会计判断、构建交易结构、定价衍生品、处理税务和合规边缘案例等。每个问题都附带一个详细的、基于点的评分标准,用于对自由文本答案进行可重复的、基于标准的评分,评分标准主要基于推理过程、步骤以及模型处理矛盾信息的能力。问题包含推理和回答所需的所有信息,排除了大型语言模型的检索能力,专注于纯推理。数据集涵盖33个金融领域,采用test分划,包含在单个JSONL文件中。数据生成过程采用递归自我改进方法,通过多次批判和重写确保场景内部一致且推理路径明确。该数据集适用于评估大型语言模型在复杂金融推理任务上的性能,特别是对需要跨领域整合和情境分析的高级专业任务的评估。
FinancePro-Bench is a benchmark dataset containing 400 complex expert-level financial questions. These questions require deep financial knowledge and span multiple domains such as regulations, law, strategy, mathematics, and code generation. It simulates the detailed, context-specific, multi-step reasoning processes needed by financial experts in real-world tasks, such as reviewing accounting judgments, structuring transactions, pricing derivatives, and handling tax and compliance edge cases. Each question comes with a detailed, point-based scoring rubric for repeatable, standards-based evaluation of free-text answers, with the rubric largely based on reasoning processes, steps, and the models ability to handle contradictory information. The questions include all necessary information for reasoning and answering, excluding the retrieval capabilities of LLMs to focus solely on pure reasoning. The dataset covers 33 financial domains, uses a test split, and is contained in a single JSONL file. The data generation process employs a recursive self-improvement method, involving multiple rounds of critique and rewriting to ensure internal consistency and clear reasoning paths. It is suitable for evaluating the performance of large language models on complex financial reasoning tasks, particularly for advanced professional tasks requiring cross-domain integration and contextual analysis.
数据集概述:FinancePro-Bench
FinancePro-Bench 是一个面向金融领域的高难度基准测试数据集,旨在评估大语言模型在复杂金融推理任务上的表现。
核心特点
- 规模与构成:包含 400 道专家级金融问题,覆盖 33 个金融子领域。
- 难度定位:问题不仅需要深厚的金融知识,还涉及法规、法律、策略、数学和代码生成等跨领域推理,模拟高级金融专业人员在处理会计判断、交易结构设计、衍生品定价、税务合规等场景中所需的复杂、多步骤推理。
- 评估方式:每道题配备一个详细的、基于要点的 评分标准(Rubric),支持对自由文本答案进行可复现的、标准驱动的评分。评分标准包含得分项、陷阱惩罚和洞察奖励,侧重评估模型的推理过程、步骤和跨矛盾推理能力。
- 评估重点:本基准测试排除了 LLM 的检索能力,专注于纯粹的推理能力。
数据集摘要
| 项目 | 描述 |
|---|---|
| 问题数量 | 400 道专家级金融问题 |
| 领域类别 | 33 个金融领域 |
| 评分方式 | 基于要点的评分标准,包含陷阱惩罚和洞察奖励 |
| 数据划分 | test(全部数据用于评估) |
| 领先模型 | SanscriticFinance — 88.4%(对比 Claude Opus 4.7 的 65.8% 和 GPT 5.5 的 61.5%) |
问题示例
每道题呈现一个基于现实金融的复杂虚构场景。典型问题包含:
- 多方叙述:包含特定实体、角色、所有权结构和合同安排。
- 编号子问题:通常有 2-3 个部分,需要进行不同但相关的分析。
- 附件:提供表格、法规摘录、通信和财务数据,解答所需信息全部嵌入在问题中。
- 惯例说明:指定适用的框架、报告日期和明确假设。
评分标准示例
每道题的评分标准包含:
- 评分项:每个必要分析有分层积分(0 / 部分 / 满分),满分要求引用具体标准、逐步展示计算过程并展示结构理解。
- 陷阱惩罚:对常见错误或捷径进行扣分,例如未展示必要调整就报告数字、误用安全港测试等。
- 洞察奖励:对于识别干扰项、引用跨框架段落或展示超越问题要求的综合能力,给予少量加分。
- 最高分:每个评分标准定义最高分(通常 80-100 分),并指定评分的输出格式。
生成过程
该数据集使用 递归自我改进 方法生成。每个候选问题都会被反复批判和重写,以消除内部不一致性,直至场景内部连贯并支持唯一可辩护的专业推理路径。同时,评分标准也会被强化,以确保评分明确且可复现。
模型性能
在整体性能上,SanscriticFinance 以 88.4% 的准确率大幅领先于其他前沿模型:
| 模型 | 准确率 |
|---|---|
| SanscriticFinance | 88.4% |
| Claude Opus 4.7 (Adaptive) | 65.8% |
| GPT 5.5 (high) | 61.5% |
| Qwen 3.6 Max Preview | 54.4% |
| Gemini 3.1 Pro Preview | 44.6% |
| DeepSeek V4 Pro | 38.2% |
在 33 个类别中,SanscriticFinance 在所有领域均处于领先地位,包括最难的多框架类别。
数据集配置与文件
- 配置名称:
default - 数据文件:
data/finance_pro_bench.jsonl - 数据划分:
test
(注:本数据集文件位于 Hugging Face 仓库 Sanscritic/finance-pro-bench 的 data/ 目录下,完整的绝对地址为:https://huggingface.co/datasets/Sanscritic/finance-pro-bench/resolve/main/data/finance_pro_bench.jsonl)





