遇见数据集

big-finance-benchmark

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

BigFinanceBench Public Release 是一个用于评估金融研究智能体的基准测试数据集公开子集。其核心目标是确保金融答案的可审计性,要求智能体不仅生成数值答案,还需提供完整的工作流程轨迹,这些轨迹将根据详细的、带权重的评分标准进行评分,涵盖来源选择、周期、会计定义、假设、调整和计算等多个关键检查点。本公开版本包含从完整928项基准测试中分层抽取的50个问题,确保了在流程和难度上的代表性,使模型排名与完整集高度一致。每个数据样本包含一个唯一的稳定标识符、一个自然语言的金融研究任务查询、一个由专家撰写的参考答案,以及一个有序的评分标准数组。每条评分标准都包含描述文本和整数权重分值,最终得分通过累计获得分数除以问题总可能分数计算。数据集规模为50个问题,共包含793条评分标准线和1,931个评分点,平均每个问题有15.86条评分标准和38.62个评分点。此外,该发布还附带了多个前沿大模型在这些问题上的工作轨迹文件(包含工具使用和中间输出)以及由法官模型生成的评分结果。该数据集适用于开放领域问答、文本生成、智能体工作流评估、金融研究工具使用验证等任务,旨在推动可审计、可靠的金融分析智能体的发展。

The BigFinanceBench Public Release is a public subset of the benchmark dataset for evaluating financial research AI Agents. Its core objective is to ensure the auditability of financial answers, requiring AI Agents to not only generate numerical answers but also provide complete workflow traces. These traces will be scored against detailed, weighted scoring rubrics covering multiple key checkpoints including source selection, time periods, accounting definitions, assumptions, adjustments, and calculations. This public release includes 50 questions sampled via stratified sampling from the complete 928-item benchmark set, ensuring representativeness in terms of workflow and difficulty, such that model rankings align highly with those of the full dataset. Each data sample contains a unique stable identifier, a natural language financial research task query, an expert-written reference answer, and an ordered array of scoring rubrics. Each scoring rubric includes a descriptive text and an integer weight score. The final score is calculated by dividing the accumulated earned points by the total possible points for the corresponding question. The dataset comprises 50 questions in total, containing 793 scoring rubric lines and 1,931 scoring points, with an average of 15.86 scoring rubrics and 38.62 scoring points per question. In addition, this release also provides workflow trace files (including tool usage and intermediate outputs) for multiple cutting-edge large language models (LLMs) on these questions, as well as scoring results generated by judge models. This dataset is applicable to tasks such as open-domain question answering, text generation, AI Agent workflow evaluation, and validation of financial research tool usage, aiming to promote the development of auditable and reliable financial analysis AI Agents.

创建时间:
2026-05-28
原始信息汇总

数据集概述

BigFinanceBench 是一个用于评估金融研究智能体(agent)工作流的基准测试数据集。其核心在于不仅评估智能体生成的最终数字答案,还通过基于点数的评分细则(point-weighted rubric)对其整个推理过程(包括来源选择、时间段、会计定义、假设、调整和计算)进行评分,以确保结果的可审计性。

基本信息

  • 语言: 英语
  • 许可证: CC BY 4.0
  • 领域: 金融
  • 任务: 问答、文本生成 (开放域问答)
  • 数据集大小: 小于1K样本
  • 数据来源: 原始创作

数据规模与版本

  • 本次发布的是 BigFinanceBench 完整基准测试(928个问题)的一个 50个问题的分层子集
  • 该子集根据工作流和难度四分位数进行分层,使得模型排名与完整928问题集高度一致(Kendalls tau = 0.956)。
  • 完整的基准测试项被保留,以减轻基准污染并保持评估有效性。
  • 数据集统计:
    • 总样本数: 50
    • 总评分细则行数: 793行
    • 总评分点数: 1,931点
    • 平均每个问题: 15.86行评分细则, 38.62点

数据格式与字段

数据集以 JSONL 文件 (big_finance_subset.jsonl) 格式提供,每行包含一个基准测试项,包含以下字段:

  • id: 稳定的问题标识符。
  • query: 自然语言的金融研究任务。
  • reference_answer: 专家撰写的参考答案。
  • rubric: 有序的评分检查点数组。每个条目是一个独立的评分细则行,包含:
    • text (字符串): 对答案或推理轨迹的要求描述。
    • points (整数): 该检查点的分值权重。

评分示例: json { "id": "bf-0a8c20169a", "query": "For EnviroStar (ticker: EVI), in December 2016...", "reference_answer": "$14.21", "rubric": [ {"text": "Records 12/06/2016 shares sold = 32,476.", "points": 1}, {"text": "Calculates weighted average sale price = $14.21 per share, when rounded to the nearest cent.", "points": 10} ] }

文件结构

  • big_finance_subset.jsonl: 包含50个公开基准测试项。
  • traces/: 包含模型在被评估问题上的运行轨迹(包括工具调用、工具输出、最终答案和运行元数据)。
  • grades/: 包含对上述轨迹的评判结果,包括最终答案正确性和每个细则行的得分。

模型与评判

  • 已评估模型: GPT-5.5, GPT-5.4 Mini, Claude Opus 4.7, Claude Sonnet 4.6, Gemini 3.1 Pro Preview, Gemini 3 Flash Preview, Gemma 4 31B, GLM-5.1, Kimi K2.6, Qwen3.6 27B。
  • 评判模型: Gemini 3.1 Pro Preview, Claude Opus 4.7。

其他信息

  • 维护方: 由 Rogo 维护。
  • 联系方式: alexwang@rogo.ai, georg@rogo.ai。
  • 相关链接:
    • arXiv 论文: https://arxiv.org/abs/2606.03829
    • 项目网站: https://bigfinancebench.com/
    • GitHub 仓库: https://github.com/Rogo-Technologies/big-finance-benchmark
    • 博客文章: https://rogo.ai/news/introducing-the-big-finance-benchmark
搜集汇总
数据集介绍
big-finance-benchmark 数据集图片
构建方式
BigFinanceBench是一个专为评估金融研究智能体全流程能力而设计的基准数据集。该数据集由领域专家精心构建,包含928个问题,此次公开的子集为50个精选样本。构建过程采用分层抽样策略,依据工作流类型和难度四分位数进行分层,以确保子集能够准确反映完整基准的排名趋势,其Kendall tau系数高达0.956。每个样本均包含自然语言金融研究问题、专家撰写的参考答案以及点权重评分细则。评分细则由一系列可独立核查的检查点构成,每个检查点包含描述文本和整数分值,总分为各点得分之和。这种设计使评估不仅关注最终答案的正确性,更严格追溯智能体生成答案的完整轨迹。
特点
该数据集的核心特点在于其工作流导向的评估理念,即金融答案只有在他人能够审计其产生过程时才具有实际价值。BigFinanceBench通过点权重评分细则,系统评估智能体在来源选择、时间范围、会计定义、假设、调整和计算等关键环节的表现。公开的50个问题包含793条评分细则,总计1,931分,平均每个问题拥有15.86条细则和38.62分。此外,数据集还提供了多种模型在子集上的完整运行轨迹和评分结果,包括工具调用、输出、最终答案及元数据,每个问题由两个裁判模型独立评分,确保了评估的全面性和客观性。
使用方法
数据集以JSONL格式提供,每条记录包含编号、查询问题、参考答案和评分细则数组。使用者可直接加载big_finance_subset.jsonl文件,通过解析rubric字段获取有序的评分检查点。评估时,将智能体生成的答案及其轨迹与评分细则逐一比对,计算每个检查点的得分,最终以总得分除以总分值得到标准化评分。traces目录提供了模型运行轨迹,grades目录包含了裁判评分结果,可用于复现报告中的评测结果。建议使用者首先阅读随附的论文和网站文档,了解完整的评估协议和评分标准,再基于公开子集开展模型的开发与验证工作。
背景与挑战
背景概述
BigFinanceBench是一个专为金融研究智能体设计的工作流导向型基准测试,由Rogo团队于2026年创建,核心研究团队包括Alex Wang、Georg Meinhardt等学者。该数据集聚焦于金融领域智能体的完整可审计工作流评估,要求智能体不仅产生数值答案,还需在源选择、时间段、会计定义、假设调整和计算等环节遵循专家设计的加权评分表。作为领域内首个强调过程可审查性的基准,BigFinanceBench通过50个经过分层抽样的公开问题(来自928个完整集),有效维护了模型排名的稳定性(Kendall's tau=0.956),对推动金融智能体的透明性和可靠性研究具有里程碑意义。
当前挑战
该数据集面临的核心挑战在于解决金融问答领域长期存在的‘审计鸿沟’问题——即传统基准仅关注答案正确性而忽略产生过程的合理性与可追溯性。为此,数据集构建过程必须克服多重困难:首先,金融问题具有高度专业性和多义性,需由领域专家手工编写包含多个独立可查点的加权评分表(平均每问题15.86个评分项),确保评判细粒度;其次,为防止基准污染与验证失效,构建团队刻意保留大部分问题未公开,仅释放分层子集;此外,还需设计双裁判模型交叉评分机制以抵消单一裁判的偏差,并对不同模型(涵盖GPT-5.5至Gemma 4 31B等10个模型)的完整轨迹进行收集与量化评估,这对数据收集与标准化提出了严峻挑战。
常用场景
经典使用场景
在金融分析与智能体评估的交叉领域中,BigFinanceBench 作为一个以工作流为核心基准的数据集,最经典的使用场景在于评测金融研究智能体的端到端推理与执行能力。该数据集通过精心设计的 928 道财务研究问题,要求智能体不仅给出数值答案,更需完整记录从数据源选取、时间段确认、会计定义裁定到假设调整与计算的整个推理轨迹。每一道题目配有专家撰写的参考答案和基于分值的细粒度评分规则,使得对智能体在复杂金融逻辑链上的表现进行量化审计成为可能。这种结构化评测方式尤其适用于需要验证智能体在真实财务分析任务中是否遵循规范流程的场景,例如财报解读、估值计算、盈利调整等专业环节,从而为金融大语言模型的能力边界提供可靠且可复现的度量标准。
衍生相关工作
BigFinanceBench 的发布催生了一系列围绕金融智能体可审计性和工作流建模的衍生研究。首先,基于该基准的评分规则设计理念,后续工作提出了将细粒度过程奖励模型融入金融智能体训练框架的方法,通过针对每一条评分点进行反向传播优化,显著提升了模型在复杂财务推理链上的表现。其次,该数据集的轨迹级评估方式启发了研究者构建面向金融场景的智能体记忆与规划系统,使模型能够动态调整信息获取策略以匹配评分规则中的隐性约束。此外,围绕该基准的模型排名一致性分析推动了金融领域中跨模型校准技术的探索,旨在消除不同评分法官模型之间的评判偏差。这些衍生工作共同拓展了可解释金融人工智能的研究边界,强化了智能体在合规严苛的金融环境中的实用基础。
数据集最近研究
最新研究方向
BigFinanceBench作为金融研究智能体的首个工作流程导向基准,精准回应了金融领域对可审计AI代理的迫切需求。在量化分析与监管合规并重的当下,该基准通过点权重评分体系,严格评估智能体在源选择、会计期间、定义、假设调整及计算全流程的审计能力。其50题分层子集设计,既缓解了基准污染问题,又维持了与完整928题集高度一致的模型排名(Kendall tau=0.956)。最新研究表明,该基准正推动金融AI从单纯追求答案正确性转向工作流透明度与可复现性,为高频交易、财报分析等高可靠场景提供了评估新范式,其发布的轨迹与评分数据更将加速可审计金融代理系统的迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务