遇见数据集

FinTrace

收藏
Hugging Face2026-08-10 更新2026-08-11 收录
官方服务:

资源简介:

FinTrace 是一个用于评估大语言模型(LLM)在金融查询中进行工具调用(函数调用)能力的基准数据集。它基于 Financial Modeling Prep (FMP) MCP 工具集构建,包含专家精心策划的多轮工具调用轨迹,覆盖 30 多种金融任务类别,并使用九项评估指标(涵盖动作正确性、执行效率、过程质量和输出质量)进行评价。数据集的核心是评估集(evaluation/testset.json),包含 800 条查询,每条查询配有一个模型输出轨迹和一个黄金参考轨迹。

FinTrace is a benchmark dataset for evaluating the tool-calling (function-calling) capability of large language models (LLMs) in financial queries. It is built based on the Financial Modeling Prep (FMP) MCP toolset, containing expert-curated multi-turn tool-calling trajectories covering over 30 financial task categories, and evaluated using nine metrics (covering action correctness, execution efficiency, process quality, and output quality). The core of the dataset is the evaluation set (evaluation/testset.json), which includes 800 queries, each with a model output trajectory and a golden reference trajectory.

创建时间:
2026-08-08
原始信息汇总

FinTrace 数据集概述

基本信息

  • 许可证:MIT
  • 语言:英语
  • 任务类型:问答(question-answering)
  • 标签:金融、工具调用、函数调用、智能体、轨迹、LLM评估
  • 数据集规模:n<1K(少于1000条)

数据集简介

FinTrace 是一个用于评估大型语言模型(LLM)在金融查询中工具调用(函数调用)能力的基准数据集。它基于 Financial Modeling Prep (FMP) MCP 工具集构建,包含专家策划的多轮工具调用轨迹,覆盖 30 多个金融任务类别,并使用包含动作正确性、执行效率、过程质量和输出质量四个维度的九项指标评估体系。

核心内容

评估集(evaluation/testset.json)

  • 规模:包含 800 条查询
  • 结构:每条记录将模型的输出轨迹黄金参考轨迹(由 LLM 评判者从三个前沿模型运行结果中选择的最佳轨迹)配对
  • 主要字段
    • id:唯一查询 ID
    • source_query:金融问题
    • task_type / task_type_bucket:任务类别(32 种类型 / 12 个桶)
    • resource / data_source:查询来源
    • difficulty_score / difficulty_tier:难度标注
    • traj_len_bin:轨迹长度分段
    • endpoints_called:输出轨迹中调用的 FMP 端点
    • reference_answer:标准答案
    • output_answer:输出轨迹的最终答案
    • reasoning:输出轨迹的推理摘要
    • output_trajectory:完整的多轮消息列表(推理、工具调用、工具响应)
    • golden_trajectories:同一查询的黄金参考轨迹

资源状态

路径 描述 状态
evaluation/testset.json 800 条查询的评估集,包含输出和黄金轨迹 ✅ 可用
trajectories/ 模型生成的轨迹,每个模型一个文件夹 🔜 即将推出
training/ FinTrace-Training SFT / DPO 偏好数据 🔜 即将推出

使用方式

由于轨迹数据嵌套较深,推荐直接下载原始 JSON 文件而非使用 load_dataset 方法。可通过 hf_hub_download 函数从 Hugging Face Hub 下载 evaluation/testset.json 文件。

相关资源

引用信息

如需引用 FinTrace,请参考数据集详情页中提供的 BibTeX 引用格式(作者包括 Cao, Yupeng 等人,发表于 arXiv 预印本 2604.10015,2026 年)。

搜集汇总
数据集介绍
FinTrace 数据集图片
构建方式
FinTrace数据集的构建依托于Financial Modeling Prep (FMP) MCP工具集,由领域专家精心策划了覆盖30余种金融任务类型的多轮工具调用轨迹。每个查询条目均包含模型输出轨迹与黄金参考轨迹,后者通过选取三个前沿模型运行结果中的最优者并经由LLM评判确定,确保了参考基准的可靠性与代表性。数据集还整合了任务类型、资源来源、难度等级及轨迹长度等多维度标注信息,形成了结构化的评估框架。
特点
FinTrace数据集的核心特色在于其全面的轨迹级评估视角,超越了传统的单一工具调用正确性检查。它采用九项指标的综合评估体系,涵盖动作正确性、执行效率、过程质量与输出质量等多个层面,能够细致刻画模型在长周期金融任务中的表现。此外,数据集包含800个精心设计的查询,覆盖32种任务类型和12个任务桶,每个条目均附带丰富的元数据,如难度评分、轨迹长度分类、调用的FMP端点等,为深度分析模型行为提供了坚实的数据基础。
使用方法
鉴于轨迹数据的高度嵌套结构,建议直接下载原始JSON文件而非通过datasets库加载。用户可通过Hugging Face的hf_hub_download函数获取evaluation/testset.json文件,随后利用Python的json模块便捷地读取数据。每项记录包含模型输出轨迹与黄金轨迹,支持多角度对比分析,适用于评估LLM工具调用智能体的性能。数据集的公开代码库提供了详细的评估脚本,便于复现论文中的实验结果或进行定制化评估。
背景与挑战
背景概述
FinTrace数据集诞生于大型语言模型(LLM)工具调用能力迅猛发展的时代背景下,由Yupeng Cao、Haohang Li等来自多所高校与研究机构的研究人员于2026年构建,其核心研究问题聚焦于金融领域长时程任务中LLM工具调用轨迹的整体性评估。该数据集基于金融建模预备(FMP)MCP工具集,精心构建了包含800条专家筛选的多轮工具调用轨迹,覆盖30余种金融任务类别,并首创九项评估指标从动作正确性、执行效率、过程质量与输出质量四个维度进行全方位度量。作为COLM 2026的预印本研究成果,FinTrace填补了金融领域工具调用评估基准的空白,为金融智能体研究提供了标准化评估平台,推动了该领域的实证研究进展。
当前挑战
FinTrace数据集的构建与评估面临多重挑战。于领域问题层面,金融任务具有长时程、多步骤、高复杂性及对数据准确性极度敏感的特点,现有工具调用评估基准多局限于单步或短链操作,难以刻画真实金融场景中的轨迹级决策过程,且缺乏对过程质量与执行效率的综合考量,导致评估结果与实际应用脱节。于构建过程层面,如何从海量金融查询中筛选出代表性样本并确保任务类型覆盖的均衡性,如何融合专家经验以定义高质量黄金参考轨迹(从三个前沿模型候选轨迹中经LLM裁判精心遴选),以及如何设计多维度的难度标注体系以精确刻画轨迹复杂度,均是构建过程中的关键挑战,对数据集的信度与效度提出了严峻考验。
常用场景
经典使用场景
FinTrace作为专为金融领域设计的工具调用智能体评估基准,其核心应用在于对大型语言模型(LLM)在多轮对话中调用外部金融工具(如Financial Modeling Prep的MCP工具集)的能力进行系统性评测。该数据集精心构建了覆盖30余种金融任务类别的专家级多轮轨迹数据,每条查询均包含模型输出轨迹与黄金参考轨迹的配对,为研究者提供了一个标准化、高可信度的测试平台。其经典使用场景聚焦于长时域、多步骤金融查询,如公司财务分析、市场数据聚合和投资组合评估,通过九项指标全面衡量动作正确性、执行效率、流程质量及输出质量,从而精准刻画智能体在真实金融任务中的工具调用能力。
实际应用
在产业实践中,FinTrace可广泛服务于金融科技、智能投顾及自动化报告生成等场景。金融机构可借其评估候选LLM智能体在实时行情查询、财务指标计算和风险指标监控中的稳定度,从而甄选出最适配业务需求的模型。量化交易团队利用该数据集验证智能体在多源数据整合与复杂指令解析上的可靠性,以支撑高频决策系统。此外,金融教育平台可将其用作仿真训练环境,通过对比黄金轨迹反馈,提升AI助手的专业应答质量。FinTrace所驱动的工具调用优化,正逐步渗透至智能客服、合规审查等环节,成为连接前沿大模型技术与金融业务落地的重要桥梁。
衍生相关工作
FinTrace的发布催生了一系列衍生研究。其配套的FinTrace-Training偏好数据集(含SFT/DPO数据)为微调金融工具调用模型提供了基准资源,衍生出面向轨迹级优化的强化学习算法探索。研究者基于其九项指标框架,进一步构建了针对多智能体协作或跨域迁移的评估体系。论文中设立的难度分层与任务分类标准,被后续工作采纳为金融智能体能力图谱的参考范式。同时,其黄金轨迹生成与LLM裁判方法,启发了自动化评估协议的通用设计,推动了工具调用评测领域从静态集到动态金标准的演进,相关方法论正拓展至医疗、法律等其他专业领域的智能体测评之中。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务