遇见数据集

V-FiLLM

收藏
arXiv2026-08-11 更新2026-08-13 收录
官方服务:

资源简介:

V-FiLLM是由苏黎世联邦理工学院构建的金融推理基准框架,旨在评估大语言模型在结构化表格数据上的组合推理能力。该数据集基于合成财务报表,涵盖15家合成公司2020至2025年的财务数据,通过可执行计算树生成问题,支持控制推理深度(0至2层)、表达式宽度、金融概念复杂度及上下文大小等难度轴。数据集创建过程采用确定性流水线:从合成数据构建带语义元数据的原子,采样类型化二值表达式树,并渲染为自然语言问题,同时自动验证答案。该基准旨在解决金融表格推理中领域知识与组合算术的挑战,提供可扩展、无标注成本的评估工具,并揭示模型在深层推理及对抗性扰动下的脆弱性。

V-FiLLM is a financial reasoning benchmark framework developed by ETH Zurich, designed to evaluate the compositional reasoning capabilities of large language models (LLMs) on structured tabular data. This dataset is built on synthetic financial statements, covering financial data of 15 synthetic companies spanning from 2020 to 2025. Questions are generated via executable computation trees, and the framework supports controlling multiple difficulty dimensions including reasoning depth (0 to 2 layers), expression width, financial concept complexity, and context size. The dataset creation follows a deterministic pipeline: constructing atomic units with semantic metadata from synthetic data, sampling typed binary expression trees, rendering them into natural language questions, and automatically validating the corresponding answers. This benchmark aims to address the challenges of domain knowledge and compositional arithmetic in financial tabular reasoning, providing a scalable, annotation-free evaluation tool, and uncovering the vulnerabilities of models under deep reasoning and adversarial perturbations.

创建时间:
2026-08-11
原始信息汇总

项目概述

这是一个关于金融推理中LLM基准测试的研究项目,专注于评估语言模型在组合性金融推理任务上的表现。项目通过生成合成金融电子表格、采样表达式树并绑定生成多步骤问答对,在多种对抗条件下(数据损坏、棘手措辞、提示注入)评估语言模型的性能。

核心流程

项目采用两阶段数据生成 + 基准评估的工作流:

  1. 数据生成阶段:首先构建底层金融电子表格数据及其"数据障碍"变体(基线干净数据、放大数字、额外乘数、提示注入),然后从这些数据中采样表达式树,生成带已知标准答案的英文问题(可应用"查询障碍"改变措辞)。
  2. 评估阶段:将生成的数据集交给LLM(本地模型或API模型),在容差范围内将答案与数值标准答案进行评分比较。还支持对抗性评估、LoRA微调以及多轮问题分解。

项目结构

  • script/compiler_pipeline_adversarial/ — 当前活跃的流水线,负责合成数据生成、表达式树采样、问题渲染及障碍应用
  • script/benchmark/ — LLM评估模块(本地模型、API模型、对抗性评估),包含结果比较与可视化工具
  • script/lora/ — LoRA微调模块,支持监督微调和思维链变体
  • script/Multi-turn/ — 将复合问题分解为多轮子问题链
  • output/ — 存放生成的数据集与评估结果,包含10q/90q/两种数据集风格,dataset_output/为最终合并数据集,output_llm/存放原始评估结果
  • parser/ — 独立的CSV/PDF与JSON转换工具,用于手动检查或重新格式化数据集
  • temp/ — 已废弃的历史流水线版本,仅供参考

数据集特点

生成的数据集包含两个"风格"变体:

  • 10q/ — 季度报告风格的小型问答数据集
  • 90q/ — 固定的90题基准数据集(混合操作符和深度)

项目设计了两个独立的对抗轴:

  • 数据障碍:包括放大数字、额外乘数、提示注入(单元格值中嵌入对抗性指令)
  • 查询障碍:包括单位缩放变化、无用信息、条件表述、否定表述

快速开始

数据生成

bash cd script/compiler_pipeline_adversarial python data_obstacles.py # 生成各数据障碍变体 python query_obstacles.py # 生成各查询障碍变体及单元格级损坏

LLM评估

bash python script/benchmark/run_llm_eval.py --models Qwen3.5-4B Qwen3.5-9B --datasets 10q 90q mt --tol 0.1 python script/benchmark/run_llm_eval_api_call.py --limit 10 # API模型 python script/benchmark/run_llm_eval_api_call_adversarial.py --datasets baseline prompt_injection # 对抗性评估

LoRA微调

bash python script/lora/lora2.py --limit 200 --epochs 3 python script/lora/lora2_cot.py --limit 200 --epochs 3 --gen-tokens 512 --tol 0.01

技术依赖

主要依赖包括:torchtransformerspeft/trl(LoRA微调)、anthropic/openai(API评估)、pandas/numpy/scipypdfplumber/reportlab(PDF解析)、matplotlib/plotly(可视化)。

搜集汇总
数据集介绍
构建方式
V-FiLLM数据集通过一种确定性的生成框架构建,该框架首先构造合成金融电子表格,涵盖模拟10-Q申报的杂乱格式与规则化简洁表格两种形态。随后,将表格内容分解为携带语义元数据(如财务概念、公司、年份等)的类型化原子,并采样可执行的计算树,其叶子节点为原子,内部节点为算术运算或派生财务概念(如毛利润、净利润)。经类型感知的约束采样与绑定环境确保表达式有效后,通过自底向上的语义渲染将计算树转化为自然语言问题,并直接计算表达式获得正确答案。整个过程无需人工标注,可任意规模扩展,且答案由构造保证正确。
使用方法
使用V-FiLLM时,研究者可直接下载生成的问答对及其元数据,按需筛选特定难度区间(如深度0-5)进行模型评估,计算准确率。针对鲁棒性分析,可利用提供的扰动工具(如缺失值、OCR字符替换、跨表污染等)测试模型在噪声表格下的表现。此外,该框架支持生成训练集,用于构建验证链式思维(CoT)数据,通过LoRA等参数高效微调方法优化模型,实验表明这种微调能提升模型在自身基准及外部金融数据集(如FinQA)上的推理能力。
背景与挑战
背景概述
V-FiLLM(Verified Financial LLM Reasoning Benchmark)是苏黎世联邦理工学院(ETH Zürich)与Aisot Technologies Ltd合作,于2026年推出的金融推理基准框架。该数据集由Alicia Larsen、Victoire Laurent、Aulia Kharis Rakhmasari、Lara Turgut及Nino Antulov-Fantulin等人创建,旨在解决大语言模型在结构化表格数据上金融推理能力评估不足的问题。不同于依赖人工标注的现有基准,V-FiLLM通过可执行计算树从真实表格数据中自动生成问题与答案,确保答案构建上正确,并消除了生成器的误差率,实现零注释成本的任意规模扩展。该框架提供四个独立可控的难度维度:计算深度、表达式广度、金融概念复杂度和上下文大小,为系统性评估模型在组合式金融推理中的表现提供了可靠工具。通过实验揭示,模型准确率随推理深度增加下降高达51%,在对抗性数值扰动下下降47%,凸显了金融表格推理中鲁棒性的关键挑战。V-FiLLM的提出填补了金融QA领域缺乏可控难度和可验证答案基准的空白,对推动金融推理模型的评估与优化具有重要意义。
当前挑战
V-FiLLM所面临的挑战源于金融推理的固有复杂性。领域层面,模型需同时满足多个约束:从结构化表格中正确检索数值、掌握领域特定金融概念及其公式,并具备跨异质数量(如货币金额、比率、比值)的多步算术组合能力。当前模型在推理深度增加时准确率显著下降(如Gemma-31B从6步的85%降至8步的55%),且在对抗性扰动(如OCR字符替换、单位改变)下性能骤降(如10-Q表格中单位改变致准确率降至3%),表明模型在鲁棒性和组合推理方面仍有较大不足。基准构建层面,挑战在于确保生成问题的语义无歧义、避免受保护金融概念被等价算术表达式绕过,以及控制推理难度与真实文档噪声(如格式混乱、混合单位)的平衡。此外,现有基准因依赖人工标注而难以扩展至广阔推理深度分布,且常将源噪声与推理失误混为一谈,V-FiLLM通过确定性生成流程缓解了这些问题,但仍需应对多轮推理中错误传播和轻量级微调泛化性等后续挑战。
常用场景
经典使用场景
V-FiLLM作为金融推理基准框架,其经典使用场景在于系统评估大型语言模型在结构化表格数据上的组合推理能力。该框架通过可执行计算树生成问题,并精确控制推理深度、表达式广度、金融概念复杂度和上下文规模四个维度,为模型性能的细粒度剖析提供了标准化的测试平台。研究者可借助混合深度问题集、多轮对话变体以及对抗性扰动版本,全面度量模型在复杂金融问答任务中的准确率、鲁棒性和泛化能力,从而揭示不同规模模型在真实财务报表推理中的优势与短板。
解决学术问题
V-FiLLM直面金融推理基准中标注成本高昂、难度不可控及错误根源混淆等核心症结。其独创的确定性生成管线,通过类型感知的表达式树采样,实现零人工标注的自动问答构建,突破规模瓶颈。该基准精准分离检索误差与推理缺陷,使模型失败模式可归因于特定计算步骤,进而量化推理深度与性能衰减的关联。此外,对抗性扰动测试暴露了模型对单位漂移和字符污染的脆弱性,为鲁棒金融推理研究提供了实证基础,弥补了现有基准在可扩展性与可解释性上的学术空白。
实际应用
在金融科技实践中,V-FiLLM可用于验证自动化财务分析系统的可靠性,涵盖财报解读、风险评估与投资决策支持等场景。其合成表格模拟了10-Q文件与规范化报表两种格式,能够检测模型在信息提取、多步计算及概念应用中的潜在失误,指导系统在噪声环境下的容错设计。此外,基于已验证思维链的LoRA微调方法,为低资源机构定制轻量级金融推理模型提供了可行路径,有望提升智能投顾、合规审查等应用的推理精度与稳健性,推动AI在真实金融业务中的安全落地。
数据集最近研究
最新研究方向
在金融大语言模型评测领域,现有基准多依赖人工标注或模型辅助抽取,难以精确控制推理难度与隔离噪声干扰。V-FiLLM框架以可执行计算树为锚点,借由合成财务表格自动生成验证问答对,实现了推理深度、表达式广度、金融概念复杂度及上下文规模四维难度的独立调控,突破了传统基准的扩展瓶颈。该数据集的前沿研究方向聚焦于推理深度对模型性能的显著影响、对抗性数值扰动下的鲁棒性挑战以及轻量级LoRA微调对组合推理能力的提升,为构建可复现、可扩展的金融推理评估体系提供了新范式。
相关研究论文
  • 1
    V-FiLLM: Verified Financial LLM Reasoning Benchmark苏黎世联邦理工学院; Aisot Technologies Ltd · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务