遇见数据集

vifinqa

收藏
Hugging Face2026-08-23 更新2026-08-24 收录
官方服务:

资源简介:

ViFinQA 是一个面向越南财务报告查询和自动计算的数据集,旨在将财务报告 OCR 文本转化为可执行的 Pandas 代码。数据集包含原始财务报告文本文件(.txt 格式,来自越南企业的财务报表)、用于开发和测试的模拟 CSV 数据(mock_csv/)、从原始文本自动提取的 CSV 文件(processed_csv/)以及一个合成训练集(synthetic_train/),该合成集可能包含问题-代码-答案对。此外,还提供了一个包含 1012 个测试问题的 JSONL 文件(questions.jsonl),这些问题涉及财务指标(如营收、净利润等)的查询,但未提供答案。项目的输出格式要求每个问题对应一个 JSON 对象,包含问题 ID、问题文本、答案(浮点数)、相关文档、相关表格、证据 CSV 路径以及 Pandas 查询语句。数据集的主要应用场景是训练和评估文本到 Pandas 的自动化系统,特别适用于金融领域的信息抽取和数值推理任务。

ViFinQA is a dataset for Vietnamese financial report query and automatic calculation, aiming to convert financial report OCR text into executable Pandas code. The dataset includes raw financial report text files (.txt format from Vietnamese enterprise financial statements), simulated CSV data for development and testing (mock_csv/), automatically extracted CSV files from raw text (processed_csv/), and a synthetic training set (synthetic_train/) which may contain question-code-answer pairs. Additionally, a JSONL file with 1012 test questions (questions.jsonl) is provided, covering queries of financial metrics (e.g., revenue, net profit) but without answers. The output format requires each question to correspond to a JSON object containing question ID, question text, answer (float), relevant documents, relevant tables, evidence CSV path, and Pandas query statement. The main application scenario is training and evaluating text-to-Pandas automation systems, particularly suitable for information extraction and numerical reasoning tasks in the financial domain.

创建时间:
2026-08-23
原始信息汇总

ViFinQA 数据集概述

数据集简介

ViFinQA是一个面向越南语金融领域的数据集,旨在实现从越南财务报表(BCTC)的OCR文本到可执行Pandas代码的自动转换。该数据集围绕Text-to-Pandas任务构建,将自然语言金融问题转换为可执行的Pandas查询。

核心任务

  • 任务类型:Text-to-Pandas,即根据自然语言问题自动生成可执行的Pandas代码
  • 输入:财务报表OCR文本(.txt格式)中的金融问题
  • 输出:可用于计算答案的Pandas查询及对应的数值结果

数据规模与内容

  • 测试问题数:包含1012个测试问题,存储于questions.jsonl文件中
  • 数据来源:越南上市公司的财务报表(BCTC),涵盖OCR文本格式的原始文件
  • 数据结构:原始数据为.txt格式的OCR识别文本,需要进一步处理为结构化的CSV表格

数据组织架构

原始数据目录 (data/raw_vifinqa/)

  • 存放竞赛组织方提供的财务报表文本文件(.txt)和问题文件(questions.jsonl)

处理后数据目录 (data/processed_csv/)

  • 存放从.txt文件中自动提取的CSV格式表格数据
  • 标准CSV结构包含三列:Chỉ tiêu(指标)、Giá trị(数值)、Đơn vị(单位)

合成训练数据目录 (data/synthetic_train/)

  • 包含自动生成的合成数据集,用于训练模型

数据格式规范

提交格式(submission.json)

每条记录包含以下字段:

  • id:问题标识符(整数)
  • question:金融问题内容(字符串)
  • answer:数值结果(浮点数)
  • relevant_docs:相关报告代码列表
  • relevant_tables:相关表格列表,格式为<报告ID>|<表格位置>
  • evidence:用于执行Pandas查询的CSV文件列表
    • variable:DataFrame变量名
    • csv_path:CSV相对路径
  • pandas_query:可执行的Pandas查询语句(字符串)

报告代码规范

报告代码从文件路径中提取,去除.txt后缀后取路径最后一部分,例如:AAA_financial_statements_2015_consolidated

处理流程

  1. 数据提取:将OCR文本文件自动转换为结构化CSV格式
  2. 问题检索:从问题中提取股票代码和年份,检索最相关的1-3个CSV文件
  3. 代码生成:使用开源LLM(≤14B参数)生成Pandas代码
  4. 自修正机制:代码执行出错时自动捕获错误并重新生成(重试3-5次)
  5. 结果输出:将结果写入submission.json并打包为submission.zip

技术约束

  • 模型限制:仅允许使用参数不超过140亿(14B)的开源模型,如deepseek-r1:14b,禁止使用OpenAI/Claude等商业API
  • 提交限制:每日最多提交10次,私有测试阶段每日最多5次

应用场景

  • 自动化财务报表分析
  • 金融领域自然语言处理
  • 财务数据查询与计算自动化
  • 越南语金融信息抽取与推理
搜集汇总
数据集介绍
vifinqa 数据集图片
构建方式
ViFinQA数据集是面向越南语金融报告自动查询与计算任务构建的Text-to-Pandas基准资源,其构建流程深植于真实业务场景。原始语料源自越南上市公司财务报告的OCR文本(.txt格式),涵盖公司名称、报表类型及年份等关键信息。构建团队首先设计数据抽取模块,将非结构化的OCR文本自动解析为结构化的CSV表格,并对噪声字符、跨行文本、列对齐偏移等OCR固有误差进行专项清洗。随后,利用基于BM25与向量数据库的混合检索机制,结合硬性过滤器(依据股票代码与年份)精准定位相关数据表。为增强模型的泛化能力,团队还开发了合成数据生成器,在源CSV上自动生成大量(问题、Pandas代码、答案)三元组,用以扩充训练语料库。最终,整个流程通过流水线脚本串联,构建出包含1012道测试问题及完整证据链、可执行Pandas查询语句的数据集体系。
特点
ViFinQA数据集的独特之处在于其紧密围绕可执行代码生成与自纠错机制进行设计。每个问题均配套有直接可运行的Pandas查询语句及对应的结构化证据列表(evidence),该列表明确指向具体的CSV文件路径与变量名,使得验证自动化的答案生成过程成为可能。数据集严格规定使用不超过14B参数量的开源大语言模型,这真实模拟了资源受限环境下金融智能助手的部署要求。其标注信息丰富,包含问题ID、数值型答案、关联文档标识、具体表格位置及多变量数据框(如df1、df2)定义,为评估检索模块与推理模块的联合性能提供了细粒度依据。此外,数据构建强调处理OCR噪声与多表关联的复杂性,使数据集既贴近实际金融文档的杂乱特性,又确保了答案的可追溯性与可复现性。
使用方法
使用ViFinQA数据集时,研究者可依据其分层结构构建端到端的金融问答系统。典型流程为:给定一个自然语言财务问题,系统先通过检索模块从已解析的CSV库中返回最相关的1至3个数据表,接着由推理代理基于这些表格的结构和内容指令生成Pandas代码,进而通过代码执行得到最终数值答案。该数据集支持零样本或小样本评估,代码可运行性允许直接利用官方评测脚本核对答案正确性。对于子任务研究,如仅关注表格解析或问题理解,可单独使用其提供的解析后CSV及标注的表格位置信息。同时,由于包含合成训练数据接口,用户可按需调整合成数据生成参数以训练更强大的代码生成模型。评估时,提交的压缩包需遵循严格格式规定(如文件层级、路径前缀),这确保了跨系统对比的公平性。
背景与挑战
背景概述
ViFinQA数据集由越南人工智能竞赛Road-to-AI的参赛团队于近期构建,旨在应对越南语财务报表(BCTC)中OCR文本到可执行Pandas代码的自动转换难题。该数据集由Hồng Hà、Khánh Ngọc和Hữu Nghĩa三位成员协作开发,核心研究问题是如何从非结构化的OCR文本中精准提取财务指标,并通过检索与代码生成实现自动化问答。ViFinQA包含1012个测试问题,覆盖多家越南上市公司(如VNM、VJC)的多年财务数据,其创新之处在于引入了Text-to-Pandas任务范式,即将自然语言查询转化为可执行的Pandas代码,从而在财务分析领域实现了从数据提取到推理的端到端自动化。该数据集的发布不仅推动了越南语金融NLP的研究,也为低资源语言下的表格推理提供了宝贵的基准资源,对智能财务助手和自动化审计系统的发展具有重要影响。
当前挑战
ViFinQA的构建面临多重挑战。领域层面,金融文本的表格结构复杂且包含大量数字、单位及年份信息,OCR噪声(如列错位、断行)导致数据提取困难,传统基于规则的解析鲁棒性不足。同时,查询需跨多表关联(如利润表与资产负债表),对时间敏感性和数值精度要求极高。构建过程中,团队需设计高效的数据提取流程以处理原始.txt文件,确保生成的CSV格式统一;检索模块需应对公司代码(Ticker)和年份的精准抽取,以及指标名称的同义变体匹配;生成Pandas代码依赖≤14B的开放模型,需处理模型规模限制下的语义理解与代码生成错误,并通过自我修正机制(3-5次重试)提升正确率。此外,严格限制使用外部LLM API,增加了模型调优难度,而提交文件的格式规范(如ZIP结构、JSON schema)也要求全流程严密协作,确保数据一致性与可复现性。
常用场景
经典使用场景
ViFinQA数据集为金融领域自然语言处理与结构化数据查询的交叉研究提供了独特的基准平台。其核心使用场景围绕将基于越南语财务报告(OCR文本形式)的复杂金融问题自动转化为可执行Pandas代码,并通过执行代码从标准化表格中检索精准答案。该数据集包含1012道经过精心设计的测验题,覆盖收入、利润、资产等财务指标的提取与计算,要求模型具备跨模态理解能力——既能解析非结构化的自然语言,又能映射到结构化表格的语义模式。研究者通常以此为基础,开发并评估端到端的文本到Pandas(Text-to-Pandas)系统,推动自动化财务分析从理论走向实践。
解决学术问题
ViFinQA直面了金融智能问答中从非结构化文本到结构化查询的转化鸿沟,这一挑战在非英语环境下尤为突出。它解决了传统问答系统在财务领域缺乏高质量标注数据的问题,尤其针对越南语财务文本的OCR噪声、表格结构多样性以及财务指标术语歧义等现实障碍。通过提供标准化的评估协议(包括提交格式、证据引用及Pandas查询的可复现性),该数据集促进了检索增强生成(RAG)、语义解析及代码生成等技术的实证比较,有力地推动了低资源语言下智能财务分析的研究进展,并为金融文档理解的学术研究设立了可靠的试验场。
衍生相关工作
ViFinQA的提出激发了多项衍生研究工作,主要集中在三个方向:其一,开发针对财务领域的大语言模型微调策略,例如利用合成数据生成技术(如synthetic_generator)扩充训练集,增强模型在低资源场景下的代码生成与自我纠错能力;其二,构建更高效的表格检索机制,结合BM25与向量数据库(如FAISS)的混合检索策略,后续工作探索了基于语义理解的表格列级对齐,以精准匹配财务指标名称;其三,设计强化的agent工作流,通过多轮交互和错误信息反馈实现代码自动修复,此范式后来被推广至其他垂直领域的文本到SQL/API任务,形成了通用性验证框架。此外,该数据集还促进了针对越南语金融OCR清洗工具链的研发,带动了数据集本身的质量提升与跨语言迁移研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务