vifinqa
收藏资源简介:
ViFinQA 是一个面向越南财务报告查询和自动计算的数据集,旨在将财务报告 OCR 文本转化为可执行的 Pandas 代码。数据集包含原始财务报告文本文件(.txt 格式,来自越南企业的财务报表)、用于开发和测试的模拟 CSV 数据(mock_csv/)、从原始文本自动提取的 CSV 文件(processed_csv/)以及一个合成训练集(synthetic_train/),该合成集可能包含问题-代码-答案对。此外,还提供了一个包含 1012 个测试问题的 JSONL 文件(questions.jsonl),这些问题涉及财务指标(如营收、净利润等)的查询,但未提供答案。项目的输出格式要求每个问题对应一个 JSON 对象,包含问题 ID、问题文本、答案(浮点数)、相关文档、相关表格、证据 CSV 路径以及 Pandas 查询语句。数据集的主要应用场景是训练和评估文本到 Pandas 的自动化系统,特别适用于金融领域的信息抽取和数值推理任务。
ViFinQA is a dataset for Vietnamese financial report query and automatic calculation, aiming to convert financial report OCR text into executable Pandas code. The dataset includes raw financial report text files (.txt format from Vietnamese enterprise financial statements), simulated CSV data for development and testing (mock_csv/), automatically extracted CSV files from raw text (processed_csv/), and a synthetic training set (synthetic_train/) which may contain question-code-answer pairs. Additionally, a JSONL file with 1012 test questions (questions.jsonl) is provided, covering queries of financial metrics (e.g., revenue, net profit) but without answers. The output format requires each question to correspond to a JSON object containing question ID, question text, answer (float), relevant documents, relevant tables, evidence CSV path, and Pandas query statement. The main application scenario is training and evaluating text-to-Pandas automation systems, particularly suitable for information extraction and numerical reasoning tasks in the financial domain.
ViFinQA 数据集概述
数据集简介
ViFinQA是一个面向越南语金融领域的数据集,旨在实现从越南财务报表(BCTC)的OCR文本到可执行Pandas代码的自动转换。该数据集围绕Text-to-Pandas任务构建,将自然语言金融问题转换为可执行的Pandas查询。
核心任务
- 任务类型:Text-to-Pandas,即根据自然语言问题自动生成可执行的Pandas代码
- 输入:财务报表OCR文本(.txt格式)中的金融问题
- 输出:可用于计算答案的Pandas查询及对应的数值结果
数据规模与内容
- 测试问题数:包含1012个测试问题,存储于
questions.jsonl文件中 - 数据来源:越南上市公司的财务报表(BCTC),涵盖OCR文本格式的原始文件
- 数据结构:原始数据为
.txt格式的OCR识别文本,需要进一步处理为结构化的CSV表格
数据组织架构
原始数据目录 (data/raw_vifinqa/)
- 存放竞赛组织方提供的财务报表文本文件(.txt)和问题文件(questions.jsonl)
处理后数据目录 (data/processed_csv/)
- 存放从
.txt文件中自动提取的CSV格式表格数据 - 标准CSV结构包含三列:
Chỉ tiêu(指标)、Giá trị(数值)、Đơn vị(单位)
合成训练数据目录 (data/synthetic_train/)
- 包含自动生成的合成数据集,用于训练模型
数据格式规范
提交格式(submission.json)
每条记录包含以下字段:
- id:问题标识符(整数)
- question:金融问题内容(字符串)
- answer:数值结果(浮点数)
- relevant_docs:相关报告代码列表
- relevant_tables:相关表格列表,格式为
<报告ID>|<表格位置> - evidence:用于执行Pandas查询的CSV文件列表
- variable:DataFrame变量名
- csv_path:CSV相对路径
- pandas_query:可执行的Pandas查询语句(字符串)
报告代码规范
报告代码从文件路径中提取,去除.txt后缀后取路径最后一部分,例如:AAA_financial_statements_2015_consolidated
处理流程
- 数据提取:将OCR文本文件自动转换为结构化CSV格式
- 问题检索:从问题中提取股票代码和年份,检索最相关的1-3个CSV文件
- 代码生成:使用开源LLM(≤14B参数)生成Pandas代码
- 自修正机制:代码执行出错时自动捕获错误并重新生成(重试3-5次)
- 结果输出:将结果写入
submission.json并打包为submission.zip
技术约束
- 模型限制:仅允许使用参数不超过140亿(14B)的开源模型,如deepseek-r1:14b,禁止使用OpenAI/Claude等商业API
- 提交限制:每日最多提交10次,私有测试阶段每日最多5次
应用场景
- 自动化财务报表分析
- 金融领域自然语言处理
- 财务数据查询与计算自动化
- 越南语金融信息抽取与推理




