sujet-ai/Sujet-Finance-QA-Vision-100k
收藏资源简介:
Sujet-Finance-QA-Vision-100k是一个包含超过100,000个问题-答案对的综合数据集,这些对源自9,800多张金融文档图像。该数据集旨在支持金融文档分析和视觉问答领域的研究和开发。数据集包括9,801张独特的金融文档图像和107,050个问题-答案对,涵盖多种金融文档类型,且所有内容均为英文。
The Sujet-Finance-QA-Vision-100k dataset is a comprehensive collection containing over 100,000 question-answer pairs derived from more than 9,800 financial document images. This dataset is designed to support research and development in the field of financial document analysis and visual question answering. It includes 9,801 unique financial document images and 107,050 question-answer pairs, all in English. It consists of a training set with 9,212 images and 100,629 QA pairs, and a validation set with 589 images and 6,421 QA pairs. The dataset was created by using a model to generate diverse question-answer pairs based on detailed annotations, addressing challenges in fine-tuning small Vision-Language Models due to extensive context window size.
SujetAIs Financial QA Vision Dataset
数据集描述
Sujet-Finance-QA-Vision-100k 是一个综合数据集,包含超过 100,000 个问答对,源自 9,800 多张金融文档图像。该数据集旨在支持金融文档分析和视觉问答领域的研究和开发。
关键特征
- 9,801 张独特的金融文档图像
- 107,050 个问答对
- 英语语言
- 多样化的金融文档类型
数据集概述
- 训练集: 9,212 张图像,100,629 个问答对
- 验证集: 589 张图像,6,421 个问答对
- 总计: 9,801 张图像,107,050 个问答对
数据集创建
该数据集是基于之前的 Sujet-Finance-Vision-10k 数据集的进化版本。通过使用 meta-llama/Meta-Llama-3-70B 模型生成多样化的问答对,解决了小规模视觉语言模型在微调过程中对大量上下文窗口的需求问题。
数据字段
doc_id: 文档的唯一标识符content: 文档内容的丰富注释,用于创建问答对image: 金融文档图像qa_pairs: 包含问答对的 JSON 字符串
局限性和偏差
- 问答对基于 GPT-4 注释生成,并使用 Llama 3 70B 进行细化,可能存在与图像信息不完全对应的情况。
- 数据集主要关注英语金融文档,可能不适用于其他语言或金融系统。
伦理考虑
- 数据集中的金融信息不应未经核实用于现实世界的金融决策。
- 数据集可能反映原始金融文档或注释过程中存在的偏差。
许可证
该数据集基于 Apache 2.0 许可证。
免责声明
Sujet AI 提供的数据集“按原样”提供,不提供任何明示或暗示的保证。用户在使用数据集时应自行判断,并验证信息以满足其特定用途。




