遇见数据集

TR-DocVQA-Synth

收藏
Hugging Face2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

TR-DocVQA-Synth 是一个大规模合成的土耳其语文档视觉问答数据集,专为在土耳其商业文档上训练和评估多模态模型而设计。该数据集包含从结构化真实记录生成的 15,000 张文档图像和 235,000 个问答对。数据集聚焦于真实的土耳其文档布局和面向字段的推理,涵盖三大文档类别:1) 电子发票/电子存档风格发票,包含发票号、日期、买卖方公司、税号、商品表格、金额等典型字段;2) 商业合同,包含服务协议、货物购买协议、租赁协议等多种合同类型,涉及合同号、日期、合同方、金额、条款等字段;3) 报价/形式发票/采购订单文档,包含多种土耳其商业报价和订单表格,涉及文档号、日期、有效性、买卖方、产品/服务表格、折扣、增值税、总额等字段。数据集以 PNG 图像格式提供,并附带结构化的源元数据和问答注释。其目标是支持需要从文档图像中读取土耳其文本、理解文档布局、定位关键字段、推理表格以及使用视觉依据的文档证据回答问题的模型。在发布时,该数据集是首个专门围绕土耳其商业文档构建的大规模土耳其语文档视觉问答数据集,旨在弥补土耳其语在文档视觉问答资源方面的不足。数据集采用文档级别的训练/验证/测试划分,所有注释均以 JSONL 格式提供,并保留了用于生成文档和问答对的可审计结构化源记录。数据集为合成数据,避免了真实的个人或企业数据,适用于训练土耳其文档视觉问答模型、评估视觉语言模型、微调多模态大语言模型、基准测试 OCR+QA 流程等研究用途。

TR-DocVQA-Synth is a large-scale synthetic Turkish document visual question answering dataset designed for training and evaluating multimodal models on Turkish business documents. The dataset contains 15,000 document images and 235,000 question-answer pairs generated from structured real records. It focuses on authentic Turkish document layouts and field-oriented reasoning, covering three major document categories: 1) e-invoice/e-archive style invoices, including typical fields such as invoice number, date, buyer and seller companies, tax ID, item tables, and amounts; 2) business contracts, including various contract types such as service agreements, goods purchase agreements, and lease agreements, involving fields like contract number, date, parties, amounts, and clauses; 3) quotation/proforma invoice/purchase order documents, including various Turkish commercial quotation and order forms, involving fields such as document number, date, validity, buyer and seller, product/service tables, discounts, VAT, and total amounts. The dataset is provided in PNG image format with structured source metadata and QA annotations. Its goal is to support models that require reading Turkish text from document images, understanding document layouts, locating key fields, reasoning about tables, and answering questions using visual evidence from documents. At the time of release, it is the first large-scale Turkish document visual question answering dataset specifically built around Turkish business documents, aiming to address the scarcity of Turkish resources in document visual question answering. The dataset uses document-level train/validation/test splits, with all annotations provided in JSONL format and retaining auditable structured source records for generating documents and QA pairs. As synthetic data, it avoids real personal or corporate data and is suitable for research purposes such as training Turkish document VQA models, evaluating vision-language models, fine-tuning multimodal large language models, and benchmarking OCR+QA pipelines.

创建时间:
2026-06-03
原始信息汇总

数据集概述:TR-DocVQA-Synth

TR-DocVQA-Synth 是一个大规模、合成的土耳其语文档视觉问答(Document VQA)数据集。它专为训练和评估多模态模型在土耳其语商业文档上的理解能力而设计。

数据集规模

  • 文档总数:15,000 张文档图像
  • 问答对总数:235,000 个
  • 数据划分
    • 训练集:12,000 个文档,188,026 个问答对
    • 验证集:1,500 个文档,23,504 个问答对
    • 测试集:1,500 个文档,23,470 个问答对

文档类型

数据集包含三大类土耳其语商业文档:

  1. 发票文档 (Invoice Documents):模拟土耳其 e-Fatura / e-Arşiv 风格的发票,包含发票号、日期、买卖双方公司及税号、商品明细表、金额等信息。
  2. 合同文档 (Contract Documents):模拟商业合同,类型包括服务协议、商品采购协议、租赁协议、软件许可协议等,包含合同编号、签约方、合同金额、期限、罚则等信息。
  3. 报价/形式发票/采购订单文档 (Offer/Proforma/Purchase Order Documents):包括价格报价单、形式发票、采购订单等,包含文档编号、有效期、商品/服务表、折扣、总金额、交付与付款条款等信息。

数据集结构与格式

数据集的目录结构清晰,主要包含:

  • images/:按文档类型(invoice, contract, offer)组织的 PNG 图像文件。
  • annotations/:JSONL 格式的问答对注释文件(train.jsonl, val.jsonl, test.jsonl)。
  • documents/:JSONL 格式的文档级元数据文件。
  • source_records/:JSONL 格式的结构化源记录,用于生成文档,确保数据可重现和可审计。

注释格式

每个问答对以 JSON 格式记录,包含以下关键字段:

  • question_id: 唯一标识符
  • document_id: 所属文档 ID
  • document_type: 文档类型 (invoice/contract/offer)
  • image_path: 文档图像相对路径
  • question: 土耳其语自然语言问题
  • answer: 标准答案
  • field: 提供答案的源字段
  • split: 数据集划分 (train/val/test)

示例: json { "question_id": "contract_000001_q001", "document_id": "contract_000001", "document_type": "contract", "image_path": "images/contract/contract_000001.png", "question": "Sözleşme numarası nedir?", "answer": "SOZ202300000001", "field": "contract_no", "split": "val" }

数据集用途与特点

  • 主要任务:土耳其语文档视觉问答(Turkish Document Visual Question Answering)。
  • 数据生成:采用两阶段合成数据管线,先生成结构化源数据,再渲染成文档图像并生成问答对。所有答案皆源自结构化记录,而非 OCR 或模型猜测。
  • 布局多样性:为每种文档类型设计了多种模板,以减少模型对单一视觉结构的过拟合。
  • 核心价值:作为首个大规模聚焦土耳其语商业文档的 Document VQA 数据集,填补了该领域的空白。
  • 开源许可:数据以 CC BY 4.0 协议发布,代码以 MIT 协议发布。

注意事项与局限性

  • 合成数据:所有文档均为合成生成,不包含真实公司、个人或法律数据。
  • 局限:数据集不包含真实扫描件常见的模糊、歪斜、手写、折痕等噪声;可能未覆盖所有真实的土耳其文档布局;模板化渲染可能导致重复模式。
  • 评估建议:模型在此数据集上训练后,建议同时在真实或半真实的土耳其文档样本上进行评估,推荐使用 Exact Match、ANLS 等指标。
搜集汇总
数据集介绍
TR-DocVQA-Synth 数据集图片
构建方式
TR-DocVQA-Synth的构建采用两阶段合成数据流水线。第一阶段,针对发票、合同与报价单三大文档家族,首先生成包含公司名称、日期、金额、条款等所有可回答字段的结构化源记录,内容完全由合成方式生成,避免使用真实个人或企业数据;数值字段与计算通过确定性代码处理。第二阶段,将结构化记录渲染至多样化的文档模板中,为每条记录生成HTML、PDF、PNG格式的文档图像,并直接从源记录生成问题-答案对,确保答案与文档内容精确一致,而非依赖OCR或模型推测。最终得到15,000张文档图像与235,000个问答对,并保留完整的源记录以实现可复现。
使用方法
数据集的使用方法直观灵活。研究者可通过加载JSONL注释文件与对应PNG图像构建训练样本,例如使用PIL读取图像后与问题、答案组成三元组。对于指令微调的多模态模型,可设计土耳其语提示词引导模型基于文档图像回答问题。推荐评估指标包括精确匹配、ANLS、归一化字符串匹配及字段级准确率,针对货币与日期字段应考量格式化归一化。典型加载代码仅需遍历注释行、打开图像路径即可获取完整样本。该数据集适用于训练土耳其语文档VQA模型、微调多模态大语言模型、评估OCR+QA管道以及开发版面感知文档解析系统。
背景与挑战
背景概述
文档视觉问答(Document VQA)是近年来多模态学习与自然语言处理交叉领域的重要研究方向,旨在使模型能够理解文档图像中的文本、布局与语义信息,并据此回答自然语言问题。然而,现有的大规模文档VQA数据集多聚焦于英文等高资源语言,对土耳其语等语种的覆盖极为有限,且缺乏针对土耳其商业文档的结构化资源。为弥合这一空白,Ömer Faruk Aksoy、Yağız Ekrem Dalar、Nedim Mutlu Sezer、Ahmet Rıfat Öztürk与Feyzi Arda Salihoğlu于2026年发布了TR-DocVQA-Synth数据集,这是首个大规模、专为土耳其商业文档设计的合成文档VQA数据集。该数据集包含15,000张文档图像与235,000对问答数据,覆盖电子发票、商业合同及报价单/订单三类文档族,并采用结构化源记录生成与多模板渲染的两阶段合成流程,确保了数据的可复现性与可控性。TR-DocVQA-Synth的诞生为土耳其语文档理解研究提供了坚实的训练与评测基础,有力推动了低资源语言在多模态文档AI领域的发展。
当前挑战
TR-DocVQA-Synth所应对的领域核心挑战在于,土耳其语文档VQA领域长期缺乏大规模、高质量的结构化数据集,现有资源难以支撑模型在土耳其语商业文档上进行精准的文本识别、布局理解与字段级推理。该数据集本身在构建过程中亦面临多重挑战:首先,需生成避免真实个人与企业信息、同时具备土耳其语文本多样性的合成内容,包括公司名称、产品描述、税务标识符(VKN/TCKN)等字段,这对数据生成算法的真实性与合规性提出了高要求;其次,设计多样化的模板与布局以减少模型对单一视觉结构的过拟合,要求渲染流程兼顾形式化发票、长文本合同及表格密集型单据等多种风格;最后,确保问答标注与文档内容在字段层面上严格一致,避免因OCR误差或模型猜测导致的错配,同时维护文档级拆分以保证评测的公平性。
常用场景
经典使用场景
TR-DocVQA-Synth作为土耳其语文档视觉问答领域的标志性数据集,其经典使用场景聚焦于多模态模型在商业文档上的训练与评估。研究者将文档图像与自然语言问题配对,要求模型同时运用光学字符识别能力、土耳其语语义理解以及版面布局解析技术,从发票、合同或报价单中精准定位并提取字段级信息。例如,面对一张土耳其语电子发票图像,模型需要回答'Fatura tarihi nedir?'(发票日期是什么?)这类问题,这一过程考验了视觉语言模型在真实商业文档结构上的综合推理水平。
解决学术问题
该数据集有效填补了低资源语言文档理解领域的研究空白,解决了土耳其语商业文档自动解析缺乏大规模基准的学术困境。通过提供235,000个问题-答案对和结构化元数据,它使得研究者能够深入探究视觉语言模型在应对词形变化丰富的突厥语系时的泛化能力,并系统性评估模型对表格、关键值提取以及数字字段推理的鲁棒性。这一贡献催生了针对非英语商业文档的细粒度评估方法论,推动了多模态人工智能在跨语言文档智能处理方向的理论发展。
实际应用
在实际产业应用中,TR-DocVQA-Synth为土耳其语地区的企业级文档自动化处理提供了坚实的技术基础。基于该数据集训练的模型可部署于财务核算系统,实现电子发票关键信息的自动核验与入账;也可集成至合同管理平台,快速抽取签约方、金额及违约责任等条款内容。此外,在跨境电商领域,这些模型能够解析土耳其语报价单与订单文件,辅助国际贸易流程的数字化流转,显著降低人工审核成本并提升数据处理效率。
数据集最近研究
最新研究方向
当前,面向低资源语言的文档视觉问答研究正蓬勃发展,TR-DocVQA-Synth作为首个大规模土耳其语商业文档VQA数据集,精准填补了该领域的空白。该数据集以合成方式构建包含发票、合同及报价单等15,000张文档图像与235,000组问答对,聚焦于领域特定字段推理与表格理解。其前沿探索聚焦于提升多模态模型在土耳其语聚合性语言结构下的文本识别与布局感知能力,尤其关注税务标识符格式与本地化商业术语的应对策略。这一合成数据工作不仅为多语言文档智能提供了可复现的基准,更推动研究者关注低资源语言在文档理解中的独特挑战,所提出的结构化生成管线和跨文档风格评估方法对构建隐私合规且领域适配的文档VQA系统具有深远的启发意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务