遇见数据集

doc2json-vlm-full

收藏
Hugging Face2026-08-04 更新2026-08-05 收录
官方服务:

资源简介:

Doc2JSON VLM Full 是一个用于微调视觉语言模型(VLM)的合成数据集,包含俄罗斯文档的图像,模型能够根据动态指定的JSON模式从中提取结构化数据。该数据集于2026年8月4日发布,包含3,280个样本,源自700个原始文档,涵盖15种文档类型:俄罗斯护照、付款发票、验收证书、UPD(统一转让文件)、供应合同、服务合同、合同协议、租赁合同、许可协议、规格、附加协议、对账报告、TORG-12、发票、付款单。数据集分为训练集(2,768个样本,590个原始文档)和验证集(512个样本,110个原始文档),按 source_document_id 进行分割,确保同一文档的页面和增强版本不会跨分割出现。每个样本包含:图像(WebP格式)、对话(ShareGPT风格的提示和JSON目标)、元数据(文档类型、原始文档ID、模式语言为俄语或英语、模板变体、增强索引、是否为合成数据等)。该数据集适用于文档AI、视觉语言模型训练、动态JSON提取等任务。注意:所有数据均为合成数据,不包含真实个人信息。

Doc2JSON VLM Full is a synthetic dataset for fine-tuning Vision-Language Models (VLMs). It comprises images of Russian-language documents, enabling models to extract structured data from them in accordance with dynamically specified JSON schemas. Released on August 4, 2026, the dataset contains 3,280 samples derived from 700 original documents, covering 15 document types: Russian passport, payment invoice, acceptance certificate, UPD (Unified Transfer Document), supply contract, service contract, contract agreement, lease contract, licensing agreement, specification, supplementary agreement, reconciliation report, TORG-12, invoice, and payment slip. The dataset is split into a training set (2,768 samples, 590 original documents) and a validation set (512 samples, 110 original documents) based on source_document_id, ensuring that pages and augmented versions of the same original document do not appear across different splits. Each sample includes an image in WebP format, a conversation with ShareGPT-style prompts and JSON targets, and metadata such as document type, original document ID, schema language (either Russian or English), template variant, augmentation index, and whether the data is synthetic. This dataset is suitable for tasks including document AI, vision-language model training, dynamic JSON extraction, and more. Note: All data is synthetic and contains no real personal information.

创建时间:
2026-08-04
原始信息汇总

数据集概述

Doc2JSON VLM Full 是一个用于微调视觉语言模型(VLM)的合成图像数据集,其核心任务是根据动态指定的 JSON 模式,从俄罗斯文档图像中提取结构化数据。数据集于 2026 年 8 月 4 日发布,总计包含 3,280 个示例,来源于 700 份原始文档。

文档类型

数据集覆盖 15 种俄罗斯文档类型,包括:

  • 护照(Паспорт РФ)
  • 付款发票(Счет на оплату)
  • 已完成工作验收单(Акт выполненных работ)
  • 通用转账单据(УПД)
  • 供货合同(Договор поставки)
  • 服务合同(Договор оказания услуг)
  • 承包合同(Договор подряда)
  • 租赁合同(Договор аренды)
  • 许可合同(Лицензионный договор)
  • 规格书(Спецификация)
  • 补充协议(Дополнительное соглашение)
  • 对账报告(Акт сверки)
  • 商品移交单 ТОРГ-12
  • 发票(Счет-фактура)
  • 付款委托书(Платежное поручение)

数据划分

划分 示例数 原始文档数
train 2,768 590
validation 512 110

数据划分基于 source_document_id 进行,确保同一原始文档的页面及增强版本不会跨越训练集和验证集。

数据格式

每条记录包含以下字段:

  • id:字符串类型标识符
  • image:内嵌的 WebP 格式图像
  • conversations:ShareGPT 风格的对话结构,包含 fromvalue 字段,其中包含提示词和 JSON 目标输出
  • metadata:元数据结构,包含:
    • augmentation_index(增强版本索引)
    • document_index(文档索引)
    • document_type(文档类型)
    • page(页码)
    • schema_language(模式键语言,ruen
    • source_document_id(原始文档标识符)
    • synthetic(是否为合成数据)
    • template_variant(布局模板变体)

提示词示例: text <image> [EXTRACT_JSON] json {"document_info":{"number":"string"}}

目标输出示例: json {"document_info":{"number":"У-4968"}}

使用方法

用户可通过 datasets 库直接加载数据集:

python from datasets import load_dataset

dataset = load_dataset("p4ulbr4dl3y/doc2json-vlm-full") train_dataset = dataset["train"] validation_dataset = dataset["validation"]

验证过程

发布前已执行以下验证:

  • JSON 提示词/目标的一致性,以及目标与请求模式的匹配
  • 标量类型、数组和嵌套对象的检查
  • ID、路径和图像内容的唯一性
  • 所有 WebP 图像的存在性与可解码性
  • 训练集与验证集之间 source_document_id 无交叉
  • 对 500 份新原始文档的语义不变量检查

限制说明

  • 数据完全为合成数据,不包含真实个人数据
  • 数据集的结构验证并不等同于模型质量评估指标
  • 文档类型从 5 种扩展到 15 种后,需要进行新的微调和按文档类型进行独立的质量评估
搜集汇总
数据集介绍
doc2json-vlm-full 数据集图片
构建方式
本数据集名为Doc2JSON VLM Full,专为俄罗斯文档的视觉语言模型(VLM)微调而构建,旨在从文档图像中依据动态定义的JSON模式提取结构化数据。数据构建采用全合成方式,基于700份原始文档生成3280个样本,涵盖15种俄罗斯文档类型,包括护照、发票、合同、验收单等。每个样本由文档图像、ShareGPT风格的对话对及丰富的元数据组成,元数据记录了文档类型、源文档ID、模式语言(俄语或英语)、模板变体及增强索引。数据集按源文档ID划分为训练集(2768例)和验证集(512例),确保同一文档的页面和增强版本不跨分割重叠,从而保证评估的可靠性。
特点
该数据集的核心特点在于其高度结构化和多样化的设计。首先,所有样本均带有精确的JSON标注,目标输出严格遵循请求的模式,支持标量类型、数组和嵌套对象。其次,每个文档经过多模板和多增强变体处理,极大丰富了数据分布,有助于提升模型对不同布局和视觉噪声的鲁棒性。此外,数据集提供了俄语和英语两种模式键语言,增强了跨语言泛化能力。验证流程严格,包括JSON模式匹配、图像解码检查、ID唯一性验证以及语义不变量测试,确保数据质量与一致性。完全合成且无真实个人信息,兼顾隐私与合规。
使用方法
数据集的使用简便高效,通过HuggingFace datasets库即可加载,具体调用load_dataset("p4ulbr4dl3y/doc2json-vlm-full")即可获取训练和验证分割。每条记录包含image字段(内嵌WebP图像)和conversations字段(提示与目标JSON),提示格式遵循[EXTRACT_JSON]指令并附带JSON模式,模型需据此提取相应信息。适合用于微调视觉语言模型,实现文档理解与结构化抽取任务。需注意,由于数据由合成生成,模型性能应以实际任务评估为准,不应仅依赖数据集结构验证。扩展至15种文档类型后,建议针对每种类型进行单独微调与评估,以优化效果。
背景与挑战
背景概述
Doc2JSON VLM Full数据集于2026年8月4日发布,由研究者p4ulbr4dl3y构建,专注于俄罗斯文档的视觉语言模型微调。该数据集旨在解决从文档图像中动态提取结构化JSON数据的核心问题,涵盖15种俄罗斯常见文档类型,如护照、发票、合同等,共包含3280个训练与验证样本,源自700份原始文档。其研究背景源于文档智能领域对高效、准确信息抽取的迫切需求,尤其在处理多样化和复杂布局的文档时,传统方法难以适应动态模式。该数据集通过引入合成数据增强模型泛化能力,为视觉语言模型在文档理解任务上的应用提供了关键资源,对推动文档自动化处理技术的发展具有重要意义。
当前挑战
该数据集面临的挑战首先体现在领域问题上:俄罗斯文档类型多样,结构复杂,且存在语言和格式差异,要求模型能够理解并准确提取嵌套JSON结构中的信息,动态适配不同查询模式,这远超传统固定字段抽取的难度。其次,构建过程中,团队需合成高质量文档图像,确保真实性和多样性,同时过滤个人数据以避免隐私泄露。数据验证涉及JSON schema一致性、图像完整性、跨分割不重叠等复杂流程,需同时保证语义正确性。此外,从5种扩展至15种文档类型过程中,需重新微调并分别评估各类型性能,确保模型在新增类别上的稳定性和可靠性,这些均构成显著的技术与工程挑战。
常用场景
经典使用场景
该数据集主要用于视觉语言模型(VLM)的微调,旨在从文档图像中提取结构化信息并以JSON格式输出。其核心场景是指导模型根据动态给定的JSON模式,从俄罗斯各类官方及商业文档(如护照、发票、合同、验收单等)中准确抽取字段值。数据集采用ShareGPT风格的对话格式,每个样本包含一个图像和对应的提取指令及目标输出,适用于训练模型在特定文档类型上遵循模式并生成符合要求的JSON结果。其经典用法是作为指令微调数据,提升模型在文档AI任务中的泛化能力。
衍生相关工作
该数据集的发布催生了多项衍生研究工作,例如开发针对动态JSON模式的文档抽取模型,探索数据增强策略对VLM在低资源文档类型上的性能提升,以及构建多任务学习框架联合处理15种文档类型的分类与抽取。此外,基于该数据集,研究者可能研究了跨文档类型迁移学习的有效性,或设计了评估协议来系统衡量模型在不同布局、字体和噪声条件下的泛化能力。其验证流程(包括语义不变性检查)也为后续合成数据集的构建提供了方法论参考,推动了文档AI领域合成数据与模型评估标准的进步。
数据集最近研究
最新研究方向
当前,文档智能领域正经历从结构识别向语义抽取的范式跃迁,基于视觉语言模型(VLM)的动态JSON结构化提取成为研究热点。该数据集聚焦俄语文档场景,通过合成15类高频商业与法律文书(如合同、验收单、发票)的复杂版式,驱动模型适应动态注入JSON Schema的指令式抽取任务。其前沿价值在于模拟真实生产环境中的跨文档类型泛化与多模板鲁棒性挑战,其元数据设计(如schema_language、template_variant)为细粒度消融实验提供支撑,引领了合成数据增强、多语言文档理解及零样本结构化输出等方向的研究,为自动化文档处理系统在金融、法律等垂直领域的落地提供了关键训练资源。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务