遇见数据集

Synth-JDoc

收藏
arXiv2026-08-28 更新2026-09-01 收录
官方服务:

资源简介:

Synth-JDoc是由早稻田大学、国立信息学研究所及NII LLMC联合构建的合成日语文档图像OCR数据集,旨在提升大型视觉语言模型对日语文档(尤其是垂直书写文本)的识别能力。该数据集包含17,970张图像,涵盖横排与竖排、1至4列多种版面布局,并嵌入由文本到图像模型生成的图片及标题。数据集生成过程包括:从JSSODa文本中分割段落,为部分段落生成匹配图像和标题,利用HTML/CSS渲染为文档图像,再通过模拟扫描噪声和Augraphy库添加退化效果以增强模型鲁棒性。该数据集主要用于训练LVLM的OCR能力,解决现有日语文档图像数据集缺乏竖排文本和复杂版面的问题,从而显著提升模型在真实竖排日语文档上的文本读取性能。

创建时间:
2026-08-28
原始信息汇总

Synth-JDoc 数据集概述

基本信息

  • 数据集名称:Synth-JDoc
  • 数据集类型:图像文本到文本(image-text-to-text)
  • 语言:日语(ja)
  • 许可证:CC-BY-4.0
  • 任务类别:OCR(光学字符识别)
  • 样本规模:10K < n < 100K

数据集规模

  • 训练集样本数:17,952
  • 数据集总大小:约28.49 GB
  • 下载大小:约28.46 GB

数据字段说明

  • id:图像ID
  • image:PIL图像对象
  • question:用于视觉语言模型(VLM)的提示词
  • text:合成文档图像中写入的文本内容
  • is_vertival:是否采用纵向书写布局(布尔值)
  • num_columns:文档的栏数
  • noise_type:噪声类型(0为无噪声,1为扫描类噪声,2为Augraphy生成的噪声)

核心特性

  1. 合成方法:使用HTML/CSS生成的合成日语文档图像
  2. 内容组成:包含嵌入图像、标题、说明文字,并采用多样的多栏布局,支持横排和纵排两种书写方向
  3. 无OCR错误:由于图像直接从文本合成,完全避免OCR识别错误
  4. 布局多样性:支持多样化的多栏布局及竖排文本
  5. 数据筛选:发布前已通过NSFW检测模型进行人工审查并移除不当内容,但注意该筛选并非完美无缺

相关资源

搜集汇总
数据集介绍
Synth-JDoc 数据集图片
构建方式
Synth-JDoc数据集的构建依托于HTML与CSS技术,通过从纯文本出发合成文档图像。首先,利用语言模型对文本进行段落分割,并为选定的段落生成对应的图像及其标题,这一过程借助文本到图像模型和大型视觉语言模型完成。随后,通过HTML/CSS模板控制文档的布局,实现横排或竖排文本的多栏排列,并随机插入图像以增强视觉多样性。最后,对生成的图像施加扫描噪声和人为退化效果,以提升模型的鲁棒性。整个流程分为文档元素准备、文档图像合成和噪声应用三个阶段,最终生成包含约17,970张图像的训练集。
使用方法
Synth-JDoc数据集主要用于微调大型视觉语言模型(LVLMs),以提升其在文档图像上的OCR能力。使用时,研究者将数据集中的图像与对应的文本作为训练对,对模型进行全参数微调。训练过程中,模型被要求输出图像中的全部文本,遵循日文的阅读顺序。该数据集可与各种开源LVLM模型配合使用,如Qwen2.5-VL、Qwen3-VL等。在评估时,可采用VJRODa等真实竖排日文文档数据集来衡量模型的字符错误率(CER)和BLEU分数,以验证微调效果。
背景与挑战
背景概述
随着大型视觉语言模型(LVLMs)在文档理解领域的广泛应用,其文本识别能力成为关键瓶颈,尤其在处理兼具横排与竖排的日文文档时表现欠佳。为弥补竖排日文OCR数据集的稀缺,日本早稻田大学、国立信息学研究所及LLMC联合团队于2026年构建了Synth-JDoc数据集,旨在通过合成图像提升LVLMs对日文文档的OCR性能。该数据集采用HTML/CSS生成多栏、含嵌入图像的文档,并融合文本到图像模型与噪声增强技术。Synth-JDoc已成为评估竖排日文OCR性能的重要基准,其公开代码与数据促进了相关研究的发展。
当前挑战
Synth-JDoc所面对的挑战涵盖领域与应用层面。领域上,竖排日文文档的阅读顺序复杂(自上而下、从右至左),且多以多栏布局呈现,现有OCR数据集极少覆盖,导致LVLMs对此类文本识别准确率显著偏低。构建过程中,手动标注成本高且难以扩展,基于OCR文本提取又易引入识别错误及图像来源依赖。此外,合成图像需兼顾版式多样性、视觉真实性及对噪声的鲁棒性,而现有合成方法(如Genalog、JSSODa)无法生成含竖排、多栏及嵌入图像的复杂日文版式,且需解决图像生成模型产生的字符畸变及布局失效问题。
常用场景
经典使用场景
Synth-JDoc数据集的核心应用场景在于训练和评估大型视觉语言模型(LVLMs)在日语文档图像上的文本识别能力,尤其是针对纵向书写的日文文本。该数据集通过HTML和CSS合成多样化的多栏文档布局,涵盖横写和纵写,并嵌入由文本到图像模型生成的图像,模拟真实文档的视觉复杂性。研究者可利用该数据集对LVLMs进行微调,以提升其在复杂布局下的OCR性能,从而支持文档视觉问答等下游任务。
解决学术问题
该数据集有效解决了日语文档OCR数据集构建中的两大核心难题:高昂的人工标注成本和现有合成方法无法生成包含纵向书写及嵌入式图像的复杂布局。通过全自动合成流程,Synth-JDoc不仅提供了大规模、高多样性的训练样本,还避免了OCR错误,显著提升了模型对纵向日文文本的识别准确率,为跨语言和多方向文本识别研究提供了坚实的数据基础。
实际应用
在实际应用中,Synth-JDoc可用于提升文档数字化、自动化档案管理和智能文档处理系统的OCR性能,尤其适用于需要处理日文纵向排版文档的企业和政府机构。此外,该数据集还可作为文档视觉问答系统的训练资源,助力构建更精准的文档信息抽取和分析工具,推动办公自动化与知识管理技术的发展。
数据集最近研究
最新研究方向
Synth-JDoc数据集聚焦于提升大型视觉语言模型(LVLMs)在日语文档图像上的OCR识别能力,尤其针对竖排文本的识别瓶颈。通过利用HTML和CSS合成包含横竖混排、多栏布局及嵌入图像的文档图像,并引入文本到图像模型和LVLM生成图像与标题,结合扫描效果和Augraphy噪声增强模型鲁棒性。该数据集有效弥补了现有合成数据集在竖排文本和复杂版式支持上的不足,实验中显著降低了竖排日文文档的字符错误率,推动了LVLMs在文档视觉问答等下游任务中的性能提升,为日文文档理解领域提供了高质量训练资源。
相关研究论文
  • 1
    Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images早稻田大学; 国立信息学研究所; NII LLMC · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务