遇见数据集

sionic-ai/mdpbench-doc-ocr-sft

收藏
Hugging Face2026-06-28 更新2026-07-22 收录
官方服务:

资源简介:

mdpbench-doc-ocr-sft数据集是一个用于Qwen 4B(Qwen3-VL)模型的监督微调学习数据,专注于韩语和日语文档的OCR(光学字符识别)和解析任务。数据集包含韩国地方政府新闻通讯(报纸形式)的图像和Markdown格式的真实文本,旨在支持文档图像到文本的转换,并保留表格和阅读顺序。数据来源包括韩国地方政府出版物,如Seongnam Vision Seongnam、Seocho-gu和Gongju-si,这些是公共著作物,允许非商业和研究用途。数据集确保无污染,与MDPBench测试集无交集,并提供了训练示例和加载方法。

The mdpbench-doc-ocr-sft dataset is a supervised fine-tuning (SFT) dataset for the Qwen 4B (Qwen3-VL) model, focusing on OCR (Optical Character Recognition) and parsing tasks for Korean and Japanese documents. The dataset contains images and Markdown-formatted ground truth texts of Korean local government newsletters (in newspaper format), aiming to support document image-to-text conversion while preserving tables and reading order. Its data sources include Korean local government publications such as Seongnam Vision Seongnam, Seocho-gu, and Gongju-si, which are public domain works permitting non-commercial and research use. The dataset is guaranteed to be uncontaminated, with no overlap with the MDPBench test set, and provides training examples and loading methods.

提供机构:
sionic-ai
搜集汇总
数据集介绍
sionic-ai/mdpbench-doc-ocr-sft 数据集图片
构建方式
该数据集专为韩语与日语文档OCR及解析任务而设计,基于MDPBench基准构建。其数据源自韩国地方政府新闻通讯,包括城南市、西草区与公州市的公开出版物,依据韩国著作权法第24条之2合法采集。原始PDF文档以250 DPI分辨率渲染成图像,并采用双教师模型共识策略进行标注——结合PaddleOCR-VL-1.6与Qwen3.5-9B,对文档结构与阅读顺序进行解析,生成保留表格与层级信息的Markdown格式标注。所有标注经原始PDF文本层内容验证及双字母门控机制精校,确保高保真转录。
特点
该数据集包含2,407条韩语训练样本,每项由文档页面图像、对应Markdown标注、来源标识与语言类型组成。其显著特点在于严格的污染控制:经验证与MDPBench测试集零交集,避免评估结果失真。数据仅囊括可公开获取的政府出版物,排除了受版权保护的教育资料及来源不明的PDF,确保合法合规。所有图像均内嵌为字节数据,支持高效加载与多模态模型微调。日文配置虽在规划中,当前聚焦韩语文档,覆盖新闻通讯这一特定类型,为文档解析研究提供针对性资源。
使用方法
研究者可通过HuggingFace Datasets库便捷调用,指定配置为'ko'并选择训练集:load_dataset("sionic-ai/mdpbench-doc-ocr-sft", "ko", split="train")。每个样本提供'image'字段(PIL Image对象)用于视觉输入,以及'markdown'字段作为结构化文本标签,适用于监督式微调。该数据可直接用于训练多模态大语言模型(如Qwen2.5-VL系列)的文档OCR与解析能力,支持端到端的图像转Markdown生成任务。此外,通过'source'与'doc_type'字段,可深入分析不同来源与文档类型的性能差异,优化模型泛化性。
背景与挑战
背景概述
随着文档理解任务的发展,特别是对于韩语和日语等非拉丁语系,高质量的OCR与结构化解析数据集仍属稀缺。mdpbench-doc-ocr-sft数据集由Sionic AI研究团队于近期发布,旨在为多语言文档OCR与解析提供监督微调训练资源。该数据集聚焦于韩国地方自治团体的新闻简报型文档,包含2,407张页面图像及其对应的Markdown格式标注,涵盖表格保持与阅读顺序还原等复杂结构化信息。作为MDPBench基准的组成部分,该数据集通过公开可用的公共作品构建,并经过双重教师模型共识与原始PDF文本层验证,确保了标注质量。其发布有效填补了韩语文档解析领域公开可用训练数据的空白,并有望推动Qwen等视觉语言模型在文档智能方向上的进一步优化。
当前挑战
该数据集旨在应对文档OCR与解析中的多重挑战。首先,在领域问题层面,传统OCR系统常难以处理包含复杂表格、多栏布局与严格阅读顺序的新闻简报型文档,而现有标注数据多集中于英文或简单版式,缺乏对韩语非结构化布局文档的高质量支持。其次,在构建过程中,团队面临教师模型间标注不一致的挑战,需通过双重模型(PaddleOCR-VL与Qwen3.5-9B)的共识机制与bigram门控过滤来保证标注准确性。此外,原始PDF渲染为图像后,需与文本层内容进行交叉验证,以消除光学渲染误差。最终,所有训练数据经过与MDPBench测试集的零交集验证,确保了无数据污染,从而维护了评估的公正性。
常用场景
经典使用场景
在文档智能分析领域,mdpbench-doc-ocr-sft数据集为光学字符识别与文档解析模型的指令微调提供了高质量的监督训练语料。该数据集聚焦于韩文与日文的地方政府新闻稿图像,每份样本均包含页面图像与对应的Markdown格式标注,其中精确保留了表格结构和阅读顺序。研究者常将其作为序列到序列图像文本理解任务的基准训练集,用于提升模型对复杂版面文档的端到端转录能力,尤其适用于评估和优化多语言OCR系统在实际文档场景下的鲁棒性与精准度。
实际应用
在行业落地层面,该数据集可支撑智慧政务、档案数字化和新闻报纸电子化等典型场景。例如,地方政府的新闻稿经扫描或拍照后,借助基于该数据微调的模型,能够自动转化为可检索、可编辑的Markdown格式文档,显著提升信息归档与发布流程的效率。此外,企业知识管理系统可以将其作为训练组件,集成至自动化发票识别、合同比对和学术文献处理等流水线中,在保持高精度结构还原的同时,降低人工标注与审核成本。
衍生相关工作
围绕mdpbench-doc-ocr-sft数据集,已催生出一系列具有启发性的学术工作与方法扩展。数据集的构建流程本身提出了双教师蒸馏与n-gram门控校验的标注策略,为弱监督文档标注提供了可复现的方法论。代表性衍生工作包括基于Qwen系列的多模态文档理解模型微调方案,以及针对韩文报纸结构的版面分析模型评估基准。此外,该数据集的公开部分作为MDPBench评测体系中的指令微调资源,支撑了后续关于跨语言文档解析泛化能力、小样本版面重建以及格式化输出对齐等前沿课题的实证研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务