ahmedheakl/docatlas_instruct
收藏资源简介:
DocAtlas是一个大规模、高保真的多语言OCR数据集,覆盖82种语言和10种书写系统(包括拉丁、西里尔、阿拉伯、天城文、中文、韩文、希腊文、元音附标文字、音节文字和辅音音素文字)。它通过模型无关的差分渲染构建,提供统一的DocTag格式精确结构注释,编码布局、文本和组件类型,而不依赖任何学习模型进行核心标注。该数据集包含180,913个训练页面,支持双重注释管道:原生DOCX文档的差分渲染和针对RTL脚本的合成LaTeX生成。它涵盖31种结构元素类型(如文本、表格、标题、图形、方程、图表等)和25个以上内容领域(如健康、法律、金融、科学和教育)。数据集已准备好用于直接偏好优化(DPO),渲染衍生的真实数据作为正信号,实现稳定的跨语言转移(域内+1.9%,域外+1.8%),且无基础语言性能下降。
DocAtlas is a large-scale, high-fidelity multilingual OCR dataset covering 82 languages and 10 writing systems (including Latin, Cyrillic, Arabic, Devanagari, Chinese, Hangeul, Greek, Abugidas, Syllabaries, Abjads). It is built through model-free differential rendering, providing precise structural annotations in a unified DocTag format encoding layout, text, and component types — without relying on any learned models for core annotation. The dataset contains 180,913 training pages with dual annotation pipelines: differential rendering of native DOCX documents and synthetic LaTeX-based generation for RTL scripts. It spans 31 structural element types (e.g., text, tables, headings, figures, equations, charts) and over 25 content domains (including Health, Law, Finance, Science, Education). The dataset is DPO-ready, with rendering-derived ground truth serving as positive signal for Direct Preference Optimization, achieving stable cross-lingual transfer (+1.9% in-domain, +1.8% out-of-domain) without base-language degradation.



