遇见数据集

Modèle de segmentation et de reconnaissance optique de caractères - Kraken - Incunables sévillans 1494-1500

收藏
Zenodo2025-04-03 更新2026-05-25 收录
数据链接:
官方服务:

资源简介:

Ce dépôt contient un modèle fonctionnel de reconnaissance optique de caractères, entraîné grâce au logiciel kraken via eScriptorium. Le modèle a été entraîné sur un des incunables du <em>Regimiento de los Prínçipes</em> (connu aussi sous le titre de: <em>Glosa castellana al Regimiento de prínçipes</em>), l'incunable INC/901 de la Bibliothèque nationale d'Espagne. Il contient de même un modèle de segmentation entraîné de même sur kraken après segmentation manuelle sur eScriptorium. <strong>Réutilisabilité du modèle: </strong> Le type utilisé par Estanislao Polono pour cet incunable est le 97G (Martín Abad and Moyano Andrés, 2002, p. 61). Ce type est utilisé entre 1494 et 1500. Pour les autres incunables produits à cette époque, voir <em>op.cit</em>, p.112-121. Les zones du modèles de segmentation sont: - Header - Illustration - Main - Pagination - Signature - Title <strong>Qualité du modèle: </strong> Ce modèle a été entraîné sur 4836 lignes (537 lignes composant le jeu d'évaluation). Son taux d'erreur est d'un peu moins de 3% (97.1%). Les vérités terrain sont fournies au format ALTO et jpeg. Le modèle de segmentation a été entraîné sur 54 pages, en partant modèle de base blla.mlmodel, et est efficace à 41%. <strong>Crédits et remerciements:</strong> Les données ont successivement été entraînées sur Ocropy et Kraken. Pour entraîner originellement le modèle Ocropy qui a permis de prédire le jeu de données d'entraînement que j'ai ensuite corrigé et utilisé sur Kraken, je me suis amplement servi du manuel rédigé par Jean-Baptiste Camps (ENC-PSL), qui peut être trouvé sur son carnet de recherche. Merci à Simon Gabay (U. de Neuchâtel) pour son aide sur kraken et pour tous ses conseils méthodologiques. <strong>Bibliographie: </strong> Kiessling, Benjamin. « Kraken - an Universal Text Recognizer for the Humanities ». DH2019:Complexity, Utrecht, 2019. https://dev.clariah.nl/files/dh2019/boa/0673.html. Martín Abad, J. and Moyano Andrés, I. (2002). <em>Estanislao Polono</em>. <code>« Homemade manuscript OCR (1): OCRopy », <em>Sacré Gr@@l</em>, 6 février 2017, https://graal.hypotheses.org/786 </code>

本仓库包含一款可正常运行的光学字符识别(OCR)模型,该模型通过eScriptorium平台依托Kraken软件完成训练。本模型基于西班牙国家图书馆编号为INC/901的摇篮本(incunable)<em>Regimiento de los Prínçipes</em>(亦被称为<em>Glosa castellana al Regimiento de prínçipes</em>)中的部分内容训练而成。本仓库同时包含一个文本分割模型,该模型同样依托Kraken软件,通过eScriptorium平台完成手动分割后训练得到。 <strong>模型复用性:</strong>本次训练使用的活字型号为97G(引自Martín Abad与Moyano Andrés,2002年,第61页),该型号的活字使用时段为1494年至1500年。若需了解同期其他摇篮本的相关信息,可参阅<em>op.cit</em>第112-121页。该分割模型的识别区域包括:页眉(Header)、插图(Illustration)、正文区域(Main)、页码栏(Pagination)、书帖标记(Signature)与标题区域(Title)。 <strong>模型质量:</strong>本光学字符识别模型基于4836行文本训练而成,其中537行作为评估集。模型错误率略低于3%(识别准确率为97.1%)。基准真值数据以ALTO与JPEG格式提供。本分割模型以blla.mlmodel为基础模型,基于54页文本训练得到,分割准确率达41%。 <strong>贡献与致谢:</strong>本数据集先后基于Ocropy与Kraken进行训练。为最初训练Ocropy模型以生成训练数据集(后续我对该数据集进行了校正并用于Kraken模型训练),我主要参考了Jean-Baptiste Camps(ENC-PSL)撰写的使用手册,该手册可在其个人研究博客中获取。感谢Simon Gabay(纳沙泰尔大学)在Kraken使用方面提供的帮助以及所有方法论层面的建议。 <strong>参考文献:</strong> 1. Kiessling, Benjamin. <em>Kraken——面向人文学科的通用文本识别器</em>。发表于DH2019:复杂性研讨会,乌得勒支,2019年。链接:https://dev.clariah.nl/files/dh2019/boa/0673.html。 2. Martín Abad, J. 与Moyano Andrés, I.(2002)。<em>Estanislao Polono</em>。载于<code>《自制手稿OCR(1):OCRopy》,<em>Sacré Gr@@l</em>,2017年2月6日,链接:https://graal.hypotheses.org/786</code>。

提供机构:
Zenodo
创建时间:
2021-10-11
二维码
社区交流群
二维码
科研交流群
商业服务