Modèle de reconnaissance optique de caractères - Kraken - Incunables sévillans 1494-1500
收藏资源简介:
Ce dépôt contient un modèle fonctionnel de reconnaissance optique de caractères, entraîné grâce au logiciel kraken. La segmentation a été réalisée grâce à Ocropy. Le modèle a été entraîné sur un des incunables du <em>Regimiento de los Prínçipes</em> (connu aussi sous le titre de: <em>Glosa castellana al Regimiento de prínçipes</em>), l'incunable INC/901 de la Bibliothèque nationale d'Espagne. <strong>Réutilisabilité du modèle: </strong> Le type utilisé par Estanislao Polono pour cet incunable est le 97G (Martín Abad and Moyano Andrés, 2002, p. 61). Ce type est utilisé entre 1494 et 1500. Pour les autres incunables produits à cette époque, voir <em>op.cit</em>, p.112-121. <strong>Qualité du modèle: </strong> Ce modèle a été entraîné sur 4273 lignes. Son taux d'erreur est d'un peu plus de 3% (96.58%). Les données d'entraînement, de validation et de test sont fournies. <strong>Crédits et remerciements:</strong> Pour entraîner originellement le modèle Ocropy qui a permis de prédire le jeu de données d'entraînement que j'ai ensuite corrigé et utilisé sur Kraken, je me suis amplement servi du manuel rédigé par Jean-Baptiste Camps (ENC-PSL), qui peut être trouvé sur son carnet de recherche. Merci à Simon Gabay (U. de Neuchâtel) pour son aide sur kraken et pour tous ses conseils méthodologiques. Pour construire mes différents jeux de données, j'ai suivi le cours qu'il a mis en ligne sur son dépôt github. Le script python randomize_data.py (adapté par mes soins) provient de ce dépôt, et a été créé par Jean-Baptiste Camps. <strong>Bibliographie: </strong> Kiessling, Benjamin. « Kraken - an Universal Text Recognizer for the Humanities ». DH2019:Complexity, Utrecht, 2019. https://dev.clariah.nl/files/dh2019/boa/0673.html. Martín Abad, J. and Moyano Andrés, I. (2002). <em>Estanislao Polono</em>. <code>« Homemade manuscript OCR (1): OCRopy », <em>Sacré Gr@@l</em>, 6 février 2017, https://graal.hypotheses.org/786 </code>



