Jeu de données de segmentation et de reconnaissance optique de caractères - Kraken - Incunables sévillans 1494-1500
收藏资源简介:
Ce dépôt contient un modèle fonctionnel de reconnaissance optique de caractères, entraîné grâce au logiciel kraken via eScriptorium. Le modèle a été entraîné sur un des incunables du <em>Regimiento de los Prínçipes</em> (connu aussi sous le titre de: <em>Glosa castellana al Regimiento de prínçipes</em>), l'incunable INC/901 de la Bibliothèque nationale d'Espagne. Il contient de même un modèle de segmentation entraîné de même sur kraken après segmentation manuelle sur eScriptorium. <strong>Description du jeu de données: </strong> Le jeu de données contient 60 pages et 6831 lignes. Le type utilisé par Estanislao Polono pour cet incunable est le 97G (Martín Abad and Moyano Andrés, 2002, p. 61). Ce type est utilisé entre 1494 et 1500. Pour les autres incunables produits à cette époque, voir <em>op.cit</em>, p.112-121. Les zones du modèle de segmentation sont conformes au vocabulaire partagé SegmOnto (https://segmonto.github.io/). <strong>Qualité du modèle: </strong> Le modèle a été entraîné sur 5386 lignes. Son taux d'erreur est d'un peu plus de 3% (96.5%). Les vérités terrain sont fournies au format ALTO et jpeg. Deux modèles de segmentation sont fournis, pour les baselines et pour les régions. <strong>Crédits et remerciements:</strong> Les données ont successivement été entraînées sur Ocropy et Kraken. Pour entraîner originellement le modèle Ocropy qui a permis de prédire le jeu de données d'entraînement que j'ai ensuite corrigé et utilisé sur Kraken, je me suis amplement servi du manuel rédigé par Jean-Baptiste Camps (ENC-PSL), qui peut être trouvé sur son carnet de recherche. Merci à Simon Gabay (U. de Neuchâtel) pour son aide sur kraken et pour tous ses conseils méthodologiques. <strong>Bibliographie: </strong> Kiessling, Benjamin. « Kraken - an Universal Text Recognizer for the Humanities ». DH2019:Complexity, Utrecht, 2019. https://dev.clariah.nl/files/dh2019/boa/0673.html. Martín Abad, J. and Moyano Andrés, I. (2002). <em>Estanislao Polono</em>. <code>« Homemade manuscript OCR (1): OCRopy », <em>Sacré Gr@@l</em>, 6 février 2017, https://graal.hypotheses.org/786 </code>
本仓库包含一个可正常运行的光学字符识别(Optical Character Recognition, OCR)模型,该模型通过eScriptorium平台借助Kraken软件完成训练。本模型基于西班牙国家图书馆编号为INC/901的摇篮本《Regimiento de los Prínçipes》(亦名为《Glosa castellana al Regimiento de prínçipes》)中的内容训练而成。本仓库同时包含一个分割模型,该模型同样借助Kraken软件训练,训练前已在eScriptorium平台中完成手动分割。 **数据集说明:** 本次数据集共包含60个页面、6831行文本。该摇篮本所使用的字体为Estanislao Polono设计的97G型字体(引自Martín Abad与Moyano Andrés,2002年,第61页),该字体的使用时间为1494年至1500年之间。关于同期其他摇篮本的相关信息,可参见同前引书第112-121页。本分割模型所采用的区域标注规则,符合共享词汇表SegmOnto(https://segmonto.github.io/)的规范。 **模型性能:** 本模型基于5386行文本训练而成,错误率略高于3%(识别准确率为96.5%)。数据集附带真值标注数据,格式为ALTO与JPEG。本次提供两款分割模型,分别对应基线(baseline)与区域分割任务。 **致谢与声明:** 本次数据集先后基于Ocropy与Kraken软件完成训练。为最初训练Ocropy模型以生成后续经我修正并用于Kraken训练的数据集,我大量参考了Jean-Baptiste Camps(ENC-PSL)所撰写的手册,该手册可在其个人研究博客中获取。感谢Simon Gabay(纳沙泰尔大学)在Kraken软件使用方面提供的帮助与方法论指导。 **参考文献:** Kiessling, Benjamin. 《Kraken——面向人文学科的通用文本识别器》。DH2019:复杂性研讨会,乌得勒支,2019年。https://dev.clariah.nl/files/dh2019/boa/0673.html Martín Abad, J. 与Moyano Andrés, I.(2002)。《Estanislao Polono》。 《自制手稿OCR(1):OCRopy》,载《Sacré Gr@@l》,2017年2月6日,https://graal.hypotheses.org/786



