d-Prose 1870-1920
收藏资源简介:
Das Korpus "d-Prose 1870-1920" ist eine heterogene Sammlung aus 2529 deutschsprachigen, literarischen Prosatexten, die zwischen 1870 und 1920 publiziert wurden. Es enthält Erzähltexte aus Trivial- und Hochliteratur mit einem Mindestumfang von 1000 Wörtern. Das Korpus wurde im Rahmen des hermA-Teilprojekts „Gender und Krankheit“ aus manuell und teilautomatisch ausgewählten Texten aus dem deutschsprachigen Raum erstellt. Die Textdateien wurden dem KOLIMO-Korpus (Lauer/Hermann 2017) entnommen, welches wiederum auf den Repositorien TextGrid (Neuroth/Rapp/Söring 2015), Deutsches Textarchiv (BBAW 2017) sowie Gutenberg-de (Reuters 2017) beruht. Aus den XML-Dateien des KOLIMO-Korpus wurden alle deutschsprachigen literarischen Prosatexte, die zwischen 1870 und 1920 publiziert wurden, mithilfe des Programms KOLIMOtoText (Adelmann 2020) als Textdateien extrahiert. Doppelt vorkommende Texte wurden mithilfe des Autor-Name-Titel-Vergleichsprogramms ANTComp (Adelmann 2020a) und des Volltextvergleichsprogramms BatchSED (Adelmann 2020b) zur automatisierten Dublettenbereinigung entfernt (vgl. Adelmann & Gius 2020). Die verbliebenen Texte wurden für die Bedürfnisse automatisierter Analysen manuell von paratextuellen Elementen (Widmungen, Herausgeberkommentaren, Autor:innennamen etc.) bereinigt, sodass allein der Prosatext mit dem Werktitel in den Dateien erhalten sind. Die Texte liegen als Reintextdateien mit einer dazugehörigen Metadatentabelle vor. Die Metadatentabelle wurde enthält für jedes Werk Daten zu Autor:innenname, Titel des Werks, Repositorienquelle, Dateiname sowie Publikationsdatum (extrahiert aus den Metadaten der Ursprungsrepositorien, kontrolliert und ggf. korrigiert oder erweitert um Daten aus den Literaturlexika Killy und Kindler). Die größte Datei mit einem Umfang von 6,2 MB beinhaltet den Fortsetzungsroman <em>Deutsche Herzen - Deutsche Helden</em> von Karl May (980981 Wörter). Die kleinste Datei die Erzählung <em>Die Verlobung</em> von Ludwig Thoma mit einem Umfang von 6 KB (1019 Wörter). <strong>Referenzen:</strong> Adelmann, Benedikt (2020): <em>KOLIMOtoText. A tool for extracting the document text of TEI and XHTML files in the KOLIMO corpus</em>. https://github.com/benadelm/KOLIMOtoText [03.12.2020]. Adelmann, Benedikt (2020a): <em>ANTComp (Author-Name-Title-Comparer). An implementation of a heuristic approach to identifying possible duplicates in a corpus of literary works</em>. https://github.com/benadelm/ANTComp [03.12.2020]. Adelmann, Benedikt (2020b): <em>BatchSED (Batch-Substring-Edit-Distance). A tool for batch computing substring editing distances between the full texts of novels for duplicate detection</em>. https://github.com/benadelm/BatchSED [03.12.2020]. Adelmann, Benedikt / Gius, Evelyn (2020): „Korpusbereinigung für größere Textmengen. Eine (kurze) Problematisierung und ein Lösungsansatz für Duplikate“. In: <em>Book of Abstracts</em>, DHd-Tagung, Paderborn, S. 331334. Berlin-Brandenburgischen Akademie der Wissenschaften (Hrsg.) (2017): <em>Deutsches Textarchiv. Grundlage für ein Referenzkorpus der neuhochdeutschen Sprache</em>. Berlin. http://www.deutschestextarchiv.de/ [03.12.2020]. Herrmann, Berenike / Lauer, Gerhard (2017): <em>KOLIMO. </em><em>A corpus of Literary Modernism for comparative analysis</em>. https://kolimo.uni-goettingen.de/about [01.05.2020]. Neuroth, Heike / Rapp, Andrea / Söring, Sibylle (Hrsg.) (2015): <em>TextGrid: Von der Community — für die Community. Eine Virtuelle Forschungsumgebung für die Geisteswissenschaften</em>. Universitätsverlag Göttingen, Verlag Werner Hülsbusch, Glückstadt. Reuters, Hella (Hrsg.) (2017): <em>Projekt Gutenberg-DE, Die weltweit größte kostenlose deutschsprachige Volltext-Literatursammlung</em>. https://www.projekt-gutenberg.org/ [03.12.2020].
语料库“d-Prose 1870-1920”是一部异构合集,收录了2529篇于1870至1920年出版的德语文学散文文本。该语料库涵盖通俗文学与纯文学的叙事文本,单篇最低字数不低于1000词。 本语料库是在hermA子项目“性别与疾病”框架下,从德语区范围内经人工与半自动化筛选的文本中构建而成。 本次语料库所用文本均取自KOLIMO语料库(Lauer/Hermann 2017),而该语料库的数据源为TextGrid仓储库(Neuroth/Rapp/Söring 2015)、德意志文本档案馆(BBAW 2017)以及Gutenberg-de(Reuters 2017)。 研究人员借助工具KOLIMOtoText(Adelmann 2020),从KOLIMO语料库的XML文件中提取出所有1870至1920年出版的德语文学散文文本,并保存为纯文本文件。 重复出现的文本通过作者-姓名-标题对比工具ANTComp(Adelmann 2020a)与全文对比工具BatchSED(Adelmann 2020b)进行自动化去重处理,以清除重复项(参见Adelmann与Gius 2020)。 为适配自动化分析需求,研究人员对剩余文本进行人工清洗,移除所有副文本元素(如献词、编辑评论、作者姓名等),最终仅保留散文正文与作品标题。 所有文本以纯文本文件形式存储,并附带对应的元数据表。 该元数据表为每部作品提供以下元数据:作者姓名、作品标题、仓储库来源、文件名以及出版日期(数据从原始仓储库的元数据中提取,经人工校验后,必要时会参考Killy与Kindler文学词典的数据进行修正或补充。 本次语料库中体积最大的文件为6.2MB,包含卡尔·迈(Karl May)所著的系列续作小说《德意志之心——德意志英雄》,全文共计980981词。体积最小的文件为路德维希·托马(Ludwig Thoma)所著的叙事作品《婚约》,仅6KB,共计1019词。 <strong>参考文献:</strong> 1. Adelmann, Benedikt(2020):《KOLIMOtoText:一款用于提取KOLIMO语料库中TEI与XHTML文件文档文本的工具》,https://github.com/benadelm/KOLIMOtoText,[2020年12月3日] 2. Adelmann, Benedikt(2020a):《ANTComp(作者-姓名-标题对比工具):一种识别文学作品语料库中潜在重复项的启发式方法实现》,https://github.com/benadelm/ANTComp,[2020年12月3日] 3. Adelmann, Benedikt(2020b):《BatchSED(批量子串编辑距离):一款用于批量计算小说全文本间子串编辑距离以检测重复项的工具》,https://github.com/benadelm/BatchSED,[2020年12月3日] 4. Adelmann, Benedikt / Gius, Evelyn(2020):《针对大规模文本集的语料库清洗:关于重复项问题的简要探讨与解决方案》,载于《论文摘要集》,DHd会议,帕德博恩,第331-334页 5. 柏林-勃兰登堡科学院(编者)(2017):《德意志文本档案馆:新德语语料库参考基准》,柏林,http://www.deutschestextarchiv.de/,[2020年12月3日] 6. Herrmann, Berenike / Lauer, Gerhard(2017):《KOLIMO:用于比较分析的文学现代主义语料库》,https://kolimo.uni-goettingen.de/about,[2020年5月1日] 7. Neuroth, Heike / Rapp, Andrea / Söring, Sibylle(编者)(2015):《TextGrid:来自社区,服务社区——面向人文社科的虚拟研究环境》,哥廷根大学出版社、Werner Hülsbusch出版社,格吕克施塔特 8. Reuters, Hella(编者)(2017):《Gutenberg-DE项目:全球最大的免费德语全文文学作品集》,https://www.projekt-gutenberg.org/,[2020年12月3日]



