PoeTree. Poetry Corpora in Czech, English, French, German, Hungarian, Italian, Norwegian, Portuguese, Russian, Slovenian, and Spanish
收藏资源简介:
PoeTree is a dataset comprising nearly 335,000 poems / 90,000,000 tokens in 11 languages (Czech, English, French, German, Hungarian, Italian, Norwegian, Portuguese, Spanish, Slovenian, and Russian). Each corpus has been deduplicated, enriched with Universal Dependencies, provided with additional metadata and converted into a unified JSON structure (schema available at https://versologie.cz/poetree/json-schema). cs (~80k poems) derived from Corpus of Czech Verse de (~74k poems) derived from Metricalizer and Deutsches Lyrik Korpus en (~40k poems) based on texts from Project Gutenberg es (~9k poems) derived from Corpus of Spanish Golden-Age Sonnets and Diachronic Spanish Sonnet Corpus fr (~18k poems) derived from Malherbə hu (~13k poems) derived from ELTE Poetry Corpus it (~40k poems) derived from Biblioteca Italiana no (~3k poems) derived from NORN Poems pt (~5k poems) derived from Poemas ru (~45k poems) derived from Corpus of Russian Poetry sl (~5k poem) based on texts from wikisource new in v. 1.0.0: PoeTree.no added PoeTree.(cs,de,en,fr,hu,it,ru,sl) enriched with geolocation mentions Updated and corrected metadata in PoeTree.(de,en,es,ru) Multiple text corrections in PoeTree.ru



