遇见数据集

PoeTree. Poetry Corpora in Czech, English, French, German, Hungarian, Italian, Norwegian, Portuguese, Russian, Slovenian, and Spanish

收藏
Zenodo2025-11-30 更新2026-05-26 收录
官方服务:

资源简介:

PoeTree is a dataset comprising nearly 335,000 poems / 90,000,000 tokens in 11 languages (Czech, English, French, German, Hungarian, Italian, Norwegian, Portuguese, Spanish, Slovenian, and Russian). Each corpus has been deduplicated, enriched with Universal Dependencies, provided with additional metadata and converted into a unified JSON structure (schema available at https://versologie.cz/poetree/json-schema). cs (~80k poems) derived from Corpus of Czech Verse de (~74k poems) derived from Metricalizer and Deutsches Lyrik Korpus en (~40k poems) based on texts from Project Gutenberg es (~9k poems) derived from Corpus of Spanish Golden-Age Sonnets and Diachronic Spanish Sonnet Corpus fr (~18k poems) derived from Malherbə hu (~13k poems) derived from ELTE Poetry Corpus it (~40k poems) derived from Biblioteca Italiana no (~3k poems) derived from NORN Poems pt (~5k poems) derived from Poemas ru (~45k poems) derived from Corpus of Russian Poetry sl (~5k poem) based on texts from wikisource new in v. 1.0.0: PoeTree.no added PoeTree.(cs,de,en,fr,hu,it,ru,sl) enriched with geolocation mentions Updated and corrected metadata in PoeTree.(de,en,es,ru) Multiple text corrections in PoeTree.ru

提供机构:
Zenodo
创建时间:
2023-10-17
二维码
社区交流群
二维码
科研交流群
商业服务