遇见数据集

PoeTree. Poetry Treebanks in Czech, English, French, German, Hungarian, Italian, Portuguese, Russian, Slovenian and Spanish

收藏
NIAID Data Ecosystem2026-05-01 收录
数据链接:
官方服务:

资源简介:

PoeTree (Poetry Treebanks) is a dataset comprising over 330,000 poems / 89,000,000 tokens in nine languages (Czech, English, French, German, Hungarian, Italian, Portuguese, Spanish, Slovenian, and Russian). Each corpus has been deduplicated, enriched with Universal Dependencies, provided with additional metadata and converted into a unified JSON structure (schema available at https://versologie.cz/poetree/json-schema). cs (~80k poems) derived from Corpus of Czech Verse de (~74k poems) derived from Metricalizer and Deutsches Lyrik Korpus en (~40k poems) based on texts from Project Gutenberg es (~9k poems) derived from Corpus of Spanish Golden-Age Sonnets and Diachronic Spanish Sonnet Corpus fr (~18k poems) derived from Malherbə hu (~13k poems) derived from ELTE Poetry Corpus it (~40k poems) derived from Biblioteca Italiana pt (~5k poems) derived from Poemas ru (~45k poems) derived from Corpus of Russian Poetry sl (~5k poem) based on texts from wikisource new in v. 0.0.2: PoeTree.sl added PoeTree.de enriched with Deutsches Lyrik Korpus

创建时间:
2024-05-02
二维码
社区交流群
二维码
科研交流群
商业服务