This corpus is manually annotated at several levels – aside from syntactic parsing and morphological information, it is annotation for sentence information structure, multiword expression, coreference
This corpus includes Abkhaz texts published between 1920 and 2016. The corpus is encoded in TEI. The corpus is available for online browsing through the Corpuscle concordancer (CLARINO distribution).
该数据集包含两个版本的Estonian National Corpus 2021,分别是有形态学标注的文本(corpus_et.jsonl)和清理后的纯文本(corpus_et_clean.jsonl)。数据集总大小约为43GB,包含约1.96亿个句子、24亿个单词、1170万篇文档和6450万个段落。这些数据可以用于形态学分析、自然语言理解、语言模型微调等多种自然语言处理任务。