awesome-nlp-polish
收藏资源简介:
这是一个专门针对波兰语自然语言处理(NLP)的精选资源列表,主要收集和整理波兰语文本数据集、模型、工具和论文等资源。合集涵盖多个领域,包括任务导向数据集(如KLEJ基准、PolEval数据集、CDSCorpus、WCCRS情感语料库等)、原始文本语料(如OSCAR语料库、波兰维基百科转储、Opus平行语料库等),以及模型、库和学术资料,旨在为波兰语NLP研究和应用提供全面的数据集索引和推荐。
This is a curated resource list specifically tailored for Polish natural language processing (NLP), which primarily collects and organizes resources including Polish text datasets, models, tools and academic papers. The collection spans multiple domains, covering task-oriented datasets such as the KLEJ benchmark, PolEval dataset, CDSCorpus and WCCRS Sentiment Corpus, raw text corpora including the OSCAR corpus, Polish Wikipedia dump and Opus Parallel Corpus, as well as models, libraries and other academic materials. It aims to provide a comprehensive dataset index and recommendation for Polish NLP research and practical applications.
波兰语自然语言处理资源汇总
波兰语文本数据集
任务导向型数据集
- KLEJ基准测试:包含9个波兰语语言理解评估任务
- PolEval数据集:
- 仇恨言论分类任务(2019年Task6),区分正常/无害推文与包含有害信息的推文
- 波兰语CDSCorpus:包含1万对波兰语句子,人工标注语义相关性和蕴含关系
- Wroclaw消费者评论情感语料库(WCCRS):涵盖酒店、医疗、产品和大学等领域的波兰语评论,标注文本级和句子级情感
- Ermlab Opineo数据集:包含Opineo评论数据
- HateSpeech语料库:包含2000多条从波兰公共网页爬取的帖子
- 波兰语类比数据集:用于词嵌入评估(如"雅典 希腊 巴格达 伊拉克")
- 波兰国家语料库(NKJP):包含经典文学、日报、专业期刊、对话转录及互联网文本,小部分语料可下载
- PolEmo 2.0情感分析数据集:用于CoNLL任务
- 波兰音乐数据集:最大的波兰艺术家、歌曲和歌词信息数据集(目前仅包含嘻哈艺术家)
原始文本
- Clean Polish OSCAR:预处理后的波兰语OSCAR语料,已去除外语句子和非有效波兰语句子
- OSCAR语料库:通过对Common Crawl语料进行语言分类和过滤获得的多语言语料库,包含109GB或49GB波兰语文本
- 波兰语维基百科转储:每月定期更新,超过4GB文本
- Opus开放平行语料库:
- 波兰语OpenSubtitles v2018:4590万句子,2.871亿词元,来自电影字幕
- ParaCrawl v5:640万句子,1.571亿词元
- 波兰议会语料库(PPC):包含波兰议会(Sejm和Senate)会议记录文本
模型与嵌入
波兰语Transformer模型
- Polish Roberta Model:基于波兰语维基百科、书籍文章和议会语料训练
- PoLitBert:基于波兰语维基百科、文学作品和OSCAR训练的波兰语RoBERTA模型
- PolBert:波兰语BERT模型,可与Hugging Face Transformers合并使用
- Allegro HerBERT:基于波兰语语料训练,使用仅MLM目标和动态整词掩码
- SlavicBert:多语言BERT模型,涵盖保加利亚语、捷克语、波兰语和俄语,12层结构,1.1亿参数
其他模型
- ELMo嵌入:基于大型文本语料库(KGR10)训练的波兰语ELMo模型
- Zalando Flair波兰语模型:包含前向和后向两种上下文字符串嵌入模型
- IPIPAN Word2Vec波兰语模型:多种预训练词向量
- 弗罗茨瓦夫科技大学Word2Vec:基于不同语料库(KGR10、NKJP、维基百科)训练的分布式语言模型
- FastText波兰语模型:基于Common Crawl和维基百科训练
- FastText KGR10波兰语模型:二进制格式
- 通用句子编码器多语言版:覆盖16种语言(含波兰语)的句子嵌入
- BPEmb子词嵌入:包含波兰语,易于与Flair集成
- ULMFiT(TensorFlow 2.0版):基于英语和波兰语维基百科转储训练的语言模型
语言处理工具与库
- Morfologik / pyMorfologik:基于词典的形态分析器(Java/Python)
- Morfeusz:形态分析器,另有Elasticsearch插件
- Stempel / pystempel:算法词干提取器(Python),另有Elasticsearch插件
- spaCy for Polish / spacy-pl:扩展spaCy以支持波兰语,集成现有波兰语工具和资源
- KRNNT波兰语形态标注器:基于循环神经网络的波兰语形态标注器
- Stanza:斯坦福大学NLP分析包,支持句子/词元切分、词形还原、词性标注、依存句法分析、命名实体识别,包含波兰语模型
- Duckling:将文本解析为结构化数据的库,支持波兰语
- NLTK句子分词器波兰语缩写列表:基于维基百科文本整理
论文、文章与博客
- 波兰语NLP工具基准测试:包括单/多词词形还原、词性标注、依存句法分析、浅层句法分析、命名实体识别、摘要等
- 波兰语词嵌入和语言模型列表:包含Word2Vec、FastText、GloVe、ELMo等(GitHub仓库)
- 波兰语词嵌入评测:对多种词嵌入方法进行类比任务评估
- 波兰语句子评估:对八种句子表示方法在五个波兰语语言任务上进行评估
- 从零训练RoBERTa指南:使用Hugging Face Transformers训练波兰语语言模型的完整教程




