awesome-kyrgyz-nlp
收藏资源简介:
这是一个关于吉尔吉斯语自然语言处理的数据集合集,收录了多个与吉尔吉斯语相关的数据集资源,包括语料库(如Manas-UdS、kyWaC、Leipzig Corpora Collection、TilCorpusu)、原始文本数据(如kloop语料库)、手写字母识别数据(Kyrgyz MNIST)、LLM评估数据(如KyrgyzLLM-Bench)、形态学与句法数据(如UD树库)、命名实体识别数据(如WikiANN和KyrgyzNER)以及文本分类数据(如Kyrgyz Multi-Label News Classification)。该合集旨在为研究人员和开发者提供开放的、可下载的数据集资源,以支持吉尔吉斯语NLP的研究和应用。
This is a dataset collection for Kyrgyz language natural language processing, which aggregates multiple dataset resources related to Kyrgyz language, including corpora (such as Manas-UdS, kyWaC, Leipzig Corpora Collection, TilCorpusu), raw text data (such as the kloop corpus), handwritten character recognition data (Kyrgyz MNIST), LLM evaluation data (such as KyrgyzLLM-Bench), morphological and syntactic data (such as UD Treebanks), named entity recognition data (such as WikiANN and KyrgyzNER), as well as text classification data (such as Kyrgyz Multi-Label News Classification). This collection aims to provide open and downloadable dataset resources for researchers and developers to support the research and application of Kyrgyz NLP.
数据集与资源概览:Awesome Kyrgyz NLP
该页面汇集了吉尔吉斯语自然语言处理(NLP)相关的开源工具、可下载数据集及研究论文资源。
数据集
语料库
- Manas-UdS:包含 120 万词、84 篇文学作品,涵盖小说、中篇小说、史诗、短篇史诗和童话五种体裁;提供词形、词性标注及丰富的逐篇元数据。
- kyWaC:2012 年 1 月构建的网络吉尔吉斯语语料库,共 1900 万词(非开源)。
- Kyrgyz in Leipzig Corpora Collection:包含社区数据/新闻爬取(100 万句)和维基百科(30 万句)。
- TilCorpusu:1 亿词,来源包括新闻和小说;2023 年 7 月公开(受法律限制仅开放新闻部分)。
原始文本
- kloop corpus:包含 16,826 篇文章(sqlite3 数据库文件)及爬虫代码。
字符识别
- Kyrgyz language hand-written letters (Kyrgyz MNIST):包含 80,213 张手写吉尔吉斯语字母图片,已转换为 50x50 像素和 CSV 格式。
大语言模型评估数据
- KyrgyzLLM-Bench:包含 KyrgyzMMLU(392 个任务)和 KyrgyzRC(80 个任务)原始数据集;GSM8K、HellaSwag、BoolQ、WinoGrande 和 TruthfulQA 为英文数据集的翻译和人工校正版本。
形态与句法
- UD Treebank (KTMU):781 句,后经扩充和修正。
- UD Treebank (TueCL):145 句(含 20 句开罗语料),另含突厥语组建议的约 100 句;英文、阿塞拜疆语和土耳其语译文可用。
- Verbal paradigms for Kyrgyz:100 个吉尔吉斯语动词的完整变位表。
命名实体识别
- WikiANN:包含吉尔吉斯语部分。
- KyrgyzNER:来自 24.KG 新闻门户的 1,499 篇新闻文章,共 10,900 句,39,075 个实体提及,27 个实体类别。
文本分类
- Kyrgyz Multi-Label News Classification:包含 1000/500 篇新闻文档的训练/评估代码及数据集。
词相似度与词义消歧
- Kyrgyz Word Embedding Evaluation:尚未发布,但两个最佳模型已发布在 Zenodo。
- kyrgyz-nlp/disambiguator:研究流行嵌入模型基于锚词选择词义的能力。
指令数据
- Machine-Translated Alpaca:使用 ChatGPT 和 Google Translate 将 Stanford Alpaca 数据集翻译为吉尔吉斯语。
机器可读词典
- Country names table:吉尔吉斯语-俄语-英语国家名称对照表(TSV 格式)。
- KyrSpell:吉尔吉斯语正字词典(使用前需审查许可协议)。
- Tatu Ylonens enwiktionary-based dictionary:基于维基词典的吉尔吉斯语词典,另有派生学习用 Anki 牌组。
机器翻译
- Kyrgyz Language Seed Dataset OLDI:6,193 句吉尔吉斯语-英语平行句。
- TurkLang-7:426,190 句吉尔吉斯语-俄语平行句(未公开)。
- X-WMT:500 句吉尔吉斯语-英语翻译句对。
- NLLBv1:21,360,637 句吉尔吉斯语-英语句对(需注意非吉尔吉斯语句子被检测到)。
- GoURMET project data:14,498 句吉尔吉斯语-英语、23,017 句吉尔吉斯语-俄语句。
- FLORES+:专业翻译,训练集 1012 句,测试集 997 句。
语音数据
- Mozilla Common Voice — Kyrgyz:众包朗读语音及转写文本,CC-0 许可;可在 Hugging Face 上获取。
- CSLT ASR data:128 小时语音,163 位说话人(100 男/63 女),提供语音转写及词级词典;需通过邮件申请许可。
预训练模型
- Polyglot morfessor:针对吉尔吉斯语的预训练 Morfessor 模型。
- fastText:300 维 fastText 词向量(来自 fastText 官方)。
- compressed fastText:由 Bernhard Liebl 制作的压缩版 fastText 模型。
- fastText trained on Leipzig Corpora:基于莱比锡语料库训练的最佳性能 100/300 维 fastText 向量。
- fastText from Kuriyozov et al.2020:基于 SketchEngine 的 KyWaC 训练。
- BERT-based NER:在
bert-base-multilingual-cased上对 Wikiann 微调用于命名实体识别(作者声明不可用,仅为概念验证)。 - Manas-GPT:在《玛纳斯》史诗上训练的 nanoGPT 项目。
- kyrgyz-tokenizers-collection:预训练的吉尔吉斯语子词分词器集合。
- KyrgyzBert:在吉尔吉斯语文本上从头训练的 BERT 模型(6 编码器、8 头、隐藏层 512 维)。
语音模型
- AkylAI TTS Mini:基于 Matcha-TTS 的吉尔吉斯语文本转语音模型,在约 13 小时语音/7,000 样本上训练。
- TurkicTTS:覆盖包括吉尔吉斯语在内的十种突厥语言的多语言语音合成模型。
方法与软件
- spaCy:基础支持,包括分词、停用词、
like_num。 - stanza-ky:名为 ktmu 的流水线(需谨慎使用,存在括号处理可疑问题)。
形态学
- Kyrgyz for Apertium:形态分析和生成、词性标注;提供安装脚本。
- kymopl (已弃用):基于 Prolog 的吉尔吉斯语形态学工具。
仇恨言论检测
- Jupyter Notebook for hate speech detection:仇恨言论检测示例代码。
拼写与正字法
- ӨҮҢизатор:概念验证字母替换 Telegram 机器人,修正 О, У, Н 至 Ө, Ү, Ң。
其他
- Tilchi:开源桌面版电子俄语-吉尔吉斯语词典。
- Number-to-words conversion:数字转文字工具(JavaScript 和 TypeScript 版本)。
- Telegram bot for Kyrgyz morphological analysis:基于 Apertium 数据的吉尔吉斯语形态分析 Telegram 机器人。
在线演示
- Cyrillic-to-Latin online converter:西里尔转拉丁字母在线转换器。
其他资源
- Kyrgyz NLP bibliography:吉尔吉斯语自然语言处理文献目录。
- Turkic Interlingua 和 SIGTURK:突厥语言相关社区与兴趣组。
- Apertiums list of tools:Apertium 上列出的相关工具与资源。
- el-sozduk.kg:在线词典及其他实用资源。
- Turkic languages-related resources:伊斯坦布尔理工大学团队整理的突厥语言相关资源。




