Kurd-LLM-Dataset
收藏资源简介:
Kurd-LLM-Dataset 是一个大规模、精心编制的库尔德语语言资源库,由 Kurdish-Tech 组织创建。该数据集旨在弥补低资源语言建模的不足,作为开发库尔德语高级AI应用、文本处理工具和翻译引擎的核心基础设施。它包含超过50万个单词、术语和定义,覆盖 Kurmancî 和 Soranî 方言,原始数据大小约166 MB,源自 wq ferheng 数据库,并格式化为机器可读形式。
Kurd-LLM-Dataset is a large-scale, meticulously curated Kurdish language resource created by the Kurdish-Tech organization. This dataset aims to address the gap in low-resource language modeling, serving as a core infrastructure for developing advanced Kurdish AI applications, text processing tools, and translation engines. It contains over 500,000 words, terms, and definitions, covering both the Kurmancî and Soranî dialects. The original dataset has a size of approximately 166 MB, sourced from the wq ferheng database, and is formatted into machine-readable form.
🧠 Kurd-LLM-Dataset 数据集详情
📌 概述
Kurd-LLM-Dataset 是一个大规模、精心编译的库尔德语语言资源库,由 Kurdish-Tech 组织创建。该数据集旨在弥合低资源语言建模的差距,为库尔德语的高级AI应用、文本处理工具和翻译引擎提供核心基础设施。
📊 数据集规格
- 总记录数: 超过 500,000 个词汇、术语和定义
- 大小: 约 166 MB(原始文本/数据)
- 涵盖方言: Kurmancî(北库尔德语)和 Soranî(中库尔德语)
- 数据来源: 完全从 wq ferheng 大型数据库编译和工程化处理,格式化为机器可读
🚀 目的与用例
该数据集发布旨在赋能库尔德语在数字和AI时代的发展,高度优化用于以下场景:
- 训练大型语言模型(LLM): 微调基础模型(如 LLaMA、GPT 等),使其原生理解和生成库尔德语文本
- 自然语言处理(NLP): 情感分析、分词、词干提取和句法分析
- 机器翻译: 构建库尔德语方言与全球语言之间的高精度翻译矩阵
- 语音识别(STT/TTS): 提供语音映射和语音AI训练的文本基线
🤝 贡献与组织
该项目由 Kurdish-Tech 维护,鼓励研究人员、数据科学家和开发者 fork、分析并在此基础上构建应用。




