遇见数据集

Cleaned-Kazakh-Wikipedia

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

Kazakh-Wiki-Clean-228K 是一个经过清洗和结构化的哈萨克语维基百科数据集,包含 228,810 篇主命名空间文章,旨在用于大语言模型(LLM)的预训练与微调以及自然语言处理(NLP)任务。该数据集由 AMAImedia.com 的 NOESIS 专业多语言配音自动化平台(框架:DHCF-FNO)发布,创始人为 Ilia Bolotnikov。数据来源于 Wikimedia Foundation 的哈萨克语维基百科(kkwiki),采用西里尔字母书写。所有文章均经过预处理流程:仅保留主命名空间(NS 0)文章,去除重定向、讨论页和管理类别;丢弃最终长度低于 200 字符的低质量文章;递归剥离嵌套的 MediaWiki 模板、信息框和表格,移除 HTML 标签和技术元数据,将内部维基链接转换为纯文本;移除技术命令(如 __NOTOC__、__NOEDITSECTION__),清理空括号等结构残留,并规范化空白和标点。数据集以 JSON Lines 格式存储,每行包含一个 JSON 对象,字段为“title”(文章标题)和“text”(提取并清洗后的文本内容)。该数据集适用于语言模型预训练与微调、哈萨克语语义表示开发、检索增强生成(RAG)系统的知识库,以及哈萨克语的统计与结构语言学研究。数据集采用 ODC-By 许可证分发,使用时需注明原作者。

Kazakh-Wiki-Clean-228K is a cleaned and structured Kazakh Wikipedia dataset containing 228,810 main namespace articles, intended for pre-training and fine-tuning of large language models (LLMs) and natural language processing (NLP) tasks. The dataset is released by the NOESIS Professional Multilingual Dubbing Automation Platform (Framework: DHCF-FNO) of AMAImedia.com, founded by Ilia Bolotnikov. The data originates from the Kazakh Wikipedia (kkwiki) of the Wikimedia Foundation, written in Cyrillic script. All articles undergo a preprocessing pipeline: only main namespace (NS 0) articles are retained, redirects, discussion pages, and administrative categories are removed; low-quality articles with a final length below 200 characters are discarded; nested MediaWiki templates, infoboxes, and tables are recursively stripped, HTML tags and technical metadata are removed, internal wiki links are converted to plain text; technical commands (e.g., __NOTOC__, __NOEDITSECTION__) are removed, structural remnants such as empty parentheses are cleaned, and whitespace and punctuation are normalized. The dataset is stored in JSON Lines format, with each line containing a JSON object with fields title (article title) and text (extracted and cleaned text content). This dataset is suitable for language model pre-training and fine-tuning, developing Kazakh semantic representations, serving as a knowledge base for retrieval-augmented generation (RAG) systems, and statistical and structural linguistic research on Kazakh. The dataset is distributed under the ODC-By license, requiring attribution to the original authors.

创建时间:
2026-08-16
原始信息汇总

数据集概述:Kazakh-Wiki-Clean-228K

Kazakh-Wiki-Clean-228K 是一个经过清洗和结构化的哈萨克语维基百科文章集合,包含 228,810篇 主命名空间文章,专为大型语言模型(LLM)预训练、微调及自然语言处理(NLP)任务设计。


核心信息

属性 详情
文章总数 228,810
数据来源 维基媒体基金会(kkwiki)
语言 哈萨克语(西里尔字母)
格式 JSON Lines(.jsonl
文章范围 仅包含主命名空间(Namespace 0)文章
许可协议 Odc-by 许可证
发布背景 作为 NOESIS 专业多语言配音自动化平台的一部分发布

数据清洗流程

  • 过滤:仅保留主命名空间文章,排除重定向、讨论页和管理分类,并丢弃长度低于200字符的文章。
  • 标记移除:递归删除嵌套的 MediaWiki 模板、信息框和表格,去除 HTML 标签和技术元数据,并将内部链接转换为纯文本。
  • 规范化:移除技术命令(如 __NOTOC__),清理结构残留物(如空括号、残余括号),并规范化空白和标点。

数据结构

数据以 JSONL 格式存储,每行代表一篇文章,包含两个字段:

  • title:文章标题
  • text:提取并清洗后的文本内容

预期应用场景

  • 语言建模:用于 Transformer 架构模型的预训练和微调
  • 词向量嵌入:开发哈萨克语语义表示
  • RAG 系统:作为检索增强生成管道的知识库
  • 语言学研究:支持哈萨克语的统计和结构分析

许可与署名

该数据集采用 Odc-by 许可证 发布,用户在使用或重新分发时必须注明原作者(创建者:kurumikz)。

搜集汇总
数据集介绍
Cleaned-Kazakh-Wikipedia 数据集图片
构建方式
哈萨克语作为突厥语系中资源相对匮乏的语言,其维基百科数据的系统性清洗与结构化构建,对于推动该语言在自然语言处理领域的研究具有基础性意义。该数据集的构建依托一套定制化的流式抽取管线,面向维吾尔文维基媒体基金会哈萨克语站点(kkwiki)的主条目命名空间进行采集。在数据筛选环节,仅保留主命名空间文章,剔除重定向页、讨论页及管理分类,并将最终文本长度低于200字符的条目予以舍弃,以保障内容质量。在标记清理方面,采用递归方式剥离嵌套的MediaWiki模板、信息框与表格,移除HTML标签及技术元数据,并将内部维基链接转换为纯文本。在规范化处理阶段,清除技术性命令与结构性残留,统一空白与标点,最终形成228,810篇条目的结构化语料。
特点
该数据集以JSON Lines格式存储,每行对应一篇独立文章,包含标题与清洗后正文两个字段,便于流式读取与大规模并行处理。数据规模介于十万至百万量级之间,涵盖哈萨克语西里尔文字书写体系下的百科知识内容。经过多阶段清洗,数据集在保留原始语义信息的同时显著降低了模板噪音与格式冗余,适合作为语言模型的预训练与微调语料。其条目范围限定于主命名空间,确保了文本主题的集中性与知识密度。宽松的开放数据许可协议亦为学术研究与商业应用提供了便利,使用者仅需在使用或再分发时对原作者予以署名。
使用方法
研究者和开发者可通过Hugging Face数据集接口直接加载该语料,或下载JSONL文件进行本地处理。在语言建模任务中,可将标题与正文拼接作为训练序列,用于哈萨克语Transformer模型的预训练或领域适应微调。在语义表示学习中,该数据集可作为训练语料,构建哈萨克语词向量或句子嵌入模型。在检索增强生成系统中,可将其作为知识库,配合检索器实现哈萨克语问答与文本生成。在语言学研究方面,可基于该语料开展词频统计、句法结构分析及语料库语言学探索。使用时需遵循开放数据许可协议,并在成果中注明原作者。
背景与挑战
背景概述
哈萨克语作为突厥语系的重要分支,长期面临数字化语料稀缺的困境,制约了其在自然语言处理领域的发展。Cleaned-Kazakh-Wikipedia数据集由AMAImedia机构的Ilia Bolotnikov主导创建,作为NOESIS多语言配音自动化平台(基于DHCF-FNO框架)的组成部分,于2026年发布。该数据集从哈萨克语维基百科中提取并清洗了228,810篇主体文章,旨在为大型语言模型的预训练、微调及语义表示提供高质量语料。其核心研究问题在于如何从维基百科的复杂标记中还原纯净文本,以支撑低资源语言的模型训练。该数据集的发布显著提升了哈萨克语在LLM和RAG系统中的可用性,为突厥语系的语言技术研究注入了新动力。
当前挑战
该数据集所应对的领域问题在于低资源语言的语料匮乏与质量参差,其核心挑战在于构建过程中如何从维基百科的复杂标记中提取纯净文本。具体挑战包括:MediaWiki模板、信息框和表格的递归剥离,需在保留语义的同时去除嵌套结构;内部维基链接和HTML标签的转换,要求准确映射为纯文本且不丢失关键信息;技术命令与结构伪影的清理,如空括号和残留方括号,需精细处理以避免破坏文本连贯性;长度过滤阈值的设定,需平衡内容质量与数据规模;以及哈萨克语西里尔字母的规范化,确保字符编码一致性。这些挑战共同构成了数据集构建的技术难点。
常用场景
经典使用场景
在低资源语言建模与跨语言迁移学习领域,该数据集最经典的使用场景在于为哈萨克语预训练语言模型提供高质量语料。研究者可直接加载228,810篇经过深度清洗的维基百科正文,开展掩码语言建模、因果语言建模等自监督训练,也可将其作为下游任务微调的领域适应语料,从而显著提升模型对哈萨克语词法、句法及篇章结构的表征能力。
衍生相关工作
以该数据集为基础,后续研究可衍生出哈萨克语词向量训练、指令微调语料构建以及多语言对比学习等经典工作。围绕其清洗流程与数据格式,亦有学者探索低资源语言的语料扩充策略与质量评估方法,进而推动哈萨克语预训练模型、嵌入模型及检索增强系统的迭代发展。
数据集最近研究
最新研究方向
在低资源语言自然语言处理日益受到重视的背景下,Cleaned-Kazakh-Wikipedia数据集为哈萨克语语言模型的预训练与微调提供了高质量、结构化的语料基础,推动了中亚语言数字化研究的纵深发展。当前前沿研究聚焦于利用该数据集构建哈萨克语词嵌入与语义表示,进而支持检索增强生成系统在低资源场景下的知识问答应用。与此同时,伴随大语言模型对多语言覆盖需求的增长,该数据集成为评估模型在突厥语系语言上泛化能力的重要基准之一,其清洗流程与命名空间过滤策略亦为其他维基类语料的预处理提供了可借鉴的方法论,对促进哈萨克语信息检索、机器翻译及语言资源建设具有显著的学术价值与实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务