遇见数据集

multidomain-kazakh-dataset

收藏
Hugging Face2026-08-25 更新2026-08-26 收录
官方服务:

资源简介:

MDBKD(多领域双语哈萨克语数据集)是一个包含约 24,883,808 个独特文本的哈萨克语数据集,涵盖多个领域。该数据集主要用于因果语言建模和掩码语言建模任务。数据实例包含文本内容、预测语言标签、是否包含哈萨克语符号标志以及唯一标识符。数据集由五个子集组成:cc100-monolingual-crawled-data(维基百科文章)、kazakhBooks(书籍)、leipzig(文章/新闻)、oscar(CommonCrawl)和kazakhNews(新闻)。总文本数约 2488 万,总 token 数约 20.9 亿,唯一 token 数约 1780 万,完整数据集大小为 25GB。数据集不包含额外标注,未进行匿名化处理,可能包含个人姓名。该数据集旨在整理哈萨克语开源数据集,用于进一步研究和商业用途。许可证为 Apache-2.0。

MDBKD (Multi-domain Bilingual Kazakh Dataset) is a Kazakh dataset containing approximately 24,883,808 unique texts, covering multiple domains. It is mainly used for causal language modeling and masked language modeling tasks. Data instances include text content, predicted language label, whether it contains Kazakh script flag, and unique identifier. The dataset consists of five subsets: cc100-monolingual-crawled-data (Wikipedia articles), kazakhBooks (books), leipzig (articles/news), oscar (CommonCrawl) and kazakhNews (news). The total number of texts is about 24.88 million, total tokens about 2.09 billion, unique tokens about 17.8 million, and the full dataset size is 25GB. The dataset does not include additional annotations, has not been anonymized, and may contain personal names. It aims to compile Kazakh open-source datasets for further research and commercial use. The license is Apache-2.0.

创建时间:
2026-08-16
原始信息汇总

MDBKD | Multi-Domain Bilingual Kazakh Dataset

数据集概述

MDBKD是一个多领域双语哈萨克语数据集,包含24,883,808条独特文本,覆盖多个领域。该数据集作为NOESIS专业多语言配音自动化平台的一部分发布,采用Apache-2.0许可证。

数据规模与统计

  • 总文本数:24,883,808条
  • 总词元数:2,091,564,186个
  • 唯一词元数:17,802,998个
  • 数据集大小:25GB

数据划分

数据集包含5个划分,统计如下:

数据划分 领域 文本数量 词元数量 唯一词元数 文本中位词元数
cc100-monolingual-crawled-data Wikipedia文章 19,635,580 441,623,321 6,217,337 12
kazakhBooks 书籍 8,423 351,433,586 7,245,720 40,264
leipzig 文章/新闻 1,706,485 26,494,864 1,109,113 14
oscar CommonCrawl 269,047 230,314,378 3,863,498 431
kazakhNews 新闻 3,264,273 1,041,698,037 5,820,543 209

数据字段

每条数据实例包含以下字段:

  • text:字符串,包含文本内容
  • predicted_language:字符串,预测的文本语言标签
  • contains_kaz_symbols:整数,文本中是否包含哈萨克语符号的标志
  • id:字符串,文本的十六进制哈希值

支持任务

  • MLM/CLM:可用于训练因果语言建模和掩码语言建模模型

语言

  • 哈萨克语 (kk):主要用于哈萨克斯坦普遍使用的哈萨克语

数据来源

标注与敏感信息

  • 标注情况:数据集不包含任何额外的人工标注
  • 个人与敏感信息:数据集未进行匿名化处理,可能包含个人姓名,但不包含原始作者信息

社会影响与用途

该数据集旨在整合哈萨克语的开源数据集,以支持进一步的研究和商业用途。

许可信息

数据集版本1.0.0采用Apache-2.0许可证发布。

联系方式

  • 主要联系人:Sanzhar Murzakhmetov (sanzharmrz@gmail.com)、Besultan Sagyndyk (nuxyjlbka@gmail.com)
  • 创始人:Ilia Bolotnikov
  • 组织:AMAImedia.com

引用信息

如需引用该数据集,请引用以下文献:

Beksultan Sagyndyk, Sanzhar Murzakhmetov, Kirill Yakunin. Kaz-RoBERTa Conversational Technical Report. TechRxiv. October 02, 2025. DOI: 10.36227/techrxiv.175942902.25827042/v1

贡献者

感谢 @KindYAK@BeksultanSagyndyk@SanzharMrz 对该数据集的贡献。

搜集汇总
数据集介绍
multidomain-kazakh-dataset 数据集图片
构建方式
该数据集整合了来自维基百科、书籍、新闻、CommonCrawl及莱比锡语料库等多领域的哈萨克语文本,共计逾2488万条独立文本,涵盖超过20亿个语义单元。构建过程中,数据经由严格的清洗与去重流程,并辅以语言识别与哈萨克字符检测,确保语料的纯净度与代表性。每个数据实例均包含文本内容、预测语言标签及唯一标识符,为多领域语言建模提供了丰饶的语料基础。
特点
该数据集具备显著的多领域均衡性与规模优势,汇聚了维基百科文章、长篇书籍、新闻资讯及网络爬虫文本,展现了哈萨克语在不同语境下的多样性和丰富性。其独特的双语特性(哈萨克语与俄语)为跨语言研究与多语言模型训练提供了宝贵资源。数据集结构清晰,附有详细的统计信息,便于研究者高效筛选与应用,从而推动哈萨克语自然语言处理技术的进步。
使用方法
数据集适用于掩码语言建模与因果语言建模等任务,可无缝接入HuggingFace的Transformers库进行模型预训练与微调。研究者可依据研究目标,灵活选择单一语料或组合多领域数据进行训练,以提升模型对哈萨克语的泛化能力。数据集字段设计简洁,易于解析与批处理,支持大规模高效训练流程,是开发哈萨克语智能应用与学术研究的坚实基石。
背景与挑战
背景概述
MDBKD(多领域双语哈萨克语数据集)于2026年8月26日由NOESIS专业多语言配音自动化平台发布,创始人为Ilia Bolotnikov,所属机构为AMAImedia.com,主要研究人员包括Sanzhar Murzakhmetov、Besultan Sagyndyk及Kirill Yakunin。该数据集旨在整合哈萨克语开源语料,涵盖维基百科、书籍、新闻、CommonCrawl等多领域,规模达2488万条独特文本及20.9亿个词元。其核心研究问题在于为哈萨克语自然语言处理提供大规模、多样化的预训练语料,支持掩码语言建模和因果语言建模任务。作为Kaz-RoBERTa对话模型的基础,该数据集填补了哈萨克语资源匮乏的空白,对低资源语言NLP研究具有重要推动作用,并在多语言配音自动化领域展现出应用潜力。
当前挑战
该数据集面临的挑战主要来自两方面。在领域问题层面,哈萨克语作为低资源语言,开源语料稀缺且分布不均,多领域覆盖(如书籍的长文本与新闻的短文本)导致数据不平衡,增加了模型训练的难度;同时,数据集中包含未匿名化的个人姓名,涉及隐私保护问题,限制了其商业应用与共享。在构建过程中,团队需从五个子集(如CC-100、OSCAR)整合海量数据,需解决格式差异、噪声清洗及语言标识的准确性;此外,数据规模达25GB,存储与处理耗时,需高效管理及去重策略,确保数据质量与一致性。
常用场景
经典使用场景
该数据集作为哈萨克语自然语言处理领域的重要资源,广泛应用于预训练语言模型的训练,特别是掩码语言建模(MLM)和因果语言建模(CLM)。其多领域语料覆盖维基百科、书籍、新闻、CommonCrawl等,为构建高性能的哈萨克语词向量与上下文表示提供了丰富素材,助力学术研究在低资源语言建模方向上取得突破。
解决学术问题
该数据集有效缓解了哈萨克语语料稀缺的困境,解决了低资源语言在预训练阶段数据不足、领域单一等核心问题。通过整合多源异构文本,其规模与多样性支持了跨领域泛化能力的探究,为语言模型的鲁棒性评估、词频统计以及子词切分等学术议题提供了坚实的数据基础,推动了哈萨克语信息处理技术的进步。
衍生相关工作
该数据集催生了诸如Kaz-RoBERTa等针对哈萨克语的专用预训练模型,其技术报告展示了在对话系统上的优化。相关衍生工作还包括跨语言迁移学习研究、多领域语言模型压缩技术,以及基于该数据集的命名实体识别、情感分析等下游任务基准测试,为后续研究者提供了可复现的基线与对比参照。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务