遇见数据集

Til-Corpus-Additions-v2

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

Til-Corpus-Additions-v2 是一个用于哈萨克语 Til-Corpus 的预训练文本补充数据集。它整合了来自 TilQazyna 2026 年新来源的高质量、经过评判的文本,旨在实现“识别/抓取文本同时加入 Til-Corpus”的总体规划。数据来源包括:KazNEB OCR 书籍、zharar 散文、KK 教育网络爬虫以及 600-kitap 有声读物的自动语音识别(ASR)转录文本。数据集仅包含每个来源 `processed/` 分割中评判分数不低于 3 的“优质”和“干净”文本行,并统一为单一模式。每条数据记录包含文本内容及其来源元数据,具体字段包括:文本内容 (`text`)、语言/分数/类别等评判标签 (`lang`/`score`/`category`)、质量层级 (`tier`,分为“premium”和“clean”)、数据来源 (`source`) 以及获取方式 (`route`)。该数据集主要面向哈萨克语的非商业研究用途,计划在去重后合并到未来的 Til-Corpus v2 中,适用于文本生成等预训练任务。

Til-Corpus-Additions-v2 is a supplementary pre-trained text dataset for the Kazakh-language Til-Corpus. It integrates high-quality, annotated texts from new sources of TilQazyna 2026, aiming to fulfill the overall plan of "identifying/scraping texts and incorporating them into Til-Corpus". Data sources include: KazNEB OCR books, zharar prose, KK education web crawler data, and automatic speech recognition (ASR) transcriptions from 600-kitap audiobooks. The dataset only retains "high-quality" and "clean" text lines with an annotation score of no less than 3 in the `processed/` split of each source, and unifies them into a single format. Each data entry contains the text content and its source metadata, with specific fields including: text content (`text`), annotation labels such as language/score/category (`lang`/`score`/`category`), quality tier (`tier`, divided into "premium" and "clean"), data source (`source`), and acquisition method (`route`). This dataset is primarily intended for non-commercial research purposes related to the Kazakh language. It is planned to be merged into the future Til-Corpus v2 after deduplication, and is applicable to pre-training tasks such as text generation.

创建时间:
2026-06-23
原始信息汇总

数据集概述

Til-Corpus-Additions-v2 是一个面向哈萨克语的预训练文本补充数据集,用于扩展原有的 Til-Corpus。该数据集由 TilQazyna 从2026年新增的多个来源中收集高质量文本,经筛选后统一格式。

数据来源

数据集包含以下四种来源经过评判后的高质量文本:

  • Til-Books-KazNEB:来自哈萨克斯坦国家电子图书馆的OCR识别书籍。
  • Til-Zharar-v2:来自于Zharar文章的文本。
  • Til-Web-KK:来自哈萨克语教育网络爬取的内容。
  • Til-Audio:来自600-kitap有声书的ASR转录文本。

数据筛选与分类

  • 仅保留每个来源中 processed/ 分片里评判分数≥3的 premiumclean 行。
  • tier 字段用于区分质量等级:
    • premium:分数≥4 且语言为哈萨克语的行。
    • clean:其余符合基本质量标准的行。
  • 所有行统一为单一的 text 文本架构。

字段说明

字段 含义
text 文档、页面或转录文本内容
lang / score / category 由 Qwen 模型评判的语言、分数和类别标签
tier 质量等级(premium / clean
source 数据来源(Til-Books-KazNEB / Til-Zharar-v2 / Til-Web-KK / Til-Audio)
route 数据获取路径(ocr / web / asr

使用方式

可通过 Hugging Face Datasets 库加载训练集,示例代码如下:

python from datasets import load_dataset ds = load_dataset("TilQazyna/Til-Corpus-Additions-v2", split="train") premium = ds.filter(lambda r: r["tier"] == "premium")

预期用途

该数据集计划在进行去重处理后,合并到未来的 Til-Corpus v2 中,用于非商业性的哈萨克语研究。

许可与语言

  • 许可协议:其他(非商业许可)
  • 语言:哈萨克语(kk)、俄语(ru)
搜集汇总
数据集介绍
Til-Corpus-Additions-v2 数据集图片
构建方式
Til-Corpus-Additions-v2 是哈萨克语 Til-Corpus 的预训练文本扩展数据集,旨在聚合来自 TilQazyna 2026 年新增源的优质文本。数据源自 KazNEB 光学字符识别图书、zharar 论文、哈萨克语教育网络爬虫以及 600-kitap 有声读物自动语音识别转录文本。构建过程中,仅保留每个源 processed/ 分割中评分不低于 3 的“优质”与“纯净”行,并统一为单一文本模式。每一条数据均携带来源与元数据标签,包括文本内容、语言、评分、类别、层级(优质或纯净)以及来源与路径信息,确保可追溯性和高质量。
特点
该数据集的核心特点在于其严格的质控机制与多元化的数据来源。通过 Qwen 模型对文本进行语言、评分与类别标注,并依据评分与语言设定“优质”与“纯净”两个层级,其中评分不低于 4 且为哈萨克语的文本被归为优质,其余为纯净。数据涵盖图书、论文、网页及音频转录等多种形态,覆盖哈萨克语与俄语,但聚焦于哈萨克语研究。每一样本均附带完整的来源与路径信息,便于用户按需筛选与分析,充分体现其作为预训练语料的高纯净度与结构化优势。
使用方法
用户可通过 HuggingFace Datasets 库便捷加载该数据集,示例代码为:from datasets import load_dataset; ds = load_dataset('TilQazyna/Til-Corpus-Additions-v2', split='train')。为获取最高质量的子集,可使用 filter 方法筛选 tier 字段为 premium 的行。该数据集设计用于未来的去重与合并,以构建更完善的 Til-Corpus v2。需注意,其使用范围限定于非商业性的哈萨克语学术研究,遵循其特定的许可协议。通过灵活的过滤机制,研究人员可根据需求提取特定来源或层级的文本,助力语言模型预训练与自然语言处理任务。
背景与挑战
背景概述
Til-Corpus-Additions-v2 是由哈萨克斯坦研究机构 TilQazyna 于2026年发布的高质量哈萨克语预训练语料补充集。该数据集聚焦于提升低资源语言哈萨克语的自然语言处理能力,核心研究问题在于通过整合多源异构文本——包括 KazNEB 光学字符识别书籍、Zharar 学术论文、KK 教育网页爬取数据以及 600-kitap 有声书自动语音识别转录——来构建统一且纯净的语料库。数据集采用自动评判机制(Qwen 评分),仅保留评分≥3的高品质样本,并按质量分为“premium”与“clean”等级。这一工作为哈萨克语大语言模型预训练奠定了重要数据基础,对低资源语言 NLP 研究具有显著推动力。
当前挑战
该数据集所解决的领域挑战在于哈萨克语作为低资源语言,缺乏大规模、高质量的统一预训练语料,现有数据往往存在噪声大、来源分散、标注不一致等问题。在构建过程中,Til-Corpus-Additions-v2 面临多重技术难题:首先是多源异构数据的清洗与去重,例如 OCR 文本的识别错误、ASR 转录的错词、网页爬取的格式混乱;其次是跨模态数据的统一 schema 设计,需平衡不同来源(如图书、论文、网页、音频)的文本特征;此外,自动评分系统需准确区分“premium”与“clean”层级,避免低分数据污染预训练效果。最终,数据集的非商业许可也限制了其在工业界的广泛应用。
常用场景
经典使用场景
在哈萨克语自然语言处理领域,Til-Corpus-Additions-v2数据集作为高品质预训练文本的补充资源,为构建大规模语言模型提供了关键支持。其经典使用场景包括与现有Til-Corpus融合,形成更完整、更具代表性的哈萨克语语料库,专为非商业性学术研究设计。研究人员可借助该数据集筛选出评分不低于3分的优质文本,包括源自KazNEB光学字符识别书籍、zharar论文、KK教育网页爬取及600-kitap有声读物自动语音识别转录的内容,从而训练出语言理解能力更强的模型。
实际应用
在实际应用层面,Til-Corpus-Additions-v2数据集为哈萨克语的文本生成系统、智能对话助手和机器翻译平台提供了高质量的训练素材。例如,利用其中的‘premium’层级数据,开发者可以微调大模型,使其在哈萨克语文章创作、教育辅助内容生成以及语音识别后文本校正等场景中展现更流畅的表现。此外,其标注的 provenance 字段使得应用系统能够追溯文本来源,从而在跨领域任务如法律文档分析或学术论文预处理中保持更高透明度与可靠性。
衍生相关工作
该数据集的发布催生了一系列具有影响力的衍生工作,其中最为典型的是基于其整合策略形成的未来Til-Corpus v2版本,后者将进一步通过去重与融合操作,成为哈萨克语语料库建设的标杆。此外,研究者借鉴其多源评分过滤流程,开发了类似的高质量语料提取工具,用于其他低资源语言如鞑靼语或蒙古语的预训练数据构建。该数据集还启发了针对哈萨克语OCR与ASR文本的联合质量评估框架,推动了跨模态语言资源建设的学术协作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务