遇见数据集

CKTN

收藏
arXiv2026-07-27 更新2026-07-29 收录
数据链接:
官方服务:

资源简介:

CKTN是由越南温大学和胡志明市理工大学等机构联合构建的首个面向越南少数民族语言(占族语、高棉语和岱侬语)的多语种语料库与基准测试集。该数据集共收录44,367篇文档,包含超过2400万子词标记,数据主要来源于越南之声等政府及地方新闻媒体的持续更新的网络文本。语料库通过自动化爬取、文本清洗和元数据提取流程构建,涵盖持续预训练、28类别分类和摘要-文档检索三大任务场景,旨在解决低资源语言在自然语言处理中因文字系统差异和标准化不足导致的语义泛化难题,为跨脚本语言建模研究提供关键基础设施。

CKTN is the first multilingual corpus and benchmark dataset targeting Vietnamese ethnic minority languages (Cham, Khmer, and Tay-Nung), jointly constructed by institutions including Vietnam Wen University and Ho Chi Minh City University of Technology. This dataset contains 44,367 documents with over 24 million subword tokens. The data is primarily sourced from continuously updated web texts from government and local news media such as Voice of Vietnam. The corpus is constructed via automated crawling, text cleaning, and metadata extraction workflows. It covers three core task scenarios: continuous pre-training, 28-category classification, and summary-document retrieval. This work aims to address the semantic generalization challenges faced by low-resource languages in natural language processing (NLP) due to disparities in writing systems and inadequate standardization, providing critical infrastructure for cross-script language modeling research.

创建时间:
2026-07-09
搜集汇总
数据集介绍
CKTN 数据集图片
构建方式
CKTN数据集的构建始于对越南国家及地方新闻媒体(如越南之声、金瓯报、芹苴报等)的持续爬取,原始HTML经过内容清洗、Unicode标准化及元数据提取(语言、来源、类别、URL、标题、摘要、日期)后,形成结构化JSON文档。针对高棉语无显式词边界的特点,采用khmer-nltk进行分词处理。最终汇集了涵盖占语、高棉语与岱侬语的44,367篇文档、超过2400万子词标记,并按80/20比例划分为预训练与开发集,同时依据各语言最高频的9-10个类别(共28个标签)构建分类基准,以及利用摘要-文档配对构建信息检索基准。
特点
CKTN数据集的核心特色在于其多维度、跨脚本的对比设计:三种语言分属南岛语系、南亚语系与侗台语系,地理上覆盖越南中南部沿海、湄公河三角洲与北部高地,文字系统涵盖拉丁字母与高棉字母。这一设计暴露了现有多语言编码器(如mBERT、XLM-R、RemBERT)对低资源语言的严重碎片化问题,并揭示了常规适应指标(如语言建模困惑度、词汇重叠检索)可能高估表示质量的陷阱——模型可通过学习浅层脚本线索而非语义混淆性来降低损失。基于此,数据集专门用以检验脚本感知的词汇增强与校准式替换标记预训练方法的有效性。
使用方法
CKTN支持三种下游任务范式:继续预训练使用全量文档以词汇增强后的编码器进行掩码语言建模或ELECTRA式替换标记检测;分类任务要求模型将文档归入各语言独立的类别标签(共28类),测试跨文档语义泛化能力;信息检索则以摘要为查询、原文为正向文档,通过衡量MRR@10与Recall@10评估表面形式匹配程度。使用时应优先关注分类性能以评判真正的表示质量,并注意高棉语检索子集仅250对,统计可靠性有限。推荐结合论文提出的脚本感知校准配方(词汇增强、线性调度、脚本约束过滤)以获得最佳分类效果。
背景与挑战
背景概述
在自然语言处理领域,低资源语言的语料库建设始终是一项艰巨挑战,尤其对于越南境内诸多少数民族语言而言,其数字化程度极低,几乎在NLP研究中处于缺席状态。2026年,由VinUniversity、胡志明市科技大学、穆罕默德·本·扎耶德人工智能大学及新加坡国立大学的研究人员联合提出了CKTN数据集,这是首个面向占语、高棉语和岱侬语的多语种语料库与基准测试集。该数据集囊括44,367篇文档、超过2400万子词词元,支持持续预训练、类别分类及摘要-文档检索三大任务。其核心研究问题在于揭示并应对现有多语种编码器在这些语言上因文字系统差异导致的严重碎片化现象,以及常见适应指标可能产生的误导——例如模型可能降低语言建模损失或在词汇重叠检索中表现优异,却仍无法实现跨文档的语义泛化。CKTN的诞生为低资源、多文字、受强势语言接触影响的少数民族语言NLP研究提供了开创性的基础设施,拓展了多语言表征学习的边界。
当前挑战
CKTN数据集所面临的挑战具有层次性与复杂性。首先,在领域问题层面,其旨在解决低资源、多文字少数民族语言在自然语言处理中的系统性匮乏,尤其是占语、高棉语和岱侬语因文字迥异、受越南语影响程度不一、缺乏标准化,导致标准多语种模型极易学习到错误信号,难以实现有效的语义迁移与泛化。传统的语言建模损失或者在词汇层面表现的检索指标并不能真实反映模型的表征质量,模型可能在看似接近的指标下依然无法完成跨文档的语义理解。其次,在数据集构建过程中,挑战同样严峻。数据来源极度稀缺且分散,主要依赖政府及国有新闻平台,导致语料偏向正式新闻语体,缺乏非正式或代码混用文本;类别分布严重不均衡,新闻类占绝对主导;高棉语检索子集仅有250对摘要-文档对,统计可靠性受限。此外,多文字环境下的分词与预训练面临独特困境——现有多语种分词器对这些语言词汇碎片化严重,且文字异构性使标准替换标记检测训练产生捷径,如将高棉文字符替换入拉丁文语境,使判别器仅依据文字标识即可判断真假,而非真正学习语义混淆性。
常用场景
经典使用场景
CKTN数据集作为首个面向越南少数民族语言Cham、Khmer与Tay-Nung的多语料库与基准测试集合,其最经典的使用场景在于支撑低资源语言的自然语言处理研究。具体而言,该数据集为持续预训练、文本分类以及摘要-文档检索三项核心任务提供了标准化评估框架。研究者可借助CKTN中的44,367篇文档与超过2400万子词单元,系统评估多语言编码器在脚本异构且资源极度稀缺条件下的迁移学习能力,尤其聚焦于模型在词汇碎片化严重、脚本差异显著的环境中能否实现有效的语义泛化。
实际应用
在实际应用层面,CKTN数据集为越南少数民族语言的数字化保护与信息无障碍提供了关键基础设施。该数据集所支撑的文本分类技术可应用于政府新闻门户的自动内容归类和舆情监测,使占越南人口约14%的少数民族群体能够更便捷地获取分类化的本土语言资讯。摘要-文档检索功能则服务于少数民族语言新闻档案的智能查询系统,帮助研究者、记者与社区成员快速定位相关文献。此外,该研究提出的脚本感知训练方法可直接推广至全球其他面临相似困境的少数民族语言,为构建包容性的多语言信息处理系统奠定了方法论基础。
衍生相关工作
CKTN数据集的发布催生了一系列具有启发性的衍生工作。在词汇层面,该研究验证了词汇增强策略(如FVT、WECHSEL方法)对多语言编码器性能的显著提升作用,并推动了熵引导式词汇扩展技术在低资源场景中的进一步发展。在预训练目标方面,CKTN提出的脚本感知校准型RTD方法开创了ELECTRA范式在脚本异构环境中的新应用路径,激励后续研究探索类似困难校准机制。在评估框架上,该工作通过揭示分类任务与检索任务对表征质量的不同敏感度,促成了对低资源语言评估指标的重新审视,推动了超越词汇重叠的语义泛化基准的构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务