遇见数据集

classla/xlm-r-bertic-data

收藏
Hugging Face2024-05-29 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含115亿个克罗地亚语、波斯尼亚语、黑山语和塞尔维亚语的文本单词,是BERTić-data数据集的扩展。新增了MaCoCu HBS爬取集合和mC4 HBS数据集。数据集通过`onion`工具基于5个单词的元组进行去重,重复阈值为90%。

This dataset contains 11.5 billion textual words in Croatian, Bosnian, Montenegrin and Serbian, and is an extended variant of the BERTić-data dataset. It includes the newly added MaCoCu HBS crawled corpus and mC4 HBS dataset. Deduplication was performed on the dataset using the `onion` tool based on 5-word tuples, with a deduplication threshold of 90%.

提供机构:
classla
原始信息汇总

XLM-R-BERTić 数据集

组成和用途

该数据集包含 115 亿字的克罗地亚语、波斯尼亚语、黑山语和塞尔维亚语文本。

它是 BERTić-data 数据集 的扩展,后者是一个包含 84 亿字的集合,用于预训练 BERTić 模型论文)。在此数据集中有两个主要新增部分:MaCoCu HBS 爬虫集合,一个新闻项目爬虫集合,以及 mC4 HBS 数据集。去重顺序如下:

  • macocu_hbs
  • hr_news
  • mC4
  • BERTić-data
    • hrwac
    • classla_hr
    • cc100_hr
    • riznica
    • srwac
    • classla_sr
    • cc100_sr
    • bswac
    • classla_bs
    • cnrwac

数据集使用 onion 基于 5 元组单词进行去重,重复阈值设置为 90%。

整个数据集可以按以下方式下载和使用: python import datasets dict_of_datasets = datasets.load_dataset("classla/xlm-r-bertic-data") full_dataset = datasets.concatenate_datasets([d for d in dict_of_datasets.values()])

也可以单独获取某个分片,但请注意这会下载和生成所有分片,可能需要较长时间: python import datasets riznica = datasets.load_dataset("classla/xlm-r-bertic-data", split="riznica")

为了避免这种情况,可以使用流式处理: python import datasets riznica = datasets.load_dataset("classla/xlm-r-bertic-data", split="riznica", streaming=True) for i in riznica.take(2): print(i)

输出:

{text: PRAGMATIČARI DOGMATI SANJARI}

{text: Ivica Župan}

如果使用此数据集,请引用以下文献:

@inproceedings{ljubesic-etal-2024-language, title = "Language Models on a Diet: Cost-Efficient Development of Encoders for Closely-Related Languages via Additional Pretraining", author = "Ljube{v{s}}i{c}, Nikola and Suchomel, V{\i}t and Rupnik, Peter and Kuzman, Taja and van Noord, Rik", editor = "Melero, Maite and Sakti, Sakriani and Soria, Claudia", booktitle = "Proceedings of the 3rd Annual Meeting of the Special Interest Group on Under-resourced Languages @ LREC-COLING 2024", month = may, year = "2024", address = "Torino, Italia", publisher = "ELRA and ICCL", url = "https://aclanthology.org/2024.sigul-1.23", pages = "189--203", }

搜集汇总
数据集介绍
classla/xlm-r-bertic-data 数据集图片
构建方式
该数据集是一个面向克罗地亚语、波斯尼亚语、黑山语和塞尔维亚语的高质量大规模文本集合,总量达115亿词。它是对原有BERTić-data数据集的扩展,在84亿词的基础上新增了MaCoCu HBS爬取新闻语料库和mC4 HBS数据集两大来源。构建过程中,数据集按照macocu_hbs、hr_news、mC4以及BERTić-data所包含的多个子集(如hrwac、classla_hr、cc100_hr等)的顺序进行组织,并采用onion工具以5元词元组为基础、重复阈值设为90%进行去重处理,从而确保数据的多样性与纯净度。
特点
该数据集最显著的特点在于其多语言覆盖与规模优势,涵盖了四种密切相关的南斯拉夫语支语言,为低资源语言的预训练提供了丰沛的语料基础。通过整合新闻爬取、通用网络文本以及已有的高质量语料库,数据集在领域多样性和时间跨度上实现了均衡。去重机制的引入有效降低了冗余信息,使得模型训练更加高效。此外,数据集的层级化拆分设计便于研究者按需选取特定子集,兼顾了灵活性与可复用性。
使用方法
研究者可通过HuggingFace的datasets库直接加载整个数据集,使用load_dataset函数获取所有分片的字典,再通过concatenate_datasets合并为完整语料。针对特定子集,亦可指定split参数直接访问,但需注意所有分片会同时下载。为节省存储与时间,推荐采用streaming模式进行流式加载,仅迭代所需样本。例如,加载riznica子集并查看前两条记录,即可快速验证数据格式。详细流式使用方法可参考datasets官方文档。
背景与挑战
背景概述
在自然语言处理领域,针对低资源语言和方言的语言模型预训练数据构建始终是一项重要挑战。classla/xlm-r-bertic-data数据集由卢布尔雅那大学等机构的研究团队于2024年创建,旨在为克罗地亚语、波斯尼亚语、黑山语和塞尔维亚语这四种高度相关的南斯拉夫语言提供大规模、高质量的文本语料。该数据集扩展自BERTić-data,融合了MaCoCu HBS爬取语料与mC4 HBS子集,最终规模达到115亿词,显著超过了此前8.4亿词的版本。这一资源不仅支撑了XLM-R-BERTić模型的预训练,也为多语言编码器在近似语言上的低成本开发提供了关键数据基础,对推动巴尔干地区自然语言处理研究具有里程碑意义。
当前挑战
该数据集面临的核心挑战首先在于所解决的领域问题:为四种高度相似但存在细微差异的语言构建统一的预训练语料,需在保留语言特异性的同时实现跨语言泛化,避免模型混淆方言边界。其次,构建过程中存在多重技术挑战:一是数据来源的多样性与质量平衡,需整合新闻爬取、网络文本、学术语料等异构资源;二是去重难题,采用基于5-gram的onion工具并以90%相似度阈值进行去重,需在去除冗余与保留有效信息间取得精细平衡;三是数据规模带来的存储与处理压力,115亿词级别的语料加载需借助流式读取等高效方案,方可实现实际应用中的可访问性。
常用场景
经典使用场景
在自然语言处理领域,classla/xlm-r-bertic-data数据集的核心经典用途在于大规模预训练语言模型的构建与优化。该数据集汇聚了克罗地亚语、波斯尼亚语、黑山语和塞尔维亚语四种高度相似的南斯拉夫语支文本,总词量高达115亿,为训练跨语言理解模型提供了丰沛的语料基础。研究者常利用该数据集对XLM-R等已有模型进行领域内持续预训练,从而提升模型在巴尔干地区语言上的表征能力与下游任务表现。其去重策略基于5元组词与90%相似度阈值,确保了数据质量与多样性之间的微妙平衡。
衍生相关工作
围绕classla/xlm-r-bertic-data数据集,学术界已衍生出一系列具有代表性的研究工作。最直接的成果是BERTić模型——一个基于该数据早期版本预训练的BERT变体,其在巴尔干语言上的词法、句法与语义任务中取得了当时最优性能。随后,研究者进一步探索了跨语言知识迁移的边界,利用该数据集验证了在紧密相关语言上附加预训练可降低约60%的计算成本而不牺牲精度。此外,该数据集还被用于评估去重算法(如onion)对多语言语料质量的影响,以及作为基准测试材料推动低资源语言预训练范式的理论发展。
数据集最近研究
最新研究方向
在低资源语言与多语言自然语言处理领域,classla/xlm-r-bertic-data数据集的最新研究方向聚焦于通过高效、低成本的附加预训练策略,为克罗地亚语、波斯尼亚语、黑山语和塞尔维亚语等密切相关的南斯拉夫语支语言构建高性能编码器模型。该数据集融合了MaCoCu HBS爬取集合、mC4 HBS子集以及经典BERTić语料库,总规模达115亿词,并采用基于5元词组的onion去重技术确保数据质量。这一工作直接呼应了当前对低资源语言预训练模型的经济性与可扩展性的迫切需求,尤其是在计算资源受限场景下,通过精心设计的语料组合与去重流程,显著提升了模型的泛化能力与领域适应性。该数据集的发布不仅推动了巴尔干地区语言技术的进步,也为其他低资源语言的多语联合建模提供了可复现的范式,具有重要的学术价值与应用前景。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务