遇见数据集

maithili-corpus

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

MaithiliCorpus是一个用于迈蒂利语(Maithili)的大规模文本语料库,迈蒂利语是一种使用天城文字母的低资源印度语言,约有3400万使用者。该语料库是当前最大的开放迈蒂利语文本资源,包含经过语言识别(LID)过滤和去重后的39.8百万单词,对应于47,882个文档。数据构成存在领域不平衡,其中文学作品占比55.9%,儿童文学仅占0.7%。该语料库主要用于训练首个迈蒂利语预训练语言模型MaithiliBERT(基于RoBERTa-base架构),支持掩码语言建模(MLM)等自然语言处理任务。需要注意的是,由于数据来源的领域限制,模型可能无法很好地泛化到方言或不同的语域变体,且BPE分词器在处理罕见迈蒂利语单词时可能效率不高。

MaithiliCorpus is a large-scale text corpus for Maithili, a low-resource Indic language written in Devanagari script with approximately 34 million speakers. It is currently the largest open Maithili text resource, containing 39.8 million words filtered and deduplicated via language identification (LID), corresponding to 47,882 documents. The corpus exhibits domain imbalance: literary works account for 55.9% of the total data, while children's literature only makes up 0.7%. It is primarily utilized to train the first Maithili pre-trained language model MaithiliBERT, which is built on the RoBERTa-base architecture, and supports natural language processing tasks such as Masked Language Modeling (MLM). It should be noted that due to domain limitations of the data sources, the model may fail to generalize well to dialects or various register variants, and the BPE tokenizer may exhibit low efficiency when handling rare Maithili words.

创建时间:
2026-07-25
原始信息汇总

数据集概述

数据集名称:MaithiliCorpus
发布机构:AiventraLab
数据集地址:https://huggingface.co/datasets/AiventraLab/maithili-corpus

语言:迈蒂利语(mai)
许可证:CC-BY-4.0


数据集规模与构成

  • 总词数:39.8M 单词
  • 文档数量:47,882 篇
  • 数据版本:gold_deduped(经过语言识别过滤和去重处理)
  • 语域分布:以文学类文本为主(55.9%),儿童文学仅占 0.7%,存在语域不均衡问题

数据集用途

该数据集被用于预训练 MaithiliBERT,一个基于 RoBERTa-base 架构的迈蒂利语首个预训练语言模型,可用于掩码填充(fill-mask)等任务。

模型属性

  • 参数量:124M
  • 词汇表:BPE 分词,50K tokens
  • 上下文长度:512 tokens
  • 训练轮次:10 epochs
  • 有效批次大小:32

已知限制

  • 预训练数据语域不均衡,可能影响模型对非文学类文本的泛化能力
  • 对迈蒂利语方言或语体变化的适应能力有限
  • BPE 分词器在处理罕见迈蒂利语词汇时可能效率不高

相关资源

  • 模型仓库:AiventraLab/maithili-roberta
  • 数据集详细文档:CORPUS_DOCUMENTATION.md(位于数据集仓库内)
  • 计算资源致谢:AnK Komputing(https://ank-world.com)提供了训练所需的算力与基础设施
搜集汇总
数据集介绍
maithili-corpus 数据集图片
构建方式
迈蒂利语料库(MaithiliCorpus)是目前规模最大的开源迈蒂利语文本集合,涵盖约3980万词,语料经过语言识别(LID)过滤与去重处理,最终形成包含47882篇文档的高质量子集。该语料库的构建基于对原始文本的严格清洗流程,确保数据纯净度,并以此为基础训练了首个迈蒂利语预训练语言模型MaithiliBERT。模型采用RoBERTa-base架构,参数规模为1.24亿,词表大小为5万,通过字节对编码(BPE)学习子词单元,并在10个训练周期内以有效批次大小32和混合精度(FP16)完成预训练。
特点
该数据集的显著特点在于其低资源语言的稀缺性与高质量标注的结合。作为约3400万使用者的小众印度语言,迈蒂利语此前缺乏大规模开源语料,而MaithiliCorpus填补了这一空白。语料来源以文学作品为主(占比55.9%),兼顾多样化领域,但儿童文学仅占0.7%,呈现出领域分布不均的特性。此外,数据集经过去重与过滤,减少了噪声干扰,但其BPE分词器对罕见词汇的分割效率有限,且模型可能难以泛化至不同方言或语体变体。
使用方法
用户可通过HuggingFace Transformers库便捷调用该数据集对应的预训练模型。具体步骤包括使用AutoModelForMaskedLM和AutoTokenizer加载AiventraLab/maithili-roberta模型与分词器,并通过pipeline接口执行掩码语言建模任务。例如,给定包含<mask>标记的迈蒂利语句子,模型可预测被遮蔽词语的概率分布。值得注意的是,模型在单一领域不均衡的语料上预训练,建议下游任务前评估其对目标方言或领域的适配性。
背景与挑战
背景概述
MaithiliCorpus是首个专为迈蒂利语(Maithili)构建的大规模开源文本语料库,由AiventraLab团队于2026年创建。迈蒂利语作为印度-雅利安语支中拥有约3400万使用者的低资源语言,长期缺乏高质量、可复用的数字化语言资源与预训练语言模型。该语料库涵盖约3980万词条,经过语言识别过滤与去重处理,并基于其训练的MaithiliBERT模型(基于RoBERTa架构,1.25亿参数)成为该语言首个预训练语言模型。这一工作填补了迈蒂利语在自然语言处理基础资源上的空白,为低资源印度语言的研究提供了重要支撑,对推动多语言人工智能的包容性发展具有显著影响。
当前挑战
MaithiliCorpus所面临的挑战主要体现在两个层面。在领域问题层面,迈蒂利语作为低资源语言,面临标注数据稀缺、语言变体多样(如方言差异)以及形态学复杂性高等固有困难,这些因素严重制约了模型在命名实体识别、文本分类等下游任务上的泛化能力与准确性。在语料库构建过程中,团队需要从互联网与现有数字资源中收集大量噪声数据,并克服语言识别模型对迈蒂利语覆盖不足的问题;同时,语料中存在显著的领域不平衡(如文学类占55.9%,儿童文学仅占0.7%),导致预训练模型可能无法充分覆盖多种语言使用场景,进一步增加了数据质量管控与表示学习上的挑战。
常用场景
经典使用场景
在自然语言处理领域,MaithiliCorpus作为迈蒂利语首个大规模预训练语言模型的基础语料库,其最经典的使用场景是用于掩码语言模型(Masked Language Model)的预训练与微调。研究者可基于该语料库训练类似MaithiliBERT的RoBERTa架构模型,通过捕捉词汇与上下文语义关系,有效提升对低资源语言的文本理解能力。该语料库覆盖约47.9万篇文档、3980万词,经过语言识别过滤与去重处理,为构建高质量语言表示提供了坚实的训练基础。
衍生相关工作
基于MaithiliCorpus衍生出的经典工作包括MaithiliBERT这一首个迈蒂利语预训练语言模型,其采用RoBERTa-base架构,拥有1.24亿参数与5万词级别的BPE词表。相关研究还包括基于该语料库的领域分类任务(四类准确率评测)以及词法规则归纳的验证性研究。该语料库的构建方法——语言识别过滤与去重流程——为其他低资源语言的语料库建设提供了可复用的技术路线,推动了如印地语、比哈尔语等相近语种的自然语言处理研究范式的发展。
数据集最近研究
最新研究方向
在当前低资源语言自然语言处理的前沿浪潮中,迈蒂利语作为印度-雅利安语支中约3400万人口使用的语言,长期面临基础语料匮乏与模型缺失的困境。MaithiliCorpus的构建与MaithiliBERT的发布标志着该领域的关键突破:通过大规模收集、语言识别过滤与去重处理,形成了包含3980万词汇、近4.8万篇文档的开放语料库,并基于RoBERTa架构训练出首个迈蒂利语预训练语言模型。这一工作不仅填补了迈蒂利语在深度学习基础设施上的空白,更引发了学术界对低资源印度语言语言模型迁移学习、跨方言泛化能力及语料库领域偏差控制等热点问题的深入探讨。其采用BPE分词器与掩码语言建模策略,为后续构建更加鲁棒的多语言、多方言预训练体系奠定了实证基础,也推动了对南亚次大陆语言数字化保护的全球性关注。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务