遇见数据集

neBrahma-Nepali-Pretrain-Corpus

收藏
Hugging Face2026-06-25 更新2026-06-26 收录
官方服务:

资源简介:

neBrahma尼泊尔语预训练语料库P2b是一个大规模、生产级的尼泊尔语文本语料库,专为语言模型预训练而构建和认证。该语料库包含20,321,968份文档和18.45亿个标记,均为经过清洗和验证的天城文尼泊尔语文本。数据来源于四个多样化渠道:IndicCorp v2(CC0许可)、FineWeb-2(ODC-By许可)、IRIIS Nepali(研究用途许可)和Sagarmatha ASR文本(作者自有许可)。语料库通过一个八阶段的清洗和质量管道处理,包括获取、Unicode NFC规范化、天城文字体转换、精确去重、语言识别、跨源精确去重、近似去重、质量标注与过滤,以及最终的分片和SentencePiece BPE标记化。数据集结构包含三个字段:唯一文档标识符`id`、清洗后的天城文尼泊尔语文本`text`和数据来源`source`。语料库被认证为“适合训练”,无警告,并经过人工抽查确认语言质量。它主要用于尼泊尔语文本生成、语言模型预训练等任务,是neBrahma-llm尼泊尔语多模态大语言模型的训练数据。需要注意的是,IRIIS子集依赖众包转录可能存在潜在不准确性;数据集不包含说话者、地区方言或领域元数据;Sagarmatha ASR子集规模较小;探索性数据分析基于20万份文档的样本;且不同数据来源遵循不同的使用许可。

创建时间:
2026-06-24
原始信息汇总

数据集概述:neBrahma Nepali Pretrain Corpus P2b

该数据集是一个大规模的、面向生产的尼泊尔语文本语料库,专为语言模型预训练而构建。

数据集规模

  • 文档总数:20,321,968 篇
  • 总词元数:1,845,781,044 (BPE 32k)
  • 原始文档输入:26,148,451 篇
  • 整体保留率:77.72%

数据来源与构成

来源 保留文档数 占总文档比例 许可证
IndicCorp v2 17,147,383 84.4% CC0
FineWeb-2 1,583,002 7.8% ODC-By
IRIIS Nepali 1,563,850 7.7% 研究用途
Sagarmatha ASR text 27,733 0.1% 作者自有
总计 20,321,968 100% -

数据字段

字段 类型 描述
id string 唯一文档标识符(格式:{source}:{original_id}
text string 经过清洗和NFC规范化的天城体尼泊尔语文本
source string 数据来源:indiccorp, fineweb2, iriis, 或 sagarmatha

质量认证

  • 结论:FIT TO TRAIN(适合训练)
  • 硬性检查:通过
  • 警告:无(零警告)
  • 人工抽检:300 篇文档全部通过
  • 二进制校验:通过(SHA-256完整性,分片合约)
  • 可逆性:通过(保留数据与剔除数据总和等于原始输入)

数据集划分

  • 训练集词元:1,827,236,028
  • 验证集词元:9,320,924
  • 测试集词元:9,224,092
  • 总分片数:21(19个训练分片 / 1个验证分片 / 1个测试分片)
  • 词表大小:32,000(SentencePiece BPE)
  • 已见词元类型:31,091 / 32,000 (97.16%)

所用语言

  • 语言:尼泊尔语 (ne)
  • 文字:天城体 (Devanagari)
  • 平均天城体字符比率:1.00(纯脚本,无拉丁字符污染)

数据处理流程(八阶段流水线)

  1. 获取:从源API流式获取原始文档
  2. 清洗:Unicode NFC标准化、天城体字体转换、脚本比率预过滤
  3. 精确去重:在同一来源内进行SHA-1哈希去重
  4. 语言识别:GlotLID过滤,保留尼泊尔语天城体且得分>=0.6的文档;对混合语言文档进行行级过滤
  5. 跨来源精确去重:在所有来源(合并后)进行SHA-1去重
  6. 近似去重:MinHash LSH,Jaccard相似度>=0.8时移除近似重复段落
  7. 质量标注与过滤:超过25个信号门控(词数、天城体比率、数字比率、拉丁比率、KenLM困惑度、n-gram重复率、停用词比率等)
  8. 拆分与打包:基于哈希键的确定性训练/验证/测试集拆分,然后进行SentencePiece BPE词元化,打包为uint16分片用于训练

使用方式

python from datasets import load_dataset

加载完整语料库(约8GB Parquet下载)

ds = load_dataset("tonibirat/neBrahma-Nepali-Pretrain-Corpus")

按来源过滤

indiccorp_only = ds["train"].filter(lambda x: x["source"] == "indiccorp")

流式迭代(适用于大规模使用)

ds_stream = load_dataset("tonibirat/neBrahma-Nepali-Pretrain-Corpus", streaming=True) for example in ds_stream["train"]: text = example["text"] src = example["source"]

局限性

  • IRIIS众包噪声:IRIIS子集依赖众包转录,尽管通过了质量过滤,但可能仍存在潜在的不准确之处。
  • 无人口统计学元数据:未包含说话人、方言或领域元数据。可通过 source 字段获取来源信息。
  • Sagarmatha ASR部分较小:Sagarmatha ASR文本子集(27,733篇文档,0.1%)由短话语级转录组成,由于ASR转录的句子较短,保留率较低(54.6%)。
  • EDA样本:文档级EDA可视化基于20万文档样本,而非全部2030万文档。分片级别的词元统计是精确的(基于全部21个分片计算)。
  • 许可合规性:IndicCorp v2为CC0,FineWeb-2为ODC-By(需注明出处),IRIIS为研究用途分发。请根据您的使用场景验证合规性。

数据集标签

  • 类别:文本生成
  • 标签:尼泊尔语、天城体、预训练、大语言模型、文本语料库、neBrahma
  • 大小类别:10M < n < 100M
搜集汇总
数据集介绍
neBrahma-Nepali-Pretrain-Corpus 数据集图片
构建方式
该语料库的构建依托于一个八阶段的精细流水线。首先从IndicCorp v2、FineWeb-2、IRIIS以及Sagarmatha ASR四个来源获取原始文档,共计逾2600万篇。随后进入文本清洗阶段,执行Unicode NFC标准化与天城文转换,并通过语种识别工具GlotLID筛选出尼泊尔语天城文内容。在去重环节,依次实施来源内SHA-1精确去重、跨来源精确去重以及基于MinHash LSH的近似去重,以消除冗余。最后,借助超过25项质量信号门控,包括词数、天城文比例、语言模型困惑度等,对文本进行严格质检与标注,将保留的文档按哈希键值划分为训练、验证与测试集,并经过SentencePiece BPE分词后打包为uint16格式的分片,以供神经语言模型直接训练。
特点
该数据集的核心特色在于其纯净性与规模化。最终语料包含约2032万篇文档,总token数达18.45亿,整体保留率为77.72%,所有保留文档的天城文比例均为1.0,彻底杜绝了拉丁字符等非天城文污染。数据来源多元,其中IndicCorp v2贡献了84.4%的文档量,确保了语料的广度与代表性。经过严格的质量认证,该语料获得‘适合训练’的最高评级,零警告,且通过300篇人工抽查验证,确认了其文本的流畅性与语言规范性。此外,数据集内置了明确的来源标签与作者许可信息,方便用户在合规框架下使用。
使用方法
用户可通过HuggingFace的datasets库便捷加载该语料库。推荐使用流式加载模式以处理大规模数据,例如调用load_dataset并设置streaming=True,逐批次获取文本进行模型预训练。数据集中的每条记录包含唯一标识符、纯天城文文本以及来源标签,支持按来源过滤(如仅使用IndicCorp v2数据)以进行消融实验或领域微调。对于计算资源有限的场景,可以选定数据分片(shard)进行局部训练。此外,由于语料已预先完成分词与打包,开发者可直接将其输入至兼容字节级BPE的模型框架中,大幅降低数据预处理阶段的工程负担,尤其适用于从零开始训练的尼泊尔语多模态大模型项目。
背景与挑战
背景概述
在低资源语言自然语言处理领域,高质量预训练语料库的匮乏长期制约着相关语言大模型的发展。由Toni Birat Gautam主导构建的neBrahma-Nepali-Pretrain-Corpus于2026年面世,旨在为尼泊尔语多模态大模型neBrahma-llm提供训练数据。该语料库汇聚来自IndicCorp v2、FineWeb-2、IRIIS及Sagarmatha ASR四大来源的原始文档,经八阶段清洗管道处理后,最终保留逾两千万份纯天城体尼泊尔语文档,共计18.45亿BPE子词单元。作为首个经过严格质量认证的尼泊尔语预训练语料,其问世为尼泊尔语NLP研究注入关键数据基础设施,显著推动该语言的LLM预训练研究进展。
当前挑战
该数据集所应对的核心领域挑战在于尼泊尔语作为低资源语言长期缺乏大规模、高纯度、可复用的预训练语料。构建过程中面临多重技术难题:跨来源文档需统一进行Unicode NFC标准化并处理非标准字体(如Preeti/Kantipur)的转换;对天城体文字占比、拉丁字符污染、语言识别得分等多维度实施精确过滤以将脚本纯度维持在100%;采用SHA-1精确去重与MinHash LSH近似去重(Jaccard阈值为0.8)的组合策略消除文档内部及跨来源冗余;历经超过25项质量信号门控(包括词长、困惑度、n-gram重复率、停用词比例等)的严格筛检,使整体保留率控制在77.72%。IRIIS众包子集潜在的转录误差及Sagarmatha ASR文本的短句特性进一步增加了质量控制难度。
常用场景
经典使用场景
作为低资源语言预训练语料库的典范,neBrahma-Nepali-Pretrain-Corpus是构建尼泊尔语大语言模型(LLM)的核心基石。该数据集汇集了来自IndicCorp v2、FineWeb-2、IRIIS及Sagarmatha ASR四大来源的逾两千万高质量文档,经过八阶段清洗流程与严格质量认证,最终产出约18.45亿词元,专用于自回归语言模型的预训练。研究者通常直接调用HuggingFace接口加载该语料,配合SentencePiece BPE分词器,在C++/CUDA框架中从头训练尼泊尔语多模态模型,如neBrahma-llm,同时支持文本、语音识别与语音合成任务的联合学习。其纯天城体文字、零拉丁污染的特性,确保了模型在尼泊尔语生成任务中的语言纯度与领域适应性。
实际应用
在实际部署中,基于本数据集训练的模型广泛赋能尼泊尔语智能应用生态。在教育领域,可用于智能辅导、自动作文评分与尼泊尔语语法纠错;在政务场景中,支撑政府公报的自动摘要、政策问答系统与跨部门文档理解;在媒体与文化传播方面,助力新闻生成、社交媒体内容审核、以及天城体文献的数字典藏与自动转写。此外,该语料库还支撑语音助手与对话系统在尼泊尔地区的本地化落地,结合其多模态特性,可实现对尼泊尔语语音命令的准确理解与响应。企业级开发者通过流式加载接口,能够在资源受限环境下高效完成模型微调与部署,推动尼泊尔语智能交互产品的普惠化。
衍生相关工作
围绕该数据集已衍生出一系列具有代表性的研究工作。最核心的是neBrahma-llm项目,这是一个从零构建、基于C++/CUDA自研框架的尼泊尔语多模态大语言模型,融合文本、ASR与TTS能力,直接验证了该语料在统一多模态预训练中的有效性。此外,该数据集为跨源数据融合与质量标准制定提供了范式参考,推动了IndicCorp v2、FineWeb-2等更大规模多语言清洗管线的优化。在方法论层面,其八阶段联合清洗策略、MinHash近似去重及KenLM困惑度门限设立等做法,已被后续研究者借鉴用于其他南亚低资源语言的语料库构建。同时,该语料也为低资源场景下的语言模型预训练效率评测、词表覆盖度分析及数据缩减策略提供了标准化基准。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务