nb-gpt-gemma3-4b-base-aurora-2604-pretrain
收藏官方服务:
资源简介:
该数据集是挪威语预训练数据集aurora-2604,用于支持挪威语大语言模型的开发。数据集包含3000亿个token的挪威语文本数据,覆盖挪威语(no)及其两种主要书面变体:博克马尔语(nb)和新挪威语(nn)。该数据集是borealis项目的一部分,专门用于gemma3系列模型的预训练任务,作为基础预训练数据集使用。数据集许可证为other。
创建时间:
2026-07-02
搜集汇总
数据集介绍

构建方式
该数据集基于Google发布的gemma3-4b-pt基础模型,在挪威国家图书馆与AI实验室联合构建的aurora-2604语料库上进行持续预训练。数据集的构建过程涉及对约3000亿词元的挪威语文本进行深度处理,涵盖书面挪威语(Bokmål)和新挪威语(Nynorsk)两种官方语言变体,以确保模型对挪威语多元表达形态的全面掌握。训练采用Borealis计算基础设施,通过大规模分布式训练框架实现高效词元学习。
特点
作为挪威语自然语言处理领域的重要资源,nb-gpt-gemma3-4b-base-aurora-2604-pretrain数据集展现出鲜明的地域语言特性。其核心优势在于对北欧语言特有语法结构、词汇形态及文化语境的深度建模能力。数据集在保持gemma3架构高效性的同时,通过针对性预训练显著增强了挪威语语义理解与生成质量,并兼顾了Bokmål与Nynorsk两种标准语体的均衡覆盖。
使用方法
该数据集主要面向挪威语下游NLP任务微调与评估,用户可通过HuggingFace Transformers库直接加载基础模型权重。建议在挪威语文本分类、命名实体识别、机器翻译或对话系统等场景中,基于该预训练检查点进行参数高效微调(如LoRA方法)。使用时需注意,模型默认输入格式遵循gemma3的tokenizer规范,并需对挪威语特有字符进行正确编码处理。
背景与挑战
背景概述
在自然语言处理领域,预训练语言模型的技术革新往往受制于特定语言的资源稀缺性。针对挪威语这一小语种,挪威国家图书馆与人工智能实验室(NbAiLab)联合开发了nb-gpt-gemma3-4b-base-aurora-2604-pretrain数据集,其创建于近期,以谷歌Gemma 3-4B基础模型为架构,融合aurora-2604数据集进行300B tokens的预训练。该数据集的核心研究问题在于构建一个覆盖挪威语书面语(博克马尔语与新挪威语)的高质量预训练语料库,旨在推动北欧语言模型的自主化发展,其影响力主要体现在为低资源语言提供可复现的训练范式,并强化北欧地区在多语言AI生态中的话语权。
当前挑战
该数据集面临的挑战首先在于领域问题的解决:挪威语作为小语种,缺乏如英语般海量的公开语料,需从aurora-2604数据集(涵盖图书馆、新闻等多源文本)中筛选出语法规范、领域均衡的语料,以缓解数据稀疏性与偏差问题,从而支持通用语言理解与生成。构建过程中,挑战集中于预训练阶段:如何压缩300B tokens的庞大数据量至Google Gemma 3-4B模型适配的格式,同时避免灾难性遗忘;此外,需处理挪威语特有的形态学变体(如名词性数、动词变位)和博克马尔语与新挪威语之间的语码混杂,确保模型在双语环境中保持鲁棒性,这提升了数据清洗与训练策略设计的复杂度。
常用场景
经典使用场景
该数据集专为挪威语大语言模型的预训练而设计,其经典使用场景在于基于Google Gemma 3 4B基础架构,利用Aurora-2604语料库对模型进行300B token的持续预训练。这一过程旨在强化模型对书面挪威语(bokmål)和新挪威语(nynorsk)的理解与生成能力,为后续的指令微调或领域适应提供坚实的语言基础。研究者通常将其作为挪威语自然语言处理的起点,用以构建适应北欧语言生态的基底模型。
解决学术问题
该数据集主要解决了挪威语大语言模型领域训练数据匮乏与模型适配性的核心学术问题。由于挪威语在全球语料库中占比较低,通用模型常表现出对斯堪的纳维亚语言的欠拟合。通过Aurora-2604高质量语料的预训练,增强了模型对挪威语语法、语义及文化特定表达的捕捉能力,显著提升了低资源语言的表征质量。这一工作推动了多语言模型在区域性语言上的公平性研究,为平衡语言学多样性和模型性能提供了实证基础。
衍生相关工作
围绕该数据集与模型的结合,衍生出了若干经典工作路径:一是基于此基座模型进行监督微调,形成如指令跟随或对话优化的变体版本;二是利用其强大的语言表征进行迁移学习,探索在冰岛语、瑞典语等相近语言上的零样本或少样本性能;三是通过对比实验分析,量化300B token预训练对不同语言变体的影响,为未来多语言模型的训练策略提供参照。这些工作共同丰富了对挪威语深度语言模型泛化能力的认知体系。
以上内容由遇见数据集搜集并总结生成



