nb-gpt-gemma3-4b-base-aurora-2604-open-pretrain
收藏数据链接:
官方服务:
资源简介:
aurora-open-2604是一个大规模、开源的挪威语文本数据集,专门用于语言模型的预训练。它包含了书面挪威语(Bokmål)和新挪威语(Nynorsk)的文本。该数据集被用于训练‘nb-gpt-gemma3-4b-base-aurora-2604-open-pretrain’模型,其训练过程消耗了约3000亿个token。数据集旨在支持挪威语自然语言处理任务的基础模型开发。
aurora-open-2604 is a large-scale, open-source Norwegian text dataset, specifically designed for pre-training language models. It contains texts in both Bokmål and Nynorsk, the two written standards of Norwegian. This dataset was used to train the nb-gpt-gemma3-4b-base-aurora-2604-open-pretrain model, with a training process that consumed approximately 300 billion tokens. The dataset aims to support the development of foundation models for Norwegian natural language processing tasks.
创建时间:
2026-07-02
搜集汇总
数据集介绍

构建方式
该数据集基于挪威语领域的最新需求而构建,旨在为低资源语言的预训练模型提供高质量语料支撑。具体而言,其以Google发布的Gemma3-4b基础模型为架构起点,并结合NbAiLab团队精心整理的aurora-open-2604开放语料库进行二次预训练。整个构建过程在Borealis计算平台上完成,通过对3000亿个token的持续学习,使模型充分吸收挪威语书面语(包括巴克摩语和新挪威语)的语义与语法特征,最终形成针对北欧语言场景优化的基座模型数据集。
使用方法
用户可便捷地通过HuggingFace平台加载该数据集进行下游任务开发。推荐以transformers库的AutoModel和AutoTokenizer接口直接调用,将其作为挪威语文本生成、语义理解或领域迁移学习的预训练权重起点。由于数据集继承了Gemma3的标准化分词方案,使用时无需额外配置词表。对于需要微调的场景,建议在挪威语语料上继续训练以强化领域适配性;而在推理阶段,可结合当前最优解码策略,充分发挥其在北欧语言理解上的独特优势。
背景与挑战
背景概述
该数据集由挪威人工智能实验室(NbAiLab)主导创建,基于Google开源的Gemma 3 4B基座模型,并采用挪威语开放预训练语料库aurora-open-2604进行持续预训练,旨在构建挪威语生成式预训练语言模型。核心研究问题是提升大语言模型在低资源语言——挪威语上的语言建模能力,涵盖书面挪威语(Bokmål)和新挪威语(Nynorsk)两种官方变体。研究团队通过处理约3000亿词元的大规模预训练,推动了北欧语言自然语言处理领域的发展,为挪威语AI基础设施建设提供了关键资源。该工作对多语言模型适应性、低资源语言预训练策略及北欧语言技术自主化具有重要参考价值。
当前挑战
领域问题层面,挪威语作为低资源语言面临深度学习语料匮乏的挑战,尤其需要同时覆盖Bokmål和Nynorsk两种语言变体,且缺乏规模化的高质量预训练数据集。构建过程中,需从aurora-open-2604语料库中清洗、去重并均衡不同语言变体的分布,确保模型能平等习得两种变体的语法和词汇特征。此外,基于Gemma 3 4B模型继续训练,还需解决迁移学习中的灾难性遗忘问题,即在纳入挪威语知识的同时保持模型原有的通用能力。这些挑战共同决定了预训练方案的设计与最终模型性能的优劣。
常用场景
经典使用场景
在自然语言处理领域,针对低资源语言的预训练语言模型构建始终是一项极具挑战性的任务。该数据集专为挪威语(包括书面挪威语和新挪威语)的大规模语言模型预训练而设计,其经典使用场景在于利用Google Gemma 3 4B基础模型,结合Aurora Open 2604海量语料进行持续预训练。研究者能够通过此数据集探索多方言挪威语的统一表征学习,破解小语种模型在数据稀疏条件下的性能瓶颈,为斯堪的纳维亚语系的语言理解与生成任务奠定坚实基础。
解决学术问题
该数据集核心解决了低资源语言预训练中领域覆盖不足与方言差异显著的学术难题。传统预训练模型过度依赖英语等大语种资源,导致挪威语等语言在下游任务中表现欠佳。通过300B tokens的大规模预训练,数据集首次系统性地在挪威语双方言(Bokmål和Nynorsk)上实现了语言模型的持续学习,推动了多方言语言建模的理论发展。其意义在于验证了即使基础模型容量有限,通过高质量语料适配仍可显著提升小语种自然语言理解能力,为全球化语言技术公平性研究提供了关键实证。
实际应用
在实际应用中,该数据集驱动的预训练模型可直接服务于挪威语地区的智能客服、文本摘要、语法纠错与机器翻译等场景。例如,在挪威公共部门的政务系统自动化中,模型能够精准处理新挪威语的用户查询,打破方言差异带来的服务壁垒。此外,该数据集还赋能了北欧语料丰富的学术文献检索与教育智能辅导工具,使挪威语数字生活更加智能无缝,显著提升了小语种AI产品的可用性与本土化适配效率。
数据集最近研究
最新研究方向
该数据集聚焦于挪威语(包括书面挪威语与新挪威语)大语言模型的持续预训练,基于Gemma3-4B基础架构,结合Aurora开放语料库进行3000亿token的深度训练。当前北欧低资源语言模型研究正蓬勃发展,该成果回应了高资源语言主导下小语种AI落地的迫切需求,为挪威语自然语言理解与生成任务提供了坚实的基座模型。其开源特性及与Borealis生态的协同,预示着未来多语言模型在文化保护、政务智能化及区域特色产业应用中的广阔前景,推动了语言多样性与人工智能普惠化的前沿实践。
以上内容由遇见数据集搜集并总结生成



