遇见数据集

nb-gpt-gemma3-12b-base-aurora-2604-open-pretrain

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

aurora-open-2604 是一个用于挪威语预训练的开源数据集,专注于挪威语及其两种官方书面变体:博克马尔语(Bokmål)和尼诺斯克语(Nynorsk)。该数据集旨在支持大规模语言模型的预训练任务,特别为适应挪威语的语言特点和文化背景而构建。基于该数据集训练的模型(如nb-gpt-gemma3-12b-base-aurora-2604-open-pretrain)使用了3000亿个token进行预训练,表明数据集具有相当大的规模。它适用于挪威语的自然语言处理基础模型开发、语言理解与生成任务,以及多方言挪威语的语言模型研究。

aurora-open-2604 is an open-source dataset for Norwegian language pretraining, focusing on Norwegian and its two official written variants: Bokmål and Nynorsk. The dataset is designed to support large-scale language model pretraining tasks, specifically built to adapt to the linguistic characteristics and cultural context of Norwegian. Models trained on this dataset, such as nb-gpt-gemma3-12b-base-aurora-2604-open-pretrain, use 300 billion tokens for pretraining, indicating that the dataset is of substantial size. It is suitable for Norwegian natural language processing foundation model development, language understanding and generation tasks, as well as research on multi-dialect Norwegian language models.

创建时间:
2026-07-02
原始信息汇总
  • 数据集名称: nb-gpt-gemma3-12b-base-aurora-2604-open-pretrain
  • 模型基础: google/gemma-3-12b-pt
  • 训练数据集: NbAiLab/aurora-open-2604
  • 预训练规模: 300B tokens
  • 许可协议: 其他 (license: other)
  • 语言: 挪威语,包含书面挪威语 (nb) 和新挪威语 (nn)
  • 数据集标签: borealis, gemma3, norwegian, norwegian-bokmal, norwegian-nynorsk, pretraining, pretrain, base
  • 数据集用途: 基础模型预训练
搜集汇总
数据集介绍
nb-gpt-gemma3-12b-base-aurora-2604-open-pretrain 数据集图片
构建方式
该数据集由NbAiLab构建,以谷歌的gemma3-12b-pt为基座模型,并基于aurora-open-2604数据集进行持续预训练。构建过程聚焦于挪威语语料的深度整合,使用了约3000亿个词元(tokens)进行预训练,旨在强化模型对书面挪威语(bokmål)和新挪威语(nynorsk)两种官方语言形式的理解与生成能力。数据集的构建充分考量了北欧语言环境的特殊性,通过大规模、高质量的语言数据注入,使基座模型能够更好地适应挪威语的词汇、语法与语义特征。
使用方法
该数据集作为预训练基座模型使用,适用于下游挪威语自然语言处理任务的微调与适配。研究人员可直接基于此模型进行指令微调、文本分类、命名实体识别、机器翻译等任务的二次开发。推荐使用Hugging Face Transformers库进行加载与调用,利用gemma3系列的标准接口进行模型权重载入与推理。使用时需注意其遵循的license为'other',应事先查阅相关授权条款以确保合规使用。对于需要高性能挪威语理解能力的应用场景,该模型是一个理想的起点。
背景与挑战
背景概述
该数据集由挪威人工智能实验室(NbAiLab)于2025年发布,基于Google的Gemma 3 12B基础模型进行持续预训练,核心研究问题在于提升大型语言模型对挪威语(包括书面挪威语布克莫尔和新挪威语)的语义理解与生成能力。通过整合NbAiLab构建的aurora-open-2604开源语料库,该数据集在原始Gemma 3模型基础上额外进行了300B token的预训练,旨在填补多语言大型语言模型在低资源斯堪的纳维亚语言上的性能鸿沟。其影响力主要体现在推动北欧语系自然语言处理的边界,为挪威语领域的生成式AI应用提供了可靠的基础模型底座。
当前挑战
领域层面,主要挑战在于解决挪威语(布克莫尔和新挪威语)在预训练语料中占比极低的问题,需克服通用模型因语言分布不均导致的挪威语理解偏差。构建过程中,面临300B token大规模预训练的计算资源调度与优化难题,同时需确保从aurora-open-2604数据集中有效过滤噪音、平衡两种挪威语变体的数据分布。此外,如何在不损失其他语言能力的前提下,维持预训练后的模型在挪威语任务上的泛化性,也是技术实现上的关键瓶颈。
常用场景
经典使用场景
在自然语言处理领域中,针对低资源语言(如挪威语)的预训练语言模型构建一直是学术研究的前沿挑战。nb-gpt-gemma3-12b-base-aurora-2604-open-pretrain 数据集结合了 Google 的 Gemma3-12b 基础架构与挪威语大规模语料库 Aurora Open 2604,为挪威语的词法、句法和语义建模提供了高质量的预训练数据。研究者可利用该数据集在挪威语上从头训练或继续预训练语言模型,尤其适用于北日耳曼语支的语言理解与生成任务,包括文本分类、命名实体识别、句法分析等经典基准场景。该数据集的开放性和规模(300B tokens)使其成为挪威语 NLP 研究社区中不可或缺的基础资源。
解决学术问题
该数据集核心解决了挪威语等斯堪的纳维亚语言在深度学习时代预训练数据匮乏的学术困境。长期以来,挪威语(包括书面语 Bokmål 和新挪威语 Nynorsk)在主流 NLP 研究中受到显著的数据约束,导致其模型性能远低于英语等资源丰富语言。nb-gpt-gemma3-12b-base-aurora-2604-open-pretrain 通过提供大规模、高质量且覆盖挪威语两大标准变体的预训练数据,显著降低了语言建模偏差,提升了跨方言的泛化能力。这一数据集的问世推动了对低资源语言迁移学习、持续预训练与领域自适应等学术问题的深入探索,并为构建公平、包容的多语言 NLP 系统奠定了数据基础。
实际应用
在实际应用中,该数据集驱动的预训练模型可直接赋能挪威语数字生态系统的智能化改造。在政府公共服务领域,支持挪威语自然语言理解的聊天机器人、文档自动摘要与智能问答系统可大幅提升公民服务效率;在媒体与出版行业,挪威语自动内容生成、标题优化与多语言翻译工具可降低人工编辑成本;在医疗与法律专业场景中,基于该数据集的模型可用于挪威语病历文本分析与合同条款审查。此外,挪威语语音助手与教育软件中的语法纠错模块也因预训练模型的语言知识注入而获得性能飞跃。这些实际部署彰显了数据集在弥合低资源语言与先进 AI 技术之间鸿沟的关键作用。
数据集最近研究
最新研究方向
当前,低资源语言的大规模预训练模型研究正蓬勃兴起,挪威语作为小语种的代表,其语言资源匮乏问题成为学界关注的焦点。nb-gpt-gemma3-12b-base-aurora-2604-open-pretrain数据集的出现,标志着基于Gemma-3架构的挪威语基础模型迈入全新阶段。该数据集依托aurora-open-2604语料库,经过300B tokens的深度预训练,显著提升了模型对书面挪威语(Bokmål)和新挪威语(Nynorsk)两种官方语言形态的语义理解与生成能力。紧跟多语言NLP前沿,该工作不仅填补了斯堪的纳维亚语系在开放基础模型上的空白,更通过Borealis项目推动北欧语境下的AI民主化,为低资源语言的预训练范式提供宝贵经验。其发布意味着在文化保护与数字主权语境下,挪威语人工智能基础设施正从依赖泛用模型向专用精准模型演进,对促进语言多样性和技术创新具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务