遇见数据集

nb-gpt-gemma3-12b-base-aurora-2604-pretrain

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

aurora-2604是一个用于挪威语预训练的大规模文本数据集,包含挪威语(no)、挪威博克马尔语(nb)和挪威尼诺斯克语(nn)的文本内容。该数据集主要用于基础模型的预训练任务,预训练规模达到3000亿个token,作为挪威语预训练数据源,支持构建挪威语语言模型,适用于文本生成、语言理解等自然语言处理任务。

aurora-2604 is a large-scale text dataset for Norwegian language pre-training, containing text in Norwegian (no), Norwegian Bokmål (nb), and Norwegian Nynorsk (nn). The dataset is primarily used for pre-training foundational models, with a pre-training scale of 300 billion tokens. As a Norwegian pre-training data source, it supports the construction of Norwegian language models and is suitable for natural language processing tasks such as text generation and language understanding.

创建时间:
2026-07-02
原始信息汇总
  • 数据集名称:nb-gpt-gemma3-12b-base-aurora-2604-pretrain
  • 基础模型:google/gemma-3-12b-pt
  • 训练数据集:NbAiLab/aurora-2604
  • 预训练规模:300B tokens(3000亿个词元)
  • 语言:挪威语(包括书面挪威语 nb 和新挪威语 nn
  • 许可协议:other(其他)
  • 标签:borealis、gemma3、norwegian、norwegian-bokmal、norwegian-nynorsk、pretraining、pretrain、base
搜集汇总
数据集介绍
nb-gpt-gemma3-12b-base-aurora-2604-pretrain 数据集图片
构建方式
该数据集基于Google发布的Gemma 3 12B参数预训练基础模型(google/gemma-3-12b-pt),并在挪威语语料库Aurora-2604上进行持续预训练而构建。Aurora-2604数据集由NbAiLab提供,包含丰富的挪威语书面语(包括书面挪威语与新挪威语)文本资源。通过在300B tokens的大规模语料上进一步预训练,模型在保留原有多语言能力的基础上,针对挪威语的语言特征、句式结构与文化语境进行了深度适配,从而形成了专精于挪威语的预训练语言模型基座。
特点
该数据集的核心特点在于其语言聚焦性与领域专精性。它专注于挪威语,同时涵盖书面挪威语(nb)和新挪威语(nn)两种官方书写形式,能够有效应对挪威语特有的语法变异与词汇多样性。基于Gemma 3-12B的强大基础架构,结合300B tokens的高质量挪威语预训练数据,该模型在挪威语的文本生成、语义理解及语境推理等任务上展现出优异的表现。此外,数据集采用Borealis标签,表明其遵循北欧语言模型的开源与协作精神,具有较高的研究与应用价值。
使用方法
用户可通过HuggingFace Transformers库直接加载该模型进行推理与微调。首先,使用`from_pretrained`方法加载模型与分词器,指定模型ID为`NbAiLab/nb-gpt-gemma3-12b-base-aurora-2604-pretrain`。加载后,可基于挪威语文本数据进行零样本推理,或在下游任务(如分类、摘要、对话生成等)中通过少量标注数据进一步微调,以适配特定应用场景。建议在挪威语环境下使用,以充分发挥其在语言理解与生成方面的专长。
背景与挑战
背景概述
在自然语言处理领域,大规模语言模型的预训练对于提升模型在特定语言上的理解与生成能力至关重要,尤其是对于资源相对稀缺的语言,如挪威语。该数据集由挪威国家图书馆(National Library of Norway)等机构的研究人员创建,旨在基于Google的Gemma 3 12B基础模型(gemma3-12b-pt)进行持续预训练,使用了来自挪威语语料库Aurora-2604的300B tokens。该数据集的核心研究问题聚焦于如何将通用的大语言模型适配至挪威语(包括书面挪威语Bokmål和新挪威语Nynorsk),以提升其在低资源北欧语言上的表现,对推动多语言模型在区域性语言的落地具有重要的示范意义。
当前挑战
该数据集面临的挑战主要体现在两个层面。在领域问题层面,挪威语作为低资源语言,面临预训练数据不足、语料多样性有限的问题,需要从多源异构的挪威语文本中高效提取代表性tokens,以避免模型过拟合或产生语言偏差。在构建过程中,研究人员需处理混合语言(Bokmål和Nynorsk)的标准化和清洗,同时平衡大规模预训练(300B tokens)的计算成本与数据质量,确保模型在不丢失通用能力的前提下,有效捕获挪威语的句法和语义特征,这为数据筛选和训练策略带来了技术难点。
常用场景
经典使用场景
在自然语言处理领域,该数据集与Gemma3-12b基座模型协同,专为挪威语(包括书面挪威语与新挪威语)的预训练任务而设计。其经典使用场景在于构建大规模、高质量的语言模型底座,通过对Aurora-2604语料库中300B token的深度习得,捕捉挪威语独特的语法结构、词汇表达及文化语境,从而为下游任务奠定坚实的表征基础。
衍生相关工作
基于该数据集的预训练工作,衍生出了面向挪威语的指令微调模型、领域适应模型以及多语言迁移学习研究。相关经典工作包括在此基础上进行的Borealis系列模型优化,以及针对北欧语言一致性的跨语言对比分析,这些成果进一步拓展了Gemma架构在低资源语言场景下的应用边界,并催生出更多高效的检索增强生成与知识蒸馏方法。
数据集最近研究
最新研究方向
该数据集聚焦于挪威语大语言模型的预训练前沿,依托Google Gemma-3-12B基础架构与Aurora-2604大规模语料库,完成300B tokens的持续预训练,显著增强了模型对书面挪威语(Bokmål)和新挪威语(Nynorsk)的深度语义理解与生成能力。这一工作直接回应当前多语言与低资源语言模型发展的迫切需求,尤其在斯堪的纳维亚自然语言处理领域,推动了北欧语言在生成式AI中的系统性嵌入。结合Borealis生态标签,该数据集为区域性语言基础设施的建设提供了重要范例,助力弥合主流语言与小语种之间的技术鸿沟,具有深远的语言多样性与文化包容性意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务