遇见数据集

NPSC_orto_morphcoded

收藏
Hugging Face2026-08-28 更新2026-08-29 收录
官方服务:

资源简介:

NPSC Ortho Morphcoded 是一个基于挪威语书面语(Bokmål)的形态学与拼写变体数据集。它源自 NbAiLab/NPSC_orto 数据集中的挪威议会句子,并经过 AltMorph 工具处理,标记出每个句子中允许的形态或拼写替代形式(用方括号括起,竖线分隔)。数据集包含三个字段:id(原始句子标识符)、source(标准化后的句子原文)、target(AltMorph 编码后的句子,其中包含替代形式,如 [broa|broen|brua|bruen])。数据规模为 64,541 行,其中训练集 62,541 行,验证集 1,000 行,测试集 1,000 行。训练集中有 35,886 行被 AltMorph 修改,验证集和测试集分别有 581 行和 563 行被修改。该数据集为银数据(silver data),即目标由自动工具生成,未经人工验证,可能包含假阳性或遗漏有效变体。适用于训练或评估能够识别或生成挪威语形态和拼写变体的系统,也可用于文本生成任务。许可证为 CC BY-SA 3.0。

NPSC Ortho Morphcoded is a dataset of morphological and orthographic variants based on Norwegian Bokmål. It originates from the Norwegian parliamentary sentences in the NbAiLab/NPSC_orto dataset and has been processed with the AltMorph tool to mark allowed morphological or spelling alternatives (enclosed in square brackets and separated by vertical bars) in each sentence. The dataset contains three fields: id (original sentence identifier), source (normalized sentence), and target (AltMorph-encoded sentence with alternatives, e.g., [broa|broen|brua|bruen]). It consists of 64,541 rows, with 62,541 in the training set, 1,000 in the validation set, and 1,000 in the test set. In the training set, 35,886 rows are modified by AltMorph; the validation and test sets have 581 and 563 modified rows, respectively. This dataset is silver data, meaning the targets are generated automatically without human verification, potentially containing false positives or missing valid variants. It is suitable for training or evaluating systems that recognize or generate Norwegian morphological and orthographic variants, as well as for text generation tasks. The license is CC BY-SA 3.0.

创建时间:
2026-08-28
原始信息汇总

数据集概述

NPSC Ortho Morphcoded 是一个面向挪威语(书面语 Bokmål)的文本生成数据集,基于挪威议会语料库(NPSC)构建,并通过 AltMorph 工具添加了形态与拼写变体标注。


数据集内容

  • 任务类型:文本生成(text-generation),同时适用于文本到文本生成(text2text-generation)。
  • 语言:挪威语书面语(nb / nob)。
  • 数据来源
    • 源文本来自 NbAiLab/NPSC_orto
    • 目标文本由 AltMorph 自动生成,AltMorph 会以方括号和竖线形式标注允许的形态或拼写变体。
  • 字段说明
字段 含义
id 原始 NPSC 句子 ID(超长句子会附加确定性后缀)
source 经过空白标准化的 NPSC 书面语转写句子
target 经过 AltMorph 编码的同一句子,例如 `[broa
  • 变体规则:每个括号内的变体按不区分大小写的字母顺序排列,源拼写不占据特殊位置。

数据划分

数据按随机种子 42 划分,验证集和测试集各 1,000 条,其余为训练集。具体统计如下:

划分 行数 经 AltMorph 修改的行数
train 62,541 35,886
validation 1,000 581
test 1,000 563

长度处理

  • 仅对超过 200 个空格分隔单词(约 256 token)的源行进行切分,先按句末标点切句,再按固定词块切分。
  • 当前版本中无超长行,所有 ID 均为原始 NPSC 句子 ID 的字符串形式。
  • 本版本最大源句长度为 175 个单词。

生成信息

  • 生成时间:2026-08-28T07:06:56.938184+00:00
  • NPSC 源版本:b6537bebda02239b125a8a415ef75f633f9a8aed
  • AltMorph 版本:577585ef7c5caaed53dcada22a7f57e83230f642
  • 词性标注器:Humit-Oslo/humit-tagger-large(版本 942f2901ec3271c9f627eb6a78b07ade87cf8126)
  • 上下文评分器:north/t5_base_NCC(North-T5)
  • 词汇与屈折数据:Ordbank API
  • 变体排序:不区分大小写的字母顺序
  • 总变体组数:70,365
  • 最终排序调整的组数:42,711
  • 未变化行数:27,511

预期用途与局限性

  • 用途:用于训练或评估识别、生成挪威语合法形态与拼写变体的系统。
  • 局限性
    • 属于银标准数据(silver data),目标为自动生成,未经人工验证。
    • 可能包含误报、遗漏合法变体,或出现不符合上下文的屈折形式。
    • 不应视为每个变体在所有语境中同样常用。
    • 保留所有行,包括源等于目标的行。

许可与引用

  • 上游 NPSC 的议会转写部分为 CC0,其 Hugging Face 策展部分为 CC BY-SA 3.0。
  • 本派生数据集采用 CC BY-SA 3.0 许可。
  • 引用时请遵循 NPSC 数据集卡片中的引用指引,并致谢以下贡献者:
    • 挪威国家图书馆 / NPSC 数据集维护者
    • 奥斯陆大学 HumIT 团队及 Humit-Oslo/humit-tagger-large
    • 卑尔根大学 Ordbank 服务
    • North-T5 作者及 north/t5_base_NCC
    • AltMorph 作者
搜集汇总
数据集介绍
NPSC_orto_morphcoded 数据集图片
构建方式
该数据集基于挪威议会演讲语料库NPSC_orto构建,通过AltMorph形态标注工具对挪威博克马尔语文本进行自动处理,生成形态学或拼写变体的标注版本。构建过程中,对源文本进行空白规范化,并利用HumIT标签器进行词法和词性分析,AltMorph查询Ordbank API获取允许的形态变体,并以方括号和竖线分隔的格式标注于目标文本中。对于长度超过预设阈值的句子,采用先按句末标点切分再固定词块划分的策略。数据划分阶段,从全量数据中随机抽取各1000条作为验证集和测试集,其余作为训练集,确保各分割间ID不重叠。
特点
该数据集的核心特点在于其生成的形态学变体标注具有系统性和规范性。每个变体块内的备选项按不区分大小写的字母顺序排列,且源拼写不享有特权位置。数据集为银标准数据,未经过人工校验,可能存在误报或遗漏,但完整保留了所有行,包括源目标相同的样本。此外,数据集附带了详尽的生成元信息,包括来源版本、工具版本及处理参数,确保了可复现性。其规模可观,训练集包含6万余条样本,其中超过半数的行包含至少一个变体标注,为挪威语形态学自然语言处理任务提供了丰富资源。
使用方法
该数据集适用于训练和评估能够识别或生成挪威语允许的形态学和拼写替代方案的自然语言处理系统。用户可通过HuggingFace数据集库直接加载,支持文本生成和文本到文本生成任务。使用时应注意到其银标准性质,目标文本可能包含上下文不合适的变体,因此不宜将其视为所有替代形式均在语境中等价的声明。数据集遵循CC BY-SA 3.0许可,使用时需遵守相关引用规范,并致谢挪威国家图书馆、奥斯陆大学HumIT团队、卑尔根大学Ordbank服务、North-T5作者及AltMorph作者。相关构建脚本可在AltMorph仓库中获取,便于用户自定义数据集生成流程。
背景与挑战
背景概述
NPSC_orto_morphcoded数据集诞生于2026年,由挪威国家图书馆与奥斯陆大学、卑尔根大学等机构合作构建,旨在为挪威书面语(Bokmål)提供形态与拼写变体的标注资源。该数据集基于NPSC_orto议会转录文本,通过AltMorph工具自动生成允许的形态或拼写替代形式,以方括号和竖线分隔,为自然语言处理中的形态学规范化与拼写变体识别提供了大规模训练语料。其研究核心在于捕捉挪威语中丰富的形态变体,支持生成任务和拼写标准化模型的开发。该工作推动了低资源语种在形态学层面的技术进展,对挪威语语言技术和北欧语料库建设具有重要影响。
当前挑战
该数据集面临多重挑战:在领域层面,挪威语形态变体丰富且语境敏感,自动标注需精确区分合法替代与上下文限制,且现有模型(如North-T5)难以在所有场景中准确判断;在构建层面,数据来源于议会转录,存在长句分割、空白标准化等预处理难题,同时AltMorph依赖Ordbank API,需处理网络超时、服务器错误及数据缓存一致性,确保生成结果的可靠性与完整性。此外,作为银标准数据,自动生成的替代项可能存在误报或遗漏,且未经过人工验证,这限制了其在严格评估场景下的适用性,并要求使用者在应用中谨慎对待其潜在的噪声与不确定性。
常用场景
经典使用场景
NPSC_orto_morphcoded数据集作为挪威语书面语形态学与拼写变体研究的基石性资源,在自然语言处理领域扮演着不可或缺的角色。其核心应用聚焦于文本生成任务,特别是针对挪威布克莫尔语的标准正交文本与形态编码文本之间的序列转换。研究者利用该数据集训练序列到序列模型,以精准学习并预测允许的形态学与拼写变体。该数据集通过提供包含方括号内以竖线分隔的多种合法形态的标注目标,为模型在词形变化、拼写规范化及形态学生成方面提供了丰富的训练语料,成为挪威语文本规范化、形态学标注及语言生成研究的关键基准。
解决学术问题
该数据集系统性地解决了挪威语形态学与拼写变体自动识别与生成的学术难题。在传统语言资源中,形态变化的非确定性常导致模型输出不符合语言规范。此数据集通过AltMorph工具编码所有允许的形态学与拼写备选方案,为模型提供了明确的监督信号,使其能够学习在特定语境下选择合法且符合语法的变体。同时,数据集保留了无变体的原始句子,有效防止了模型产生过度的形态偏差。这一设计显著推动了挪威语语料库的语言学验证与自动化处理方法,为评估生成模型在形态学层面的表现提供了标准测试平台,从而提升了自然语言生成在低资源语言上的鲁棒性与准确性。
衍生相关工作
该数据集的发布催生了多项开创性后续工作。研究者基于其形态编码结构,探索了多任务学习框架,将形态学变体预测与词性标注、依存句法分析等任务相结合,取得了显著效果提升。在模型层面,相关工作利用该数据微调预训练语言模型,如基于T5架构的挪威语模型,以增强其对形态学规则的表征能力。此外,该数据集亦被用于评估数据增强策略,如通过随机选择合法变体生成多样化的训练样本,从而提升模型的泛化性能。其构建所采用的AltMorph流程、基于上下文评分的启发式方法及可复现的脚本,亦为其他语言构建类似的形态学变体数据集提供了方法学参考,催生了类似资源的生成范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务