NPSC_orto_morphcoded
收藏资源简介:
NPSC Ortho Morphcoded 是一个基于挪威语书面语(Bokmål)的形态学与拼写变体数据集。它源自 NbAiLab/NPSC_orto 数据集中的挪威议会句子,并经过 AltMorph 工具处理,标记出每个句子中允许的形态或拼写替代形式(用方括号括起,竖线分隔)。数据集包含三个字段:id(原始句子标识符)、source(标准化后的句子原文)、target(AltMorph 编码后的句子,其中包含替代形式,如 [broa|broen|brua|bruen])。数据规模为 64,541 行,其中训练集 62,541 行,验证集 1,000 行,测试集 1,000 行。训练集中有 35,886 行被 AltMorph 修改,验证集和测试集分别有 581 行和 563 行被修改。该数据集为银数据(silver data),即目标由自动工具生成,未经人工验证,可能包含假阳性或遗漏有效变体。适用于训练或评估能够识别或生成挪威语形态和拼写变体的系统,也可用于文本生成任务。许可证为 CC BY-SA 3.0。
NPSC Ortho Morphcoded is a dataset of morphological and orthographic variants based on Norwegian Bokmål. It originates from the Norwegian parliamentary sentences in the NbAiLab/NPSC_orto dataset and has been processed with the AltMorph tool to mark allowed morphological or spelling alternatives (enclosed in square brackets and separated by vertical bars) in each sentence. The dataset contains three fields: id (original sentence identifier), source (normalized sentence), and target (AltMorph-encoded sentence with alternatives, e.g., [broa|broen|brua|bruen]). It consists of 64,541 rows, with 62,541 in the training set, 1,000 in the validation set, and 1,000 in the test set. In the training set, 35,886 rows are modified by AltMorph; the validation and test sets have 581 and 563 modified rows, respectively. This dataset is silver data, meaning the targets are generated automatically without human verification, potentially containing false positives or missing valid variants. It is suitable for training or evaluating systems that recognize or generate Norwegian morphological and orthographic variants, as well as for text generation tasks. The license is CC BY-SA 3.0.
数据集概述
NPSC Ortho Morphcoded 是一个面向挪威语(书面语 Bokmål)的文本生成数据集,基于挪威议会语料库(NPSC)构建,并通过 AltMorph 工具添加了形态与拼写变体标注。
数据集内容
- 任务类型:文本生成(text-generation),同时适用于文本到文本生成(text2text-generation)。
- 语言:挪威语书面语(nb / nob)。
- 数据来源:
- 源文本来自 NbAiLab/NPSC_orto。
- 目标文本由 AltMorph 自动生成,AltMorph 会以方括号和竖线形式标注允许的形态或拼写变体。
- 字段说明:
| 字段 | 含义 |
|---|---|
| id | 原始 NPSC 句子 ID(超长句子会附加确定性后缀) |
| source | 经过空白标准化的 NPSC 书面语转写句子 |
| target | 经过 AltMorph 编码的同一句子,例如 `[broa |
- 变体规则:每个括号内的变体按不区分大小写的字母顺序排列,源拼写不占据特殊位置。
数据划分
数据按随机种子 42 划分,验证集和测试集各 1,000 条,其余为训练集。具体统计如下:
| 划分 | 行数 | 经 AltMorph 修改的行数 |
|---|---|---|
| train | 62,541 | 35,886 |
| validation | 1,000 | 581 |
| test | 1,000 | 563 |
长度处理
- 仅对超过 200 个空格分隔单词(约 256 token)的源行进行切分,先按句末标点切句,再按固定词块切分。
- 当前版本中无超长行,所有 ID 均为原始 NPSC 句子 ID 的字符串形式。
- 本版本最大源句长度为 175 个单词。
生成信息
- 生成时间:2026-08-28T07:06:56.938184+00:00
- NPSC 源版本:b6537bebda02239b125a8a415ef75f633f9a8aed
- AltMorph 版本:577585ef7c5caaed53dcada22a7f57e83230f642
- 词性标注器:Humit-Oslo/humit-tagger-large(版本 942f2901ec3271c9f627eb6a78b07ade87cf8126)
- 上下文评分器:north/t5_base_NCC(North-T5)
- 词汇与屈折数据:Ordbank API
- 变体排序:不区分大小写的字母顺序
- 总变体组数:70,365
- 最终排序调整的组数:42,711
- 未变化行数:27,511
预期用途与局限性
- 用途:用于训练或评估识别、生成挪威语合法形态与拼写变体的系统。
- 局限性:
- 属于银标准数据(silver data),目标为自动生成,未经人工验证。
- 可能包含误报、遗漏合法变体,或出现不符合上下文的屈折形式。
- 不应视为每个变体在所有语境中同样常用。
- 保留所有行,包括源等于目标的行。
许可与引用
- 上游 NPSC 的议会转写部分为 CC0,其 Hugging Face 策展部分为 CC BY-SA 3.0。
- 本派生数据集采用 CC BY-SA 3.0 许可。
- 引用时请遵循 NPSC 数据集卡片中的引用指引,并致谢以下贡献者:
- 挪威国家图书馆 / NPSC 数据集维护者
- 奥斯陆大学 HumIT 团队及 Humit-Oslo/humit-tagger-large
- 卑尔根大学 Ordbank 服务
- North-T5 作者及 north/t5_base_NCC
- AltMorph 作者




