遇见数据集

NPSC_orto_morphcoded_clean

收藏
Hugging Face2026-08-29 更新2026-08-30 收录
官方服务:

资源简介:

NPSC Ortho Morphcoded Clean 是一个经过共识过滤的挪威语议会转录文本的形态学编码数据集,源自 NbAiLab/NPSC_orto_morphcoded。该数据集保留了原始数据的 id、source 和 target 字段,其中 source 为挪威议会会议转录文本,target 为按字母顺序排列替代项的 AltMorph 编码。清洗过程使用一个基于 T5Gemma 2 1B 模型微调的生成器,对每行生成预测,与原始目标一致的样本被保留;不一致的样本则由两个独立的语言模型评审员分别从随机化的候选 A/B 中选择,仅当两者独立选择同一非 None 候选且通过形态学语法和源文本可恢复性检查后才保留,最终目标被规范化为不区分大小写的字母顺序替代形式。数据集中包含多个分割:训练集(train,62,394 行)、验证集(eval,1,000 行;eval_clean,991 行)和测试集(test,1,000 行;test_clean,993 行),其中 eval_clean 和 test_clean 只包含通过共识清洗保留的行。该数据集适用于文本生成、文本到文本生成、形态学编码等自然语言处理任务,尤其适合挪威语形态学分析和议会文本处理。注意:该数据集为自动生成的银标准数据,使用时应结合人类评估。许可证为 CC BY-SA 3.0。

NPSC Ortho Morphcoded Clean is a consensus-filtered morphological encoding dataset of Norwegian parliamentary transcriptions, derived from NbAiLab/NPSC_orto_morphcoded. This dataset retains the original id, source, and target fields, where source is the Norwegian parliamentary meeting transcription and target is the AltMorph encoding of alphabetically ordered alternatives. The cleaning process uses a generator fine-tuned from the T5Gemma 2 1B model to generate predictions for each row; samples consistent with the original target are retained. For inconsistent samples, two independent language model reviewers select from randomized candidate A/B; the sample is retained only if both independently select the same non-None candidate and pass morphological grammar and source text recoverability checks. The final target is normalized to case-insensitive alphabetically ordered alternative forms. The dataset contains multiple splits: training set (train, 62,394 rows), validation sets (eval, 1,000 rows; eval_clean, 991 rows), and test sets (test, 1,000 rows; test_clean, 993 rows), where eval_clean and test_clean only contain rows retained by consensus filtering. This dataset is suitable for natural language processing tasks such as text generation, text-to-text generation, and morphological encoding, especially for Norwegian morphological analysis and parliamentary text processing. Note: This dataset is automatically generated silver-standard data; human evaluation should be combined when using it. License: CC BY-SA 3.0.

创建时间:
2026-08-29
原始信息汇总

NPSC Ortho Morphcoded Clean 数据集概述

基本信息

  • 语言:挪威语(nb)
  • 许可证:CC BY-SA 3.0
  • 任务类型:文本生成(text-generation)
  • 标签:挪威语、形态学、文本到文本生成

数据集来源与构建方法

本数据集是 NbAiLab/NPSC_orto_morphcoded(修订版 c0a5864ffde32ca05a683652b54282ee785ca16d)的共识过滤衍生版本,保留了原始数据的 id、source、target 架构及原始源文本。

清洗流程

  1. 使用基于 T5Gemma 2 1B 微调的模型对每一行生成一个预测,保留模型与目标完全一致的条目。
  2. 对不一致的条目,交由两个独立的自动语言模型审查者进行审查(只可选择 A、B 或 None),且审查者无法看到候选来源或对方判断。
  3. 仅当两位审查者独立选择相同的非 None 候选时才保留该不一致条目,其余全部丢弃。
  4. 通过 AltMorph 语法检查和源文本可恢复性检查的候选才保留,目标候选按不区分大小写的字母顺序规范化。

数据规模与划分

划分 行数 源与目标不同行数
train 62,394 35,830
eval 1,000 581
eval_clean 991 582
test 1,000 563
test_clean 993 561
  • train:清洗后的原始训练集。
  • eval / test:保留全部原始评估/测试行及标签,用于直接对比。
  • eval_clean / test_clean:仅包含共识清洗筛选后的行及选定目标。

字段说明

字段 含义
id 原始 NPSC 句子 ID(字符串)
source 挪威议会转录文本
target 保留源文本的 AltMorph 编码,备选按字母顺序排列

划分重叠情况

各划分的 ID 互不重叠,但上游随机划分存在重复行。相对清洗后的 train 集,eval 与 test 中完全重复的源/目标对分别有 105 和 99 行,评估时不应视为独立泛化。

来源与引用要求

  • 生成时间:2026-08-29
  • 清洗模型:google/t5gemma-2-1b-1b 微调版本
  • 上游数据:议会转录文本为 CC0,Hugging Face 策展及本衍生数据集使用 CC BY-SA 3.0。
  • 需致谢:挪威国家图书馆及 NPSC 维护者、奥斯陆大学 HumIT 团队、卑尔根大学 Ordbank 服务、North-T5 作者、AltMorph 作者以及 Google/T5Gemma 团队。

局限说明

  • 本数据集仍为自动生成的银标准数据,训练集上的预测可能反映记忆效应。
  • 模型与目标共享的错误可能通过自动一致性过滤。
  • 审查者判断可能存在相关性或语言学错误。
  • 建议使用 eval/test 与原始银标准对比,使用 eval_clean/test_clean 作为更严格的保留子集,并在重要应用中辅以人工或语言学专家评估。
搜集汇总
数据集介绍
NPSC_orto_morphcoded_clean 数据集图片
构建方式
该数据集源自挪威议会语料库(NPSC)的正字法形态标注版本,经由严格的共识过滤流程精炼而成。构建过程首先利用基于T5Gemma 2 1B模型微调的序列到序列生成器,对原始语料中每一条源句生成候选目标形态编码。随后,仅保留生成结果与原始目标完全一致的样本;对于存在分歧的条目,则引入两个彼此隔离的自动化语言模型评审代理进行独立裁决,评审者仅基于随机化的候选项进行选择,且必须双方一致选定同一非空候选项方予采纳。最终,所有保留的候选目标还需通过AltMorph语法校验及源文本可恢复性检查,并统一为字母顺序排列的规范形式。
特点
该数据集的核心特色在于其三重质量保障机制:生成器与原始标签的自动一致性过滤,配合双代理共识评审,以及严格的语法与可逆性验证,确保了标注的高度可靠性。数据划分精心设计,提供保留全部原始样本的eval/test集与仅含精炼后样本的eval_clean/test_clean集,便于模型性能对比与消融研究。值得注意的是,数据集中存在跨划分的重复句子对,这一特性在文档中明确标注,警示研究者在评估时应谨慎解释泛化能力,避免因重复导致的乐观偏差。此外,所有目标均经过去重与规范化排序,增强了数据的结构化程度。
使用方法
该数据集专为挪威语的形态学文本生成任务设计,适用于训练和评估基于文本到文本框架的模型。研究者可利用默认的train划分进行模型微调,其中包含了丰富的源与目标不一致的样本,以增强模型的对齐能力。对于性能评估,建议使用eval与test划分与原始银标签数据集进行直接对比,或选用eval_clean与test_clean子集以检验模型在高度精炼标注上的表现。由于数据自动生成性质,用户应当意识到其潜在的记忆化风险及评审代理的局限性,并在关键应用中辅以人工或语言学家的验证。数据使用需遵循CC BY-SA 3.0许可,并按要求注明多方来源。
背景与挑战
背景概述
NPSC_orto_morphcoded_clean数据集由挪威国家图书馆与奥斯陆大学等机构于2026年联合构建,源自挪威议会语料库(NPSC)的形态学编码版本,经过共识过滤与自动化质量审核,旨在提供高纯净度的挪威语文本到文本生成资源。该数据集的核心研究问题在于如何通过自动化流程筛选并验证形态学编码的一致性,以支持低资源语言的语法分析与生成任务。其发布为挪威语自然语言处理领域提供了可靠的基准,尤其在形态丰富语言的预训练与微调评估中具有显著影响力。
当前挑战
该数据集面临的挑战包括:首先,源领域问题在于挪威语形态复杂且歧义多,传统标注依赖人工且成本高昂,需开发自动化编码方案;其次,构建过程中,清洗方法依赖T5Gemma模型预测与双重模型审核,但模型间错误可能相关,共识过滤无法绝对保证语义保留,且训练集中存在重复样本,可能高估模型泛化能力。此外,银标准数据的固有局限,如记忆效应与审核偏差,仍需人类专家评估以验证可靠性。
常用场景
经典使用场景
NPSC_orto_morphcoded_clean数据集为挪威语自然语言处理领域提供了一项严苛清洗后的形态学标注资源,其核心使用场景聚焦于形态学感知的文本生成任务,涵盖从原始议会语料到规范化AltMorph编码的无损转换。该数据集通过共识过滤机制,剔除了自动化标注中的分歧与噪声,保留了高置信度的源-目标配对,尤其适用于训练并评估端到端的形态学重写模型,推动挪威语在低资源条件下的形态学分析与生成研究。其精心划分的训练、验证与测试子集,既支持直接对比实验,也便于对模型泛化能力进行更为严谨的检验。
解决学术问题
该数据集的构建化解了自动形态学标注中长期存在的质量不可控难题,为学术界提供了一个经由双重独立审查与严格语法校验的语料库。它有效缓解了对齐噪声对模型训练的干扰,使得形态学编码的源恢复性得以保障,从而为探究形态学交替(如屈折变化、词干映射)提供了可靠实验床。此举不仅提升了形态学生成任务的评估可信度,亦为清洗流程中蕴含的自动化质量控制的通用方法论提供了范例,对于促进低资源语言的形态学理论建模与数据驱动研究具有深远意义。
衍生相关工作
围绕NPSC_orto_morphcoded_clean,衍生研究可划分为数个方向:其一聚焦于迭代式的质量提升,以共识过滤策略为基础,探索更为精细的人工审核与半监督学习机制,以构建黄金标准形态学测试集;其二利用其高信噪比的数据特性,微调预训练语言模型以解析AltMorph编码,进而衍生出面向北欧诸语的多任务形态学框架;其三则借鉴其清洗评估流程,开发通用性的语料去噪工具,并应用于其他语种或标注类型的衍生集。此外,将清洗前后数据集的对比性能作为基准,亦促成了一套关于标注不确定性的测量方案,这些工作共同推动了基于共识的语料库工程与形态学自然语言处理研究的深入拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务