遇见数据集

nb-asr-supermorphed-nno

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

NbAiLab/nb-asr-supermorphed-nno 是一个专为挪威尼诺斯克语(Nynorsk)设计的文本到文本生成数据集,旨在将普通尼诺斯克文本转换为AltMorph括号编码格式。该数据集包含训练集(482,592行,9,457,601个源词)、验证集(1,000行)和测试集(1,000行),此外还有一个审计配置(audit),用于存储被拒绝的样本、候选文本、解码投票及拒绝状态。每个样本都保留了原始来源信息,如源数据集、不可变修订版本、行ID、文档ID、类型和许可证。数据集构建过程严格:采用NFC和空白标准化、去重、语言识别(LID)过滤非挪威语文本、基于E5编码器的语义聚类,以及教师-学生工作流生成候选。规则教师模型使用AltMorph、HumIT标签器、Ordbank和North-T5;学生模型使用T5Gemma 2 1B进行微调。最终通过三重盲审解决分歧,确保高质量。该数据集适用于任何需要从尼诺斯克文本生成AltMorph编码的任务,如文本规范化、形态学转换或机器翻译中的中间表示。

NbAiLab/nb-asr-supermorphed-nno is a text-to-text generation dataset designed specifically for Norwegian Nynorsk. It aims to convert ordinary Nynorsk text into the AltMorph bracket encoding format. The dataset contains a training set (482,592 rows, 9,457,601 source words), a validation set (1,000 rows), and a test set (1,000 rows), plus an audit configuration for storing rejected samples, candidate texts, decoding votes, and rejection status. Each sample retains original source information such as source dataset, immutable revision, row ID, document ID, type, and license. The dataset construction process is rigorous: it employs NFC and whitespace normalization, deduplication, language identification (LID) filtering to remove non-Norwegian text, semantic clustering based on E5 encoder, and a teacher-student workflow to generate candidates. The rule-based teacher model uses AltMorph, HumIT tagger, Ordbank, and North-T5; the student model is fine-tuned T5Gemma 2 1B. Final disagreements are resolved through triple-blind review to ensure high quality. This dataset is suitable for any task requiring generation of AltMorph encoding from Nynorsk text, such as text normalization, morphological transformation, or intermediate representation in machine translation.

创建时间:
2026-09-04
搜集汇总
数据集介绍
nb-asr-supermorphed-nno 数据集图片
构建方式
该数据集构建于挪威尼诺斯克语自然语言处理与形态学编码的交叉领域,旨在建立从常规文本到AltMorph括号编码的直接映射。构建流程严格限定使用上游训练材料,经NFC标准化与空白符归一化后切分为不超过200词的行,并筛选至多1000万源词且排除超过120词的行。去重后采用固定版本的北欧语言辨识模型进行高置信度外语否决,利用多语言E5编码器生成余弦局部敏感哈希聚类,并依据源类型、长度及语义聚类联合采样。候选生成融合规则教师与微调的学生模型,经三盲评审共识保留有效行。
使用方法
该数据集适用于文本到文本生成任务,支持挪威尼诺斯克语到AltMorph括号编码的直接转换。使用者可通过HuggingFace加载默认配置,获取训练、验证与测试划分,或加载审计配置获取被拒行及候选详情。模型训练时建议遵循源/目标长度限制512词元,采用贪婪推理批大小8。需注意验证与测试集未经过人工检验,且行级许可证各异,复用时应参照上游数据集卡片及行级许可证字段,确保合规使用。
背景与挑战
背景概述
随着语言资源建设向形态句法标注深化,挪威语新诺尔斯克方言(Nynorsk)的自动形态分析成为低资源语言处理的重要课题。NbAiLab于2024年发布nb-asr-supermorphed-nno数据集,旨在将自然文本直接映射为AltMorph括号编码,为形态丰富语言的生成与解析提供监督资源。该数据集基于上游开放语料构建,融合规则教师与神经学生模型,经多轮清洗与盲审校验,最终形成逾48万条训练样本。其核心研究问题在于实现无分词依赖的端到端形态编码转换,对挪威语语音识别、句法分析及机器翻译等下游任务具有基础性支撑作用。
当前挑战
该数据集所应对的领域问题极具挑战:挪威语新诺尔斯克形态变化复杂且资源稀缺,AltMorph编码要求精确还原词素边界与可选变体,传统序列标注方法难以兼顾覆盖率与准确性。构建过程中亦面临多重困难:源语料跨多许可证且质量参差,需通过文档级哈希隔离防止数据泄漏;生成阶段需协调规则系统与神经模型,并依赖多模型语言辨识排除外语干扰;候选歧义需经三人盲审共识方可保留,而高一致性阈值与严格去重策略在保证质量的同时,也使得部分有效样本被排除至审计集,凸显了数据规模与标注精度之间的内在张力。
常用场景
经典使用场景
在挪威尼诺斯克语自然语言处理领域,该数据集的核心经典用途在于训练序列到序列模型执行文本规范化任务,即将常规尼诺斯克语文本直接映射为AltMorph括号编码格式。每一行数据由原始源文本和经严格校验的目标编码构成,括号内允许的备选词素按字母序排列并以竖线分隔,从而为模型提供明确的结构化监督信号。研究者据此可构建端到端的形态生成系统,在保持语义一致性的前提下输出符合AltMorph规范的可逆编码,有力推动了低资源语言形态标准化与文本到编码转换研究的发展。
解决学术问题
该数据集有效缓解了尼诺斯克语在形态分析、拼写变体归一化及低资源语言生成等研究中长期存在的标注资源匮乏问题。传统方法依赖人工规则或单语料库,难以覆盖丰富的屈折变化和方言差异。本数据集通过提供大规模、经多轮质量筛选与盲审验证的平行样本,使模型能够学习从自然文本到规范化编码的稳健映射,进而支撑形态消歧、语言标识验证和生成一致性评估等学术任务。其严谨的构建流程与可追溯的来源信息,也为低资源语言数据集的构建方法学设立了可复现的参考标准。
实际应用
在实际应用层面,该数据集可服务于挪威尼诺斯克语的拼写检查、语法辅助工具和语言学习平台,帮助用户将自由文本转换为规范的形态编码,以支持词典编纂、机器翻译预处理和语音识别后处理等场景。AltMorph编码的可逆性使其尤其适合需要精确形态还原的出版与本地化流程,能显著降低人工校对成本。此外,该数据集也可用于构建面向尼诺斯克语的文本规范化API或浏览器插件,提升数字内容在多种语言技术栈中的互操作性。
数据集最近研究
最新研究方向
在低资源语言形态学处理领域,nb-asr-supermorphed-nno数据集推动了从普通挪威新诺斯克语文本到AltMorph括号编码的直接转换。该方向聚焦于利用教师-学生工作流,结合规则系统与微调模型(如t5gemma-2-1b),实现高精度形态生成,并引入三盲评审机制确保数据质量。此研究契合当前语言资源建设中形态丰富语言的计算处理热点,尤其对挪威语等形态复杂语言,其方法论可迁移至其他低资源语言,提升机器翻译与语音识别的形态建模能力,具有重要的学术影响和实用价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务