遇见数据集

nb-asr-morfologisk-stil-nob

收藏
Hugging Face2026-09-05 更新2026-09-06 收录
官方服务:

资源简介:

该数据集专为文档条件化的布克莫尔形态风格转换任务设计,旨在训练模型根据同一源文档中观察到的5–20个词形(形态风格)重写一个句子。每个列出的词形均在 AltMorph 中有已验证的替代形式,证据来自另一个句子,且与目标的替代家族不相交。数据集的提示格式适用于序列到序列训练,包含形态风格选择和带替代项的句子。此外,还提供了因果配置(causal),包含28,791对匹配样本,其中带括号的句子固定,但两个不同的参考文档提供对比风格列表,从而生成两种不同的完整句子。数据集共有396,706行,源自84,101个不同目标句子,按近重复文档聚类哈希划分为训练集(327,912行)、验证集(34,032行)和测试集(34,762行),确保无文档跨划分。数据源自 NbAiLab/nb-asr-supermorphed-nob 数据集,每行保留原始来源、修订版本、文档标识符、来源类型和行级许可证。构建过程中,替代块精确对齐人工编写的源文本,风格形式仅保留每个候选为单一词形的情况,并保留文字Markdown、数学和编辑括号。每个行包含每个风格形式的替代项和证据句子、目标家族元数据以及近重复聚类ID。随附 manifest.json、audit.json、source_profile.json 和 human_inspection.json 文件以提供可复现性和检查记录。注意,风格列表是证据而非全局一致的语言学标签,源文档可能包含引用、多个作者或真实变异,评估时应分开报告带括号和打乱模式,并与基于规则和未改变的基线进行比较。

This dataset is designed for document-conditioned Bokmål morphological style transfer, aiming to train models to rewrite a sentence based on 5–20 word forms (morphological styles) observed in the same source document. Each listed word form has a verified alternative form in AltMorph, with evidence from another sentence, and is disjoint from the targets alternative family. The datasets prompt format is suitable for sequence-to-sequence training, including morphological style selection and sentences with alternatives. Additionally, a causal configuration is provided, containing 28,791 pairs of matched samples, where the bracketed sentence is fixed, but two different reference documents provide contrasting style lists, generating two different complete sentences. The dataset has a total of 396,706 rows, derived from 84,101 distinct target sentences, and is split into training (327,912 rows), validation (34,032 rows), and test (34,762 rows) sets based on near-duplicate document clustering hashing, ensuring no cross-partition documents. The data originates from the NbAiLab/nb-asr-supermorphed-nob dataset, with each row preserving original source, revision version, document identifier, source type, and row-level license. During construction, replacement blocks are precisely aligned with manually written source texts, style forms are retained only when each candidate is a single word form, and textual Markdown, mathematical notation, and editing brackets are preserved. Each row contains alternatives and evidence sentences for each style form, target family metadata, and near-duplicate cluster ID. Accompanying manifest.json, audit.json, source_profile.json, and human_inspection.json files are provided for reproducibility and inspection records. Note that style lists are evidence rather than globally consistent linguistic labels; source documents may contain citations, multiple authors, or genuine variation. Evaluation should separately report bracketed and shuffled patterns and compare against rule-based and unmodified baselines.

创建时间:
2026-09-05
原始信息汇总

数据集概述

该数据集名为 Document-conditioned Bokmål morphological style(文档条件化的书面挪威语形态风格),由 NbAiLab 发布,旨在训练模型根据同一源文档中观察到的 5–20 个词形,将一句话重写为该文档的形态风格。

基本信息

  • 语言:书面挪威语(nob)
  • 许可证:other(每条数据行均带有独立的许可证字段,需查阅上游数据集卡片)
  • 任务类别:文本生成(text-generation)

任务格式

数据集提供两种输入模式:

  1. sequence-to-sequence 模式prompt 字段直接包含风格词形列表(如 hytta | hosta)及带有替代选项的句子(如 [Jenta|Jenten] [kasta|kastet] ballen.)。
  2. 因果模式(causal config):输入为打乱顺序的表层句子,目标为完整的完成句。

所有样本的目标输出仅为补全后的句子,不包含隐藏推理或结构化中间目标。

数据划分

划分 行数
train 327,912
validation 34,032
test 34,762
总计 396,706
  • 划分基于近重复文档簇的固定哈希分配,确保源文档及其近重复簇不会跨划分。
  • 测试集分配时未查看目标句子,且未纳入人工检查包。

数据来源与许可

  • 源数据集为 NbAiLab/nb-asr-supermorphed-nob(修订版本 346754624582a2858864a18c685aa365d338504e)。
  • 每一行保留上游数据集、修订版本、行/文档标识符、源类型及行级许可证。
  • 整个语料库采用多种兼容的开放许可证,因此 Hub 级别许可证标记为 other

构建与审核

  • 数据集包含 396,706 行,源自 84,101 个不同的目标句子。
  • 替代块与人工撰写的源文本精确对齐;风格词形仅在所有候选项均为单一词法形式时保留。
  • 字面的 Markdown、数学及编辑括号被保留,而非当作 AltMorph 语法处理。
  • 每行包含所有风格词形的替代选项与证据句、目标族元数据及近重复簇 ID。
  • 随附 manifest.jsonaudit.jsonsource_profile.jsonhuman_inspection.json 文件,用于可复现性与检查记录。

因果配置

因果配置包含 28,791 对匹配样本。每对样本中,带括号的句子保持不变,而两个不同的参考文档提供不同的风格列表,从而允许两个不同的完成句。因此,该任务无法通过单一的全局多数形式解决。

局限性

  • 风格列表是证据而非保证全局连贯的语言学标签,源文档可能包含引文、多位作者或真实的文体变异。
  • 评估时应分别报告带括号模式和打乱模式的结果,并与不变基线及基于规则的基线进行比较,同时包含匹配的对比风格列表因果测试。
搜集汇总
数据集介绍
nb-asr-morfologisk-stil-nob 数据集图片
构建方式
该数据集立足于挪威书面语博克马尔语形态学风格迁移这一自然语言处理任务,其构建根植于真实语料中形态变异的系统性重构。以NbAiLab/nb-asr-supermorphed-nob为源语料,构建过程首先从同一源文档中抽取5至20个已观测词形作为风格证据,并经AltMorph验证每个词形均存在合法替代形式。随后对证据进行去重处理,剔除与目标句替代家族相交的样本,确保风格信号来源于另一独立句子。由此形成396,706行数据,覆盖84,101个不同目标句,并辅以manifest.json、audit.json等文件记录可复现性与人工审查流程,使构建链条具备审计透明度。
特点
该数据集的核心特征在于其文档条件化的风格建模机制与因果配对设计。常规配置下,模型需依据同一文档中观察到的若干词形来重写目标句的形态风格;因果配置则包含28,791对匹配样本,在保持带括号目标句不变的前提下,由两份不同参考文档提供对比性风格列表,从而生成两种不同的完成句。这一设计有效排除了依靠单一全局多数形式即可解题的可能,迫使模型捕捉局部文档的风格倾向。数据按近重复文档聚类进行哈希划分,源文档及近重复聚类均不跨训练、验证与测试集,测试集未经目标检查分配,保障了评估的独立性与可靠性。
使用方法
使用该数据集时,可将prompt字段直接输入序列到序列模型进行训练,其标准格式以skriv_i_samme_morfologiske_stil指令开头,依次给出形态风格选项列表与含括号替代形式的句子。第二种输入模式以setning:引导,后接刻意打乱的表层句子,目标输出始终仅为补全后的句子,无需隐藏推理或结构化中间目标。研究者应在评估中分别报告括号模式与打乱模式的结果,并设置未改动基线、规则基线以及匹配对比风格列表的因果测试。鉴于Hub层许可为other,使用者须依据每行license字段并参考上游数据集卡片以遵守相应许可条款。
背景与挑战
背景概述
在挪威语书面语规范中,书面挪威语(Bokmål)允许可选形态变体共存,如“hytta/hytten”、“kasta/kastet”等,此类变异既反映地区与文体差异,也为自然语言生成带来了独特的风格控制问题。该数据集由挪威人工智能实验室(NbAiLab)等研究人员构建,基于nb-asr-supermorphed-nob语料拓展而来,其核心研究问题在于:模型能否仅凭源文档中5至20个已观测词形,推断并复现该文档的形态学风格,从而完成句子的风格化改写。数据集通过对比性参照与因果配对设计,推动低资源语言形态风格建模与可复现评测的发展,对挪威语自然语言处理及形态学可控生成领域具有参考价值。
当前挑战
该数据集所面对的领域问题属于细粒度形态风格控制与文本改写,要求模型从有限词形证据中归纳局部风格并迁移至目标句,而风格列表仅为证据、并非全局一致的语言学标签,源文档中的引文、多作者与真实变异更增大了归纳难度。构建过程中需严格保证参照证据来自其他句子且与目标备选词族不相交,排除近重复文档跨划分泄漏,并处理字面括号与AltMorph语法标记的歧义,同时维护逐行许可证与可追溯性。评测还须区分括号模式与乱序模式,纳入不变与规则基线以及配对的对比风格因果测试,以检验模型是否真正依赖风格列表而非全局多数形式。
常用场景
经典使用场景
在自然语言处理领域,风格可控的文本生成始终是核心议题之一。该数据集最经典的使用场景在于训练序列到序列模型,使其依据同一源文档中抽取的5至20个已验证词形,对目标句子执行形态学风格的重写。具体而言,模型接收一个包含括号备选形式的句子以及一份形态风格清单,继而输出与文档整体风格相契合的完成句。此任务形式有效模拟了书面挪威语中因地域、社会或文体因素而产生的形态变体选择过程,为风格条件生成提供了标准化且可复现的实验框架。
实际应用
在实际应用层面,该数据集可服务于多种需要风格一致性的文本处理任务。新闻机构与出版行业可借助其训练模型,将稿件自动调整至与目标刊物一致的书面挪威语形态风格,从而提升编辑效率与文本统一性。语言教育工具亦可利用该数据集生成风格适配的例句,辅助学习者辨析不同形态变体的语用差异。此外,在机器翻译后编辑场景中,该数据集支持的模型能够依据参考文档的风格清单对译文进行形态学层面的润色,使输出更贴合特定语境或作者偏好,展现出显著的实用价值。
衍生相关工作
围绕该数据集,已衍生出若干具有代表性的后续工作。研究者基于其因果配置设计了风格对比评估协议,用以检验序列到序列模型在形态学风格迁移中的忠实度与泛化能力。部分工作将该数据集与规则基线及未改动基线进行系统比较,揭示了数据驱动方法在风格条件生成中的优势与局限。亦有学者利用其提供的近重复聚类划分与人工审核记录,探究数据泄漏对风格建模的影响,并推动更严格的数据划分标准。这些衍生研究共同丰富了书面挪威语形态学风格生成的方法论体系,并为多语言风格可控生成提供了可借鉴的范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务