遇见数据集

target-morphology

收藏
Hugging Face2026-07-28 更新2026-07-29 收录
官方服务:

资源简介:

target-morphology 是一个多语言非监督形态学数据集,旨在从圣经文本中自动学习有生产力的后缀、前缀和词干词典。该数据集基于 Linguistica 风格方法,通过最小描述长度无关的方式识别词缀的生产力,即一个词缀需附着于多个范式词干才被视为有生产力。数据内容包括针对每种语言的衍生统计模型,涵盖词缀清单和词干列表,但不包含原始源文本。数据集提供了 stem(word) 功能,用于剥离一个词缀并将屈折变体映射到共享词干,例如在印地语中将 बोला 和 बोलता 归一到 बोल。该数据集最初为词位对齐器设计,用于填充注释的正常化部分并可选地对 eflomal 输入进行词干提取,但作为独立资源发布,适用于多语言形态学分析、词干提取和 token-classification 任务。数据规模可通过 manifest.json 文件查看每种语言的统计信息和内容哈希。数据集采用 CC0-1.0 许可证,确保模型作为统计数据自由重用。

Target-morphology is a multilingual unsupervised morphological dataset dedicated to automatically learning productive suffixes, prefixes, and stem lexicons from biblical texts. Built upon a Linguistica-style methodology, it identifies affix productivity via a Minimum Description Length (MDL)-agnostic approach, where an affix is deemed productive only when it attaches to multiple paradigm stems. The dataset includes derived statistical models for each language, covering affix inventories and stem lists, but does not contain the original source texts. It provides the `stem(word)` function, which is used to strip an affix and map inflectional variants to a shared stem. For example, it normalizes the Hindi words बोला and बोलता to बोल. Originally designed for lexeme aligners to fill in the normalized sections of annotations and optionally perform stemming on eflomal inputs, the dataset is released as an independent resource applicable to multilingual morphological analysis, stemming, and token-classification tasks. The dataset's scale, along with statistical information and content hashes for each language, can be accessed via the manifest.json file. Licensed under CC0-1.0, the dataset ensures free reuse of the models as statistical data.

创建时间:
2026-07-14
原始信息汇总

数据集概述:target-morphology

  • 许可证:CC0-1.0
  • 任务类别:Token 分类(token-classification)
  • 标签:形态学(morphology)、无监督(unsupervised)、多语言(multilingual)、圣经文本(bible)

核心内容

  • 描述:为每种语言提供的无监督形态学模型,包含能产性后缀前缀以及词干词典。模型以该语言的圣经文本为基础,采用类似“Linguistica”的方法(MDL-free)学习:如果一个后缀能附加到多个范式词干上,则被视为能产。
  • 特点
    • 不依赖标签、预训练模型或外部下载,因此适用于任何有翻译的语言,包括那些没有大语言模型或编码器覆盖的语言。
    • stem(word) 函数可去除一个能产词缀,当剩余部分为已知词干时生效;形态变化形式可归约为共同词干(例如印地语:बोला/बोलता → बोल)。
    • 原本为词位对齐器(lexeme-aligner)构建,用于填充词汇表(gloss)的归一化器,也可用于语义角色标注(eflomal)的输入词干化,但作为无监督分割工具独立发布。
  • 数据来源:模型基于统计派生(词缀清单 + 词干列表),未重新分发源文本
  • 附加文件:提供 manifest.json,包含每种语言的统计信息和内容哈希值。
搜集汇总
数据集介绍
target-morphology 数据集图片
构建方式
该数据集以无监督方式构建,基于语言本身的圣经文本,采用“Linguistica”风格的学习算法。通过分析文本中词干与词缀的共现模式,判断后缀或前缀的生产性——若某一词缀能够附着于多个不同的词干,则被视为生产性词缀。系统据此提取出生产性词缀列表与词干词典,无需借助任何标注数据、预训练模型或外部资源,从而实现对任意拥有翻译版本的语言进行形态建模,涵盖大量低资源语言。
使用方法
数据集主要用于词法对齐任务中的词形还原与词干提取。函数`stem(word)`能够去除单词中的一个生产性词缀,当剩余部分为已知词干时返回规约结果,从而实现屈折变体的归一化。用户可将其集成至词干对齐器的规范化模块,或直接用于对eflomal等词对齐工具的输入进行词干化处理。由于模型以独立文件形式发布,开发者可轻松加载并使用,无需复杂部署,适合下游自然语言处理任务中的形态简化与数据预处理。
背景与挑战
背景概述
该数据集target-morphology由语言学计算领域的研究人员构建,专注于无监督词态分析,创建时间未明确标注,但核心研究问题在于从单语圣经文本中自动学习语言的形态结构,包括生产性后缀、前缀及词干词典。采用MDL-free的“Linguistica”风格方法,无需标注数据、预训练模型或网络下载,使得该数据集能够覆盖LLM或编码器尚未支持的低资源语言。作为词素对齐器的组成部分,它既可用于词汇归一化,也可作为词干提取工具,显著提升了对形态复杂语言的跨语言处理能力,对自然语言处理中的形态学研究和低资源语言技术发展具有重要影响。
当前挑战
当前挑战主要体现为:1)形态切割领域问题方面,该数据集无法处理高度黏着或融合型语言的连续词素边界,且对语素变体及不规则形态的覆盖有限,例如屈折变化强烈的语言中词干提取可能不准确;2)构建过程中,由于仅依赖单语圣经文本,语料规模小且领域单一,导致统计出的词缀和词干词典可能带有偏差,无法反映日常语言使用的多样性和语义复杂性。此外,无监督方法依赖于低频词缀与高频词干之间的平衡,难以区分同形异义或语境相关的形态变化,从而影响下游任务如词对齐或机器翻译的鲁棒性。
常用场景
经典使用场景
在自然语言处理与计算语言学领域,target-morphology数据集为无监督形态学分析提供了坚实的基础。其经典使用场景是基于Bible译本的无监督词形还原与构词模式挖掘,能够自动识别每种语言中的生产性后缀、前缀及词干词典,无需任何标注数据或预训练模型。研究者可借助该数据集对低资源语言进行高效的形态分析,尤其适用于那些缺乏大规模语料库或LLM覆盖的语言,从而拓展了无监督形态学从理论到实践的边界。
解决学术问题
该数据集主要解决了跨语言无监督形态学建模中的核心学术难题——如何在缺乏标注信息的前提下,从有限文本中提取生产性词缀与词干结构。传统有监督方法依赖昂贵的语言学家标注,而target-morphology通过MDL-free策略(Linguistica范式)统计词缀与词干的共现频率,实现了对形态复杂语言的高效分析。这一方法不仅降低了多语言形态分析的研究门槛,更促进了计算语言学在语言多样性保护、历史语言学比较等议题中的深入探索,其开源共享的模式进一步推动了复现与改进。
实际应用
在实际应用中,target-morphology为机器翻译系统(尤其是神经机器翻译中的子词分词)与跨语言信息检索提供了关键的形态预处理能力。作为词元对齐器(lexeme-aligner)的标准化工具,它能够统一不同屈折形态形态下的词汇表示,例如将印地语的बोला与बोलता还原为共同词干बोल。此外,该数据集还可直接服务于双语词典构建、OCR后的文本归一化以及Bible数字人文项目中的形态标注,在低资源语言技术生态中扮演着不可或缺的角色。
数据集最近研究
最新研究方向
当前,无监督形态学分析在多语言自然语言处理领域成为前沿热点,尤其针对低资源语言与零样本场景。target-morphology数据集通过完全无监督的方式,从圣经译本中自动学习各语言的形态结构,提取能产性词缀与词干词典,无需任何标注数据或预训练模型。这一方法突破了传统依赖大规模标注语料或高资源语言模型的局限,使得形态分析能够覆盖包括无LLM覆盖的语言在内的广泛语种。其研究意义在于,为机器翻译、词对齐等下游任务提供了轻量级、可迁移的形态学预处理工具,推动了面向语言多样性的无监督形态学建模发展,尤其契合当前对低资源语言保护与数字化应用的迫切需求。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务