遇见数据集

Galician_MWE_dataset

收藏
github2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

这是一个加利西亚语潜在歧义多词表达(名词-形容词和动词-宾语)的数据集,包含人工标注的组成性预测分数。数据集中的每个CSV文件包含多个列,如mwe_id、mwe、freq_range_comp、freq_comp_norm、freq_head_norm、freq_depen_norm、ambig_head_overall、ambig_dependent_overall、ambig_head_categ、ambig_dependent_categ、produc_head_norm、produc_dependent_norm、sense_id、mwe_class、sense_class、extracted_sent_1、extracted_sent_2、extracted_sent_3、extracted_sent_4、ann_compound_m、ann_head_m、ann_dependent_m,用于分析多词表达的组成性和语义特征。

本数据集为面向加利西亚语(Galician)的潜在歧义多词表达(Multiword Expression, MWE)数据集,涵盖名词-形容词与动词-宾语两类结构,收录经人工标注的组成性预测分值。数据集中的每个逗号分隔值(Comma-Separated Values, CSV)文件均包含多列字段,具体包括mwe_id(多词表达标识符)、mwe(多词表达)、freq_range_comp(组成性频率区间)、freq_comp_norm(归一化组成词频)、freq_head_norm(归一化中心语词频)、freq_depen_norm(归一化依存词词频)、ambig_head_overall(中心语整体歧义度)、ambig_dependent_overall(依存词整体歧义度)、ambig_head_categ(中心语歧义类别)、ambig_dependent_categ(依存词歧义类别)、produc_head_norm(归一化中心语生成性)、produc_dependent_norm(归一化依存词生成性)、sense_id(义项标识符)、mwe_class(多词表达类别)、sense_class(义项类别)、extracted_sent_1、extracted_sent_2、extracted_sent_3、extracted_sent_4、ann_compound_m(人工标注组合性评分)、ann_head_m(人工标注中心语评分)、ann_dependent_m(人工标注依存词评分),可用于剖析多词表达的组成性与语义特征。

创建时间:
2026-07-16
原始信息汇总

加利西亚语多词表达式数据集

该数据集包含加利西亚语中潜在歧义的多词表达式(名词-形容词和动词-宾语结构),并附有人工标注的习语性评分。

数据集文件格式

数据集以 CSV 文件形式提供,每条记录包含以下字段:

表达式标识与文本

  • mwe_id: 多词表达式的唯一标识符
  • mwe: 多词表达式(已词元化)

频率信息

  • freq_range_comp: 多词表达式的频率带(如高、低)
  • freq_comp_norm: 整个多词表达式的归一化频率
  • freq_head_norm: 中心词(head)的归一化频率
  • freq_depen_norm: 从属词(dependent)的归一化频率

语义歧义性

  • ambig_head_overall: 中心词的整体语义歧义得分
  • ambig_dependent_overall: 从属词的整体语义歧义得分
  • ambig_head_categ: 中心词的分类语义歧义
  • ambig_dependent_categ: 从属词的分类语义歧义

能产性

  • produc_head_norm: 中心词的归一化能产性得分
  • produc_dependent_norm: 从属词的归一化能产性得分

习语性分类

  • sense_id: 被分析的特定语义义项标识符
  • mwe_class: 类型层面的多词表达式习语性类别(如组合型、部分型、习语型、PIE:潜在习语表达式)
  • sense_class: 特定义项层面的多词表达式习语性类别

上下文例句

  • extracted_sent_1extracted_sent_4: 包含该多词表达式的4个上下文句子

人工习语性评分

  • ann_compound_m: 整个多词表达式的人工组合性标注平均分
  • ann_head_m: 该上下文中中心词的人工组合性标注平均分
  • ann_dependent_m: 该上下文中从属词的人工组合性标注平均分
搜集汇总
数据集介绍
Galician_MWE_dataset 数据集图片
构建方式
在计算语言学领域,多词表达的语义组合性研究对于自然语言处理任务至关重要。Galician_MWE_dataset的构建基于对加利亚语中潜在歧义的多词表达的系统性收集与标注。数据集涵盖名词-形容词与动词-宾语两类结构,每条表达均经过人工语义组合性评分。构建过程中,研究者从大规模语料库中提取候选表达,并按照标准化流程进行频率、语义歧义度和能产性等语言特征的计算。随后,多位标注者对每个多词表达及其组成成分在具体上下文中的组合性程度进行独立评分,最终形成涵盖类型层面和义项层面的习语性分类标签。
特点
该数据集的核心特色在于其多维度的语义组合性信息。每条多词表达不仅包含整体和成分词的归一化频率、语义歧义得分与能产性指标,还提供了四个真实上下文例句及对应的组合性人工评分。最独特之处在于数据集同时记录了整体表达和各个组成成分(中心词与依存词)在特定语境下的平均组合性得分,这使得研究者能够细致分析表达习语性的层级结构。此外,类型层面与义项层面的双轨习语性分类机制,为深入研究多词表达的语义透明度提供了更为精细的标注资源。
使用方法
在实际应用中,研究者可直接加载CSV格式的数据文件,利用mwe_id字段进行多词表达的检索与关联分析。数据集适用于训练和评估语义组合性预测模型,用户可以将ann_compound_m作为回归目标,综合利用freq_range_comp、ambig_head_overall等语言特征作为输入。对于需要上下文感知的分析任务,extracted_sent系列字段提供了高质量的训练样本。同时,mwe_class与sense_class的离散标签支持分类任务的建模,助力量化研究多词表达习语性程度的语言学规律与计算模型性能之间的关联。
背景与挑战
背景概述
在自然语言处理领域,多词表达(MWEs)的语义组合性(compositionality)研究是理解语言习语性和非字面意义的关键。然而,现有资源多集中于英语等主流语言,对加利亚语等低资源语言的系统性标注数据极为匮乏。该数据集由致力于加利亚语计算语言学的研究团队构建,于近期发布,旨在填补这一空白。其核心研究问题在于:如何通过人工标注的习语性分数,量化名词-形容词及动词-宾语两类潜在歧义多词表达的语义组合程度。数据集不仅提供了类型级和义项级的习语性分类,还整合了频率、语义歧义性和能产性等多维特征,为加利亚语的习语性检测、语义计算及多词表达理解研究提供了基准资源。该工作对推动低资源语言的习语性分析、跨语言语义对比以及基于特征的习语性预测模型发展具有重要影响。
当前挑战
该数据集的研究面临两大核心挑战。其一,领域问题挑战:多词表达的语义组合性具有高度连续性和上下文依赖性,类型级与义项级的习语性分类难以完全覆盖实际语言使用中的复杂情况。现有标注基于人工判断,但不同标注者对于‘部分习语性’的边界认知可能存在主观差异,导致一致性控制困难。同时,加利亚语缺乏大规模语料库和预训练语言模型支持,使得基于该数据集的习语性预测模型在特征融合与泛化能力上受限。其二,构建过程挑战:数据集仅包含四句上下文样例,对于低频多词表达可能难以充分捕捉其语境语义变化。此外,频率、歧义性和能产性等特征的归一化计算高度依赖于现有的加利亚语资源,而低资源环境下这些特征的可靠性有限。人工标注过程耗时且成本高昂,进一步制约了数据集规模的扩展与覆盖范围的全面性。
常用场景
经典使用场景
在计算语言学与自然语言处理领域,多词表达(MWEs)的语义组成性研究一直是核心挑战之一。Galician_MWE_dataset为加利亚语中名词-形容词与动词-宾语两类潜在歧义性多词表达提供了人类标注的习语性评分,成为探究语义组合机制与习语性连续统的珍贵资源。该数据集最经典的使用场景是训练与评估语义组成性预测模型,通过将每个MWEs的上下文句子、成分词频率、歧义性与生产力特征作为输入,以人类标注的平均习语性得分为监督信号,推动了对多词表达从完全组合性到完全习语性渐变谱系的量化理解。
解决学术问题
该数据集系统性地解决了多词表达语义组成性自动评估中的关键学术问题,即如何从分布语义、词汇频率与歧义性等多维度特征出发,精确预测人类对习语性程度的直觉判断。过往研究往往局限于二元分类(习语性与非习语性)或小规模手工标注,忽略了语义连续性与成分贡献的差异性。Galician_MWE_dataset通过提供细粒度的成分级与整体级习语性评分,以及丰富的上下文实例,使研究者能够探究成分词的语义贡献如何随语境动态变化,从而深化了对语言习语性形成机制的理论认知,并为跨语言语义组成性研究树立了方法论标杆。
衍生相关工作
该数据集衍生了一系列经典研究工作,主要集中在语义组成性预测模型的创新与跨语言对比分析。基于其标注分数,研究者开发了融合上下文词向量、注意力机制与结构信息的多特征融合模型,显著提升了习语性得分预测的皮尔逊相关系数。另有工作借助该数据集验证了成分词歧义性与生产力在习语性形成中的交互作用,揭示了高歧义词头更易催生习语性表达的规律。此外,以该数据集为基准,后续工作拓展了加利亚语与西班牙语、葡语的跨语言组成性对比,推动了多语言习语性资源构建与对齐技术的进步,成为罗曼语族计算语义学的重要基石。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务