Galician_MWE_dataset
收藏资源简介:
这是一个加利西亚语潜在歧义多词表达(名词-形容词和动词-宾语)的数据集,包含人工标注的组成性预测分数。数据集中的每个CSV文件包含多个列,如mwe_id、mwe、freq_range_comp、freq_comp_norm、freq_head_norm、freq_depen_norm、ambig_head_overall、ambig_dependent_overall、ambig_head_categ、ambig_dependent_categ、produc_head_norm、produc_dependent_norm、sense_id、mwe_class、sense_class、extracted_sent_1、extracted_sent_2、extracted_sent_3、extracted_sent_4、ann_compound_m、ann_head_m、ann_dependent_m,用于分析多词表达的组成性和语义特征。
本数据集为面向加利西亚语(Galician)的潜在歧义多词表达(Multiword Expression, MWE)数据集,涵盖名词-形容词与动词-宾语两类结构,收录经人工标注的组成性预测分值。数据集中的每个逗号分隔值(Comma-Separated Values, CSV)文件均包含多列字段,具体包括mwe_id(多词表达标识符)、mwe(多词表达)、freq_range_comp(组成性频率区间)、freq_comp_norm(归一化组成词频)、freq_head_norm(归一化中心语词频)、freq_depen_norm(归一化依存词词频)、ambig_head_overall(中心语整体歧义度)、ambig_dependent_overall(依存词整体歧义度)、ambig_head_categ(中心语歧义类别)、ambig_dependent_categ(依存词歧义类别)、produc_head_norm(归一化中心语生成性)、produc_dependent_norm(归一化依存词生成性)、sense_id(义项标识符)、mwe_class(多词表达类别)、sense_class(义项类别)、extracted_sent_1、extracted_sent_2、extracted_sent_3、extracted_sent_4、ann_compound_m(人工标注组合性评分)、ann_head_m(人工标注中心语评分)、ann_dependent_m(人工标注依存词评分),可用于剖析多词表达的组成性与语义特征。
加利西亚语多词表达式数据集
该数据集包含加利西亚语中潜在歧义的多词表达式(名词-形容词和动词-宾语结构),并附有人工标注的习语性评分。
数据集文件格式
数据集以 CSV 文件形式提供,每条记录包含以下字段:
表达式标识与文本
- mwe_id: 多词表达式的唯一标识符
- mwe: 多词表达式(已词元化)
频率信息
- freq_range_comp: 多词表达式的频率带(如高、低)
- freq_comp_norm: 整个多词表达式的归一化频率
- freq_head_norm: 中心词(head)的归一化频率
- freq_depen_norm: 从属词(dependent)的归一化频率
语义歧义性
- ambig_head_overall: 中心词的整体语义歧义得分
- ambig_dependent_overall: 从属词的整体语义歧义得分
- ambig_head_categ: 中心词的分类语义歧义
- ambig_dependent_categ: 从属词的分类语义歧义
能产性
- produc_head_norm: 中心词的归一化能产性得分
- produc_dependent_norm: 从属词的归一化能产性得分
习语性分类
- sense_id: 被分析的特定语义义项标识符
- mwe_class: 类型层面的多词表达式习语性类别(如组合型、部分型、习语型、PIE:潜在习语表达式)
- sense_class: 特定义项层面的多词表达式习语性类别
上下文例句
- extracted_sent_1 至 extracted_sent_4: 包含该多词表达式的4个上下文句子
人工习语性评分
- ann_compound_m: 整个多词表达式的人工组合性标注平均分
- ann_head_m: 该上下文中中心词的人工组合性标注平均分
- ann_dependent_m: 该上下文中从属词的人工组合性标注平均分




