遇见数据集

clarin-pl/kpwr-ner

收藏
Hugging Face2023-01-30 更新2024-03-04 收录
官方服务:

资源简介:

KPWR-NER是波兰弗罗茨瓦夫理工大学波兰语语料库的一部分,专注于细粒度实体类别的命名实体识别任务。该数据集包含来自多个领域和体裁的文本,并由人类进行标注。数据集的版本为n82,意味着类别数量限制为82个(原始为120个)。数据集的任务是命名实体识别,输入为一系列标记,输出为这些标记的类别序列,使用BIO标注法。数据集的评估指标为F1-score(seqeval)。数据集分为训练集和测试集,训练集包含13959个句子,测试集包含4323个句子。数据集的类别分布详细列出了各类别的频率。

KPWR-NER is part of the Polish language corpus from Wrocław University of Science and Technology, focusing on the named entity recognition (NER) task with fine-grained entity categories. This dataset contains texts from diverse domains and genres, and has been manually annotated by human annotators. The dataset is versioned as n82, which means the number of entity categories is limited to 82 (the original number was 120). The task of this dataset is named entity recognition: the input is a sequence of tokens, and the output is the category sequence of these tokens using the BIO annotation scheme. The evaluation metric for this dataset is F1-score (seqeval). The dataset is split into training and test sets: the training set contains 13,959 sentences, while the test set contains 4,323 sentences. The category distribution of the dataset details the frequency of each entity category.

提供机构:
clarin-pl
原始信息汇总

数据集概述

基本信息

  • 名称: KPWr-NER
  • 语言: 波兰语 (pl)
  • 许可证: CC-BY-3.0
  • 多语言性: 单语
  • 大小: 18K - 10K<n<100K
  • 来源: 原始数据
  • 任务类别: 其他
  • 任务ID: 命名实体识别
  • 标签: 结构预测

描述

KPWr-NER是波兰语料库的一部分,专注于细粒度实体的命名实体识别。该数据集是KPWr的‘n82’版本,实体类别限制为82种(原为120种)。数据集中的文本来自多个领域和体裁,由人工标注。

任务详情

  • 任务: 命名实体识别 (NER)
  • 输入: 序列的令牌
  • 输出: 预测的令牌类别序列,使用BIO表示法(82种可能的类别)
  • 评估指标: F1-score (seqeval)

数据分割

子集 基数(句子数)
训练 13959
开发 0
测试 4323

类别分布

数据集提供了详细的类别分布,包括但不限于以下类别:

  • B-nam_liv_person
  • B-nam_loc_gpe_city
  • B-nam_loc_gpe_country
  • B-nam_org_institution
  • B-nam_org_organization
  • B-nam_org_group_team
  • B-nam_adj_country
  • B-nam_org_company
  • B-nam_pro_media_periodic
  • B-nam_fac_road
  • B-nam_liv_god
  • B-nam_org_nation
  • B-nam_oth_tech
  • B-nam_pro_media_web
  • B-nam_fac_goe
  • B-nam_eve_human
  • B-nam_pro_title
  • B-nam_pro_brand
  • B-nam_org_political_party
  • B-nam_loc_gpe_admin1
  • B-nam_eve_human_sport
  • B-nam_pro_software
  • B-nam_adj
  • B-nam_loc_gpe_admin3
  • B-nam_pro_model_car
  • B-nam_loc_hydronym_river
  • B-nam_oth
  • B-nam_pro_title_document
  • B-nam_loc_astronomical
  • B-nam_oth_currency
  • B-nam_adj_city
  • B-nam_org_group_band
  • B-nam_loc_gpe_admin2
  • B-nam_loc_gpe_district
  • B-nam_loc_land_continent
  • B-nam_loc_country_region
  • B-nam_loc_land_mountain
  • B-nam_pro_title_book
  • B-nam_loc_historical_region
  • B-nam_loc
  • B-nam_eve
  • B-nam_org_group
  • B-nam_loc_land_island
  • B-nam_pro_media_tv
  • B-nam_liv_habitant
  • B-nam_eve_human_cultural
  • B-nam_pro_title_tv
  • B-nam_oth_license
  • B-nam_num_house
  • B-nam_pro_title_treaty
  • B-nam_fac_system
  • B-nam_loc_gpe_subdivision
  • B-nam_loc_land_region
  • B-nam_pro_title_album
  • B-nam_adj_person
  • B-nam_fac_square
  • B-nam_pro_award
  • B-nam_eve_human_holiday
  • B-nam_pro_title_song
  • B-nam_pro_media_radio
  • B-nam_pro_vehicle
  • B-nam_oth_position
  • B-nam_liv_animal
  • B-nam_pro
  • B-nam_oth_www
  • B-nam_num_phone
  • B-nam_pro_title_article
  • B-nam_oth_data_format
  • B-nam_fac_bridge
  • B-nam_liv_character
  • B-nam_pro_software_game
  • B-nam_loc_hydronym_lake
  • B-nam_loc_gpe_conurbation
  • B-nam_pro_media
  • B-nam_loc_land
  • B-nam_loc_land_peak
  • B-nam_fac_park
  • B-nam_org_organization_sub
  • B-nam_loc_hydronym
  • B-nam_loc_hydronym_sea
  • B-nam_loc_hydronym_ocean
  • B-nam_fac_goe_stop
搜集汇总
数据集介绍
clarin-pl/kpwr-ner 数据集图片
构建方式
KPWr-NER数据集源自弗罗茨瓦夫理工大学波兰语语料库,专注于细粒度命名实体识别任务。该数据集采用‘n82’版本,将原始120个实体类别精简至82类,以确保类别体系的精炼与实用性。语料文本由人类专家从多种来源精挑细选,覆盖广泛领域与文体,并通过人工标注方式赋予每个实体相应的类型标签。构建过程中,严格遵循详细的标注指南,采用BIO标注体系对文本中的命名实体进行序列化标记,最终形成高质量、多领域的标注语料库,为波兰语NER研究奠定坚实基础。
特点
该数据集最显著的特点在于其细粒度的命名实体分类体系,涵盖人物、地理位置、组织机构、产品、事件等82个具体类别,能够精准捕捉文本中实体的语义多样性。数据集规模适中,训练集包含13,959个句子,测试集包含4,323个句子,且类别分布呈现长尾现象,高频类别如人物和城市占据主导,而低频类别如桥梁、公园等则稀疏存在,这为模型在少样本场景下的泛化能力提出挑战。此外,所有标注均采用BIO格式,便于与序列标注模型无缝对接。
使用方法
研究者可通过HuggingFace Datasets库直接加载该数据集,使用`load_dataset("clarin-pl/kpwr-ner")`命令即可获取训练集与测试集。数据以tokens和ner标签列的形式提供,其中ner列存储了以整数索引表示的类别标签。在评估时,需将预测的整数标签转换为原始类别名称,并借助seqeval工具计算F1分数,该工具支持IOB2标注方案,可逐类别评估模型性能。典型应用流程包括加载数据、训练序列标注模型、生成预测结果,最后利用seqeval进行精确评估,以衡量模型在82个细粒度实体类别上的表现。
背景与挑战
背景概述
KPWr-NER数据集源自波兰弗罗茨瓦夫理工大学开发的波兰语语料库(KPWr),由Bartosz Broda、Michał Marcińczuk等研究人员于2012年构建,旨在推动细粒度命名实体识别(NER)在波兰语中的发展。该数据集以82个细粒度实体类别(如人物、地点、组织等)为核心,覆盖多领域、多体裁的文本,为波兰语自然语言处理提供了高质量的训练与测试资源。其发布遵循CC-BY-3.0许可协议,促进了学术研究的可重复性,并成为波兰语NER领域的重要基准,对低资源语言的实体识别研究具有示范意义。
当前挑战
KPWr-NER面临的核心挑战在于细粒度实体类别的稀疏性与不平衡性,例如部分类别(如天体、山峰)在训练集中出现频率极低,导致模型难以泛化。此外,构建过程中人工标注的复杂性显著,需处理120类原始标签压缩至82类的映射,且文本来源多样(如新闻、文学、技术文档),增加了标注一致性的维护难度。领域问题方面,波兰语的屈折形态与自由语序进一步加剧了实体边界识别与多义消歧的挑战,现有模型需在长尾分布下平衡精度与召回率。
常用场景
经典使用场景
在自然语言处理领域,命名实体识别(NER)是信息抽取的核心任务之一。KPWr-NER数据集作为波兰语精细粒度命名实体识别的标杆资源,凭借其涵盖82个实体类别的丰富标注体系,为研究者提供了训练和评估NER模型的理想平台。该数据集最经典的应用场景在于序列标注任务,其中输入为分词后的文本序列,输出则采用BIO标注格式对每个词元分配对应的实体类别,例如识别出人名、地名、组织机构等细粒度类型。通过使用F1-score等指标进行性能度量,研究者可以系统性地比较不同模型在波兰语NER任务上的表现。
衍生相关工作
KPWr-NER数据集作为波兰语NER研究的基石,催生了多项具有影响力的衍生工作。研究者基于该数据集开发了多种基于Transformer架构的波兰语NER模型,例如利用HerBERT和Polish RoBERTa等预训练语言模型进行微调,显著提升了实体识别的准确率。此外,该数据集还被用于探索跨语言迁移学习与多任务联合训练方法,推动了低资源语言NER技术的进步。在评测基准方面,KPWr-NER成为波兰语结构预测任务的标准测试集,其类别体系与标注规范被后续的波兰语语料库建设所借鉴,形成了广泛认可的标注范式。
数据集最近研究
最新研究方向
在自然语言处理领域,命名实体识别(NER)作为信息抽取的核心任务,正朝着细粒度、多类别与跨语言方向纵深演进。KPWr-NER数据集以其82类精细实体标注体系,为波兰语NER研究提供了高密度、多领域的标注资源,尤其在人名、地名、机构等基础类别之外,涵盖产品、媒体、事件、技术等前沿细分实体,契合当前对结构化语义理解日益增长的需求。该数据集源自弗罗茨瓦夫理工大学波兰语语料库,原始标注类别多达120类,经优化后的n82版本在保持语义丰富性的同时提升了模型训练的可行性。近期研究聚焦于利用该数据集训练基于Transformer架构的波兰语NER模型,探索在低资源语言环境下如何通过迁移学习与多任务学习提升细粒度实体识别性能。KPWr-NER的发布不仅填补了东欧语言细粒度NER基准的空白,也为多语言NER系统的公平评估与跨语言泛化能力研究提供了关键支撑,推动了语言资源相对匮乏语种在信息抽取技术上的平等发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务