CoNLL-NERC-es
收藏资源简介:
CoNLL-NERC-es 是 CoNLL-2002 共享任务的西班牙语数据集,专注于命名实体识别和分类任务。该数据集包含四种类型的命名实体标注(人物、地点、组织和其他杂项实体),采用标准的 BIO 格式。数据集由西班牙 EFE 新闻社 2000 年 5 月的新闻电讯文章构成,包含 8,324 个训练句子(19,400 个命名实体)、1,916 个开发句子(4,568 个命名实体)和 1,518 个测试句子(3,644 个命名实体)。数据标注由加泰罗尼亚理工大学 TALP 研究中心和巴塞罗那大学语言与计算中心完成,得到了欧盟 NAMIC 项目的资助。该数据集适用于西班牙语自然语言处理任务,特别是命名实体识别领域的研究和应用。
CoNLL-NERC-es 数据集概述
数据集基本信息
- 数据集名称:CoNLL-NERC-es
- 来源页面:https://huggingface.co/datasets/IIC/CoNLL-NERC-es
- 原始网站:https://www.cs.upc.edu/~nlp/tools/nerc/nerc.html
- 联系人:Xavier Carreras (carreras@lsi.upc.es)
- 语言:西班牙语 (es-ES)
- 多语言性:单语
- 任务类别:词元分类
- 任务ID:词性标注
- 标注创建者:专家生成
- 语言创建者:发现
数据集摘要
CoNLL-NERC是CoNLL-2002共享任务的西班牙语数据集。该数据集使用标准的开始-内部-外部(BIO)格式标注了四种类型的命名实体:人物、地点、组织和其他杂项实体。语料库包含8,324个训练句子(19,400个命名实体)、1,916个开发句子(4,568个命名实体)和1,518个测试句子(3,644个命名实体)。该数据集被用作EvalEs西班牙语基准测试的一部分。
支持的任务
- 命名实体识别与分类
数据集结构
数据字段
id:字符串类型tokens:字符串列表pos_tags:列表类型,包含60个词性标签类别(AO, AQ, CC, CS, DA, DE, DD, DI, DN, DP, DT, Faa, Fat, Fc, Fd, Fe, Fg, Fh, Fia, Fit, Fp, Fpa, Fpt, Fs, Ft, Fx, Fz, I, NC, NP, P0, PD, PI, PN, PP, PR, PT, PX, RG, RN, SP, VAI, VAM, VAN, VAP, VAS, VMG, VMI, VMM, VMN, VMP, VMS, VSG, VSI, VSM, VSN, VSP, VSS, Y, Z)ner_tags:列表类型,包含9个命名实体标签类别(O, B-PER, I-PER, B-ORG, I-ORG, B-LOC, I-LOC, B-MISC, I-MISC)
数据实例示例
每个文件有两列,第一列是单词形式或标点符号,第二列是对应的IOB标签。不同文件之间用空行分隔。
数据划分
- 训练集:8,324个样本,6,672,153字节
- 验证集:1,916个样本,1,333,764字节
- 测试集:1,518个样本,1,294,136字节
- 总数据集大小:9,300,053字节
- 下载大小:1,479,313字节
原始文件划分
- esp.train:273,037行
- esp.testa:54,837行(用作开发集)
- esp.testb:53,049行(用作测试集)
数据集创建
数据来源
数据来源于西班牙EFE新闻社提供的新闻电讯文章集,文章时间为2000年5月。
标注信息
标注由加泰罗尼亚理工大学(UPC)的TALP研究中心和巴塞罗那大学(UB)的语言与计算中心(CLiC)完成,由欧洲委员会通过NAMIC项目(IST-1999-12392)资助。
使用注意事项
社会影响
该数据集有助于西班牙语语言模型的发展。
引用信息
使用该语料库时必须引用以下论文: Erik F. Tjong Kim Sang. 2002. Introduction to the CoNLL-2002 Shared Task: Language-Independent Named Entity Recognition. In COLING-02: The 6th Conference on Natural Language Learning 2002 (CoNLL-2002).




