数据链接:
官方服务:
资源简介:
This is the first release of Universal NER: UNER v1
应用场景:
创建时间:
2023-11-14
相关数据集
CLUENER2020
CLUENER2020是一个细粒度实体识别数据集,用于实体识别任务,数据集包含多种实体类型如人名、地址、公司等,并提供了实体在文本中的位置信息。
github2023-04-11 更新1070
RONEC
RONEC是罗马尼亚语的命名实体语料库,由布加勒斯特理工大学创建。该数据集包含5127个句子,共26377个命名实体,涵盖16种不同的实体类别。数据来源于版权免费的报纸文本,旨在解决罗马尼亚语在命名实体识别领域的资源匮乏问题。数据集创建过程中,通过多次迭代和讨论,不断优化标注指南,最终形成高质量的标注结果。RONEC的应用领域广泛,可用于信息提取、机器翻译等多种自然语言处理任务。
arXiv2020-04-28 更新170
DavidFM43/gutenberg_spacy-ner-monitoring
--- dataset_info: features: - name: tokens sequence: string - name: ner_tags sequence: class_label: names: '0': O '1': B-CARDINAL '2': I-CARDI
Hugging Face2023-04-08 更新120
ferrazzipietro/LS_Llama-2-7b-hf_adapters_en.layer1_NoQuant_32_32_0.01_4_0.0002_5EpochsBestF1Train
该数据集主要用于自然语言处理任务,特别是命名实体识别(NER)和相关文本分析。数据集包含多个特征,如句子、实体列表、原始文本、原始ID、标记、NER标签、输入ID、注意力掩码、标签、预测和真实标签。实体列表中包含ID、偏移量、角色、语义类型ID、文本和类型。数据集分为测试集,包含681个样本,总大小为2785371字节。
Hugging Face2024-05-16 更新200
Tippawan/SNOMED-CT-NER-V.2
--- dataset_info: features: - name: text sequence: string - name: tag sequence: int64 splits: - name: train num_bytes: 226675 num_examples: 1228 - name: validation num_
Hugging Face2024-04-12 更新150



