相关数据集
ferrazzipietro/LS_Llama-2-7b-hf_adapters_en.layer1_NoQuant_32_32_0.01_4_0.0002_5EpochsBestF1Train
该数据集主要用于自然语言处理任务,特别是命名实体识别(NER)和相关文本分析。数据集包含多个特征,如句子、实体列表、原始文本、原始ID、标记、NER标签、输入ID、注意力掩码、标签、预测和真实标签。实体列表中包含ID、偏移量、角色、语义类型ID、文本和类型。数据集分为测试集,包含681个样本,总大小为2785371字节。
Hugging Face2024-05-16 更新200
DavidFM43/gutenberg_spacy-ner-monitoring
--- dataset_info: features: - name: tokens sequence: string - name: ner_tags sequence: class_label: names: '0': O '1': B-CARDINAL '2': I-CARDI
Hugging Face2023-04-08 更新120
liahchan/wnut_test_subset
--- dataset_info: features: - name: id dtype: string - name: tokens sequence: string - name: ner_tags sequence: int64 splits: - name: train num_bytes: 23919.0 num_examp
Hugging Face2023-03-04 更新70
RONEC
RONEC是罗马尼亚语的命名实体语料库,由布加勒斯特理工大学创建。该数据集包含5127个句子,共26377个命名实体,涵盖16种不同的实体类别。数据来源于版权免费的报纸文本,旨在解决罗马尼亚语在命名实体识别领域的资源匮乏问题。数据集创建过程中,通过多次迭代和讨论,不断优化标注指南,最终形成高质量的标注结果。RONEC的应用领域广泛,可用于信息提取、机器翻译等多种自然语言处理任务。
arXiv2020-04-28 更新170
uzair921/QWEN_WNUT_17_EMBEDDINGS_TEXT_LLM_RAG_25_openai_Text
该数据集是一个用于命名实体识别的任务的数据集,包含tokens(文本序列)和ner_tags(实体标签序列)两个特征。实体标签序列包含多个类别,如公司、作品、团体、地点、人物和产品等。数据集分为训练集、验证集和测试集,分别包含2391、1009和1287个示例。数据集的总大小为1,374,988字节,下载大小为381,440字节。
Hugging Face2025-02-08 更新70



