数据链接:
官方服务:
资源简介:
WikiANN and SADILAR datasets for BigScience.
应用场景:
创建时间:
2022-09-20
相关数据集
ai4privacy/pii-masking-digital-pdi-preview
--- license: cc-by-4.0 language: - en - de - fr - es - it - nl - pt - pl - cs - ro - hu - bg - el - hr - sk - sl - sr - lt - lv - et - fi - da - sv task_categories: - token-classification tags: - pii
Hugging Face2026-04-04 更新200
Results obtained when gold mentions are used.
1=EUSKOR, 2=1+Wiki sieve, 3=1+Synonymy sieve, 4=1+Wiki sieve+Synonymy sieve.
NIAID Data Ecosystem120
iwan-rg/wikiann_translated_af
--- dataset_info: config_name: private features: - name: tokens sequence: string - name: ner_tags sequence: class_label: names: '0': O '1': B-PER
Hugging Face2024-08-19 更新60
MULTICONER
MULTICONER是一个大规模多语言命名实体识别数据集,涵盖11种语言和3个领域(维基句子、问题和搜索查询),并包含多语言和代码混合子集。该数据集旨在代表NER的当代挑战,包括低上下文场景(短且无大小写的文本)、语法复杂的实体(如电影标题)和长尾实体分布。通过使用维基百科和Wikidata等公开资源,结合本地化版本和自动文本翻译方法,生成了适用于测试跨语言和跨领域NER性能的数据。MULTICO
arXiv2022-08-31 更新200
REFLEX Entity Translation Training/DevTest
Introduction REFLEX Entity Translation Training/DevTest was developed by the Linguistic Data Consortium for the Automatic C
DataCite Commons2021-07-01 更新100



