遇见数据集

WolofEntityLinking

收藏
Hugging Face2026-06-26 更新2026-06-29 收录
官方服务:

资源简介:

Wolof Entity Linking 是一个针对低资源非洲语言——沃洛夫语(Wolof)的实体链接基准数据集。该数据集旨在解决低资源语言实体链接任务中的一个核心挑战:正字法变异(即非标准化的拼写形式)。数据来源于 MasakhaNER 2.0 数据集的验证集和测试集,经过筛选保留了包含有效实体提及(排除仅含日期或无实体提及的句子)的 1,045 个沃洛夫语句子。数据集共包含 2,049 个实体提及,涵盖三种命名实体类型:地点(LOC)、组织(ORG)和人物(PER)。其中,1,704 个提及(In-KB)成功链接至 565 个唯一的 Wikidata 知识库条目(QID),而 345 个提及(Out-of-KB/NIL)则代表了 Wikidata 中不存在的实体。数据集以 JSON 格式提供,每个样本包含句子 ID、原始文本、分词列表以及详细的实体标注信息。实体信息包括字符/词索引边界、实体类型、链接状态(链接或 NIL)、对应的 Wikidata QID、标签、描述(法语或英语)以及元数据(标注来源、方法、NIL 原因等)。该数据集适用于命名实体识别(NER)、实体链接、低资源 NLP 研究以及跨语言知识库构建等任务。

Wolof Entity Linking is a benchmark dataset for entity linking in Wolof, a low-resource African language. It addresses a core challenge in entity linking for such languages: orthographic variation (i.e., non-standardized spellings). The data is derived from the validation and test sets of the MasakhaNER 2.0 dataset, filtered to retain 1,045 Wolof sentences containing valid entity mentions (excluding sentences with only dates or no mentions). The dataset includes 2,049 entity mentions covering three named entity types: location (LOC), organization (ORG), and person (PER). Among these, 1,704 mentions (In-KB) are successfully linked to 565 unique Wikidata knowledge base entries (QIDs), while 345 mentions (Out-of-KB/NIL) represent entities not present in Wikidata. The dataset is provided in JSON format, with each sample containing a sentence ID, original text, tokenized list, and detailed entity annotations. Entity information includes character/token index boundaries, entity type, linking status (linked or NIL), corresponding Wikidata QID, label, description (in French or English), and metadata (annotation source, method, NIL reason, etc.). It is suitable for tasks such as named entity recognition (NER), entity linking, low-resource NLP research, and cross-lingual knowledge base construction.

创建时间:
2026-06-22
搜集汇总
数据集介绍
WolofEntityLinking 数据集图片
构建方式
该数据集构建源于对低资源非洲语言实体链接中正字法变体瓶颈的攻克。以MasakhaNER 2.0中的沃洛夫语验证集与测试集为原始语料,经严格筛选,剔除不含实体提及或仅含日期提及的句子,最终保留1,045句黄金标准样本。每句中的实体提及被细分为LOC、ORG、PER三类,通过手工与半自动结合的方式进行标注:对于可链接至维基数据的实体,依据统一资源标识符精准映射至对应QID;对于知识库外实体,则记录为NIL并标注其缺失原因。标注过程专门制定了针对正字法变体、体育转喻、地理粒度及缩略词歧义的处理规则,确保语义指向的准确性。
使用方法
该数据集可直接通过JSON文件加载,适用于三大核心任务:首先,作为序列标注基准,可配合token-classification框架开展命名实体识别训练;其次,构建实体链接模型时,利用qid字段进行知识库映射,通过NIL标注支持开放世界假设下的链接评估;最后,作为文本生成任务的外部知识源,可注入实体描述以增强生成内容的上下文相关性。使用时需注意,引文需同时标注原作者及MasakhaNER 2.0源数据,以尊重双重学术贡献。建议结合沃洛夫语分词工具预处理输入文本,并依据标注指南中的正字法规则处理变体,确保模型输出的鲁棒性。
背景与挑战
背景概述
WolofEntityLinking数据集由Mouhamed Mbaye于2026年创建,聚焦于低资源非洲语言沃洛夫语的实体链接任务。在自然语言处理领域,实体链接作为知识库与文本之间的桥梁,对于信息检索与问答系统至关重要,然而低资源语言因标注数据匮乏与正字法变体频现而长期受困。该数据集从MasakhaNER 2.0中筛选出1,045句沃洛夫语文本,涵盖2,049个实体提及,并将其解析至Wikidata知识库,形成了包含1,704个可链接实体与345个未登录实体的黄金标准。其发布不仅推动了非洲语言的信息抽取研究,也为跨语言迁移学习与多模态知识融合提供了坚实基础。
当前挑战
该数据集所解决的领域核心挑战在于应对低资源语言实体链接中严重的正字法变体问题,例如沃洛夫语中同一实体(如“Maki Sall”与“Macky Sall”)存在多种书写形式,需通过人工准则统一映射至唯一Wikidata标识。构建过程中面临两大难点:其一,体育转喻现象需精细区分,如国家名“Senegaal”在足球语境下需链接至球队而非地理实体;其二,地理粒度歧义与本地缩略词(如“SDE”)的消解要求标注者具备深厚的区域背景知识,从而确保实体指代的准确性。
常用场景
经典使用场景
在低资源自然语言处理领域,WolofEntityLinking数据集为沃洛夫语的实体链接任务提供了不可或缺的黄金标准。其核心应用场景在于从非结构化的沃洛夫语文本中识别出命名实体,并将其精准映射至Wikidata知识库中对应的唯一标识符。数据集精心标注了1045个句子,涵盖2049个实体提及,囊括了地点、组织和人物三大类别。研究者利用该数据集,可以训练和评估实体链接模型在低资源语言上的表现,尤其能有效应对沃洛夫语中普遍存在的拼写变体问题,例如通过将同一实体的不同表面形式链接至同一Wikidata QID,从而验证模型的鲁棒性和泛化能力。
解决学术问题
该数据集精准击中了低资源语言实体链接研究中的关键瓶颈——拼写变体与知识库覆盖不全问题。在学术层面,它为探究非标准化语言变体下的消歧策略提供了实验基础,例如如何区分国家实体与其同名国家足球队的语义差异。此外,数据集中的345个NIL提及揭示了Wikidata在非洲语言实体覆盖上的显著缺口,这推动了关于开放知识库扩展和空缺实体发现的研究。通过提供详尽的标注原因和类别,WolofEntityLinking促使学界重新审视实体链接的评价体系,不再局限于简单匹配,而是深入理解实体缺失背后的语言学根源,对推动非洲语言NLP研究的公平性与包容性具有深远意义。
实际应用
在实际应用中,WolofEntityLinking数据集赋能了一系列面向沃洛夫语人群的信息提取与知识组织工具。例如,开发人员可基于此构建智能问答系统,使塞内加尔等西非国家的用户能够以母语查询实体相关信息,如政治人物、地标或地方组织。在新闻聚合与舆情监控场景中,该数据集有助于自动从沃洛夫语新闻文本中识别并链接人物与地点,为区域内容分析提供结构化知识。此外,其标注规范对体育转喻(如国家名指代球队)和地域粒度的精细处理,使得从社交媒体数据中抽取赛事动态或地理信息成为可能,极大提升了低资源语言在数字人文与商业情报领域的应用价值。
数据集最近研究
最新研究方向
WolofEntityLinking数据集的发布,为低资源非洲语言实体链接研究开辟了新的前沿。当前研究重点聚焦于应对沃洛夫语中突出的正字法变体问题,通过将非标准化名称映射至统一维基数据标识符(QID),显著缓解了跨语言知识库对齐中的歧义挑战。该数据集在体育转喻(如国家名指代运动队)和地理颗粒度(村落级实体解析)等复杂语义场景中的精细标注准则,推动了实体消歧技术向语言学深度理解演进。结合MasakhaNER 2.0的迁移学习框架,该资源不仅为非洲语言NLP提供了黄金标准基准,更催化了针对低资源环境的跨模态实体链接方法创新,其处理大规模NIL实体的策略为知识库补全与开放世界实体识别树立了新范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务