遇见数据集

XLEnt

收藏
arXiv2021-09-11 更新2024-06-21 收录
数据链接:
官方服务:

资源简介:

XLEnt数据集由约翰斯·霍普金斯大学等机构创建,包含1.64亿对跨语言实体,覆盖120种语言与英语的对应关系。该数据集通过自动挖掘网络数据,利用词义音位对齐技术LSP-Align构建,旨在改善低资源语言的跨语言实体识别。XLEnt不仅支持机器翻译和跨语言信息链接,还为多语言自然语言处理任务提供重要资源,有助于推动全球语言技术的进步。

The XLEnt dataset was created by Johns Hopkins University and other institutions. It contains 164 million cross-lingual entity pairs, covering cross-lingual correspondences between English and 120 languages. This dataset was constructed by automatically mining web data and leveraging the lexical-phonetic alignment technique LSP-Align, aiming to improve cross-lingual entity recognition for low-resource languages. Besides supporting machine translation and cross-lingual information linking, XLEnt also serves as a critical resource for multilingual natural language processing tasks, contributing to the advancement of global language technology.

创建时间:
2021-04-18
搜集汇总
数据集介绍
构建方式
跨语言命名实体词典是机器翻译与跨语言维基化等多语言自然语言处理任务的重要基础资源。然而,低资源语言中相应实体的缺失严重制约了这些技术的普适性。为应对这一挑战,XLEnt数据集应运而生,其构建依托于一种创新的LSP-Align技术。该技术首先利用高质量NER工具对英语句子进行实体标注,随后通过词对齐模型将标注的实体投影至目标语言。具体而言,LSP-Align融合了三种对齐信号:基于FastAlign的词汇共现对齐、基于LASER多语言嵌入的语义距离对齐,以及基于无监督音译与编辑距离的语音对齐。通过统一生成式模型整合上述信号,并利用最大似然估计计算翻译概率,最终从CCAligned、WikiMatrix和CCMatrix等大规模网络平行语料中自动挖掘出超过1.64亿对跨语言实体对,覆盖120种语言与英语的配对。
特点
XLEnt数据集的核心特点在于其前所未有的规模与语言覆盖广度,横跨120种语言,包含1.64亿个独特的跨语言实体对,为低资源语言研究提供了珍贵资源。其独创的LSP-Align模型在性能上显著优于单一对齐方法,尤其在处理低频实体时展现出卓越鲁棒性,实验表明其Fuzzy-F1分数平均达到0.86,高于纯词汇对齐的0.84与纯语音对齐的0.83。数据集质量呈现资源依赖性,高资源语言(如西班牙语、法语)的F1分数可达0.90以上,而低资源语言(如泰米尔语)则相对较低,但LSP-Align仍能有效提升后者的对齐效果。此外,数据集支持通过调整挖掘频率阈值来控制实体词典的质量与规模,为用户提供了灵活的应用定制能力。
使用方法
XLEnt数据集的使用灵活多样,可直接服务于多语言命名实体识别、跨语言实体链接及多语言知识库构建等下游任务。用户可通过官方链接(data.statmt.org/xlent/或opus.nlpl.eu/XLEnt-v1.1.php)获取全部实体对及附带的多语言实体标注语料。在实际应用中,研究者可根据目标语言与英语的平行语料规模,直接利用挖掘出的实体对作为跨语言词典,或将其作为弱监督信号训练低资源语言的NER模型。数据集还提供了按频率筛选实体的功能,用户可设定频率阈值以平衡词典的精确度与召回率,从而适配不同任务需求。此外,伴随发布的实体投影标注语料可用于跨语言迁移学习,为缺乏标注数据的语言提供高质量的伪标注数据。
背景与挑战
背景概述
跨语言命名实体词典是机器翻译、跨语言维基化等多语言自然语言处理任务的核心资源。尽管知识库在英语、法语等高资源语言中拥有海量实体,低资源语言对应的实体却往往缺失,严重制约了多语言文本理解的发展。为弥合这一鸿沟,来自Twitter Cortex、Facebook AI与约翰霍普金斯大学的研究人员于2021年提出了XLEnt数据集。该数据集由Ahmed El-Kishky、Adithya Renduchintala、James Cross、Francisco Guzmán与Philipp Koehn联合创建,核心研究问题在于如何自动且高质量地从网络挖掘的海量平行语料中构建跨语言实体词典。通过融合词汇、语义与语音三种对齐信号,研究者从120种语言与英语的平行句对中挖掘出超过1.64亿条跨语言实体对,并同步发布了大规模多语言命名实体标注语料。XLEnt的发布为低资源场景下的实体识别、实体链接与知识库构建提供了宝贵的数据支撑,显著推动了跨语言NLP领域的实证研究。
当前挑战
XLEnt数据集所面临的挑战可从两个维度审视。其一,在领域问题层面,跨语言实体词典构建的核心挑战在于低资源语言实体覆盖率严重不足,现有基于词对齐的投影方法在实体词频稀疏时性能急剧下降。尤其对于形态复杂或书写系统迥异的语言,单一的对齐信号(如纯词汇共现)极易导致实体误对齐,从而影响词典的准确性与完整性。其二,在构建过程中,研究者需应对海量网络文本中噪声的干扰,包括句子对齐质量参差不齐、实体边界模糊以及低资源语言缺乏高质量标注器等问题。此外,如何有效融合词汇、语义与语音三种异构对齐信号,并在不同资源水平的语言间保持稳定的抽取效果,也是一项技术难题。实验表明,尽管LSP-Align模型整体优于单一基线,但在低资源语言上(如泰米尔语、豪萨语)的F1值仍不足0.3,凸显了数据稀疏与跨语言异构性带来的持久挑战。
常用场景
经典使用场景
在跨语言自然语言处理研究中,XLEnt数据集被广泛用于构建和评估跨语言命名实体词典。其经典使用场景在于,通过将高资源语言(如英语)中识别出的命名实体,利用词对齐技术投射到低资源语言文本中,从而自动生成大规模、多语种的实体对。研究者常借助该数据集训练和测试命名实体识别(NER)模型在低资源语言上的泛化能力,尤其是在缺乏标注数据的情况下,XLEnt为监督学习和弱监督学习提供了宝贵的跨语言实体对齐基准。
解决学术问题
XLEnt数据集有效解决了跨语言命名实体资源匮乏这一核心学术难题。传统方法依赖人工标注或知识库(如维基百科),但低资源语言往往覆盖不足。该数据集通过融合词汇、语义和语音三种对齐信号,显著提升了低频实体的挖掘质量,为多语言NER、跨语言实体链接和知识库构建提供了大规模、高质量的训练数据。其意义在于推动了低资源场景下的跨语言迁移学习研究,使NLP系统能够超越语言边界,实现更广泛的语言理解。
衍生相关工作
XLEnt数据集的发布催生了多项经典衍生工作。例如,基于其提出的LSP-Align对齐模型,后续研究进一步优化了语音和语义信号的融合策略,提出了更轻量级的跨语言实体投影方法。此外,该数据集被用于评估多语言BERT等预训练模型在命名实体识别上的跨语言迁移能力,推动了XLM-R、mT5等模型的改进。还有工作利用XLEnt构建了大规模多语言实体链接基准,促进了低资源语言信息抽取技术的快速发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务