遇见数据集

argosopentech/xlent-de_en

收藏
Hugging Face2022-11-17 更新2024-03-04 收录
官方服务:

资源简介:

XLEnt数据集是一个包含120种语言与英文的平行实体对的数据集,总计超过1.6亿个对齐实体对。该数据集通过挖掘CCAligned、CCMatrix和WikiMatrix的平行句子构建,使用了命名实体识别和类型标注技术,并通过词对齐方法将英文实体标签和类型投影到非英文句子中。词对齐方法结合了词共现对齐、语义对齐和音译对齐三种信号,形成了一个统一的词对齐模型。数据集的构建不涉及对原始数据的知识产权声明。

The XLEnt dataset is a parallel entity pair dataset covering 120 languages paired with English, containing a total of over 160 million aligned entity pairs. It is constructed by mining parallel sentences from CCAligned, CCMatrix and WikiMatrix, adopting named entity recognition (NER) and entity typing technologies, and projecting English entity labels and their types onto non-English sentences through a word alignment approach. This word alignment approach integrates three types of alignment signals: word co-occurrence alignment, semantic alignment and transliteration alignment, thereby forming a unified word alignment model. No intellectual property right claims are made regarding the original data used in the dataset's construction.

提供机构:
argosopentech
原始信息汇总

数据集概述

数据集名称: XLEnt

版本: v1.1

发布日期: 2021年5月23日

格式: Moses格式

内容描述: XLEnt数据集包含120种语言与英语之间的平行实体提及。该数据集通过从CCAligned、CCMatrix和WikiMatrix中挖掘平行句子创建,这些源数据来自Commoncrawl快照和Wikipedia快照。数据集中的实体对是通过对英语句子进行命名实体识别和类型标注,并将标签投影到非英语对齐的句子对上得到的。实体对是通过结合三种对齐信号((1) FastAlign的词共现对齐 (2) 使用LASER嵌入的语义对齐 (3) 通过转写实现的语音对齐)构建的统一词对齐模型得到的。这种方法产生了超过1.6亿对在120种语言中与英语对齐的实体对。

数据集来源:

  • 原始数据来自CCAligned、CCMatrix和WikiMatrix。
  • 数据处理包括命名实体识别、类型标注和词对齐。

数据集特点:

  • 包含超过1.6亿对实体对。
  • 支持120种语言与英语的对齐。
  • 使用了词共现、语义和语音三种对齐方法。

数据集链接:

  • 原始数据集链接: http://data.statmt.org/xlent/
搜集汇总
数据集介绍
argosopentech/xlent-de_en 数据集图片
构建方式
在跨语言自然语言处理领域,实体对齐是知识迁移与信息检索的核心挑战。XLEnt数据集通过融合词汇、语义与语音三重对齐信号,构建了覆盖120种语言的大规模平行实体库。其构建流程始于对CCAligned、CCMatrix和WikiMatrix等并行语料库中英文句子的命名实体识别与类型标注,随后利用FastAlign的词汇共现对齐、LASER嵌入的语义对齐以及音译驱动的语音对齐,将英文实体标签投影至非英文句子,形成统一的词对齐模型。最终通过英文实体作为枢纽,将不同目标语言中的实体对进行拼接,从而获得直接配对非英文实体(如阿拉伯语-法语)的对齐结果,并仅保留最优评分链接以避免冗余。
使用方法
研究者可通过HuggingFace平台直接调用该数据集,例如使用datasets库加载'argosopentech/xlent-de_en'以获取德语-英语对齐实体。数据以Moses格式存储,包含源语言与目标语言的实体对及其对齐分数。用户可基于英文实体进行索引,通过分组操作获得跨语言实体对(如阿拉伯语-法语),或直接利用预对齐的平行实体进行跨语言命名实体识别、机器翻译评估或知识图谱构建等任务。建议在引用时标注原始论文《XLEnt: Mining Cross-lingual Entities with Lexical-Semantic-Phonetic Word Alignment》及OPUS项目,以遵循学术规范。
背景与挑战
背景概述
XLEnt数据集由Ahmed El-Kishky等研究人员于2021年创建,隶属于OPUS开放平行语料库体系,旨在解决跨语言实体对齐这一核心自然语言处理问题。该数据集通过挖掘CCAligned、CCMatrix和WikiMatrix等大规模平行语料,结合命名实体识别与词对齐技术,构建了涵盖120种语言与英语配对的超过1.6亿个实体对。其创新之处在于融合词汇共现、语义嵌入和音译对齐三种信号,显著提升了多语言实体识别的准确性与覆盖范围。XLEnt的发布为跨语言信息检索、机器翻译及知识图谱构建等领域提供了关键资源,推动了低资源语言处理技术的发展。
当前挑战
XLEnt数据集面临的核心挑战在于多语言实体对齐的噪声与歧义问题。首先,从网络爬取语料中提取的实体对常因命名实体识别错误或词对齐失准而引入虚假关联,尤其对形态复杂或资源匮乏的语言影响显著。其次,不同语言间实体类型的语义差异(如专有名词的变体形式)导致投影标签的可靠性下降,需依赖音译对齐缓解但难以完全消除。构建过程中,融合三种对齐信号虽提升了召回率,却增加了计算开销与超参数调优难度,且在非英语实体对直接配对时,最优对齐路径的选择仍存在偏差风险。
常用场景
经典使用场景
在跨语言自然语言处理领域,XLEnt数据集最经典的应用场景是作为大规模平行实体对齐的基准资源。该数据集覆盖120种语言与英语的实体对,通过融合词汇共现、语义嵌入和音译对齐三种信号,实现了高精度的跨语言实体映射。研究者常将其用于训练和评估多语言命名实体识别与实体链接模型,尤其适合需要跨语言知识迁移的任务,例如从英语到低资源语言的实体标签投射。其丰富的语言覆盖和严格的构建流程,使其成为多语言信息抽取领域不可或缺的黄金标准数据。
解决学术问题
XLEnt数据集有效解决了跨语言实体对齐中标注数据匮乏与对齐精度不足的学术难题。传统方法依赖双语词典或平行语料,难以应对多语言场景下的词汇歧义和形态差异。通过结合FastAlign的词汇共现、LASER的语义相似性和音译匹配,该数据集在超过1.6亿个实体对上实现了鲁棒的对齐,显著提升了低资源语言实体识别的可靠性。这一工作推动了跨语言知识图谱构建、多语言问答系统等研究的发展,为探索语言间的实体语义等价性提供了坚实的数据基础。
实际应用
在实际应用中,XLEnt数据集被广泛用于构建多语言搜索引擎、跨语言信息检索系统和全球化知识图谱。例如,企业可借助其对齐实体对实现多语言产品目录的自动关联,或在国际新闻监控中快速匹配不同语言报道中的同名人物与地点。此外,该数据集支持医疗、法律等专业领域的术语跨语言映射,帮助打破语言壁垒,促进全球信息的无障碍流通。其高效的实体对齐能力也为机器翻译的后编辑环节提供了辅助,提升翻译结果中命名实体的准确性。
数据集最近研究
最新研究方向
跨语言实体对齐与多语言知识图谱构建的前沿探索
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务