遇见数据集

SEACrowd/wikiann

收藏
Hugging Face2024-06-24 更新2024-03-04 收录
官方服务:

资源简介:

Wikiann数据集是一个多语言的命名实体识别数据集,包含多种语言的Wikipedia文章,标注了位置(LOC)、人物(PER)和组织(ORG)等实体标签,采用IOB2格式。该数据集的语言包括印尼语、爪哇语、米南加保语、巽他语、亚齐语、马来语、缅甸语、他加禄语、泰语、越南语和高棉语等。数据集的使用方法包括通过`datasets`库和`seacrowd`库加载。数据集的版本为1.1.0,许可证为Apache 2.0。

The Wikiann dataset is a multilingual named entity recognition (NER) dataset consisting of Wikipedia articles across multiple languages, annotated with entity tags such as location (LOC), person (PER), and organization (ORG) in IOB2 format. The languages covered by this dataset include Indonesian, Javanese, Minangkabau, Sundanese, Acehnese, Malay, Burmese, Tagalog, Thai, Vietnamese, Khmer, and others. This dataset can be loaded via the `datasets` library and `seacrowd` library. The dataset is at version 1.1.0 and is licensed under Apache 2.0.

提供机构:
SEACrowd
原始信息汇总

数据集概述

数据集名称

Wikiann

语言

  • 印尼语 (ind)
  • 爪哇语 (jav)
  • 米南加保语 (min)
  • 巽他语 (sun)
  • 亚齐语 (ace)
  • 马来语 (zlm)
  • 缅甸语 (mya)
  • 他加禄语 (tgl)
  • 泰语 (tha)
  • 越南语 (vie)
  • 高棉语 (khm)

任务类别

命名实体识别 (Named Entity Recognition)

数据集标签

  • O (0)
  • B-PER (1)
  • I-PER (2)
  • B-ORG (3)
  • I-ORG (4)
  • B-LOC (5)
  • I-LOC (6)

数据集版本

  • 源版本: 1.1.0
  • SEACrowd版本: 2024.06.20

数据集许可证

Apache License 2.0 (apache-2.0)

引用

@inproceedings{pan-etal-2017-cross, title = "Cross-lingual Name Tagging and Linking for 282 Languages", author = "Pan, Xiaoman and Zhang, Boliang and May, Jonathan and Nothman, Joel and Knight, Kevin and Ji, Heng", booktitle = "Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)", month = jul, year = "2017", address = "Vancouver, Canada", publisher = "Association for Computational Linguistics", url = "https://www.aclweb.org/anthology/P17-1178", doi = "10.18653/v1/P17-1178", pages = "1946--1958", } @inproceedings{rahimi-etal-2019-massively, title = "Massively Multilingual Transfer for {NER}", author = "Rahimi, Afshin and Li, Yuan and Cohn, Trevor", booktitle = "Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics", month = jul, year = "2019", address = "Florence, Italy", publisher = "Association for Computational Linguistics", url = "https://www.aclweb.org/anthology/P19-1015", pages = "151--164", } @article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
SEACrowd/wikiann 数据集图片
构建方式
在自然语言处理领域,命名实体识别(NER)是信息抽取的核心任务之一,而跨语言NER的研究更是推动多语言理解技术发展的关键。SEACrowd/wikiann数据集正是为此而生,它源自WikiANN(亦称PAN-X),一个基于维基百科文章构建的多语言命名实体识别语料库。该数据集采用IOB2标注格式,对文本中的地点(LOC)、人物(PER)和组织(ORG)三类实体进行标注,标签体系涵盖O(0)、B-PER(1)、I-PER(2)、B-ORG(3)、I-ORG(4)、B-LOC(5)和I-LOC(6)。其构建过程借鉴了Rahimi等人(2019)的研究,从原始WikiANN语料中精心筛选出平衡的训练集、验证集和测试集,并特别聚焦于东南亚地区的多种语言,包括印度尼西亚语、爪哇语、米南加保语、巽他语、亚齐语、马来语、班尤马桑语、缅甸语、他加禄语、泰语、越南语和高棉语,从而为低资源语言的NER研究提供了宝贵的数据支持。
使用方法
使用SEACrowd/wikiann数据集进行命名实体识别任务时,研究人员可借助HuggingFace的datasets库便捷地加载数据。通过一行代码“datasets.load_dataset('SEACrowd/wikiann', trust_remote_code=True)”即可获取完整语料,该命令自动信任远程代码以处理数据集配置。对于偏好SEACrowd生态的用户,亦可采用seacrowd库:先调用“sc.load_dataset('wikiann', schema='seacrowd')”加载默认配置,再通过“sc.available_config_names('wikiann')”查看所有可用的语言子集,随后利用“sc.load_dataset_by_config_name(config_name='<config_name>')”指定特定语言进行加载。这种灵活的双接口设计,既满足了快速原型开发的需求,也为精细化的多语言实验提供了支持。加载后的数据可直接用于训练序列标注模型,如BERT或LSTM-CRF,其IOB2格式的标签体系与主流NER框架天然兼容。
背景与挑战
背景概述
WikiANN(亦称PAN-X)是一个面向多语言命名实体识别(NER)任务的数据集,其构建基于维基百科文章,标注了地点(LOC)、人物(PER)和组织(ORG)三类实体,并采用IOB2格式。该数据集由Xiaoman Pan等人于2017年首次提出,旨在实现跨语言命名实体标注与链接,覆盖多达282种语言。随后,Afshin Rahimi等人在2019年进一步优化,生成了平衡的训练、验证和测试划分。SEACrowd团队于2024年将该数据集的印尼语、爪哇语、米南佳保语、巽他语、亚齐语、马来语等11种东南亚语言子集整合发布,为低资源语言的自然语言处理研究提供了宝贵资源。该数据集的核心研究问题在于如何通过跨语言迁移学习,提升对资源匮乏语言的命名实体识别能力,对推动多语言NLP领域的发展具有深远影响。
当前挑战
WikiANN数据集面临的挑战主要体现在两个方面:其一,在领域问题层面,由于东南亚语言在形态、句法和书写系统上差异显著,且许多语言缺乏大规模标注语料,模型在跨语言NER任务中常面临标注稀疏和领域迁移困难,导致实体识别性能不均衡。其二,在数据集构建过程中,原始数据依赖维基百科的跨语言链接和知识库属性自动生成“银标准”标注,这种弱监督方式引入了噪声和标注不一致问题;同时,从英语到其他语言的标注迁移可能丢失语言特有的命名实体模式,如人名和地名的本地化表达。此外,处理如爪哇语、巽他语等低资源语言时,数据量不足进一步加剧了模型泛化的难度。
常用场景
经典使用场景
SEACrowd/wikiann数据集作为多语言命名实体识别(NER)的基准资源,其经典使用场景聚焦于跨语言实体抽取任务的训练与评估。该数据集囊括了印度尼西亚语、爪哇语、巽他语等东南亚语言,以维基百科文章为语料,标注了人名(PER)、地名(LOC)和组织名(ORG)三类实体,格式遵循IOB2标准。研究者常利用其平衡划分的训练、验证和测试子集,来验证模型在低资源语言上的泛化能力,尤其适用于多语言迁移学习与零样本NER场景,成为探究语言多样性与模型鲁棒性的重要试验场。
解决学术问题
该数据集有效解决了低资源语言命名实体识别标注数据匮乏的核心学术难题。通过从维基百科跨语言链接和知识库属性中自动生成‘银标准’注释,并经由自训练与主题选择精炼,为多达282种语言提供了可用的NER标注。它推动了跨语言迁移学习研究,使得在资源丰富的语言(如英语)上训练的模型能够泛化至东南亚等低资源语言,显著降低了人工标注成本,并促进了多语言NER系统的性能提升与公平性评估。
实际应用
在实际应用中,SEACrowd/wikiann数据集支撑了多语言信息抽取系统的构建,例如在东南亚地区的新闻分析、社交媒体监控和地理信息检索中自动识别关键实体。企业可利用其训练的模型处理跨语言客户反馈,提取产品、地点或组织信息以优化服务;政府机构则能将其用于舆情监测或灾害响应中的位置识别。此外,该数据集还赋能了维基百科知识库的自动填充与实体链接系统,提升了多语言场景下信息整合的准确性与效率。
数据集最近研究
最新研究方向
当前,SEACrowd/wikiann数据集在命名实体识别(NER)领域的前沿研究聚焦于东南亚低资源语言的跨语言迁移学习与模型泛化能力提升。随着多语言自然语言处理技术的蓬勃发展,该数据集所涵盖的印尼语、爪哇语、巽他语等12种东南亚语言,成为探索语言多样性对NER系统影响的重要试验场。近期研究热点包括利用大规模预训练语言模型(如mBERT、XLM-R)在极低资源场景下进行零样本或少样本学习,以及通过对抗训练与语言自适应技术缓解标注稀疏问题。此外,结合维基百科多语言知识库的实体链接任务,研究者正尝试构建统一的跨语言NER框架,以服务于区域信息抽取、文化遗产数字化等实际应用。该数据集的发布不仅填补了东南亚语言NER基准的空白,更为推动包容性人工智能发展、弥合数字语言鸿沟提供了关键数据支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务