遇见数据集

SEACrowd/indonlu_nergrit

收藏
Hugging Face2024-06-24 更新2024-03-04 收录
官方服务:

资源简介:

Indonlu Nergrit数据集是一个用于命名实体识别(NER)任务的数据集,来源于Grit-ID仓库。数据集中包含三种命名实体标签:PERSON(人名)、PLACE(地名)和ORGANIZATION(组织名)。数据集支持的任务是命名实体识别,并且提供了使用`datasets`和`seacrowd`库加载数据集的示例代码。此外,README还提供了数据集的版本信息、许可证信息以及引用文献。

This NER dataset is taken from the Grit-ID repository, and the labels are spans in IOB chunking representation. The dataset consists of three kinds of named entity tags, PERSON (name of person), PLACE (name of location), and ORGANIZATION (name of organization). The supported task is Named Entity Recognition, and it provides example code for loading the dataset using the `datasets` and `seacrowd` libraries. Additionally, the README provides version information, license information, and citation references.

提供机构:
SEACrowd
原始信息汇总

数据集概述

语言

  • 印尼语 (ind)

任务类别

  • 命名实体识别 (Named Entity Recognition)

标签

  • 数据集包含三种命名实体标签:
    • PERSON (人名)
    • PLACE (地名)
    • ORGANIZATION (组织名)

数据集版本

  • 源版本: 1.0.0
  • SEACrowd版本: 2024.06.20

许可证

  • MIT

引用

  • 使用数据集时,请引用以下文献:

    @inproceedings{wilie2020indonlu, title={IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding}, author={Bryan Wilie and Karissa Vincentio and Genta Indra Winata and Samuel Cahyawijaya and X. Li and Zhi Yuan Lim and S. Soleman and R. Mahendra and Pascale Fung and Syafri Bahar and A. Purwarianti}, booktitle={Proceedings of the 1st Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 10th International Joint Conference on Natural Language Processing}, year={2020} } @online{nergrit2019, title={NERGrit Corpus}, author={NERGrit Developers}, year={2019}, url={https://github.com/grit-id/nergrit-corpus} } @article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
SEACrowd/indonlu_nergrit 数据集图片
构建方式
在自然语言处理领域,命名实体识别(NER)是信息抽取的核心任务之一,旨在从非结构化文本中识别出具有特定意义的实体。SEACrowd/indonlu_nergrit数据集源自Grit-ID仓库,专为印度尼西亚语的NER任务而设计。该数据集采用IOB分块标注格式,对文本中的实体跨度进行精细标记,涵盖三类命名实体标签:PERSON(人物名称)、PLACE(地点名称)和ORGANIZATION(组织名称)。其构建过程依托于对印尼语语料的深度挖掘与人工标注,确保了实体边界的准确性和标签的一致性,为后续模型训练提供了坚实的数据基础。
使用方法
使用该数据集进行模型开发时,研究人员可通过Hugging Face的datasets库便捷加载,仅需一行代码`load_dataset("SEACrowd/indonlu_nergrit", trust_remote_code=True)`即可获取数据。同时,借助SEACrowd库的`load_dataset`函数,用户能够灵活选择不同的配置(config)来适配特定需求。数据集加载后,可直接用于训练、验证和测试基于Transformer的NER模型,如BERT或RoBERTa的印尼语变体。建议在预处理阶段对IOB标签进行整数编码,并利用标准评估指标(如F1分数)来度量模型性能,从而高效地推动印尼语信息抽取任务的研究进展。
背景与挑战
背景概述
在自然语言处理领域,命名实体识别(NER)作为信息抽取的核心任务,旨在从非结构化文本中识别出人名、地名、组织机构等特定实体,为知识图谱构建、问答系统及机器翻译等应用提供基础支撑。然而,相较于英语等资源丰富语言,印度尼西亚语等低资源语言的NER研究长期受限于标注语料的匮乏与质量参差。为填补这一空白,Indonlu Nergrit数据集于2019年由NERGrit开发者团队创建,后经IndoNLU项目(2020年)整合至印尼语自然语言理解基准中,并由SEACrowd(2024年)进一步标准化与分发。该数据集源自Grit-ID仓库,采用IOB分块标注格式,涵盖PERSON、PLACE、ORGANIZATION三类实体标签,为印尼语NER研究提供了首个公开且规模可观的标注语料。其发布显著推动了东南亚语言自然语言处理的发展,成为评估印尼语实体识别模型性能的重要基准,并催生了后续多语言、多模态数据集的构建浪潮。
当前挑战
Indonlu Nergrit数据集当前面临多重挑战。在领域问题层面,印尼语形态丰富且存在大量外来词与方言变体,导致实体边界模糊、歧义频发,例如同一词汇在不同语境中可能分属PERSON或ORGANIZATION类别;同时,数据集仅覆盖三类粗粒度实体,无法满足金融、医疗等垂直领域对细粒度实体(如药物名称、金融产品)的识别需求,限制了其实际应用范围。在构建过程中,标注一致性是核心难题:原始语料来源于社交媒体与新闻文本,非正式表达与拼写错误频现,人工标注需在缺乏严格规范手册的情况下统一对缩写、复合词及跨行实体的划分标准;此外,数据集规模较小(约数千句),且未提供标注者间一致性系数,导致模型训练易过拟合,泛化至其他领域或文体时性能显著下降。
常用场景
经典使用场景
在自然语言处理领域,命名实体识别(NER)是信息抽取的核心任务之一,尤其对于低资源语言的语料建设而言,高质量的标注数据尤为珍贵。Indonlu Nergrit 数据集专为印尼语设计,聚焦于三类经典实体标签——人物、地点与组织,采用IOB分块标注格式,为序列标注任务提供了标准化的训练与评估基准。该数据集最经典的用途在于训练和评测面向印尼语的NER模型,广泛应用于学术研究中作为基准语料,支持从传统条件随机场到现代预训练语言模型(如IndoBERT)的对比实验,是推动印尼语信息抽取技术发展的关键资源。
解决学术问题
该数据集解决了印尼语自然语言理解中命名实体识别标注资源匮乏的核心学术问题。在Indonlu Nergrit出现之前,印尼语的NER研究多依赖跨语言迁移或小规模语料,难以支撑鲁棒性强的模型训练。该数据集的发布填补了这一空白,使得研究者能够系统性地评估不同模型在印尼语实体识别上的表现,推动了对印尼语语言特性的深入理解,例如语序灵活性对实体边界识别的影响。其意义在于为低资源语言的NER研究树立了可复现的标杆,促进了东南亚语言自然语言处理领域的学术进步。
实际应用
在实际应用中,Indonlu Nergrit 数据集所训练的NER模型可直接赋能印尼语文本信息抽取系统,例如从新闻文章、社交媒体帖子或政府文档中自动提取关键实体,用于舆情监控、知识图谱构建和智能客服。企业可借助该数据集微调模型,实现客户反馈中品牌名、地名与人物关系的自动关联,提升商业情报分析的效率。此外,该数据集还支持印尼语法律文档的自动化摘要与检索,帮助机构快速定位案件涉及的人员与地点,具有显著的社会与经济价值。
数据集最近研究
最新研究方向
在自然语言处理领域,命名实体识别(NER)作为信息抽取的核心任务,正日益受到关注。SEACrowd/indonlu_nergrit数据集聚焦于印尼语文本中的实体识别,涵盖人名、地名与组织名三类标签,为低资源语言的研究提供了宝贵标注资源。当前前沿方向集中于多语言NER模型的迁移学习与跨领域泛化能力,该数据集被广泛用于评估预训练语言模型在东南亚语言上的表现,尤其在SEACrowd数据枢纽的推动下,促进了该区域语言资源的标准化与基准测试。随着全球化信息处理需求的增长,这一数据集对于提升印尼语乃至周边语种的语义理解与知识图谱构建具有重要意义,为多模态、多任务学习场景下的模型鲁棒性研究奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务