遇见数据集

SEACrowd/indoner_tourism

收藏
Hugging Face2024-06-24 更新2024-06-29 收录
官方服务:

资源简介:

Indoner Tourism数据集是为印度尼西亚语旅游领域的命名实体识别(NER)任务设计的。它包含标注的命名实体序列,包括地点、设施和旅游相关实体。数据集的标注包括以下实体类型:非实体(O)、旅游相关实体(B-WIS, I-WIS)、地点实体(B-LOC, I-LOC)和设施实体(B-FAS, I-FAS)。数据集的语言为印度尼西亚语(ind),支持的任务为命名实体识别。

This dataset is designed for named entity recognition (NER) tasks in the Bahasa Indonesia tourism domain. It contains labeled sequences of named entities, including locations, facilities, and tourism-related entities. The dataset is annotated with the following entity types: O (Non-entity), B-WIS (Beginning of a tourism-related entity), I-WIS (Continuation of a tourism-related entity), B-LOC (Beginning of a location entity), I-LOC (Continuation of a location entity), B-FAS (Beginning of a facility entity), and I-FAS (Continuation of a facility entity). The datasets language is Indonesian (ind), and it supports the task of named entity recognition.

提供机构:
SEACrowd
原始信息汇总

Indoner Tourism 数据集概述

数据集描述

  • 名称: Indoner Tourism
  • 任务类别: 命名实体识别 (Named Entity Recognition, NER)
  • 领域: 印度尼西亚语旅游领域
  • 实体类型:
    • O (0): 非实体或其他不属于指定类别的词
    • B-WIS (1): 旅游相关实体的开始
    • I-WIS (2): 旅游相关实体的延续
    • B-LOC (3): 位置实体的开始
    • I-LOC (4): 位置实体的延续
    • B-FAS (5): 设施实体的开始
    • I-FAS (6): 设施实体的延续

语言

  • 印度尼西亚语 (ind)

支持的任务

  • 命名实体识别

数据集版本

  • 源版本: 1.0.0
  • SEACrowd版本: 2024.06.20

数据集许可证

  • Academic Free License v3.0 (afl-3.0)

引用

  • Indoner Tourism:

    @article{JLK, author = {Ahmad Hidayatullah and Muhammad Fakhri Despawida Aulia Putra and Adityo Permana Wibowo and Kartika Rizqi Nastiti}, title = { Named Entity Recognition on Tourist Destinations Reviews in the Indonesian Language}, journal = {Jurnal Linguistik Komputasional}, volume = {6}, number = {1}, year = {2023}, issn = {2621-9336}, pages = {30--35}, doi = {10.26418/jlk.v6i1.89}, url = {https://inacl.id/journal/index.php/jlk/article/view/89} }

  • SEACrowd:

    @article{lovenia2024seacrowd, title={SEACrowd: A Multilingual Multimodal Data Hub and Benchmark Suite for Southeast Asian Languages}, author={Holy Lovenia and Rahmad Mahendra and Salsabil Maulana Akbar and Lester James V. Miranda and Jennifer Santoso and Elyanah Aco and Akhdan Fadhilah and Jonibek Mansurov and Joseph Marvin Imperial and Onno P. Kampman and Joel Ruben Antony Moniz and Muhammad Ravi Shulthan Habibi and Frederikus Hudi and Railey Montalan and Ryan Ignatius and Joanito Agili Lopo and William Nixon and Börje F. Karlsson and James Jaya and Ryandito Diandaru and Yuze Gao and Patrick Amadeus and Bin Wang and Jan Christian Blaise Cruz and Chenxi Whitehouse and Ivan Halim Parmonangan and Maria Khelli and Wenyu Zhang and Lucky Susanto and Reynard Adha Ryanda and Sonny Lazuardi Hermawan and Dan John Velasco and Muhammad Dehan Al Kautsar and Willy Fitra Hendria and Yasmin Moslem and Noah Flynn and Muhammad Farid Adilazuarda and Haochen Li and Johanes Lee and R. Damanhuri and Shuo Sun and Muhammad Reza Qorib and Amirbek Djanibekov and Wei Qi Leong and Quyet V. Do and Niklas Muennighoff and Tanrada Pansuwan and Ilham Firdausi Putra and Yan Xu and Ngee Chia Tai and Ayu Purwarianti and Sebastian Ruder and William Tjhi and Peerat Limkonchotiwat and Alham Fikri Aji and Sedrick Keh and Genta Indra Winata and Ruochen Zhang and Fajri Koto and Zheng-Xin Yong and Samuel Cahyawijaya}, year={2024}, eprint={2406.10118}, journal={arXiv preprint arXiv: 2406.10118} }

搜集汇总
数据集介绍
SEACrowd/indoner_tourism 数据集图片
构建方式
在自然语言处理领域,命名实体识别(NER)作为信息抽取的核心任务,对于旅游行业的文本挖掘具有重要价值。Indoner Tourism数据集正是为印尼语旅游领域的NER任务而精心构建的。该数据集源自对印尼多个旅游目的地评论的采集,共计2010条评论文本,通过分句处理得到了116,564个词元。标注过程严格遵循预定义实体类型,将词元划分为非实体(O)、旅游景点实体(B/I-WIS)、位置实体(B/I-LOC)及设施实体(B/I-FAS),形成了结构化的序列标注数据。这一构建方法确保了数据集在领域特异性与标注一致性上的平衡,为模型训练提供了高质量的基础。
特点
该数据集的核心特点在于其高度的领域聚焦与细粒度的实体分类体系。首先,它专攻印尼语旅游领域,覆盖了旅游景点、地理位置及配套设施三大关键实体类别,契合了旅游评论中信息抽取的实际需求。其次,标注采用BIO(Begin-Inside-Outside)格式,通过B-和I-前缀清晰区分实体的起始与延续,增强了序列标注的精确性。此外,数据集规模适中,超过10万词元的标注量既保证了统计有效性,又避免了冗余,使其成为研究低资源语言领域NER的优质基准资源。
使用方法
使用Indoner Tourism数据集进行实验时,可便捷地通过主流工具库加载。推荐采用HuggingFace的datasets库,只需一行代码`load_dataset("SEACrowd/indoner_tourism", trust_remote_code=True)`即可获取数据。对于需要标准化架构的SEACrowd用户,可通过`seacrowd`库调用`sc.load_dataset("indoner_tourism", schema="seacrowd")`加载,并利用`available_config_names`函数探索子集配置。加载后的数据可直接用于训练NER模型,如BiLSTM架构,其原始论文已证实该数据集在F1分数上可达94.3%的优异表现。
背景与挑战
背景概述
在自然语言处理领域,命名实体识别(NER)是信息抽取的关键技术,旨在从非结构化文本中识别出具有特定意义的实体,如地名、机构名等。随着全球旅游业的蓬勃发展,旅游评论数据激增,如何高效地从印尼语旅游评论中提取关键信息成为研究热点。SEACrowd/indoner_tourism数据集由Ahmad Hidayatullah等学者于2023年创建,依托于印度尼西亚的多所研究机构,核心研究问题聚焦于构建面向印尼语旅游领域的NER模型。该数据集包含2010条旅游目的地评论,标注了116,564个词元的实体类型,涵盖旅游景点、位置和设施三大类别,为低资源语言印尼语的NER研究提供了重要基准。其发布不仅推动了印尼语自然语言处理的发展,也为东南亚语言的多模态数据生态建设贡献了力量,在SEACrowd数据枢纽中具有标志性意义。
当前挑战
该数据集所解决的领域问题在于印尼语旅游评论中命名实体的自动识别,这是提升旅游信息检索与推荐系统效能的关键。然而,构建过程面临多重挑战:首先,印尼语作为低资源语言,缺乏大规模高质量标注语料,数据收集需从分散的在线评论平台手工爬取,耗时且易引入噪声。其次,实体类型定义需兼顾领域特异性与通用性,如“设施”(FAS)与“位置”(LOC)的边界模糊,增加了标注一致性难度。此外,评论语言风格口语化、包含非正式表达与拼写变体,对BiLSTM模型的泛化能力构成考验。最终,尽管模型F1分数达94.3%,但跨领域迁移性不足,且数据集规模有限,难以覆盖旅游实体的长尾分布,限制了在真实场景中的鲁棒应用。
常用场景
经典使用场景
在印度尼西亚语自然语言处理领域,命名实体识别(NER)是信息抽取的核心任务之一。Indoner Tourism 数据集专为旅游领域的NER设计,其经典使用场景是从印尼语旅游评论中自动识别并分类三类实体:旅游景点名称(WIS)、地理位置(LOC)以及相关设施(FAS)。研究者利用该数据集训练序列标注模型,如BiLSTM-CRF或基于Transformer的架构,以精准提取结构化信息。该数据集为低资源语言——印度尼西亚语的领域特定NER提供了首个标准化基准,推动了东南亚语言在旅游信息处理中的技术发展。
解决学术问题
该数据集有效解决了印尼语旅游领域缺乏高质量标注语料库的学术困境。此前,针对印尼语的NER研究多集中于通用域或新闻文本,难以应对旅游评论中实体多样性、语言非正式性及领域专有名词的挑战。Indoner Tourism 通过细粒度实体标注(如区分景点名称与设施)和跨领域标签设计,使研究者能够系统评估不同NER模型在旅游场景下的鲁棒性与泛化能力。其公开的标注规范与评估协议,为后续比较研究提供了可重复的基线,显著降低了领域NER的门槛。
衍生相关工作
Indoner Tourism 衍生了一系列重要学术工作。原始论文提出基于BiLSTM的NER模型,在116,564个词元的测试集上达到94.3%的F1分数,验证了深度学习在印尼语旅游NER中的有效性。随后,该数据集被整合进SEACrowd多语言数据枢纽,成为东南亚语言基准测试的一部分,支持跨语言NER任务评估。此外,研究者基于该数据集探索了预训练语言模型(如IndoBERT)的微调策略,并对比了CRF与Transformer解码器的性能差异,推动了低资源语言领域NER的模型选择与优化研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务