遇见数据集

nextar36/indonlu

收藏
Hugging Face2026-05-27 更新2026-05-31 收录
官方服务:

资源简介:

IndoNLU基准是一个用于训练、评估和分析印尼语(印度尼西亚语)自然语言理解系统的资源集合。它包含12个数据集,覆盖多种自然语言处理任务:1. EmoT:一个从Twitter收集的情感分类数据集,包含约4000条印尼口语推文,涵盖愤怒、恐惧、快乐、爱和悲伤五种情感标签。2. SmSA:句子级情感分析数据集,收集自多个在线平台的评论和评价,标注为积极、消极和中性三种情感。3. CASA:基于方面的情感分析数据集,包含约1000条来自印尼在线汽车平台的评论,涵盖六个汽车质量方面,每个方面标注为积极、消极或中性。4. HoASA:基于方面的情感分析数据集,收集自酒店聚合平台,涵盖十个酒店质量方面,每个方面标注为积极、消极、中性或积极-消极(针对同一方面不同对象的多个情感)。5. WReTE:维基百科修订编辑文本蕴含数据集,包含450个句子对,标注为蕴含或不蕴含。6. POSP:印尼语词性标注数据集,来自印尼新闻网站,包含约8000个句子,使用26个词性标签。7. BaPOS:词性标注数据集,来自PAN本地化项目,包含约1000个句子,使用23个词性标签。8. TermA:方面和情感词提取数据集,收集自酒店聚合平台,使用IOB标注格式标注方面和情感词。9. KEPS:关键词提取数据集,来自Twitter上关于银行产品和服务的讨论,使用IOB格式标注关键短语。10. NERGrit:命名实体识别数据集,包含PERSON、PLACE和ORGANIZATION三种实体标签,使用IOB格式。11. NERP:命名实体识别数据集,收集自印尼新闻网站,包含PER(人物)、LOC(地点)、IND(产品或品牌)、EVT(事件)和FNB(食品和饮料)五种标签,使用IOB格式。12. FacQA:事实问答数据集,目标是从新闻文章短文中找到问题的答案,涵盖日期、地点、名称、组织、人物和数量六类问题。数据集支持印尼语,由专家生成,遵循MIT许可证。

The IndoNLU benchmark is a collection of resources for training, evaluating, and analyzing natural language understanding systems for Bahasa Indonesia (Indonesian language). It includes 12 datasets covering various NLP tasks: 1. EmoT: An emotion classification dataset from Twitter with around 4000 Indonesian colloquial tweets and five emotion labels (anger, fear, happy, love, sadness). 2. SmSA: A sentence-level sentiment analysis dataset from online platforms, annotated with positive, negative, and neutral sentiments. 3. CASA: An aspect-based sentiment analysis dataset of car reviews from Indonesian online automobile platforms, covering six aspects with positive, negative, or neutral labels. 4. HoASA: An aspect-based sentiment analysis dataset of hotel reviews from a hotel aggregator, covering ten aspects with positive, negative, neutral, or positive-negative labels. 5. WReTE: A textual entailment dataset from Wikipedia revision history, with 450 sentence pairs labeled as entailed or not entailed. 6. POSP: An Indonesian part-of-speech tagging dataset from news websites, with around 8000 sentences and 26 POS tags. 7. BaPOS: A POS tagging dataset from the PAN Localization Project, with about 1000 sentences and 23 POS tags. 8. TermA: A span-extraction dataset for aspect and sentiment words from hotel reviews, using IOB tagging. 9. KEPS: A keyphrase extraction dataset from Twitter discussions on banking, using IOB format. 10. NERGrit: A named entity recognition dataset with PERSON, PLACE, and ORGANIZATION tags in IOB format. 11. NERP: An NER dataset from Indonesian news websites with PER, LOC, IND, EVT, and FNB tags in IOB format. 12. FacQA: A factoid question-answering dataset to find answers from news passages, covering six question categories. The dataset is in Indonesian, expert-generated, and licensed under MIT.

提供机构:
nextar36
搜集汇总
数据集介绍
nextar36/indonlu 数据集图片
构建方式
IndoNLU基准数据集由多源数据经专家精心构建而成,汇聚了12个面向印尼语自然语言理解任务的子集。这些数据源自社交媒体(如Twitter)、在线评论平台(如汽车与酒店点评网站)以及新闻门户等多元渠道,覆盖了情感分类、命名实体识别、词性标注、文本蕴含与问答等核心任务。每个子集均经由具备语言学背景的专业人士进行标注,确保了标签体系的一致性与可靠性,例如EmoT数据集涵盖5类情感标签,而SmSA则包含正面、负面与中性三种情感倾向。
使用方法
用户可通过HuggingFace Datasets库便捷加载该基准,每个子集均以独立配置(config)形式提供,如`emot`、`smsa`等。数据以训练、验证与测试集划分,特征格式因任务而异:分类任务通常包含文本与标签字段,序列标注任务则以`tokens`与对应的`ner_tags`或`pos_tags`呈现。研究者可直接利用这些标准化分割进行模型训练与评估,或通过修改数据框架适配下游任务,例如将面向方面的情感数据转换为多任务学习格式。
背景与挑战
背景概述
随着自然语言处理技术的蓬勃发展,低资源语言的深度语义理解研究日益受到学界关注。印尼语(Bahasa Indonesia)作为拥有超过两亿使用者的世界主要语言之一,其自然语言理解基准的匮乏始终是制约该领域进步的瓶颈。为填补这一空白,由印度尼西亚多所高校及研究机构联合发起的IndoNLU(Indonesian Natural Language Understanding)基准数据集于2020年正式发布,相关研究成果发表于ACL 2020区域分会。该数据集以系统性评估印尼语模型的综合语言理解能力为核心研究问题,整合了涵盖情感分类、命名实体识别、词性标注、问答系统等12个多样化子任务,为印尼语自然语言处理提供了一个标准化、多任务、高权威性的评测平台。IndoNLU的创建不仅显著推动了印尼语计算语言学的发展,也为其他低资源语言的基准构建树立了重要范式,对促进自然语言处理技术的语言多样性产生了深远影响。
当前挑战
IndoNLU所应对的首要挑战在于领域问题:印尼语自然语言理解长期缺乏统一且多维度的高质量基准,导致研究碎片化,模型性能难以横向比较。数据集的构建过程亦充满挑战。首先,各子任务数据的来源极为分散,如情感分析数据源自社交媒体与多平台评论,命名实体数据则需从多领域新闻语料中抽取,数据采集与清洗工作量巨大。其次,标注体系的统一与协调极具难度,例如词性标注需同时遵循INACL与PAN Localization等多套不同规范,且部分任务的标签体系(如方面级情感的细粒度划分)极为复杂,需由印尼语语言学专家逐条审核,人力成本高昂。此外,部分子数据集(如WReTE文本蕴含数据集)规模极小(仅450条),如何在有限样本下构建具备泛化能力的评测任务,亦是对数据设计合理性的严峻考验。
常用场景
经典使用场景
IndoNLU基准数据集为印度尼西亚语自然语言理解研究提供了一个系统性的评测框架,涵盖情感分类、命名实体识别、词性标注、语义相似度判断、问答系统等十二个子任务。该数据集整合了社交媒体文本、新闻报道、产品评论、酒店评价及百科修订历史等多种语料来源,能够充分检验模型在印尼语这一低资源语言上的泛化能力。研究者可借助该数据集系统评估预训练语言模型在印尼语各项NLU任务上的表现,并分析模型对不同语言现象和文本类型的适配程度。
解决学术问题
IndoNLU的构建填补了印尼语自然语言理解领域缺乏统一标准化基准的学术空白。此前印尼语NLP研究分散在各个独立数据集上,缺乏可比的评估标准,难以客观衡量不同模型的性能差异。该数据集通过统一的标注规范和数据划分,解决了跨任务对比困难的问题,使得研究人员能够系统性地分析模型在不同NLU任务上的优势与不足。此外,该基准还促进了低资源语言NLP方法的发展,推动了针对印尼语特有语言现象的建模研究,对拓展自然语言处理技术的语言覆盖范围具有重要学术意义。
实际应用
在实际应用层面,IndoNLU涵盖的任务与印尼语互联网信息服务密切相关。情感分析子数据集可被用于社交媒体舆情监控、品牌声誉管理和产品反馈分析;命名实体识别数据集支持新闻信息抽取、知识图谱构建以及商业情报分析;方面级情感分析数据集能够帮助企业精准把握消费者对产品或服务各维度的评价;问答数据集则能够赋能智能客服系统和信息检索服务。这些应用场景对于拥有两亿多人口的印尼市场具有显著商业价值和社会效益。
数据集最近研究
最新研究方向
IndoNLU作为印度尼西亚语自然语言理解领域的标杆性基准数据集,正以其多元化的任务类型和高质量的人工标注资源,引领该语言在情感分析、命名实体识别、词性标注、问答系统等前沿方向的研究浪潮。当前,研究者借助其涵盖Twitter社交文本、在线评论、新闻语料及百科修订记录等真实场景的子集,聚焦于跨领域迁移学习、多任务联合建模及低资源场景下的鲁棒性提升。尤其是结合印尼语口语化与非正式表达的挑战,该基准为探索形态丰富语言在深度学习范式下的语义泛化能力提供了关键试验场,推动了东南亚语言处理技术的进展与全球化AI生态的平等发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务