nextar36/indonlu
收藏资源简介:
IndoNLU基准是一个用于训练、评估和分析印尼语(印度尼西亚语)自然语言理解系统的资源集合。它包含12个数据集,覆盖多种自然语言处理任务:1. EmoT:一个从Twitter收集的情感分类数据集,包含约4000条印尼口语推文,涵盖愤怒、恐惧、快乐、爱和悲伤五种情感标签。2. SmSA:句子级情感分析数据集,收集自多个在线平台的评论和评价,标注为积极、消极和中性三种情感。3. CASA:基于方面的情感分析数据集,包含约1000条来自印尼在线汽车平台的评论,涵盖六个汽车质量方面,每个方面标注为积极、消极或中性。4. HoASA:基于方面的情感分析数据集,收集自酒店聚合平台,涵盖十个酒店质量方面,每个方面标注为积极、消极、中性或积极-消极(针对同一方面不同对象的多个情感)。5. WReTE:维基百科修订编辑文本蕴含数据集,包含450个句子对,标注为蕴含或不蕴含。6. POSP:印尼语词性标注数据集,来自印尼新闻网站,包含约8000个句子,使用26个词性标签。7. BaPOS:词性标注数据集,来自PAN本地化项目,包含约1000个句子,使用23个词性标签。8. TermA:方面和情感词提取数据集,收集自酒店聚合平台,使用IOB标注格式标注方面和情感词。9. KEPS:关键词提取数据集,来自Twitter上关于银行产品和服务的讨论,使用IOB格式标注关键短语。10. NERGrit:命名实体识别数据集,包含PERSON、PLACE和ORGANIZATION三种实体标签,使用IOB格式。11. NERP:命名实体识别数据集,收集自印尼新闻网站,包含PER(人物)、LOC(地点)、IND(产品或品牌)、EVT(事件)和FNB(食品和饮料)五种标签,使用IOB格式。12. FacQA:事实问答数据集,目标是从新闻文章短文中找到问题的答案,涵盖日期、地点、名称、组织、人物和数量六类问题。数据集支持印尼语,由专家生成,遵循MIT许可证。
The IndoNLU benchmark is a collection of resources for training, evaluating, and analyzing natural language understanding systems for Bahasa Indonesia (Indonesian language). It includes 12 datasets covering various NLP tasks: 1. EmoT: An emotion classification dataset from Twitter with around 4000 Indonesian colloquial tweets and five emotion labels (anger, fear, happy, love, sadness). 2. SmSA: A sentence-level sentiment analysis dataset from online platforms, annotated with positive, negative, and neutral sentiments. 3. CASA: An aspect-based sentiment analysis dataset of car reviews from Indonesian online automobile platforms, covering six aspects with positive, negative, or neutral labels. 4. HoASA: An aspect-based sentiment analysis dataset of hotel reviews from a hotel aggregator, covering ten aspects with positive, negative, neutral, or positive-negative labels. 5. WReTE: A textual entailment dataset from Wikipedia revision history, with 450 sentence pairs labeled as entailed or not entailed. 6. POSP: An Indonesian part-of-speech tagging dataset from news websites, with around 8000 sentences and 26 POS tags. 7. BaPOS: A POS tagging dataset from the PAN Localization Project, with about 1000 sentences and 23 POS tags. 8. TermA: A span-extraction dataset for aspect and sentiment words from hotel reviews, using IOB tagging. 9. KEPS: A keyphrase extraction dataset from Twitter discussions on banking, using IOB format. 10. NERGrit: A named entity recognition dataset with PERSON, PLACE, and ORGANIZATION tags in IOB format. 11. NERP: An NER dataset from Indonesian news websites with PER, LOC, IND, EVT, and FNB tags in IOB format. 12. FacQA: A factoid question-answering dataset to find answers from news passages, covering six question categories. The dataset is in Indonesian, expert-generated, and licensed under MIT.




