遇见数据集

African-Languages_Sentiments

收藏
Hugging Face2026-07-06 更新2026-07-07 收录
官方服务:

资源简介:

非洲语言情感数据集(豪萨语、约鲁巴语、斯瓦希里语)是一个多源缝合的情感分类数据集,专为Adaption Labs AutoScientist Challenge(语言类别)构建。该数据集整合了三个独立收集的情感语料库,涵盖豪萨语、约鲁巴语和斯瓦希里语三种非洲语言,旨在通过结合三个不同领域的数据源来减少领域过拟合,提供更稳健的情感分析信号。数据集包含46,725行数据,采用70/15/15的训练/验证/测试分割,并按标签进行分层。具体语言分布为:豪萨语23,162行,约鲁巴语16,627行,斯瓦希里语6,936行。数据来源于三个不同领域:AfriSenti(Twitter领域,40,290行)、NollySenti(诺莱坞电影评论领域,2,510行)和Neurotech-HQ Swahili(社交媒体/产品评论领域,3,925行)。数据集结构包含六个字段:text(原始文本,包括推文、电影评论或社交媒体评论)、label(情感标签,取值为positive、negative或neutral)、language(语言标识,hausa、yoruba或swahili)、source(原始数据集来源)、domain(领域标识,twitter、movie_review或social_media_reviews)以及split(数据分割,train、validation或test)。该数据集适用于训练和评估豪萨语、约鲁巴语和斯瓦希里语的情感分类模型,特别适合用于基准测试多语言协同优化的训练方法。需要注意的是,数据集存在一些局限性:不同来源的标签分布不平衡(neutral标签仅来自AfriSenti);数据分割是重新计算的,并非原始分割;斯瓦希里语的领域构成与其他语言不同(约一半Twitter数据,一半社交媒体/产品评论数据)。

African Language Sentiment Dataset (Hausa, Yoruba, Swahili) is a multi-source fused sentiment classification dataset built specifically for the Adaption Labs AutoScientist Challenge (Language Track). This dataset integrates three independently collected sentiment corpora covering three African languages: Hausa, Yoruba, and Swahili, aiming to reduce domain overfitting and provide more robust sentiment analysis signals by combining data sources from three distinct domains. The dataset contains 46,725 rows of data, with a 70/15/15 train/validation/test split and is stratified by label. The specific language distribution is as follows: 23,162 rows for Hausa, 16,627 rows for Yoruba, and 6,936 rows for Swahili. The data is sourced from three distinct domains: AfriSenti (Twitter domain, 40,290 rows), NollySenti (Nollywood movie review domain, 2,510 rows), and Neurotech-HQ Swahili (social media/product review domain, 3,925 rows). The dataset structure includes six fields: text (raw text including tweets, movie reviews, or social media comments), label (sentiment label with values of positive, negative, or neutral), language (language identifier: hausa, yoruba, or swahili), source (original dataset source), domain (domain identifier: twitter, movie_review, or social_media_reviews), and split (data partition: train, validation, or test). This dataset is suitable for training and evaluating sentiment classification models for Hausa, Yoruba, and Swahili, and is particularly ideal for benchmarking training methods for multilingual collaborative optimization. It is worth noting that the dataset has several limitations: the label distribution is imbalanced across different sources (the neutral label only originates from AfriSenti); the data split is recalculated rather than the original split; the domain composition of Swahili data differs from the other languages, with approximately half being Twitter data and the other half being social media/product review data.

创建时间:
2026-07-02
原始信息汇总

数据集概述

数据集名称:African Languages Sentiment Dataset (Hausa, Yorùbá, Swahili)

许可证:CC-BY-4.0

任务类别:文本分类

标签:情感分析、非洲语言(豪萨语、约鲁巴语、斯瓦希里语)

数据集规模:10K < 样本数 < 100K


数据集来源与构成

该数据集整合了三个独立收集的情感语料库,涵盖三种非洲语言,旨在减少单一领域(Twitter)的过拟合问题,提供更鲁棒的情感信号。

来源 领域 语言 样本数
AfriSenti Twitter 豪萨语、约鲁巴语、斯瓦希里语 40,290
NollySenti 诺莱坞电影评论(人工翻译) 豪萨语、约鲁巴语 2,510
Neurotech-HQ Swahili 社交媒体/产品评论(反向翻译) 斯瓦希里语 3,925

总样本数:46,725


数据集结构

每条数据包含以下字段:

  • text:原始文本(推文、电影评论或社交媒体评论)
  • label:情感标签(positivenegativeneutral
  • language:语言(hausayorubaswahili
  • source:来源数据集名称
  • domain:领域(twittermovie_reviewsocial_media_reviews
  • split:数据划分(trainvalidationtest

数据划分

所有语言均采用 70 / 15 / 15 的 train/validation/test 比例,并按标签进行分层抽样。

语言 总计 训练集 验证集 测试集
豪萨语 23,162 16,213 3,474 3,475
约鲁巴语 16,627 11,639 2,494 2,494
斯瓦希里语 6,936 4,855 1,040 1,041

预期用途

  • 用于训练和评估豪萨语、约鲁巴语、斯瓦希里语的情感分类模型。
  • 特别适用于对比多语言联合优化训练方法(如 AutoScientist)与单源基线模型(如 Davlan/afrisenti-twitter-sentiment-afroxlmr-large)的性能。

局限性

  1. 标签分布不平衡:NollySenti 和 Neurotech Swahili 数据集仅包含正面和负面标签,neutral 标签仅来自 AfriSenti,因此中性样本覆盖较弱。
  2. 非原始划分:数据划分是重新计算后的结果,并非直接沿用原始数据集的划分方式,因此不能直接与原始数据集的基准结果进行逐行对比。
  3. Neurotech Swahili 无官方原始划分:该数据集被重新分配为 80/10/10 的比例(固定种子 42),之后才进行合并和重划分。
  4. 斯瓦希里语的领域构成不同:斯瓦希里语的数据约一半来自 Twitter,另一半来自社交媒体/产品评论;而豪萨语和约鲁巴语以 Twitter 数据为主,辅以少量电影评论。

参考信息

文件说明:仓库中包含 train.csvvalidation.csvtest.csv 三个文件,为原始、干净、人工标注的数据集(46,725 行,70/15/15 划分),可直接用于训练流程。

上下文:该数据集为 Adaption Labs AutoScientist 挑战赛(语言类别)而构建,目标语言为豪萨语、约鲁巴语和斯瓦希里语。

搜集汇总
数据集介绍
African-Languages_Sentiments 数据集图片
构建方式
该数据集通过融合三个独立收集的情感语料库构建而成,涵盖豪萨语、约鲁巴语和斯瓦希里语三种非洲语言。语料源自AfriSenti(Twitter领域,40,290条)、NollySenti(诺莱坞电影评论领域,2,510条)以及Neurotech-HQ Swahili(社交媒体与产品评论领域,3,925条),总计46,725条标注样本。数据整合过程中,统一了标签体系(positive、negative、neutral),并保留了语言、来源及领域等元信息。最终按70/15/15比例进行分层采样划分训练集、验证集与测试集,以增强跨领域情感信号的鲁棒性。
特点
该数据集的核心特点在于跨领域与跨语言的融合设计,有效降低了单一Twitter领域的过拟合风险。三种语言中,豪萨语样本量最大(23,162条),斯瓦希里语相对较少(6,936条),但后者在Twitter与社交媒体评论领域分布更均衡。标签方面,neutral类别仅来自AfriSenti,导致其覆盖范围较positive和negative偏窄。此外,数据集重新划分了原始语料的分割方式,因此不适合直接与原基准进行逐行对比,但可作为新型基线的起点。
使用方法
数据集以CSV格式提供,包含text、label、language、source、domain及split等字段,便于直接加载至训练流程。用户可直接使用train.csv、validation.csv和test.csv文件进行模型训练与评估,特别适用于豪萨语、约鲁巴语和斯瓦希里语的情感分类任务。推荐使用微调模型`gospelgit/African-Languages-Sentiment-Classifier`进行快速部署,或基于该数据基准测试多语言联合优化方法(如AutoScientist)的性能。使用时需注意标签分布不均衡及分割方案差异等局限性。
背景与挑战
背景概述
非洲语言情感数据集(African Languages Sentiment Dataset)由Adaption Labs AutoScientist挑战赛(语言赛道)催生,整合了来自Hausa、Yorùbá和Swahili三种语言的多个独立情感语料库。该数据集于2023年发布,融合了AfriSenti(推特评论)、NollySenti(尼日利亚电影评论)及Neurotech-HQ Swahili(社交媒体/产品评论)三大来源,横跨推特、电影评论与社交媒体三个领域,共计46,725条样本。其核心研究问题在于缓解单一领域(如推特)带来的过拟合风险,为低资源非洲语言提供更鲁棒的情感分析基准。该数据集在推动多语言联合优化、跨域泛化及非洲自然语言处理研究中具有重要影响力,为AutoScientist等协同训练方法提供了标准化评估平台。
当前挑战
该数据集面临的挑战主要体现在领域问题与构建过程两方面。在领域问题中,现有情感资源高度集中于推特领域,导致模型易产生领域过拟合,难以迁移至电影评论或社交媒体等异构场景;同时,中性标签仅源自AfriSenti,造成类别分布不均,影响多类别分类器的公平性。在构建过程中,NollySenti与Neurotech Swahili子集为二分类(积极/消极),需与三分类数据统一对齐;此外,由于数据集重新划分了训练/验证/测试集(70/15/15),无法直接与原始子集基准进行逐行比较,且Swahili的领域组成与Hausa、Yorùbá存在差异(推特与社交媒体评论比例不同),增加了跨语言模型泛化的复杂性。
常用场景
经典使用场景
African-Languages_Sentiments数据集为豪萨语、约鲁巴语和斯瓦希里语的情感分类任务提供了跨领域、多来源的标注语料。研究者将其作为训练和评估低资源语言情感分析模型的基准数据集,尤其适用于跨语言迁移学习与多语言联合优化的实验场景。数据集的经典使用方式包括在统一标签体系下进行三元情感分类(正面、负面、中性),并通过分层抽样按70/15/15划分训练、验证与测试集,确保各语言内部标签分布均衡。该数据集常被用于检验模型在Twitter、电影评论、社交媒体评论等多领域数据上的泛化能力,以替代单一来源的传统情感分析基准。
解决学术问题
该数据集的核心贡献在于缓解了非洲低资源语言情感分析研究中的领域过拟合问题。由于此前豪萨语、约鲁巴语和斯瓦希里语的情感资源几乎全部来自Twitter单一平台,模型在真实应用场景中往往泛化能力不足。African-Languages_Sentiments通过整合AfriSenti、NollySenti和Neurotech-HQ三个独立语料库,将Twitter、电影评论与社交媒体评论三个领域的数据融合,使研究者能够探索跨领域情感特征的鲁棒性。数据集还解决了多语言情感标签不一致的学术挑战,通过统一标注格式支持三语言的联合训练与评估,为验证多任务学习、领域自适应等迁移学习方法在非洲语言上的有效性提供了标准化平台。
衍生相关工作
基于该数据集衍生出一系列重要成果,包括由Adaption Labs AutoScientist挑战赛催生的多语言情感分类器`gospelgit/African-Languages-Sentiment-Classifier`,该模型采用神经架构搜索技术联合优化三种语言的参数共享与特定模块。研究人员还利用该数据集验证了预训练语言模型(如AfroXLMR)在非洲语言上的微调策略,并对比了单语言监督训练与跨语言联合训练的差异。此外,数据集推动了领域泛化方法的研究,例如通过对抗训练消除Twitter与电影评论之间的领域偏移。原始语料贡献者的工作同样被广泛引用:AfriSenti成为非洲语言情感分析的标准基准,NollySenti开拓了约鲁巴语电影评论分析的新方向,Neurotech-HQ Swahili则为东非社交媒体的情感分析奠定了基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务