遇见数据集

Sindhi_Sentiment_dataset

收藏
Hugging Face2026-06-10 更新2026-06-11 收录
官方服务:

资源简介:

信德语情感分析数据集是一个用于文本分类的标注数据集,专门针对低资源南亚语言信德语(سنڌي),该语言主要在巴基斯坦信德省使用,拥有超过3000万使用者。数据集包含4,420个使用波斯-阿拉伯文字母书写的信德语句子,每个样本包含文本和情感标签(积极、消极、中性三类),被划分为训练集(3,536个样本)和测试集(884个样本),标签分布大致均衡。数据集的构建融合了多种方法:第一阶段从信德语报纸语料库手动收集句子并采用半监督伪标注流程;第二阶段通过回译进行数据增强;第三阶段使用LLM进行受控生成。该数据集适用于情感分类等NLP任务,可用于训练传统机器学习模型或微调多语言Transformer模型,但存在一些局限性,如口语代表性不足、翻译伪影等。

The Sindhi Sentiment Analysis Dataset is an annotated dataset for text classification, specifically designed for the low-resource South Asian language Sindhi (سنڌي), which is primarily used in the Sindh province of Pakistan with over 30 million speakers. It contains 4,420 Sindhi sentences written in the Perso-Arabic script, each with text and sentiment labels (Positive, Negative, Neutral), divided into a training set (3,536 samples) and a test set (884 samples), with roughly balanced label distribution. The dataset was constructed using multiple methods: the first stage involved manual collection from Sindhi newspaper corpora and a semi-supervised pseudo-labeling process; the second stage used back-translation for data augmentation; the third stage employed LLM-controlled generation. It is suitable for NLP tasks such as sentiment classification and can be used to train traditional machine learning models or fine-tune multilingual Transformer models, though it has limitations like underrepresentation of colloquial language and translation artifacts.

创建时间:
2026-06-01
原始信息汇总

数据集概述

Sindhi Sentiment Analysis Dataset 是一个面向信德语(Sindhi)的情感分析标注数据集,包含 4,420 个句子,分为三类情感标签:正面(Positive)负面(Negative)中性(Neutral)。该数据集旨在支持低资源语言信德语的 NLP 研究与模型训练。

  • 语言:信德语(Sindhi,ISO 639-1 代码 sd),使用波斯-阿拉伯字母变体,主要通行于巴基斯坦信德省。
  • 许可证:Creative Commons Attribution 4.0 International (CC BY 4.0)
  • 版本:v2
  • 数据集规模:1,000 < n < 10,000

支持任务

任务 类型
情感分类 三分类:正面 / 负面 / 中性
文本分类 单语言(信德语)

数据结构

数据字段

字段 类型 描述
text string 信德语句子(波斯-阿拉伯字母变体书写)
label string 情感标签:PositiveNegativeNeutral

数据划分

划分 样本数
训练集(Train) 3,536
测试集(Test) 884
总计 4,420

标签分布

标签 训练集 测试集 总计
Positive 1,201 300 1,501
Negative 1,200 300 1,500
Neutral 1,135 284 1,419

数据集构建

数据集分三个阶段构建,以确保质量和多样性:

  1. 第一阶段——手动收集(1,898 句):从信德语报纸 KawishAwamiAwaz 的语料库中收集句子。使用基于字符 n-gram(2–6)和词 n-gram(1–2)的 LinearSVC 模型进行半监督伪标签生成,保留集外测试集准确率达 94.73%,并通过人工验证高置信度预测。
  2. 第二阶段——回译增强(+1,941 句):利用 LLaMA 3.1 (8B) 模型通过 Groq API 重新表述现有英文翻译,再经由 Google Translate 回译为信德语。每条生成句子继承原始标签,无需重新标注。经过长度比例(0.4–2.5 倍)、最少 4 个单词及人工抽样检查等质量过滤。
  3. 第三阶段——受控 LLM 生成(+581 句):使用 LLaMA 3.1 (8B) 模型,结合报纸风格的提示,按主题(政治、农业、教育、健康、天气)和情感类别生成句子。以真实数据集示例作为风格参考,过滤条件包括信德语字符占比(>50%)和最少词数。

来源语料库

来源 类型 语言
Kawish Daily (روزنامه ڪاوش) 报纸 信德语
AwamiAwaz (عوامي آواز) 报纸 信德语

数据样本

text label
اڄ جو ڏينهن تمام سٺو آهي Positive
مون پنهنجو امتحان پاس ڪيو Positive
هن ملڪ ۾ غربت وڌي رهي آهي Negative
ٻارن جو بچپن چوري ٿي ويو آهي Negative
اڄ موسم ٺيڪ آهي Neutral
حڪومت نئين منصوبو جاري ڪيو Neutral

局限性

  • 句子主要采用正式报纸语体,日常口语化信德语代表性不足。
  • 回译句子可能带有 Google Translate 的轻微翻译痕迹。
  • LLM 生成的句子虽经过过滤和抽样检查,但偶尔可能包含不自然的表达。
  • 数据集未均衡覆盖所有信德语方言。
  • 情感类别内的子主题平衡无法保证。

引用

若使用本数据集,请引用以下 BibTeX:

bibtex @dataset{nawazmahar2025sindhi, author = {Ali Nawaz Mahar}, title = {Sindhi Sentiment Analysis Dataset}, year = {2025}, publisher = {Hugging Face}, version = {2}, url = {https://huggingface.co/datasets/alinawazmahar/Sindhi_Sentiment_dataset}, license = {CC-BY-4.0} }

搜集汇总
数据集介绍
Sindhi_Sentiment_dataset 数据集图片
构建方式
该数据集的构建历经三个阶段,以确保样本质量与多样性。首先,从Kawish与AwamiAwaz两大信德语报纸语料库中手动采集1898条句子,采用基于LinearSVC的半监督伪标注方法,结合字符与词语的双重TF-IDF特征进行预测,高置信度结果经人工审核后方才纳入。其次,借助LLaMA 3.1模型将现有英文翻译重新表述,再通过谷歌翻译回信德语,实现1895条扩张样本的自动标注,无需额外注解。最后,利用相同语言模型按新闻体裁及主题约束生成581条句子,经信德语字符比例与最小词数筛选,确保生成文本的自然度与领域契合。
特点
该数据集包含4420条标注句子,覆盖积极、消极与中立三类情感,类别分布均衡,各自约有1500条样本。所有文本采用波斯-阿拉伯变体信德语书写,来自正规新闻语域,具有较高的形式化与标准性。数据集划分为训练集3536条与测试集884条,便于模型评估与复现。兼具机器生成与专家审核的双重标签机制,在保证规模的同时维持了标注的准确性。此外,数据集面向低资源环境下的情感分析任务,为信德语的NLP研究提供了宝贵的基准资源。
使用方法
该数据集可通过Hugging Face的datasets库直接加载,用户只需调用load_dataset函数即可获取预划分的训练与测试子集。数据以文本与标签两列形式组织,便于快速转换为pandas DataFrame进行探索与分析。在模型训练层面,既可使用TfidfVectorizer结合LinearSVC等传统机器学习方法进行基准建模,也可利用Transformers库对多语言预训练模型如google/muril-base-cased进行微调,实现更优的情感分类性能。代码示例已在官方文档中提供,用户可参考使用进行复现与扩展。
背景与挑战
背景概述
情感分析作为自然语言处理领域的核心任务,在资源丰富语言中已取得显著进展,然而低资源语言的研究却长期处于滞后状态。信德语(Sindhi)作为南亚地区逾三千万人使用的语言,由于缺乏大规模高质量标注语料,其情感分析研究几乎处于空白。在此背景下,Ali Nawaz Mahar于2025年推出了信德语情感分析数据集(Sindhi Sentiment Analysis Dataset),该数据集由4420个句子构成,涵盖积极、消极和中性三类情感标签。研究者融合了人工标注、半监督伪标记、回译增强及大语言模型生成等多种技术手段,系统性地解决了信德语标注语料匮乏的问题。该数据集不仅为信德语情感分类模型的训练与评估提供了标准化基准,也推动了低资源语言自然语言处理技术的发展,对南亚区域语言研究具有重要的启示意义。
当前挑战
该数据集所应对的领域核心挑战在于,信德语作为一种典型的低资源语言,缺乏公开可用的情感分析标注语料,研究人员难以直接应用深度学习模型开展情感分类任务。构建过程中,研究者面临了三重困境:其一,原始标注数据稀缺,需从报社语料库中手动收集并借助半监督学习方法进行扩展;其二,数据增强流程存在质量风险,回译生成的句子可能带有翻译工具带来的语义失真或语言不自然问题;其三,大语言模型自动生成的句子虽经严格筛选,但仍可能引入非典型表达式或偏离真实语境,数据质量与多样性的平衡难以精准把控。此外,数据集主要来源于正式新闻文本,缺乏对口语化、方言化表达的覆盖,进一步限制了模型在真实场景中的泛化能力。
常用场景
经典使用场景
在低资源自然语言处理研究领域,信德语情感分析数据集被广泛用于构建和评估针对南亚语言的文本情感分类模型。该数据集收录了4420条源于信德语报纸语料库的句子,涵盖正面、负面和中性三个情感类别,为信德语这一拥有超过3000万使用者的低资源语言提供了稀缺的标注数据。研究者通常利用该数据集进行基于线性支持向量机或Transformer架构的情感分类实验,其中混合n-gram特征方法在构建基准模型时展现出显著效果。
解决学术问题
该数据集有效缓解了信德语等低资源语言在情感分析研究中语料匮乏的困境,填补了南亚语系中波斯-阿拉伯字母变体语言在文本分类任务上的数据空白。其多阶段构建策略——融合人工标注、回译增强与大语言模型生成——为低资源语言数据集的构建提供了可借鉴的方法论框架。这一工作推动了信德语自然语言处理技术的进步,并为其他资源稀缺语言的学术研究树立了范式。
衍生相关工作
该数据集衍生出多项相关研究,包括针对低资源语言的情感分类模型优化、跨语言迁移学习方法的探索,以及数据增强技术对分类性能影响的分析。其中,基于该数据集的多语言预训练模型(如mT5、XLM-R)微调实验,为信德语与其他南亚语言的情感分析任务迁移提供了基准。此外,数据集构建过程中采用的回译与可控生成策略,启发了后续关于低资源语料库扩增的系列研究工作。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务