遇见数据集

UrduABSADataset

收藏
Hugging Face2026-06-08 更新2026-06-09 收录
官方服务:

资源简介:

UrduABSADataset是一个用于方面级情感分析(ABSA)的乌尔都语推特数据集,包含约30万条标注推文。数据来源于Twitter(X)平台,覆盖了政治、体育、娱乐、新闻、COVID-19、事件、教育、医疗保健等16个多样化主题。该数据集的一个关键特点是同时提供了原始版本和清洗版本:原始版本完整保留了社交媒体文本中特有的语言特征,如缩写、非正式表达和特定写作风格,以支持真实世界应用的鲁棒性研究;清洗版本则经过标准化处理,并提供了五个层面的精细标注,包括方面词、观点词、情感极性(针对方面)、方面类别以及类别情感极性。该数据集的创建旨在解决乌尔都语作为低资源语言在细粒度情感分析任务上标注数据匮乏的问题。它适用于多种自然语言处理任务,包括方面级情感分析、文本分类、观点挖掘、主题建模和信息检索,可作为微调乌尔都语预训练模型(如UrduBERT、mT5、XLM-R)或评估相关工具性能的基准资源。数据集的标注采用了人工与大语言模型(LLM)相结合的混合方法。

UrduABSADataset is an Urdu Twitter dataset for aspect-based sentiment analysis (ABSA), containing approximately 300,000 annotated tweets. The data is sourced from the Twitter (X) platform, covering 16 diverse topics such as politics, sports, entertainment, news, COVID-19, events, education, and healthcare. A key feature of this dataset is that it provides both raw and cleaned versions: the raw version fully retains language-specific characteristics of social media text, such as abbreviations, informal expressions, and specific writing styles, to support robustness research in real-world applications; the cleaned version is standardized and offers fine-grained annotations at five levels, including aspect terms, opinion terms, sentiment polarity (for aspects), aspect categories, and category sentiment polarity. The creation of this dataset aims to address the scarcity of annotated data for fine-grained sentiment analysis tasks in Urdu as a low-resource language. It is suitable for various natural language processing tasks, including aspect-based sentiment analysis, text classification, opinion mining, topic modeling, and information retrieval, and can serve as a benchmark resource for fine-tuning Urdu pre-trained models (such as UrduBERT, mT5, XLM-R) or evaluating the performance of related tools. The annotation of the dataset employs a hybrid method combining human effort and large language models (LLMs).

创建时间:
2026-06-03
原始信息汇总

数据集概述:Urdu Tweet ABSA Dataset (UrduABSADataset)

  • 数据集名称: Urdu Tweet ABSA Dataset (UrduABSADataset)
  • 数据集规模: 约 300,000 条乌尔都语推文(位于 100K < n < 1M 范围)
  • 语言: 乌尔都语 (ur),使用乌尔都文字
  • 许可证: Creative Commons Attribution 4.0 International (CC BY 4.0)
  • 策划者: Zoya, Seemab Latif
  • 发布者: Zoya

数据集来源

  • 数据来源: 通过 Twitter API 收集,初始约 5000 万条乌尔都语推文,经预处理和清洗后保留约 30 万条。
  • 主题覆盖: 涵盖 16 个多样化主题,包括政治、体育、娱乐、新闻、COVID-19、事件、教育与医疗保健。
  • 相关论文:
    • 基于大语言模型的乌尔都语方面级情感分析伪标签方法(Data Intelligence, 2025)
    • 乌尔都语方面级情感分析:使用大语言模型的混合数据集增强(IEEE HONET, 2025)
    • 基于自动标签的乌尔都语推文 LDA 和 NMF 主题模型分析(IEEE Access, 2021)
    • 基于统计和异常检测方法评估乌尔都语处理工具(ACM TALLIP, 2023)

数据集用途

  • 直接用途:
    • 方面级情感分析 (ABSA)
    • 细粒度意见挖掘
    • 低资源语言文本分类
    • 主题建模与信息检索
    • 乌尔都语处理工具评估
    • 可用于微调 Transformer 模型(如 UrduBERT、mT5、XLM-R)或作为 ABSA 基准
  • 超出范围用途: 文本分析以外的任务(如图像、语音或视频处理)

数据集结构

数据集提供两个版本:

  1. 原始版本: 保留社交媒体特有的语言特征,如缩写、非正式表达。
  2. 清洗与标准化版本: 提供五个层级的标注:方面词、意见词、情感极性、方面类别、方面类别极性。

标注信息

  • 标注类型: 方面词、意见词、情感极性、方面类别、方面类别极性
  • 标注方式: 人工与基于大语言模型的混合标注

创建动机

乌尔都语作为低资源语言,缺乏可用于细粒度情感分析的公开标注数据集。现有资源多为文档级或句子级情感分析,缺少方面和意见标注。该数据集旨在填补这一空白,支持乌尔都语社交媒体文本的 ABSA 研究,同时提供原始和清洗版本以支持鲁棒性研究和实际应用开发。

建议

  • 禁止将数据集用于违反 Twitter 开发者协议或适用隐私法的任何目的。
  • 基于该数据集发表研究成果时,必须引用相关论文。
搜集汇总
数据集介绍
UrduABSADataset 数据集图片
构建方式
针对乌尔都语这一低资源语言在细粒度情感分析领域标注数据匮乏的困境,该数据集通过Twitter API从社交媒体平台采集了约5000万条乌尔都语推文,经严格的数据清洗与预处理后,最终保留了约30万条高质量样本。这些推文覆盖政治、体育、娱乐、新闻、新冠疫情、教育、医疗等16个多样化主题,确保了领域分布的广泛性。在标注环节,研究团队采用人工标注与大语言模型伪标注相结合的混合策略,对每条推文在方面词、观点词、情感极性、方面类别及类别情感极性五个层级进行了精细化注释,并同步提供了保留原始语言特征的原始版本与经标准化处理的清洁版本。
使用方法
该数据集可直接用于对乌尔都语预训练模型(如UrduBERT、mT5、XLM-R)进行微调,也可作为方面级情感分析任务的基准评测集。研究者可根据任务需求灵活选用原始版本以模拟真实社交文本的噪声挑战,或采用清洁版本进行标准化实验。在模型输入时,每条样本的方面词、观点词、情感极性及类别标签均可作为多任务学习的监督信号。该数据集鼓励用于低资源语言处理研究,但需严格遵守Twitter开发者协议及相关隐私法规,并在发表成果时引用相关学术论文。
背景与挑战
背景概述
UrduABSADataset由Zoya与Seemab Latif于2025年前后构建,旨在填补乌尔都语这一低资源语言在细粒度情感分析领域的标注数据空白。该数据集囊括约30万条推特文本,覆盖政治、体育、娱乐、新冠疫情等16个主题,并同时提供原始与清洗两种版本。原始语料保留了社交媒体中的缩写与口语化表达,清洗版本则包含方面词、意见词、情感极性、类别及类别情感极性五层标注。这一资源为乌尔都语自然语言处理研究,尤其是基于方面的情感分析、文本分类与主题建模提供了高质量的基准,有力推动了低资源语言的情感计算研究。
当前挑战
该数据集所解决的领域问题在于乌尔都语情感分析长期缺乏面向方面的细粒度标注资源,现有工作多局限于文档或句子级情感,且已有标注数据集多不予公开。研究者须应对低资源语言在形态复杂性、标注成本高昂等方面的挑战。构建过程中,团队从约5000万条推特中经预处理与清洗才筛得30万条可用文本,并以人工与大型语言模型协作的混合策略完成多层级标注。如何确保标注一致性与质量、处理社交媒体中大量非规范表达,成为构建流程中的核心难题。
常用场景
经典使用场景
UrduABSADataset的核心应用场景在于面向低资源语言的细粒度方面级情感分析(ABSA)。该数据集包含约30万条乌尔都语推文,覆盖政治、体育、娱乐、新冠疫情等16个多元领域,同时提供原始文本与清洗标准化两种版本。研究者可借此对文本中的特定方面及其对应的观点词进行联合抽取,并判断其情感极性,实现从粗粒度文档级情感向精细化语义理解的跨越。这类场景对于推动低资源语言的深度学习模型训练、评估跨语言情感分析系统的鲁棒性,以及构建多语言自然语言处理基准具有重要意义。
解决学术问题
该数据集有效缓解了乌尔都语在方面级情感分析领域长期面临的标注资源匮乏问题。以往研究多局限于文档级或句子级情感分类,缺乏方面术语、观点词及类别极性的多层次标注,且已有ABSA数据集多数未公开。UrduABSADataset通过大规模、多主题的注释体系,填补了这一学术空白,使得探究面向社交媒体非正式文本的跨粒度情感推理、观点挖掘与主题建模成为可能。其双重版本设计还支持对文本规范化策略的鲁棒性分析,推动了低资源语言自然语言处理方法论的发展。
实际应用
在实际应用中,UrduABSADataset可直接服务于社交媒体舆情监控系统。例如,政府或企业可利用该数据集训练模型,从乌尔都语推文中自动化识别公众对特定政策、产品或话题的方面级反馈——如分析“新冠疫苗”相关的正面观点或“教育质量”范畴的负面评价。此外,在客服评价分析、跨语言品牌声誉管理及低资源语言的智能信息检索系统中,该数据集也为构建端到端的细粒度情感分析工具提供了关键支撑,加速了乌尔都语AI技术从实验室走向产业落地的进程。
数据集最近研究
最新研究方向
在低资源语言自然语言处理的前沿探索中,UrduABSADataset的发布为乌尔都语细粒度情感分析注入了新的活力。该数据集汇聚了约30万条涵盖政治、体育、新冠疫情等16个领域的乌尔都语推文,并提供了原始与清洗两种版本,原始语料忠实保留了社交媒体中独特的缩写、非正式表达等语言特征,为真实场景下的模型鲁棒性研究奠定了坚实基础。尤为引人注目的是,研究团队创新性地采用了大型语言模型进行伪标签生成与混合数据增强,巧妙地解决了低资源场景下标注数据匮乏的困境,这一方法不仅大幅提升了乌尔都语方面级情感分析的性能,更为其他资源匮乏语言的类似研究开辟了可借鉴的新路径。该数据集的问世,预示着乌尔都语NLP研究正从粗粒度的文档级分析迈向方面级、意见级精细建模的新纪元。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务