遇见数据集

elmurod1202/uzbek-sentiment-analysis

收藏
Hugging Face2022-05-11 更新2024-03-04 收录
官方服务:

资源简介:

该数据集是第一个用于乌兹别克语情感分析的注释数据集,来源于乌兹别克斯坦Google Play Store前100个应用的评论,包含2500条正面和1800条负面评论。此外,还通过自动翻译现有英文应用评论数据集构建了一个更大的数据集,经过手动消除主要机器翻译错误后,该翻译数据集包含约10K正面和10K负面应用评论。

提供机构:
elmurod1202
原始信息汇总

数据集概述

数据集名称

  • uzbek-sentiment-analysis

数据集描述

  • 该数据集专注于乌兹别克语的情感分析,包含两个主要部分:
    1. 手动标注的乌兹别克语应用评论数据集:从乌兹别克斯坦地区Google Play商店的前100名应用中收集,包含2500条正面评论和1800条负面评论。
    2. 自动翻译的乌兹别克语应用评论数据集:通过Google Translate API将现有的英语应用评论数据集自动翻译成乌兹别克语,经过人工校正后,包含约10,000条正面评论和约10,000条负面评论。

数据集用途

  • 用于乌兹别克语的情感分类研究,支持深度学习和传统机器学习模型的训练与测试。

数据集贡献

  • 首次创建了乌兹别克语情感分析的手动标注数据集。
  • 定义了乌兹别克语情感分析的基准,比较了传统机器学习方法和深度学习技术的效果。

研究结果

  • 研究结果显示,尽管所有测试模型都相对准确,但深度学习模型并未显著优于传统模型。研究认为当前可用的乌兹别克语预训练词嵌入的质量不足以让深度学习模型发挥其全部潜力。

引用信息

  • 若使用此数据集,请引用以下文献:

    @inproceedings{kuriyozov2019deep, author = {Kuriyozov, Elmurod and Matlatipov, Sanatbek and Alonso, Miguel A and Gómez-Rodríguez, Carlos}, title = {Deep Learning vs. Classic Models on a New {U}zbek Sentiment Analysis Dataset}, booktitle = {Human Language Technologies as a Challenge for Computer Science and Linguistics – 2019}, publisher = {Wydawnictwo Nauka i Innowacje}, year = {2019}, pages = {258--262} }

搜集汇总
数据集介绍
构建方式
该数据集专为乌兹别克语情感分析任务而构建,源自乌兹别克斯坦境内Google Play商店中排名前100的应用评论。研究团队首先人工标注了2500条正面评论与1800条负面评论,构建了一个高质量的手动标注数据集。此外,为扩大数据规模,研究者借助Google Translate API将已有的英文应用评论数据集自动翻译为乌兹别克语,并通过人工校正与剔除严重机器翻译错误的方式,最终获得了约10000条正面与10000条负面的翻译数据集。这种结合人工标注与自动翻译的构建策略,既保证了数据的准确性,又提升了数据量的充足性。
特点
该数据集的核心特点在于其双语来源与多层级标注质量。手动标注部分确保了情感标签的精确性,为模型训练提供了可靠的基准;而翻译数据集则通过大规模扩充弥补了乌兹别克语情感分析领域数据匮乏的短板。此外,研究团队基于fastText预训练词向量,系统评估了传统机器学习模型与深度学习模型在乌兹别克语情感分类上的表现,发现现有词向量质量限制了深度学习的优势,揭示了当前语言资源下的模型性能瓶颈,为后续研究提供了重要参考。
使用方法
该数据集可直接用于乌兹别克语情感分类模型的训练与评估。用户可分别将手动标注数据集与翻译数据集作为训练集或测试集,以探索不同数据规模与质量对模型效果的影响。研究团队已基于此数据集建立了传统机器学习与深度学习方法的基线结果,使用者可在此基础上复现实验或尝试更先进的模型架构。数据集以标准格式提供,便于加载至常见的自然语言处理框架中,并建议在相关研究中引用原始论文以遵循学术规范。
背景与挑战
背景概述
乌兹别克语作为中亚地区的重要语言,其自然语言处理研究长期处于资源匮乏状态。在此背景下,由Elmurod Kuriyozov、Sanatbek Matlatipov、Miguel A. Alonso和Carlos Gómez-Rodríguez等研究人员于2019年共同构建的乌兹别克语情感分析数据集应运而生。该数据集的核心贡献在于首次为乌兹别克语提供了人工标注的情感分析语料,涵盖来自Google Play商店前100个热门应用的2500条正面评论与1800条负面评论。此外,研究团队通过机器翻译技术将英文应用评论数据集扩展至约2万条,并经过人工校正以提升质量。这一开创性工作不仅填补了乌兹别克语情感分析领域的空白,还通过对比传统机器学习与深度学习方法建立了基线,为低资源语言的情感分析研究提供了重要参考,推动了中亚语言计算资源的多元化发展。
当前挑战
该数据集面临的核心挑战首先源于乌兹别克语作为低资源语言的天然困境:缺乏大规模高质量预训练词向量,导致深度神经网络模型无法充分发挥其表征能力,实验中深度学习模型并未显著超越传统方法。其次,数据集构建过程中面临标注成本高昂与数据稀疏性的矛盾,人工标注仅覆盖约4300条样本,而机器翻译扩展的样本虽数量可观,却存在翻译误差与语义偏移问题,需耗费大量人力进行校正。此外,应用评论数据来源集中于Google Play商店,可能引入领域偏差,难以全面反映乌兹别克语在不同场景下的情感表达模式。这些挑战共同制约了模型泛化能力与下游任务的鲁棒性,凸显了低资源语言情感分析中数据规模、质量与领域多样性之间的平衡难题。
常用场景
经典使用场景
在自然语言处理与情感计算交叉领域,乌兹别克语情感分析数据集(uzbek-sentiment-analysis)作为首个针对该语言的细粒度情感标注资源,被广泛用于构建和评估情感分类模型。研究者常基于该数据集中的2500条正向与1800条负向人工标注评论,结合传统机器学习(如支持向量机、朴素贝叶斯)与深度学习方法(如LSTM、CNN)进行基准测试,以探索低资源语言中情感分析的有效范式。该数据集的独特之处在于其双轨架构:除人工标注集外,还通过机器翻译构建了约2万条乌兹别克语应用评论数据,为跨语言迁移学习与数据增强策略提供了天然实验场。
衍生相关工作
该数据集催生了多项乌兹别克语自然语言处理的标志性成果。Kuriyozov等人基于此数据集的实验框架,后续提出了首个乌兹别克语情感词典UzSentiWordNet,将情感分析从句子级扩展至词汇级。研究者还利用该数据集的机器翻译子集,探索了基于回译的数据增强方法对低资源情感分类的提升效果。在模型层面,相关工作进一步测试了BERT类预训练模型在乌兹别克语上的微调策略,并与原始论文中的fastText嵌入方法进行对比,推动了该语言深度语义表征研究的进展。
数据集最近研究
最新研究方向
在自然语言处理领域,低资源语言的文本情感分析正逐渐成为前沿研究热点,尤其随着中亚地区数字化进程加速,乌兹别克语的情感分析需求日益凸显。该数据集作为乌兹别克语首个公开的情感分析标注资源,不仅涵盖了从Google Play商店应用评论中人工标注的4300条样本,还通过机器翻译扩展了约两万条双语对齐数据,为跨语言情感迁移学习提供了重要基础。当前方向聚焦于探索传统机器学习与深度学习模型在该语言上的性能边界,研究发现由于预训练词嵌入质量不足,神经网络模型并未显著超越传统方法,这揭示了低资源语言中语义表示学习的瓶颈。该工作不仅填补了乌兹别克语情感分析的数据空白,也为中亚语言资源建设与多语言情感分析模型的鲁棒性研究提供了关键参考,具有推动区域语言技术发展的深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务