遇见数据集

TagaSenti

收藏
github2026-07-17 更新2026-07-18 收录
数据链接:
官方服务:

资源简介:

TagaSenti 是一个多领域情感分析数据集,针对塔加洛语和塔格利什语,包含35,686个句子,覆盖5个领域(电子商务、新闻、社交媒体、对抗性、合成数据),分为3个类别:负面(0)、中性(1)、正面(2),包含9,378个针对性的对抗性行,用于增强边缘情况处理,并支持塔加洛语/塔格利什语代码切换,采用CC BY‑SA 4.0许可。

TagaSenti is a multi-domain sentiment analysis dataset targeting Tagalog and Taglish languages, containing 35,686 sentences across 5 domains: e-commerce, news, social media, adversarial, and synthetic data. It is categorized into three sentiment classes: negative (0), neutral (1), and positive (2). The dataset includes 9,378 targeted adversarial examples to enhance edge case handling, supports code-switching between Tagalog and Taglish, and is licensed under CC BY‑SA 4.0.

创建时间:
2026-07-17
原始信息汇总

数据集概述:TagaSenti

TagaSenti 是一个面向 Tagalog 和 Taglish 的多领域情感分析数据集及模型。

数据集详情

  • 规模与组成:包含 35,686 条句子,覆盖 5 个领域:电子商务、新闻、社交媒体、对抗性样本、合成样本。
  • 标签类别:3 类情感标签——负面 (0)、中性 (1)、正面 (2)。
  • 对抗性样本:包含 9,378 条针对性对抗性样本,经过 4 代生成,用于增强对边缘情况的鲁棒性。
  • 语言特点:支持 Tagalog 与 Taglish(他加禄语与英语的语码混合)。
  • 许可协议:数据集采用 CC BY‑SA 4.0 许可。
  • 唯一标识:DOI 为 10.57967/hf/9620
  • 托管平台:该数据集可在 Hugging Face 上获取,地址为 jjjardev/tagasenti

其他关联资源

  • 模型:基于 xlm-roberta-large(355M 参数)微调的情感分析模型,在测试集上达到 86.6% 准确率和宏 F1 分数 0.866;在 Hiligaynon 语言(HiliSenti 数据集)上进行跨语言零样本评估,准确率为 62.4%,宏 F1 为 0.624。模型权重许可为 Apache 2.0,托管于 jjjardev/tagasenti-model
  • 训练脚本:完整的训练流程位于 scripts/train/TagaSenti.py,包含数据加载、分层划分(80/10/10 训练/验证/测试)、文本规范化、动态最大长度分词、加权交叉熵 + 标签平滑、余弦学习率调度、梯度检查点、混合精度训练及早停机制,并可选择在 HiliSenti 上进行零样本评估。代码采用 MIT 许可。
  • 仓库结构:根目录包含 README.mdLICENSErequirements.txtscripts/train/ 存放训练脚本;database/README.mdmodel/README.md 分别指向 Hugging Face 上的数据集和模型。

引用信息

bibtex @misc{jessie_james_jarder_2026, author = {Jessie James Jarder}, title = {tagasenti (Revision 3ebda33)}, year = 2026, url = {https://huggingface.co/datasets/jjjardev/tagasenti}, doi = {10.57967/hf/9620}, publisher = {Hugging Face} }

搜集汇总
数据集介绍
TagaSenti 数据集图片
构建方式
TagaSenti是一个面向他加禄语及他加禄-英语混合语的多领域情感分析数据集。其构建基于对五个不同领域(电子商务、新闻、社交媒体、对抗性样本及合成数据)的语料进行系统收集与标注,共计35,686条句子。数据集采用三级情感标签体系:负面(0)、中性(1)与正面(2)。尤为突出的是,为了增强模型对边缘情况的鲁棒性,数据集中专门引入了9,378条经过四轮迭代生成的对抗性样本,覆盖了代码混合语言中的复杂表达。
特点
该数据集具有鲜明的多领域覆盖与语言混合特性,样本横跨多个真实场景,确保了情感分析的生态效度。对抗性样本的系统融入是其一大亮点,有效提升了数据集的挑战性与模型泛化能力。此外,所有文本均保留了大写形式以适应XLM-RoBERTa模型的词元化需求,并经过了包括Unicode规范化、笑声标准化、重复扩展、俚语扩展及字符去重在内的精细预处理,兼顾了数据的清洁度与语言真实性。
使用方法
研究者可通过Hugging Face Hub直接加载数据集,使用`load_dataset()`函数即可获取。训练脚本提供了完整的流水线:首先以80/10/10的比例进行分层分割,随后执行文本标准化与动态最大长度的词元化操作,再基于XLM-RoBERTa模型进行微调。训练过程采用加权交叉熵损失配合标签平滑、余弦学习率调度与早停机制。用户只需配置好Python 3.10以上环境及GPU,运行`python scripts/train/TagaSenti.py`即可复现模型训练与评估。
背景与挑战
背景概述
在低资源语言情感分析领域,他加禄语及菲律宾特色的他加禄-英语语码混合现象长期缺乏系统性的标注数据集。2025年,研究人员Jessie James Jarder等人创建了TagaSenti数据集,旨在填补这一空白。该数据集涵盖35,686条来自电子商务、新闻、社交媒体、对抗性样本及合成文本五个领域的句子,标注为消极、中立、积极三类。其核心研究问题在于构建一个跨领域、抗干扰的情感分析基准,以支持菲律宾语言的自然语言处理研究。TagaSenti的发布为南岛语系的情感计算提供了高质量的语料资源,推动了多语言情感分析模型在菲语区的应用与发展。
当前挑战
TagaSenti面临的挑战首先在于领域问题的复杂性:他加禄语中的语码混合现象使得传统单语言情感分析模型难以有效捕捉语义,且中性类别在自然文本中常被忽视,导致分类边界模糊。构建过程中,研究人员需应对标注一致性难题,特别是非规范化的网络用语与口语表达。此外,为提升模型鲁棒性,团队设计了9,378条针对性的对抗性样本,通过四轮迭代生成以覆盖边缘案例,但这也增加了数据质量控制的难度,包括维持标签平衡与避免噪声干扰。
常用场景
经典使用场景
在菲律宾语及菲英混合语(Taglish)的自然语言处理领域,情感分析任务长期面临标注数据匮乏、领域覆盖狭窄的困境。TagaSenti数据集应运而生,它精心搜集了来自电商、新闻、社交媒体、对抗性样本和合成数据等五个领域的35,686条句子,并标注为消极、中立、积极三类。其经典使用场景在于为低资源语言的情感分析模型提供高质量的多领域训练基准,尤其是通过包含9,378条针对性对抗样本,显著增强了模型在边缘案例上的鲁棒性。研究者通常利用该数据集微调跨语言预训练模型如XLM-RoBERTa,并采用分层采样、文本归一化及加权损失函数等策略,以应对类别不平衡和代码切换带来的挑战。
实际应用
在实际产业应用中,TagaSenti数据集赋予开发者在菲律宾市场部署精准情感分析系统的能力。电子商务平台可利用其在用户评论中自动识别不满情绪,及时介入客户服务;新闻聚合网站能借此量化舆论倾向,优化内容推荐算法;社交媒体管理工具则依赖该数据集训练出的模型来实时监测品牌声誉,尤其当混合使用Tagalog和英语的帖子中掺杂了代码转换表达时。由于该数据集涵盖合成与对抗性样本,部署在实际系统中能更好地抵御恶意或异常输入,大幅降低因难以处理的边缘情况而导致的误判率。基于该数据集微调出的模型已在Hugging Face上开源,运行在Tesla T4等消费级GPU上即可满足中等规模的推理需求,显著降低了中小型企业的技术门槛。
衍生相关工作
围绕TagaSenti数据集,研究者已开展了一系列具有启发意义的衍生工作。其一,基于该数据集微调的XLM-RoBERTa大型模型(355M参数)在测试集上达到了86.6%的准确率,并展现了零样本迁移至其他菲律宾语言的潜力,在HiliSenti数据集上取得了62.4%的F1分数,这直接催生了跨语言情感模型压缩与知识蒸馏的研究方向。其二,该数据集发布的对抗性样本生成流程,启发了后续工作对代码切换文本中情感混淆因素的专门建模,推动了对Tagalog独特语法现象(如重叠词还原、笑声规范)的标准化处理。此外,完整的训练管道脚本(TagaSenti.py)为同行提供了一个可复现的基准,激励了更多研究者对比不同预训练模型(如BART、ELECTRA)在低资源情感分析上的性能差异。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务