TagaSenti
收藏资源简介:
TagaSenti 是一个多领域情感分析数据集,针对塔加洛语和塔格利什语,包含35,686个句子,覆盖5个领域(电子商务、新闻、社交媒体、对抗性、合成数据),分为3个类别:负面(0)、中性(1)、正面(2),包含9,378个针对性的对抗性行,用于增强边缘情况处理,并支持塔加洛语/塔格利什语代码切换,采用CC BY‑SA 4.0许可。
TagaSenti is a multi-domain sentiment analysis dataset targeting Tagalog and Taglish languages, containing 35,686 sentences across 5 domains: e-commerce, news, social media, adversarial, and synthetic data. It is categorized into three sentiment classes: negative (0), neutral (1), and positive (2). The dataset includes 9,378 targeted adversarial examples to enhance edge case handling, supports code-switching between Tagalog and Taglish, and is licensed under CC BY‑SA 4.0.
数据集概述:TagaSenti
TagaSenti 是一个面向 Tagalog 和 Taglish 的多领域情感分析数据集及模型。
数据集详情
- 规模与组成:包含 35,686 条句子,覆盖 5 个领域:电子商务、新闻、社交媒体、对抗性样本、合成样本。
- 标签类别:3 类情感标签——负面 (0)、中性 (1)、正面 (2)。
- 对抗性样本:包含 9,378 条针对性对抗性样本,经过 4 代生成,用于增强对边缘情况的鲁棒性。
- 语言特点:支持 Tagalog 与 Taglish(他加禄语与英语的语码混合)。
- 许可协议:数据集采用 CC BY‑SA 4.0 许可。
- 唯一标识:DOI 为
10.57967/hf/9620。 - 托管平台:该数据集可在 Hugging Face 上获取,地址为 jjjardev/tagasenti。
其他关联资源
- 模型:基于
xlm-roberta-large(355M 参数)微调的情感分析模型,在测试集上达到 86.6% 准确率和宏 F1 分数 0.866;在 Hiligaynon 语言(HiliSenti 数据集)上进行跨语言零样本评估,准确率为 62.4%,宏 F1 为 0.624。模型权重许可为 Apache 2.0,托管于 jjjardev/tagasenti-model。 - 训练脚本:完整的训练流程位于
scripts/train/TagaSenti.py,包含数据加载、分层划分(80/10/10 训练/验证/测试)、文本规范化、动态最大长度分词、加权交叉熵 + 标签平滑、余弦学习率调度、梯度检查点、混合精度训练及早停机制,并可选择在 HiliSenti 上进行零样本评估。代码采用 MIT 许可。 - 仓库结构:根目录包含
README.md、LICENSE、requirements.txt;scripts/train/存放训练脚本;database/README.md和model/README.md分别指向 Hugging Face 上的数据集和模型。
引用信息
bibtex @misc{jessie_james_jarder_2026, author = {Jessie James Jarder}, title = {tagasenti (Revision 3ebda33)}, year = 2026, url = {https://huggingface.co/datasets/jjjardev/tagasenti}, doi = {10.57967/hf/9620}, publisher = {Hugging Face} }




