遇见数据集

vietnamese_sms_phishing_dataset

收藏
Hugging Face2026-08-07 更新2026-08-08 收录
官方服务:

资源简介:

该数据集是官方发布的“质量保证的越南语 SMS 诈骗数据集”(Quality-Assured Vietnamese SMS Phishing Dataset),旨在支持网络安全、自然语言处理(NLP)和机器学习领域的研究,特别是针对 SMS 垃圾短信及诈骗短信的检测任务。数据集完全由真实世界中的越南语 SMS 短信构成,非 AI 生成,也非从其他语言翻译而来。所有短信均从多个合法来源收集,并获得了贡献者的明确同意。数据集的构建过程中,研究团队使用了包含 50,000 个恶意 URL 的数据库作为标签验证的参考标准。数据集包含 2,991 个样本,分为完整数据集(full_dataset.csv)以及训练集(train.csv,2,394 个样本)和测试集(test.csv,597 个样本)。其中完整数据集包含字段:message_id(消息ID)、date(日期)、message(短信内容)、label(标签,0=合法,1=垃圾/诈骗)。训练集和测试集仅包含 message 和 label 字段。所有个人身份信息(PII)均已使用标准化占位符(如 [PHONE]、[BANK_ACC]、[MONEY]、[NUMBER]、[TIME]、[DATE])进行匿名化处理,经人工随机抽样检验未发现残留 PII。数据集采用 CC BY 4.0 许可证发布。在基准测试中,使用 Jaccard 相似度阈值 0.85 去除重复后,对多种模型进行了 5 折交叉验证评估。其中 PhoBERT-base 模型取得了最佳性能(准确率 97.28% ± 0.88%,F1 分数 96.63% ± 1.05%)。研究遵循伦理规范,已获得机构伦理委员会 IRB 豁免(协议编号 IRB-2026-NLP-0428),所有贡献者均为自愿参与并签署了知情同意书。

This dataset is the officially released "Quality-Assured Vietnamese SMS Phishing Dataset", designed to support research in cybersecurity, natural language processing (NLP), and machine learning, particularly for the detection of SMS spam and phishing messages. The dataset consists entirely of real-world Vietnamese SMS messages, not AI-generated or translated from other languages. All messages were collected from multiple legitimate sources with explicit consent from contributors. During construction, the research team used a database of 50,000 malicious URLs as a reference standard for label verification. The dataset contains 2,991 samples, divided into a full dataset (full_dataset.csv), a training set (train.csv, 2,394 samples), and a test set (test.csv, 597 samples). The full dataset includes fields: message_id, date, message, and label (0=legitimate, 1=spam/phishing). The training and test sets only contain the message and label fields. All personally identifiable information (PII) has been anonymized using standardized placeholders such as [PHONE], [BANK_ACC], [MONEY], [NUMBER], [TIME], and [DATE], and manual random sampling confirmed no residual PII. The dataset is released under the CC BY 4.0 license. In benchmark tests, after removing duplicates using a Jaccard similarity threshold of 0.85, multiple models were evaluated via 5-fold cross-validation. The PhoBERT-base model achieved the best performance (accuracy 97.28% ± 0.88%, F1 score 96.63% ± 1.05%). The research follows ethical guidelines and has obtained an IRB exemption (protocol number IRB-2026-NLP-0428), with all contributors voluntarily participating and signing informed consent forms.

创建时间:
2026-08-04
原始信息汇总

越南语短信诈骗数据集(质量保证版)

数据集概览

  • 语言:越南语(vi
  • 任务类型:文本分类(二分类)——判断短信是否为垃圾/诈骗信息(0 = 合法,1 = 垃圾/诈骗)
  • 许可证:Creative Commons Attribution 4.0 International(CC BY 4.0)
  • 数据规模:1K < N < 10K(共 2,991 条样本)
  • 发布时间:2026年(基于引用信息)

数据来源与构建

  • 数据集完全由真实世界的越南语短信构成,非 AI 生成,也非从其他语言翻译而来
  • 短信从多个合法渠道收集,所有贡献者均事先知情并同意
  • 使用了 Team Chống Lừa Đảo 提供的 50,000 条恶意 URL 作为标注与验证的参考资源
  • 研究方案已通过机构伦理委员会审查,获得 IRB 豁免(协议编号:IRB-2026-NLP-0428

数据匿名化与质量保障

  • 所有个人身份信息(PII)均被标准化占位符替代,如 [PHONE][BANK_ACC][MONEY][NUMBER][TIME][DATE]
  • 对随机抽样样本进行人工检查,确认匿名化后未残留任何个人身份信息

数据集结构

文件 说明 规模
full_dataset.csv 完整数据集(含 message_iddatemessagelabel 2,991 条
train.csv 训练集(含 messagelabel 2,394 条
test.csv 独立测试集,设计用于减少数据泄漏 597 条

模型基准测试结果

以下为基于 5 折交叉验证 的结果,使用 Jaccard 相似度阈值 J ≥ 0.85 去重后的官方基准数据集:

模型 准确率 Precision (%) Recall (%) F1-Score (%) 95% Bootstrap CI
PhoBERT-base 97.28% ± 0.88% 96.85% ± 1.10% 96.42% ± 1.25% 96.63% ± 1.05% [95.60%, 97.65%]
Char (3–5 gram) SVM 96.34% ± 0.68% 93.31% ± 2.06% 93.55% ± 2.24% 93.40% ± 1.21% [91.86%, 94.87%]
RBF SVM 95.93% ± 0.23% 95.29% ± 0.97% 89.75% ± 1.62% 92.42% ± 0.50% [90.77%, 93.99%]
Linear SVM 95.79% ± 0.44% 93.57% ± 1.39% 91.07% ± 0.81% 92.30% ± 0.79% [90.68%, 93.81%]
MLP (Neural Network) 95.52% ± 0.47% 91.79% ± 1.48% 92.07% ± 1.34% 91.92% ± 0.83% [90.43%, 93.47%]
Logistic Regression 93.96% ± 0.80% 95.25% ± 1.60% 82.31% ± 2.80% 88.28% ± 1.69% [86.38%, 90.19%]
Multinomial Naive Bayes 89.02% ± 0.91% 86.41% ± 2.94% 71.74% ± 2.93% 78.32% ± 1.86% [75.57%, 81.08%]

作者团队

  • Trần Nguyễn Thái Tuấn – 首席研究员,负责数据集构建方法、框架设计与项目协调
  • Lê Hoàng Khang – 共同作者,参与标注规则制定、标注团队协调与数据处理
  • Nguyễn Minh Tài – 研究员,参与标注、数据处理与数据预处理
  • Nguyễn Văn Thắng – 研究员,负责数据管理与组织、工作流优化与数据预处理
  • Mai Hoàng Đỉnh – 科学顾问与学术导师

引用信息

bibtex @article{tuan2026vietnamese_sms_phishing, title={Vietnamese SMS Dataset with Quality Assurance}, author={Tran, Nguyen Thai Tuan and Le, Hoang Khang and Nguyen, Minh Tai and Nguyen, Van Thang and Mai, Hoang Dinh}, journal={IEEE Access}, year={2026} }

适用场景

该数据集适用于网络安全自然语言处理(NLP)机器学习领域的研究,重点服务于短信垃圾/诈骗检测任务。

搜集汇总
数据集介绍
vietnamese_sms_phishing_dataset 数据集图片
构建方式
该数据集源于越南语真实短信的深度整合,严格规避了AI生成与跨语言翻译的偏差,经由社群自愿贡献与合法渠道采集,并依托包含50,000个恶意URL的参考资源进行标签校准。构建过程中,研究团队设计了系统的标注规则,并对全部个人身份信息实施标准化匿名处理,以占位符如[PHONE]、[BANK_ACC]等替代,确保数据隐私与合规性。最终,通过人工抽检验证了匿名化的彻底性,形成了2,991条精标注样本,并划分为训练集与测试集,以促进模型泛化能力的评估。
特点
该数据集以越南语为核心,聚焦网络安全领域的SMS垃圾与诈骗检测任务,具备高度真实性与领域专精性。其显著特点在于严格的匿名化处理与质量控制,保障了数据的安全性与可用性。此外,数据集提供了全量及分割版本,便于不同研究场景的适配。基准测试结果显示,PhoBERT-base模型在该数据集上达到了97.28%的准确率,彰显了其对于越南语文本分类任务的高挑战性与基准价值,同时为低资源语言的自然语言处理研究提供了珍贵资源。
使用方法
该数据集适用于文本分类任务的模型训练与评估,研究者可直接加载train.csv与test.csv进行监督学习。数据格式简洁,包含消息文本与二元标签,便于与主流NLP框架集成。建议采用预训练语言模型如PhoBERT进行微调,以充分捕捉越南语语义特征。同时,数据集提供了完整版本(full_dataset.csv),支持交叉验证或数据增强研究。在评估时,需注重防止数据泄露,利用官方提供的测试集以客观衡量模型泛化能力,并可参考其基准结果作为性能对照。
背景与挑战
背景概述
在移动通信与数字金融高度融合的当下,短信钓鱼攻击已成为全球网络安全领域的重要威胁,越南语用户同样面临此类风险。然而,现有的公开数据集多集中于英语或中文,严重缺乏针对越南语短信的标注语料,这制约了自然语言处理与网络安全交叉领域的研究进展。为填补这一空白,由Tran Nguyen Thai Tuan领衔的研究团队于2026年构建并发布了首个高质量越南语短信钓鱼数据集(vietnamese_sms_phishing_dataset)。该数据集包含2,991条真实世界越南语短信,严格遵循数据伦理规范,经匿名化处理并配备详尽的人工标注规则,为越南语钓鱼短信检测研究提供了可靠的基准。其论文发表于IEEE Access,为低资源语言环境下的网络威胁检测提供了宝贵资源。
当前挑战
该数据集的构建面临多重挑战。在领域层面,越南语作为低资源语言,其复杂形态特征与口语化表达使得传统文本分类模型性能受限,需针对性地设计特征工程与深度学习架构;此外,钓鱼短信与正常短信的边界模糊,语义上存在高度相似性,对判别模型的鲁棒性提出严苛要求。在构建过程中,团队需克服数据采集的道德与隐私障碍,确保所有贡献者知情同意,并需在保留真实语义的同时完成精准的PII匿名化,防止身份信息泄露。同时,鉴于短信长度短、上下文匮乏,人工标注的一致性维护与质量校验亦为一大考验,团队最终通过双人标注与专家仲裁等机制保障了标签可靠性。
常用场景
经典使用场景
该数据集聚焦于越南语短信的二分类任务,旨在区分合法短信与垃圾/诈骗短信。作为面向低资源语言网络安全领域的稀缺标注资源,其经典应用场景涵盖基于传统机器学习(如支持向量机、朴素贝叶斯)与深度预训练语言模型(如PhoBERT)的文本分类模型训练与评估。研究者可利用其提供的固定训练集与测试集划分,开展跨模型性能对比、特征工程优化及消融实验,从而系统性地探究越南语短信文本中的诈骗模式识别方法。
衍生相关工作
该数据集衍生出一系列卓有成效的后续研究,如基于该语料微调PhoBERT等预训练语言模型以提升检测精度,或将其作为越南语低资源场景下的基准测试集,验证跨语言迁移学习与数据增强策略的有效性。相关成果亦延伸至半监督与主动学习框架,旨在降低标注成本;同时,研究者也借此探索可解释性人工智能模型,以揭示诈骗短信的语言学特征,进而为多语种短信安全领域的模型设计提供了重要的评测基线与方法论启示。
数据集最近研究
最新研究方向
在网络安全与自然语言处理的交叉前沿,vietnamese_sms_phishing_dataset的发布为低资源语言下的短信欺诈检测注入了新的活力。该数据集严格基于真实越南语短信构建,杜绝了AI生成内容与跨语言翻译的污染,并通过匿名化处理与人工质量审核保障了数据纯净度,为研究社区提供了高可信度的基准资源。当前研究热点聚焦于利用PhoBERT等预训练语言模型在有限样本下的鲁棒性优化,以及针对Jaccard相似度去重后的唯一基准集进行跨模型性能对比,以应对数据泄漏与类别不平衡等挑战。该数据集的问世不仅填补了越南语短信安全语料的空白,更为全球多语言反钓鱼系统的协同发展提供了可复用的评估范式,推动了低资源环境下可迁移防御策略的探索。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务