遇见数据集

SpamMessage

收藏
arXiv2025-09-30 收录
官方服务:

资源简介:

该数据集是一个GitHub仓库,其中包含了6万条中文恶意广告信息。这些信息可用于分析不良广告的内容特征,以便于开发更有效的检测和过滤机制。

This dataset is a GitHub repository containing 60,000 Chinese malicious advertising messages. These messages can be used to analyze the content characteristics of malicious advertisements, so as to develop more effective detection and filtering mechanisms.

提供机构:
GitHub
搜集汇总
数据集介绍
SpamMessage 数据集图片
背景与挑战
背景概述
该数据集是一个用于中文垃圾短信识别的机器学习项目,包含带标签和不带标签的短信数据,支持多种分类器如感知器、逻辑回归和朴素贝叶斯。数据集特点在于手写实现分类器代码,并提供了完整的训练和测试流程,适用于自然语言处理任务。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务