french-spam-text-dataset-v1.0
收藏资源简介:
用于训练和原型开发能够检测垃圾邮件的人工智能模型的法语合成消息数据集。
A French synthetic message dataset for training and prototyping AI models capable of detecting spam.
数据集概述
该数据集为法语垃圾短信检测数据集(版本1.0),是一个专为训练和原型开发AI模型而设计的合成法语消息数据集,用于检测垃圾短信(spam)和合法消息(legitimate)。数据集包含10,000条消息,其中5,000条为垃圾消息(spam),5,000条为合法消息(legitimate),涵盖5,000条短信(SMS)和5,000封电子邮件(Email)。全部消息均为唯一的法语文本,该数据集旨在弥补法语垃圾短信检测公开数据集的不足。
数据集结构
数据集的每个样本包含以下字段:
| 字段 | 说明 |
|---|---|
id |
消息的唯一标识符 |
text |
SMS或Email的内容 |
label |
消息类别(spam或legitimate) |
domain |
消息类型(SMS或Email) |
spam_category |
垃圾邮件的具体类别 |
split |
数据集划分(训练集、验证集或测试集) |
template_group |
用于控制数据分割的结构组 |
数据划分
消息被划分为三个数据集:
- 训练集(train):用于模型训练。
- 验证集(validation):用于模型调优和比较。
- 测试集(test):用于最终评估。
相似结构的消息会被分配到不同数据集,以尽量减少相近变体出现在多个集合中的情况。
主要用途
- 训练垃圾短信检测的初始模型;
- 测试文本分类方法;
- 比较自然语言处理模型;
- 创建演示和原型系统;
- 测试数据处理与评估流水线;
- 推动法语垃圾短信检测研究。
局限性与注意事项
- 所有消息均为合成数据,并非来自真实对话,不完全代表真实环境中的消息多样性。
- 该数据集适合作为学习和原型开发的起点,不适合直接用于生产环境,使用前建议在独立真实语料上进行模型评估。
- 项目未来计划逐步发展为包含真实匿名化消息的语料库,且此类消息将合法获取并由专业人员标注。
许可协议
数据集采用 Creative Commons Attribution 4.0 International (CC BY 4.0) 许可协议,允许使用、修改和再分发(包括商业项目),但需注明来源。建议引用为:
Dataset français de détection des spams, version 1.0, corpus synthétique, 2026.
项目背景与演进
该数据集为法语垃圾短信检测提供了一个初始基础,以回应法语社区在此领域公开数据稀缺的问题。早期版本基于英文语料翻译而来,而当前版本直接用法语生成,更贴近法语表达习惯。项目欢迎社区贡献,例如改进法语表达的更自然程度、提升消息多样性、报告错误或提出新的垃圾邮件类别。未来版本将致力于构建更贴近真实法语消息、更具语言多样性和更丰富垃圾邮件类别的数据集。相关翻译版本可参考 (先前版本)。





