Phishing and Spam Email DataSet
收藏资源简介:
这是一个多层次的开放科学数据集,用于钓鱼、垃圾邮件和合法邮件的分析,包含情感、动机和语义标签。数据集包括人类编写的钓鱼、垃圾邮件和合法邮件,以及由多种LLM生成的邮件,还包含情感和动机标签、重述/改写的变体以及Claude 3.5 Sonnet的分类结果。
This is a multi-level open science dataset dedicated to the analysis of phishing, spam, and legitimate emails, which encompasses sentiment, motivational, and semantic labels. The dataset includes human-written phishing, spam, and legitimate emails, as well as emails generated by multiple large language models (LLMs), alongside sentiment and motivational labels, paraphrased/rephrased variants, and classification results from Claude 3.5 Sonnet.
PhishingSpamDataSet 数据集概述
数据集简介
这是一个用于网络钓鱼、垃圾邮件和合法邮件分析的多层开放科学数据集,包含情感、动机和语义标签。该数据集专为基于大语言模型(LLM)的电子邮件安全研究而设计,涵盖钓鱼检测、垃圾邮件分析、情感操纵以及转述下的自动化鲁棒性评估。
数据集内容
主要数据文件
merged_emails_with_categories.jsonl:包含以下信息:- 真实类别(Phishing, Spam, Valid)
- 邮件来源(人工撰写 vs. LLM生成)
- 转述来源(GPT-4o, DeepSeek, RandomAPI, Manual)
- 情感标签(紧迫感、恐惧、权威等)
- 动机标签(点击链接、窃取凭证等)
- Claude 3.5 Sonnet 预测的分类结果
邮件构成
- 人工撰写的钓鱼、垃圾和合法邮件
- LLM生成的邮件(来自 GPT-4o, DeepSeek-Chat, Grok, Llama 3.3, Gemini, Nova, Mistral 等模型)
- 由三个独立的LLM流程生成的转述/改述变体
研究方法
1. 数据集构建
- 从开源语料库和精选的钓鱼邮件库收集人工撰写的邮件
- 为增加多样性而生成LLM邮件
- 通过三个流程进行转述:
- DeepSeek-Chat
- GPT-4o
- OpenRouter 多模型流程(Gemini, Nova, Grok, Llama, Mistral 等)
2. 情感与动机标注
- 评估了四种LLM:GPT-4o-mini、GPT-4.1-mini、Claude 3.5 Sonnet、DeepSeek-Chat
- 评估指标包括:严格准确率、近似准确率、杰卡德相似度、5次独立运行的内部一致性、精确率与召回率
- 由于与人工标注匹配度最高,选择 Claude 3.5 Sonnet 进行全数据集标注
3. 邮件分类
- 使用 Claude 3.5 Sonnet 进行最终分类,依据:邮件正文、主题行、发件人元数据、URL和附件指示符
- 评估方式:
- 严格分类(钓鱼 / 垃圾邮件 / 合法)
- 宽松分类(非期望邮件 vs. 合法邮件)
- 对三个转述流程的鲁棒性
关键发现
情感与动机分析
- Claude 3.5 Sonnet 表现:
- 杰卡德相似度 = 0.60
- 近似准确率 = 42%
- 动机检测更难,但顶级模型能达到53–61%的近似准确率
- LLM经常推断出超出人工标注的额外合理动机
邮件分类性能
在所有邮件组(原始、DeepSeek转述、GPT-4o转述、RandomAPI)中:
- 严格准确率:约 66–67%
- 宽松准确率:约 69–70%
- 钓鱼邮件检测效果优异(F1 ≈ 0.93)
- 垃圾邮件检测效果较弱(F1 ≈ 0.20–0.23)
- 合法邮件分类效果中等(F1 ≈ 0.63)
对转述的鲁棒性
与原始邮件的最大偏差:
- 严格准确率偏差:0.55 个百分点
- 宽松准确率偏差:0.54 个百分点
- 转述对分类器性能影响极小
配套资源
脚本
accuracy_validation.py:情感与动机检测基准测试category.py:邮件分类流程stats.py:计算严格/宽松准确率、混淆矩阵、转述鲁棒性
可复现性
运行 stats.py 可生成:
- 严格和宽松准确率
- 混淆矩阵
- 按组别的指标
- 转述鲁棒性分析
- 可供出版物使用的 LaTeX 格式表格
数据获取与用途
所有模板、数据集和源代码均已公开发布,旨在支持AI辅助电子邮件安全领域的可复现研究。




