PhishingSpamDataSet
收藏资源简介:
本研究构建的钓鱼邮件与垃圾邮件数据集是由奥斯陆大学科研团队开发的综合性语料库,包含钓鱼邮件、垃圾邮件和正常邮件三大类别。数据集规模达9000条样本,涵盖真实场景邮件与LLM生成内容,每条数据均包含完整元数据与情感动机标注。通过整合多源邮件数据与专家标注流程,采用大型语言模型进行情感分析和意图识别,并生成语义保持的改写变体以增强数据多样性。该数据集主要应用于网络安全领域,为AI驱动的邮件威胁检测系统提供训练基准,致力于解决新型LLM生成钓鱼邮件的识别难题与社交工程攻击的防御挑战。
The phishing and spam email dataset constructed in this study is a comprehensive corpus developed by the research team of the University of Oslo. It covers three major categories: phishing emails, spam emails, and legitimate emails. The dataset contains 9000 samples in total, including real-world scenario emails and content generated by Large Language Models (LLMs). Each entry includes complete metadata and emotional motivation annotations. By integrating multi-source email data and expert annotation workflows, large language models are utilized for sentiment analysis and intent recognition, and generate semantically consistent rewritten variants to enhance data diversity. This dataset is primarily applied in the field of cybersecurity, providing training benchmarks for AI-driven email threat detection systems, and aims to address the challenges of identifying emerging LLM-generated phishing emails and defending against social engineering attacks.
PhishingSpamDataSet 数据集概述
数据集简介
PhishingSpamDataSet是一个用于网络钓鱼、垃圾邮件和合法邮件分析的多层开放科学数据集,包含情感标签、动机标签和语义标签。
数据集内容
主要数据文件
merged_emails_with_categories.jsonl:包含邮件分类、来源、改写来源、情感标签、动机标签和Claude 3.5 Sonnet预测分类
数据类型
- 人工编写的钓鱼邮件、垃圾邮件和合法邮件
- LLM生成的邮件(使用GPT-4o、DeepSeek-Chat、Grok、Llama 3.3、Gemini、Nova、Mistral等模型)
- 来自三个独立LLM管线的改写/转述变体
标注信息
分类标签
- 真实类别:钓鱼邮件(Phishing)、垃圾邮件(Spam)、合法邮件(Valid)
- 来源类型:人工编写 vs LLM生成
- 改写来源:GPT-4o、DeepSeek、RandomAPI、Manual
情感标签
- 紧急感(urgency)
- 恐惧(fear)
- 权威(authority)等
动机标签
- 链接点击(link-click)
- 凭证窃取(credential theft)等
方法论
数据集构建
- 从开源语料库和精选钓鱼邮件库收集人工编写邮件
- 生成LLM邮件以增加多样性
- 通过三个管线进行改写:DeepSeek-Chat、GPT-4o、OpenRouter多模型管线
标注流程
评估了四个LLM模型的情感动机检测能力:
- GPT-4o-mini
- GPT-4.1-mini
- Claude 3.5 Sonnet
- DeepSeek-Chat
Claude 3.5 Sonnet因与人工标注匹配度最高而被选为全数据集标注模型
关键发现
情感动机分析
- Claude 3.5 Sonnet:Jaccard相似度0.60,近似准确率42%
- 动机检测更具挑战性,顶级模型达到53-61%近似准确率
邮件分类性能
- 严格准确率:约66-67%
- 宽松准确率:约69-70%
- 钓鱼检测优秀(F1≈0.93)
- 垃圾检测较弱(F1≈0.20-0.23)
- 合法邮件分类中等(F1≈0.63)
改写鲁棒性
- 严格准确率最大偏差:0.55个百分点
- 宽松准确率最大偏差:0.54个百分点
- 改写对分类器性能影响极小
工具脚本
accuracy_validation.py:情感动机检测基准测试category.py:邮件分类管线stats.py:严格/宽松准确率、混淆矩阵、改写鲁棒性分析
研究目标
支持基于LLM的邮件安全研究,包括钓鱼检测、垃圾邮件分析、情感操纵和自动鲁棒性评估。




