LureBench
收藏资源简介:
LureBench是一个用于检测AI生成的欺诈诱饵(如钓鱼邮件、商业邮件泄露、浪漫诈骗和杀猪盘)的基准测试和评估框架。它包含一个经过精心构建的数据集,其中人类和AI生成的欺诈诱饵在长度和去敏化方式上进行了分布匹配,以消除数据偏差。该数据集支持两种任务:欺诈检测(区分欺诈与良性内容)和来源检测(区分AI与人类撰写),并提供了用于评估和基准测试的工具。
LureBench is a benchmark and evaluation framework for detecting AI-generated fraudulent lures, including phishing emails, business email compromises, romance scams, and pig butchering scams. It contains a carefully curated dataset where human-written and AI-generated fraudulent lures are distribution-matched in terms of length and desensitization methods to eliminate data bias. This dataset supports two tasks: fraud detection (distinguishing fraudulent content from benign content) and source detection (distinguishing AI-generated content from human-authored content), and provides tools for evaluation and benchmarking.
数据集概述:LureBench
LureBench 是一个用于检测 AI 生成欺诈诱饵(fraud lures)的基准测试与评估框架,重点关注当代大语言模型(LLM)生成的欺诈内容与真实人类欺诈行为的对比。
- 核心问题:在经典垃圾邮件语料库上表现良好的欺诈检测器,在遇到现代语言模型编写的诱饵时性能大幅下降。LureBench 旨在统一衡量这一差距。
- 核心发现:基于朴素构建的语料库训练的分类器看似近乎完美,但该发现是“陷阱”。模型实际上是在区分“语料来源”而非“作者身份”。经过分布匹配(将每条人类诱饵与AI重写版本配对)后,跨生成器的检测性能急剧下降,接近随机猜测(AUC 低至 0.57)。明确区分 AI 和人类撰写的欺诈内容实际上非常困难。
两大任务
benchmark 区分两个关键问题:
- 欺诈检测任务:判断内容是否为欺诈诱饵。
- 来源溯源任务:判断内容是否由 LLM 生成。
数据构成
LureBench 核心语料库(lurebench-core)包含 20,388 条记录:
| 类别 | 数量 | 细节 |
|---|---|---|
| 人类撰写的欺诈和正常文本 | 19,798 条 | 来源:David-Egea/phishing-texts 数据集(MIT 许可),经过去标记化和去毒处理。 |
| AI 生成的欺诈诱饵 | 590 条 | 覆盖四种欺诈类型,由三种生成器生成。 |
— DeepSeek deepseek-v4-pro |
190 条 | |
— GLM glm-4.6 |
200 条 | |
— Mistral mistral-large-latest |
200 条 |
- 欺诈类型:网络钓鱼、商业电子邮件欺诈、浪漫诈骗、杀猪盘。
- AI 诱饵特性:采用“硬模式”(hard-mode)生成,注重可信度和情境,而非典型的紧急催款标记。
结构与功能
- 流水线:从公共语料库和 LLM 提供商生成内容,经过人工审核,组装冻结的训练/测试集,最后进行评估(排行榜、跨生成器、鲁棒性)。
- 人工审核门控:每条生成的诱饵均经过去毒、来源记录,并在获得人类批准前保持
审核中状态。 - 分片:训练和测试集通过记录 ID 的稳定哈希划分,添加新生成器不会重新洗牌测试集。
使用与评估
- 快速开始:可通过
pip install -e .安装,并使用lurebench eval命令在示例数据上运行内置检测器。 - 命令行工具:提供
ingest,generate,train,eval,leaderboard,cross-generator,robustness,multilingual,stix等 12 个命令,覆盖完整评估流程。 - 内置检测器:包含从关键词启发式算法到训练好的分类器(如 tfidf-logreg)等多种基线检测器。
- 分布匹配实验:可复现“留一生成器”溯源崩溃实验,在朴素语料库上 AUC 接近 1.00,但在分布匹配的数据集上跌至随机水平。
鲁棒性评估
- 核心观点:纯净数据的准确率不等于部署环境下的准确率。
- 攻击测试:
robustness命令模拟真实攻击者行为,对检测器成功拦截的诱饵施加攻击,并衡量攻击成功率。 - 攻击类型:包括同形字符攻击、leet 语攻击、零宽字符攻击、空白字符攻击以及更强的 LLM 重写攻击。
- 关键发现:关键词基线检测器在字符攻击下几乎完全失效(同形字攻击成功率 99%),而训练模型则表现出较好的鲁棒性(同形字攻击成功率 38%)。鲁棒性是一个不同于纯净准确率的独立评估维度。
关联项目
- LureScope:一个可部署的配套项目,提供小型 API 和浏览器演示,可粘贴消息进行评分,并查看攻击规避检测器的过程。其鲁棒性记分卡报告了检测器在语料库上的逐攻击规避率。
负责任使用与局限性
- 应用范围:本数据集和工具包旨在用于防御性研究,严格限定于评估和训练检测器。
- 伦理措施:生成受控,文本经过人工审核门控和去毒处理,不包含真实目标的个性化信息、有效链接或支付指令。
- 已知局限:
- 跨生成器溯源结果基于三种生成器和纯网络钓鱼语料库,样本量有限。
- 人类语料库来源年代较早,使用现代人类欺诈数据可能会得出更强结果。
- 音频和视频深度伪造欺诈不在当前范围内。




