遇见数据集

LureBench

收藏
github2026-07-25 更新2026-07-27 收录
数据链接:
官方服务:

资源简介:

LureBench是一个用于检测AI生成的欺诈诱饵(如钓鱼邮件、商业邮件泄露、浪漫诈骗和杀猪盘)的基准测试和评估框架。它包含一个经过精心构建的数据集,其中人类和AI生成的欺诈诱饵在长度和去敏化方式上进行了分布匹配,以消除数据偏差。该数据集支持两种任务:欺诈检测(区分欺诈与良性内容)和来源检测(区分AI与人类撰写),并提供了用于评估和基准测试的工具。

LureBench is a benchmark and evaluation framework for detecting AI-generated fraudulent lures, including phishing emails, business email compromises, romance scams, and pig butchering scams. It contains a carefully curated dataset where human-written and AI-generated fraudulent lures are distribution-matched in terms of length and desensitization methods to eliminate data bias. This dataset supports two tasks: fraud detection (distinguishing fraudulent content from benign content) and source detection (distinguishing AI-generated content from human-authored content), and provides tools for evaluation and benchmarking.

创建时间:
2026-07-03
原始信息汇总

数据集概述:LureBench

LureBench 是一个用于检测 AI 生成欺诈诱饵(fraud lures)的基准测试与评估框架,重点关注当代大语言模型(LLM)生成的欺诈内容与真实人类欺诈行为的对比。

  • 核心问题:在经典垃圾邮件语料库上表现良好的欺诈检测器,在遇到现代语言模型编写的诱饵时性能大幅下降。LureBench 旨在统一衡量这一差距。
  • 核心发现:基于朴素构建的语料库训练的分类器看似近乎完美,但该发现是“陷阱”。模型实际上是在区分“语料来源”而非“作者身份”。经过分布匹配(将每条人类诱饵与AI重写版本配对)后,跨生成器的检测性能急剧下降,接近随机猜测(AUC 低至 0.57)。明确区分 AI 和人类撰写的欺诈内容实际上非常困难。

两大任务

benchmark 区分两个关键问题:

  • 欺诈检测任务:判断内容是否为欺诈诱饵。
  • 来源溯源任务:判断内容是否由 LLM 生成。

数据构成

LureBench 核心语料库(lurebench-core)包含 20,388 条记录:

类别 数量 细节
人类撰写的欺诈和正常文本 19,798 条 来源:David-Egea/phishing-texts 数据集(MIT 许可),经过去标记化和去毒处理。
AI 生成的欺诈诱饵 590 条 覆盖四种欺诈类型,由三种生成器生成。
— DeepSeek deepseek-v4-pro 190 条
— GLM glm-4.6 200 条
— Mistral mistral-large-latest 200 条
  • 欺诈类型:网络钓鱼、商业电子邮件欺诈、浪漫诈骗、杀猪盘。
  • AI 诱饵特性:采用“硬模式”(hard-mode)生成,注重可信度和情境,而非典型的紧急催款标记。

结构与功能

  • 流水线:从公共语料库和 LLM 提供商生成内容,经过人工审核,组装冻结的训练/测试集,最后进行评估(排行榜、跨生成器、鲁棒性)。
  • 人工审核门控:每条生成的诱饵均经过去毒、来源记录,并在获得人类批准前保持审核中状态。
  • 分片:训练和测试集通过记录 ID 的稳定哈希划分,添加新生成器不会重新洗牌测试集。

使用与评估

  • 快速开始:可通过 pip install -e . 安装,并使用 lurebench eval 命令在示例数据上运行内置检测器。
  • 命令行工具:提供 ingest, generate, train, eval, leaderboard, cross-generator, robustness, multilingual, stix 等 12 个命令,覆盖完整评估流程。
  • 内置检测器:包含从关键词启发式算法到训练好的分类器(如 tfidf-logreg)等多种基线检测器。
  • 分布匹配实验:可复现“留一生成器”溯源崩溃实验,在朴素语料库上 AUC 接近 1.00,但在分布匹配的数据集上跌至随机水平。

鲁棒性评估

  • 核心观点:纯净数据的准确率不等于部署环境下的准确率。
  • 攻击测试robustness 命令模拟真实攻击者行为,对检测器成功拦截的诱饵施加攻击,并衡量攻击成功率。
  • 攻击类型:包括同形字符攻击、leet 语攻击、零宽字符攻击、空白字符攻击以及更强的 LLM 重写攻击。
  • 关键发现:关键词基线检测器在字符攻击下几乎完全失效(同形字攻击成功率 99%),而训练模型则表现出较好的鲁棒性(同形字攻击成功率 38%)。鲁棒性是一个不同于纯净准确率的独立评估维度。

关联项目

  • LureScope:一个可部署的配套项目,提供小型 API 和浏览器演示,可粘贴消息进行评分,并查看攻击规避检测器的过程。其鲁棒性记分卡报告了检测器在语料库上的逐攻击规避率。

负责任使用与局限性

  • 应用范围:本数据集和工具包旨在用于防御性研究,严格限定于评估和训练检测器。
  • 伦理措施:生成受控,文本经过人工审核门控和去毒处理,不包含真实目标的个性化信息、有效链接或支付指令。
  • 已知局限
    • 跨生成器溯源结果基于三种生成器和纯网络钓鱼语料库,样本量有限。
    • 人类语料库来源年代较早,使用现代人类欺诈数据可能会得出更强结果。
    • 音频和视频深度伪造欺诈不在当前范围内。
搜集汇总
数据集介绍
LureBench 数据集图片
构建方式
LureBench的构建过程严谨且透明,旨在建立一个能够公正评估AI生成欺诈诱饵检测能力的基准。数据集的核心源自公开的钓鱼文本语料库,并辅以当前主流的大型语言模型(包括DeepSeek、GLM和Mistral)生成的欺诈诱饵。为确保数据质量与伦理合规,所有由AI生成的诱饵均经过脱敏处理、来源记录,并在人类审核批准后才被纳入数据集中。尤为关键的是,为了消除数据集构建中的混杂偏差——即单纯区分文本来源而非写作主体——研究人员采用了分布匹配策略,将每一条人类编写的钓鱼诱饵与AI对同一诱饵的改写版本配对,并在长度和脱敏方式上对齐,从而构建出一个公平评估AI文本溯源能力的测试环境。最终形成的数据集包含超过两万条记录,覆盖钓鱼、商业邮件欺诈、浪漫诈骗和杀猪盘四种典型欺诈类型。
使用方法
LureBench设计为开箱即用,无需下载模型或注册API密钥即可运行核心评估。用户可通过简单的命令行工具快速启动,例如使用内置的启发式检测器对样本数据进行评分。完整的核心数据集托管于Hugging Face Hub,可通过一行Python代码加载并集成到自定义的检测流水线中。该基准提供了丰富的评估命令,包括跨生成器溯源实验、对抗鲁棒性压力测试、多语言性能分析等,均通过统一的接口实现。此外,用户可轻松添加新的检测器(约30行代码)或扩展数据集生成新的诱饵。评估结果以标准格式输出,并支持导出为STIX 2.1威胁情报共享格式,便于在安全运营和分析工作流中直接使用。
背景与挑战
背景概述
LureBench是一个由immu4989研究机构于2025年创建的基准测试框架,专注于检测由现代大语言模型生成的欺诈诱饵。该数据集的核心研究问题在于,传统基于经典垃圾邮件语料库训练的欺诈检测器在面对LLM生成的诈骗文本时性能骤降。通过涵盖钓鱼邮件、商务电子邮件欺诈、婚恋诈骗及杀猪盘等典型的欺诈类型,LureBench系统性地评估了检测器在跨生成器家族(如DeepSeek、GLM、Mistral)下的表现。其重要发现揭示了一个被广泛忽视的数据集混杂偏差:当训练数据中人类撰写的欺诈文本与AI生成的文本在文本特征上存在系统性差异时,检测器实际上是在区分语料来源而非作者身份,这一发现对相关领域的研究范式产生了深远影响。
当前挑战
LureBench所解决的领域问题挑战在于,现有的欺诈检测方法难以有效识别LLM生成的、经过精心伪装的诈骗文本,这些文本规避了传统基于关键词或统计模式检测的规则。构建过程中面临的核心挑战是识别并消除一个隐蔽的数据集混杂因素——即人类与AI生成的欺诈文本在文本长度、分词方式及脱敏处理上的系统性差异,这一混淆使得初步评估中检测器的表现看似完美,实则掩盖了真实性能的虚假繁荣。此外,构建者还需应对跨生成器泛化能力评估的难题,以及设计能反映真实对抗场景的鲁棒性测试机制,确保检测器在面临同形词替换、语意改写等攻击时不会失效。
常用场景
经典使用场景
LureBench最经典的使用场景是作为检测AI生成欺诈诱饵的标准化基准测试平台。该数据集涵盖网络钓鱼、商业电子邮件泄露(BEC)、爱情诈骗和杀猪盘四种典型欺诈类型,分别由DeepSeek、GLM和Mistral等先进大语言模型生成。研究者可利用该基准评估各类检测器在区分AI撰写与人类撰写欺诈文本时的真实性能,尤其强调在分布匹配(distribution-matched)条件下的跨生成器泛化能力测试。通过内置的评估工具链,用户无需下载模型或使用API密钥即可快速运行基线检测器,从关键词启发式方法到训练好的分类器一应俱全。这一场景的核心价值在于揭示了数据集混杂因素(corpus-of-origin confound)对检测评估的严重干扰,为学术界提供了一个诚实、可复现的欺诈检测研究基础。
解决学术问题
LureBench解决了学术界长期存在的AI生成欺诈文本检测评估中的混杂因素问题。传统研究在纳朴数据集上训练检测器时,看似达到了近乎完美的检测性能(近100%召回率、0.1%虚警率),然而这一结果实际上是模型学习了训练数据的来源特征(如文本长度、标记化方式和去毒策略差异),而非真正的作者身份鉴别。通过构建分布匹配的数据集——将每条人类欺诈文本与AI改写版本配对,控制长度并统一去毒方式——该基准令跨生成器的AUC从完美的1.00骤降至0.58和0.57(接近随机猜测的0.50基线)。这一发现深刻改变了该领域的评估范式,迫使研究者重新审视先前的检测结果,并推动了更为严谨的实验设计。该工作对监管机构(如FinCEN、FBI)关注的AI助长欺诈威胁评估具有重要方法论意义。
实际应用
在实际安全部署场景中,LureBench提供了检测器鲁棒性评估的关键功能。该基准特别强调‘清洁数据评分不等于实际部署表现’这一核心理念,通过内置的攻击模拟框架(robustness命令)测量检测器在面对真实欺诈者攻击时的性能退化。攻击包括两类:免费的确定性字符篡改(如同形异义字攻击将‘verify’改为含西里尔字母的‘vеrifу’导致启发式检测器99%的捕获率失效)、以及更强的LLM改写攻击(如关键词规避和语义改写)。实验表明,基于TF-IDF逻辑回归的训练模型在面对同形异义字攻击时仍能保持38%的检测率,而简单关键词基线方法则完全崩溃。该基准还支持跨语言评估(涵盖八种语言),暴露了依赖标记化伪影的检测器在非拉丁文字上的严重失效(中文召回率从1.00降至0.09),而LLM判别器(llm-judge)可将跨语言召回率恢复至约0.94。
数据集最近研究
最新研究方向
LureBench开创性地聚焦于大语言模型生成的欺诈诱饵检测这一前沿安全议题,其核心发现颠覆了学界对AI生成文本检测能力的认知。通过构建严格的分布匹配(distribution-matched)语料库,研究揭示了此前近乎完美的检测性能源于语料库起源偏差(provenance confound)而非真正的创作主体区分:当消除长度、脱敏方式等混淆因素后,跨生成器的AI文本溯源任务AUC值从完美的1.00骤降至接近随机水平的0.58—0.57,仅个别模型保留微弱可检测特征。这一发现与FBI、FinCEN等机构对生成式AI加剧网络诈骗(如商业邮件泄露、杀猪盘)的预警高度契合,为学界和业界提供了严谨的评估范式。该基准还创新性地引入了对抗鲁棒性测试与多语言检测盲区分析,揭示了干净数据下的高准确率在真实攻击场景中可能急剧退化,非拉丁语系文本在移除脱敏标记后检测召回率出现灾难性崩塌,从而推动了语义理解型检测器(如LLM-as-Judge)的发展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务