Fraud-R1
收藏资源简介:
Fraud-R1是一个设计用来评估LLM在动态、现实世界场景中防御网络欺诈和钓鱼能力的基准。Fraud-R1包含了来自钓鱼诈骗、虚假职位发布、社交媒体和新闻的8564个欺诈案例,分为五大欺诈类型。与以前的基准不同,Fraud-R1引入了一个多轮评估管道,以评估LLM在不同阶段的欺诈抵抗力,包括信誉建设、紧迫感创造和情感操纵。
Fraud-R1 is a benchmark developed to evaluate the capability of large language models (LLMs) to defend against cyber fraud and phishing in dynamic, real-world scenarios. Fraud-R1 comprises 8,564 fraud cases collected from phishing scams, fraudulent job postings, social media platforms and news reports, which are classified into five major fraud categories. Unlike previous benchmarks, Fraud-R1 introduces a multi-turn evaluation pipeline to assess the fraud resistance of LLMs across different stages, including credibility building, urgency creation and emotional manipulation.
Fraud-R1 数据集概述
数据集简介
Fraud-R1 是一个用于评估大型语言模型(LLM)在动态、真实世界场景下对抗网络欺诈和钓鱼攻击能力的数据集。
数据集构成
- 数据来源:包含 8,564 个来自网络钓鱼诈骗、虚假招聘广告、社交媒体和新闻的欺诈案例。
- 数据类型:分为基础数据集(Base Dataset)和升级数据集(Level-up Dataset)。
- 数据划分:基础数据集占 25%,升级数据集占 75%。
- 语言分布:中文占 50%,英文占 50%。
- 欺诈类型:
- 欺诈服务:28.04%
- 冒充:28.04%
- 网络钓鱼诈骗:22.06%
- 虚假招聘广告:14.02%
- 网络关系:7.84%
- 平均令牌长度:273.92 tokens
评估流程
- 评估 LLMs 在两种不同设置(Helpful Assistant 和 Role-play)下的欺诈诱导识别和防御能力。
- 通过多轮对话设置来评估模型在不同阶段的抵抗力,包括建立信任、创建紧迫感和利用情感诉求。
数据增强
- 使用
Deepseek-R1生成欺诈信息,并通过多阶段精炼过程构建升级数据集。
模型性能
- 公开了在 Fraud-R1 数据集上的模型性能排行榜,包括防御成功率(DSR%)和防御失败率(DFR%)。
注意事项
- 该数据集包含可能令人不适的攻击性内容,仅供教育和研究使用。
联系方式
- Shu Yang: shu.yang@kaust.edu.sa
- Shenzhe Zhu: cho.zhu@mail.utoronto.ca
引用信息
- BibTeX 信息待填写。




