遇见数据集

Customer-level Fraud Detection Benchmark (CFDB)

收藏
arXiv2024-04-23 更新2024-08-06 收录
数据链接:
官方服务:

资源简介:

客户级欺诈检测基准(CFDB)是一个专为提升机器学习模型研究和评估而设计的结构化数据集。该数据集由IBM开发,包含来自SAML-D和AML-World的详细客户行为和交易历史,总计约2076455条记录。CFDB通过将交易级数据转换为客户中心框架,强调客户行为模式,以更准确地模拟潜在欺诈。此数据集不仅遵守严格的隐私指南,确保用户保密,还通过提供丰富的客户中心特征信息,支持深度学习和异常检测算法等高级分析技术的发展。CFDB的应用领域主要集中在提升欺诈检测系统的预测准确性,促进金融安全领域的创新和改进。

The Customer-Level Fraud Detection Benchmark (CFDB) is a structured dataset specifically designed for the research and evaluation of machine learning models. Developed by IBM, this dataset contains detailed customer behavior and transaction history from SAML-D and AML-World, with a total of approximately 2,076,455 records. CFDB converts transaction-level data into a customer-centric framework, emphasizing customer behavior patterns to more accurately simulate potential fraud. This dataset not only complies with strict privacy guidelines to ensure user confidentiality, but also supports the development of advanced analytical technologies such as deep learning and anomaly detection algorithms by providing rich customer-centric feature information. The application scenarios of CFDB mainly focus on improving the prediction accuracy of fraud detection systems and promoting innovation and improvement in the field of financial security.

提供机构:
IBM
创建时间:
2024-04-23
搜集汇总
数据集介绍
Customer-level Fraud Detection Benchmark (CFDB) 数据集图片
构建方式
在金融欺诈检测领域,现有数据集多聚焦于交易层面,忽略了客户行为模式的整体性。为弥补这一缺口,CFDB数据集通过将SAML-D、AML-World-HI-Small和AML-World-LI-Small三个原始交易级数据集进行重构,将每笔交易按客户维度聚合,形成以客户为中心的特征画像。具体而言,聚合过程提取每位客户的交易总数、平均交易金额、被标记为可疑活动的次数等关键指标,从而将分散的交易信息升华为反映客户长期行为模式的综合特征。这种转换不仅保留了原始数据的丰富性,还通过结构化处理确保了隐私合规性,为研究人员提供了更贴近实际业务场景的基准资源。
特点
CFDB数据集的核心特点在于其客户级视角的独特优势。它涵盖了超过200万客户的行为档案,其中SAML-D包含855,460名客户,0.92%被标记为可疑;AML-World-HI-Small和LI-Small分别包含705,907和515,088名客户,可疑比例分别为0.751%和1.23%。每个客户的平均交易次数介于9.80至11.11之间,平均交易金额则从8,762到5,500,051不等,展现了金融活动的广泛异质性。这种跨数据集、多尺度的设计,使得CFDB能够支持对复杂欺诈模式的深度挖掘,例如异常高频交易或金额剧烈波动等行为轨迹,从而增强了模型在现实场景中的泛化能力。
使用方法
使用CFDB数据集时,研究人员可将其作为标准化基准,评估不同机器学习模型在客户级欺诈检测中的表现。具体操作上,建议首先对数据进行预处理,包括缺失值处理、分类变量编码及数值特征缩放,以消除量纲影响。随后,可采用70%训练集与30%测试集的分层划分策略,确保类别分布一致性。论文中已提供了线性回归、决策树、XGBoost和神经网络等基线模型的实验框架,并推荐使用精确率、召回率、F1分数和AUC等指标进行综合评估,以克服不平衡数据集下准确率指标的局限性。该数据集及其代码已在GitHub上开源,便于复现与扩展研究。
背景与挑战
背景概述
在欺诈检测领域,数据集的可用性与隐私合规性是推动机器学习研究的关键瓶颈。传统数据集多聚焦于交易层面,虽能捕捉单次交易特征,却忽略了客户行为模式的宏观语境,难以应对日益复杂的欺诈手段。为填补这一空白,Phoebe Jing、Yijing Gao与Xianlong Zeng于近期提出了客户级欺诈检测基准(CFDB),该基准由SAML-D、AML-World-HI-Small及AML-World-LI-Small三个子数据集构成,通过将交易级数据聚合为客户画像,提供了涵盖交易频次、平均金额及异常标记等丰富属性的结构化资源。CFDB的发布不仅为研究社区提供了标准化评估平台,还促进了梯度提升、深度学习等模型在真实场景下的性能对比,显著提升了欺诈检测系统的预测精度与泛化能力。
当前挑战
CFDB所面临的挑战主要源自欺诈检测领域的两大核心难题。其一,数据高度不平衡:在SAML-D数据集中,仅有0.92%的客户被标记为可疑,而AML-World-LI-Small中可疑比例虽升至1.23%,但正负样本悬殊仍导致多数模型(如线性回归、决策树)在召回率上表现极低(低至0%),难以有效识别稀有欺诈案例。其二,构建过程中需平衡隐私保护与数据丰富性:原始交易数据受GDPR等法规严格限制,CFDB通过聚合客户级特征规避敏感信息,却面临信息粒度损失与行为模式表征不足的挑战,例如在AML-World-HI-Small上,XGBoost的召回率仅0.11,反映出复杂欺诈模式对模型敏感性的严苛要求。
常用场景
经典使用场景
在金融欺诈检测领域,模型性能的评估高度依赖于数据的质量与粒度。传统交易级数据集虽能捕捉单次异常,却难以刻画客户行为的长期模式,从而限制了欺诈识别的深度。Customer-level Fraud Detection Benchmark (CFDB) 作为一项开创性基准,将交易级数据聚合为以客户为中心的特征集合,为机器学习模型提供了评估其在客户层面识别欺诈能力的标准化平台。研究者可借助该基准,系统性地比较逻辑回归、决策树、XGBoost及神经网络等模型在精准率、召回率、F1分数及AUC等关键指标上的表现,从而深入理解不同算法在应对复杂欺诈行为时的优劣。
解决学术问题
CFDB 数据集直面欺诈检测研究中数据稀缺与隐私合规的双重困境,填补了客户级数据集的空白。传统交易级数据因忽略客户行为全貌,导致模型在捕捉隐蔽欺诈模式时力不从心。通过聚合交易历史与行为特征,CFDB 使研究者能够更准确地建模欺诈活动的累积性异常,解决了因数据粒度不足引发的假阴性率过高问题。此外,该基准支持在统一框架下评估模型对不平衡数据的处理能力,揭示了高准确率下精准率与召回率失衡的常见陷阱,为学术领域提供了方法论指导,推动了更鲁棒评估体系的建立。
衍生相关工作
CFDB 的发布催生了一系列衍生研究工作,推动了欺诈检测技术的演进。一方面,研究者基于该基准探索了集成学习与深度网络的混合架构,例如将 XGBoost 的特征提取能力与神经网络的模式泛化优势相结合,以应对不同数据集(如 AML-World 的稀疏欺诈场景)中的挑战。另一方面,CFDB 激发了针对不平衡数据处理的创新,如自适应损失函数与合成采样方法(如 SMOTE)的改进。此外,该基准还促进了跨机构协作,成为评估新型异常检测算法(如图神经网络在交易流中的应用)的标准参照,为未来开发更敏感、更精准的反欺诈系统奠定了坚实基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务