遇见数据集

SynthFin-AML

收藏
github2026-08-17 更新2026-08-24 收录
官方服务:

资源简介:

SynthFin-AML是一个图原生的反洗钱(AML)基准数据集,代表了银行账户之间交易数据的10天合成快照。

SynthFin-AML is a graph-native anti-money laundering (AML) benchmark dataset, representing a 10-day synthetic snapshot of transaction data between bank accounts.

创建时间:
2026-08-16
原始信息汇总

SynthFin-AML 数据集详情

数据集简介

SynthFin-AML 是一个面向反洗钱(AML)场景的图原生基准数据集,模拟了银行账户间10天的合成交易快照。该数据集由 MIT 许可发布,完全合成,不含任何个人身份信息(PII),可安全用于商业和学术用途。

核心统计信息

  • 节点数:100,000
  • 边数:1,273,403
  • 任务类型:传导式节点分类(Transductive Node Classification)
  • 目标:基于交易图将节点分类为干净或欺诈实体

数据结构

节点(银行账户)

每个节点包含10个特征(拓扑与聚合特征),所有特征均经过 log1p 变换:

  1. initial_balance(初始余额)
  2. out_degree(出度)
  3. in_degree(入度)
  4. out_volume(转出总额)
  5. in_volume(转入总额)
  6. out_max_amt(最大转出金额)
  7. in_max_amt(最大转入金额)
  8. nbr_in_volume(邻居转入总额)
  9. nbr_out_volume(邻居转出总额)
  10. pagerank(PageRank值)

边(交易)

  • 有向金融交易
  • 边特征:amount(交易金额)

类别标签

  • 0:干净(Clean)
  • 1:欺诈(Fraud)

欺诈比例存在高度类别不平衡,反映了现实金融犯罪的分布特征。

合成泄漏问题与解决方案

现有合成AML数据集常包含分布泄漏,导致表格模型利用基础分布伪影(如原始金额方差)而非识别潜在的金融犯罪类型。SynthFin-AML 通过固定正常与非法活动的基础分布来修正这一问题,并程序化嵌入特定拓扑AML模式(如 Structuring 和 Smurfing)。因此,模型必须学习图结构和交易序列才能正确识别欺诈节点,从而防止表格基线模型的利用。

基准测试结果

评估采用5个随机种子,严格80/20传导式划分:

模型 模态 PR-AUC P@100
LightGBM 表格(11个特征含PageRank) 0.8483 ± 0.0169 0.96
PyTorch GraphSAGE 0.8817 ± 0.0147 0.98

GraphSAGE 相比表格基线具有统计显著改进(p=0.000046)。

快速开始 / PyG封装

可通过 PyPI 安装数据集包:

bash pip install synthfin-aml

该包提供 PyTorch Geometric (PyG) 数据集封装,自动从 Hugging Face 下载图数据:

python from synthfin_aml_pkg import SynthFinDataset

初始化数据集,若未缓存则从Hugging Face下载

dataset = SynthFinDataset(root=./data) data = dataset[0]

print(f"Number of nodes: {data.num_nodes}") print(f"Number of edges: {data.num_edges}")

基准测试复现脚本位于仓库中的 examples/reddit_benchmark.py

相关资源

  • 在线实验:提供 Colab 教程笔记本(examples/benchmark_tutorial.ipynb
  • PyPI 包synthfin-aml
  • Hugging Face 数据集ovvaliyev/synthfin-aml
搜集汇总
数据集介绍
SynthFin-AML 数据集图片
构建方式
SynthFin-AML的构建旨在克服现有合成反洗钱数据集中广泛存在的分布泄漏问题,通过固定正常与非法活动的基础分布,并编程植入特定的图拓扑洗钱模式(如结构化拆分和 smurfing),生成一个包含100,000个节点(银行账户)与1,273,403条有向交易边的十日合成快照。每个节点拥有10个经log1p变换的拓扑及聚合特征,边则携带交易金额属性。类别标签将节点划分为清洗与欺诈两类,且欺诈比例极低,忠实再现真实金融犯罪的不平衡分布。
特点
该数据集的核心特色在于其‘图原生的反洗钱基准’定位,要求模型必须依托图结构与交易序列来识别欺诈节点,而非依赖简单的分布统计偏差。由此,图神经网络(如GraphSAGE)在此任务上较传统表格模型(如LightGBM)展现出显著的性能优势,PR-AUC提升至0.8817(p<0.05)。同时,数据完全合成、无个人隐私信息,且以MIT许可发布,保障了商业与学术使用的安全性与合规性。
使用方法
使用者可便捷地通过PyPI安装(pip install synthfin-aml),并借助内置的PyTorch Geometric封装类SynthFinDataset自动从Hugging Face下载数据,完成图数据加载。该封装返回一个包含节点特征、边索引及标签的Data对象,支持直接的归纳式节点分类实验。仓库还提供了基准测试脚本(examples/reddit_benchmark.py),可复现文献中报告的性能指标,便于研究者进行方法对比与验证。
背景与挑战
背景概述
SynthFin-AML 数据集由 Oktay Valiyev 等人于 2023 年创建,旨在为反洗钱(AML)领域提供高质量的图学习基准。该数据集模拟了十天内银行账户间的交易快照,包含 10 万节点和超过 127 万条边,每个节点具有拓扑与聚合特征,任务为转导式节点分类,区分正常与欺诈账户。其核心研究问题在于解决现有合成数据集中的分布泄漏问题,通过固定基础分布并嵌入结构化洗钱模式(如分层和化整为零),迫使模型学习图结构与交易序列,而非简单统计特征。该数据集在 AML 领域具有影响力,为图神经网络在金融犯罪检测中的应用提供了可信的评估平台,并已被 PyPI 和 Hugging Face 收录。
当前挑战
SynthFin-AML 所解决的领域挑战是 AML 中欺诈检测的复杂性,包括高类不平衡(欺诈比例极低)以及交易模式的隐蔽性,传统基于规则的检测难以捕捉复杂洗钱拓扑。构建过程中面临的关键挑战包括:避免合成数据的分布泄漏,确保正常与欺诈活动的特征分布相似,从而防止表格模型通过简单统计特征(如金额方差)作弊;同时需精确嵌入真实洗钱模式(如 Structuring 和 Smurfing),使数据集既反映现实又保持可学习性。此外,构建者需保证数据的合成性以消除隐私顾虑,并在 10 万节点规模下维护图结构的真实性与计算可行性。这些挑战在基准测试中得以体现,图模型(GraphSAGE)较表格模型(LightGBM)有显著提升,验证了数据集对结构学习能力的强调。
常用场景
经典使用场景
SynthFin-AML作为图原生的反洗钱基准数据集,其经典使用场景聚焦于图神经网络(GNN)的半监督节点分类任务。该数据集构建了一个包含10万个银行账户节点和超过127万条交易边的有向图,要求模型依据交易图谱的拓扑结构及节点聚合特征,精准区分合法账户与欺诈账户。这一场景不仅检验了模型对大规模图数据的处理能力,更对捕捉复杂金融犯罪模式(如拆分交易、分层交易)提出了严苛要求,成为评估GNN架构(如GraphSAGE)性能的试金石。
衍生相关工作
SynthFin-AML的发布催生了多项衍生研究。其基线实验(LightGBM vs GraphSAGE)证实了图模型优于表格模型,激发了后续对更复杂GNN架构(如Graph Transformer、异构图模型)的探索。数据集还促进了面向可解释性的反洗钱分析,研究者结合子图模式挖掘、注意力机制等,以增强模型决策的透明度。此外,其PyG封装和Hugging Face集成,降低了复现门槛,推动了标准化的AML基准测试生态,为算法公平比较和联合学习研究奠定了基础。
数据集最近研究
最新研究方向
SynthFin-AML数据集的最新研究方向聚焦于利用图神经网络(GNN)进行反洗钱(AML)检测,以克服传统表格模型对合成数据中分布泄漏的依赖。该数据集通过嵌入特定拓扑模式(如结构化拆分和蚂蚁搬家式转移)来模拟真实的洗钱行为,促使模型学习图结构与交易序列的深层特征。GraphSAGE等图模型在PR-AUC指标上显著优于LightGBM,展示了图学习方法在捕捉复杂金融犯罪模式中的优势。此研究不仅为AML领域提供了高质量基准,还推动了图数据在金融安全中的应用,具有重要的实践意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务