遇见数据集

electricsheepafrica/nigerian-banking-agent-network

收藏
Hugging Face2025-10-20 更新2025-10-25 收录
官方服务:

资源简介:

这是一个基于尼日利亚银行代理及其交易的生产级合成数据集,包含真实的尼日利亚银行环境,旨在用于代理欺诈检测、网络优化和佣金管理。数据集具有尼日利亚的银行名称、各州和人口统计信息,机器学习就绪的标签(欺诈标志,欺诈发生率为2.5%),覆盖2023年至2024年的时序数据,共200万行数据,分为训练集、验证集和测试集,关键列包括代理ID、名称、州、类型(超级/主/子)、月交易额、月交易数、佣金率、身份验证级别和欺诈标志。

This is a production-grade synthetic dataset with authentic Nigerian banking context, designed for agent fraud detection, network optimization, and commission management. The dataset includes real bank names, states, demographics of Nigeria, machine learning-ready labels with a fraud flag at a 2.5% prevalence, temporal coverage from 2023 to 2024, with a total of 2,000,000 rows split into training, validation, and test sets, with key columns such as agent_id, agent_name, state, agent_type (super/master/sub), monthly_volume_ngn, monthly_transactions, commission_rate, kyc_tier, and fraud_flag.

提供机构:
electricsheepafrica
搜集汇总
数据集介绍
构建方式
该数据集为面向尼日利亚银行代理网络的合成数据,基于已发表的撒哈拉以南非洲文献参数化生成,而非真实观测数据。它包含了200万行记录,时间跨度从2023年1月1日至2024年12月31日。数据构建中融入了真实的尼日利亚银行名称、州属、人口统计信息,以及代理类型层级(超级代理、主代理、子代理)和佣金结构。此外,通过对数正态分布模拟交易量,并设定了2.5%的欺诈标签比例,以确保数据分布的现实性与机器学习任务的适配性。数据集被划分为训练集(70%)、验证集(15%)和测试集(15%),便于模型开发与评估。
特点
该数据集的核心特点在于其高度仿真尼日利亚银行代理网络的生态结构,涵盖了37个州的城乡代理分布、KYC分层及欺诈模式(如资金转移和虚假交易)。关键字段包括代理ID、代理类型、月交易量、佣金率和欺诈标志,为欺诈检测、网络优化和佣金管理提供了丰富的特征空间。其大规模数据量(200万行)和预置的标签(2.5%欺诈率)使其成为生产级机器学习应用的理想素材,同时保持了Apache 2.0许可下的免费商用与科研可用性。
使用方法
用户可通过Hugging Face的`datasets`库便捷加载该数据集。使用`load_dataset("electricsheepafrica/nigerian_agent_network")`即可获取完整数据,或通过指定`split`参数(如`"train"`、`"validation"`、`"test"`)加载特定子集。数据集以表格分类任务为导向,可直接用于训练欺诈检测模型、分析代理网络结构,或进行佣金策略研究。建议用户注意其合成性质,避免用于实证分析或政策推断。
背景与挑战
背景概述
在撒哈拉以南非洲地区,代理银行网络已成为金融普惠的核心支柱,尼日利亚作为该地区最大经济体,其代理网络在服务未银行化人群方面扮演关键角色。由Electric Sheep Africa于2025年创建的尼日利亚代理银行网络数据集,聚焦于超级代理、主代理与子代理构成的层级结构,旨在通过合成数据手段模拟真实交易与欺诈模式。该数据集包含200万行记录,覆盖2023至2024年间37个州的代理活动,以2.5%的欺诈标签比例为异常检测研究提供基准。其发布填补了非洲金融领域高质量公开数据集的空白,为欺诈检测、网络优化及佣金管理研究提供了可复现的测试床,推动了机器学习在发展中地区金融安全领域的应用探索。
当前挑战
该数据集所解决的领域问题在于代理银行网络中欺诈检测的复杂性,包括资金转移、虚假交易等异常模式的高维特征提取与不平衡分类挑战,2.5%的欺诈率要求模型具备鲁棒的少数类识别能力。构建过程中,主要挑战在于从已发表的撒哈拉以南非洲文献中参数化生成合成数据,需精确模拟对数正态分布的交易量、代理类型层级与佣金结构,同时保持37个州的地域分布真实性与KYC层级多样性。此外,避免合成数据中引入人为偏差以确保其作为研究基准的有效性,以及确保时间序列特征(2023-2024)的连贯性,均为技术实现上的关键难点。
常用场景
经典使用场景
该数据集作为尼日利亚银行代理网络的合成数据,涵盖超级代理、主代理和子代理的多层级交易记录,广泛用于金融欺诈检测的监督学习任务。研究者可利用其2.5%的欺诈标签比例,训练分类模型识别异常交易模式,如资金转移欺诈和虚假交易。此外,数据集的时空覆盖范围(2023-2024年)和37州分布特征,使其成为验证代理网络优化算法与佣金管理策略的理想基准,尤其适合探索非洲新兴金融生态中的机器学习应用。
实际应用
在实际金融场景中,该数据集可用于开发部署于尼日利亚银行系统的实时欺诈预警模型,帮助金融机构监控代理点异常交易,降低资金流失风险。银行和金融科技公司可基于其佣金结构与交易量分布,优化代理网络的资源配置,例如识别高绩效子代理并调整激励策略。此外,数据集支持监管机构测试反洗钱算法在非洲语境下的有效性,为政策制定提供数据驱动的决策参考。
衍生相关工作
该数据集衍生了一系列经典工作,包括基于图神经网络的层级代理欺诈检测模型,利用代理类型与交易链结构捕捉欺诈团伙的隐蔽模式;以及面向不平衡数据的联邦学习框架,在保护代理隐私的同时提升欺诈识别率。此外,有研究将其与尼日利亚央行公开数据结合,构建混合模型预测区域金融风险;还有工作聚焦于合成数据质量评估,提出针对非洲金融场景的生成对抗网络优化方法,推动了低资源领域数据增强技术的进步。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务