支付领域客户风险甄别数据本数据集合包含特定的社会实体(自然人或企业法人)的风险评分。可应用在支付领域以及其他有合规要求、反洗钱要求、反欺诈要求的金融领域,如商户入网审核阶段、风险交易识别阶段等,可辅助评估和决策。以此减少可能涉及洗钱等非法跨境资金转移的高风险支付交易的发生,因为跨境支付易被不法分子利用,需确保每一笔支付都符合国际反洗钱法规和各国相关监管要求。同时,依据风险评分有助于准确判断支付请求是由真实用户发起还是欺诈行为,保障用户资金安全。1.数据采集:采集在第三方支付场景所接触入网客户关联实体相关信息以及对应身份标识发生的交易信息数据。
2.数据处理:对采集的交易信息数据进行统计性分析计算交易次数、夜间交易笔数、凌晨交易笔数、首次交易时间、末次交易时间、交易年数/月数/天数、交易时间跨度、凌晨交易占比、夜间交易占比等。
3.特征工程:将关联实体特征进行编码获取向量MRC_features=Encoder_en(Entity_features),其中Encoder_en为预先准备的实体特征编码器,Entity_features为关联实体特征包含关联实体类型、关联实体所在省份、生态类型、关联实体行业编码等;将交易特征分别进行分箱和编码,并组装成交易维度向量TC_features=Encoder_nbr(Trade_featuers),其中Encoder_nbr为预先准备的交易特征编码器,Trade_featuers为交易特征包含交易次数、首次/末次交易时间、夜间/凌晨交易笔数、交易年数/月数/天数、交易时间跨度、夜间/凌晨交易占比、风险金额笔数、风险金额百分比等;将MRC_features、Entity_features、TC_features等使用concat函数组合成features,结合对历史人工打标的风险类别(Label)加入,构成特征和标签矩阵data;
4.模型构建:模型为预先训练构建,由特征工程获取矩阵data,由矩阵中提取进行训练的向量集合X=data[features],提取特征矩阵中标签y=data[Label],这里的Label为风险类别的编码,并将特征向量和标签拆分为训练集合和测试集合X_train,X_test,y_train,y_test=train_test_split(X,y,test_size=0.3,random_state=42),基于决策树模型训练model.fit(X_train,y_train),模型经过测试和生产部署,并持续调优。
5.模型输出:生产每条数据经前述处理与特征工程编码获取单条向量R_vector,通过模型获取风险处置级别R_Label=model.predict(R_vector),获取相应概率R_Rate=model.predict_proba(R_vector),计算风险评分R_Score=100*R_Rate,推送给风控专家进行最终确认。