loan_eligibility
收藏资源简介:
loan_eligibility数据集包括客户详情,如性别、婚姻状况、教育程度、依赖人数、收入、贷款金额、信用历史等。Loan_Status列表示贷款状态,其中Y表示批准,N表示拒绝。
The loan_eligibility dataset includes customer details such as gender, marital status, education level, number of dependents, income, loan amount, credit history, and other relevant information. The Loan_Status column indicates the loan status, where 'Y' stands for approved and 'N' for rejected.
贷款资格预测数据集
问题陈述
Dream Housing Finance公司处理所有住房贷款业务。客户首先申请住房贷款,公司随后验证其资格。目标是基于客户在线申请表中提供的详细信息,实时自动化这一贷款资格流程。我们旨在创建一个模型,用于识别有资格获得贷款的客户。
数据集描述
loan_eligibility数据集包括客户详细信息,如性别、婚姻状况、教育程度、家属数量、收入、贷款金额、信用记录等。Loan_Status列表示贷款状态,其中Y表示批准,N表示拒绝。
使用的库
- pandas
- numpy
- matplotlib
- seaborn
- scikit-learn
- scipy
探索性数据分析
- 删除无关列:移除了如
Loan_ID等无预测能力的列。 - 数据集概述:审查数据集信息以理解数据类型和非空计数。
- 频率分布:检查
Loan_Status列的值分布。 - 缺失值处理:识别并处理数据集中的缺失值。
- 重复行检查:检查并移除任何重复行。
- 异常值处理:移除异常值以提高模型性能。
数据准备
- 处理缺失值:使用适当的方法(众数、均值)填充缺失值。
- 移除异常值:使用z-score识别并移除异常值。
- 数据转换:使用LabelEncoder对分类变量进行编码。
数据可视化
- 条形图:可视化各种特征的分布。
- 热图/相关性矩阵:检查特征与
Loan_Status之间的相关性。
模型训练和测试
方法论
我们的AI模型使用监督机器学习模型,特别是决策树分类器,自动化预测贷款资格。决策树提供基于客户属性的清晰、可解释的结果,便于理解影响贷款决策的因素。
模型选择
我们选择决策树模型,因为它能够自然地处理分类特征,并提供清晰的分类规则。
训练和测试
- 特征向量和目标变量:定义X(特征)和Y(目标变量)。
- 数据分割:将数据分为训练集和测试集。
- 模型拟合:在训练集上训练决策树分类器。
结果
模型实现了68%到75%的准确率,表明在预测贷款资格方面取得了合理的成功。决策树模型基于影响贷款批准的实际因素提供清晰的结果,这对客户具有说服力。




