遇见数据集

loan-application-dataset

收藏
Hugging Face2026-09-04 更新2026-09-05 收录
官方服务:

资源简介:

该数据集包含LendingClub平台2007年至2018年期间的个人贷款申请与发放记录,源自Kaggle,由BuildersLab社区用于信用风险违约项目。数据集的目的是构建一个可解释的信用风险模型,预测个人贷款申请是否会违约,该模型仅使用贷款发放时可获得的借款人和贷款特征。数据集总样本数介于100万到1000万之间,属于表格分类任务。数据分为多个配置:default配置包含原始数据,按train、validation、test三个切分以parquet格式存储;feature_engineered配置包含经过特征工程处理后的数据,同样按三个切分存储;此外还包含数据字典摘要、缺失值摘要以及手动审查结果等CSV文件。数据字典文件详细记录了每个变量的定义、缺失值统计、缺失率标签以及是否保留、是否在申请时可用等手动审核信息。数据集适用于金融领域的信用风险评估、违约预测等机器学习任务。

This dataset contains personal loan application and issuance records from the LendingClub platform between 2007 and 2018, sourced from Kaggle and used by the BuildersLab community for a credit risk default project. The dataset aims to build an interpretable credit risk model to predict whether a personal loan application will default, using only borrower and loan features available at the time of loan issuance. The total number of samples ranges from 1 million to 10 million, and it belongs to a tabular classification task. The data is divided into multiple configurations: the default configuration contains raw data, stored in parquet format with three splits (train, validation, test); the feature_engineered configuration contains data after feature engineering, also stored in three splits. Additionally, there are CSV files including data dictionary summaries, missing value summaries, and manual review results. The data dictionary file details the definition of each variable, missing value statistics, missing rate labels, and manual review information such as whether the variable is retained and whether it is available at application time. The dataset is suitable for machine learning tasks in the financial domain, such as credit risk assessment and default prediction.

创建时间:
2026-09-04
原始信息汇总

LendingClub Loan Data (2007-2018) 数据集概述

基本信息

  • 数据集名称:LendingClub Loan Data (2007-2018)
  • 许可证:CC0-1.0(公有领域)
  • 语言:英语
  • 任务类型:表格分类
  • 标签:数据科学、机器学习、风险预测、金融
  • 数据规模:100万至1000万条记录
  • 来源:源自Kaggle的 LendingClub 全部贷款数据

项目背景

该数据集由 BuildersLab 的 Credit Risk Default 项目使用,用于构建一个可解释的模型来预测个人贷款违约概率。该项目为一个虚构银行(NorthBay Bank)案例研究服务,通过交互式审查仪表板向信贷官员呈现预测结果仅供信贷审批时参考,不涉及信用卡产品。数据仅使用贷款发放时可获得的借款人和贷款特征。

数据集划分

数据集提供两种版本,均包含训练集、验证集和测试集(以Parquet格式存储):

配置名称 说明 文件路径
default(默认) 经过清洗、目标筛选、去泄漏、缺失值填充后的数据(特征工程前) data/before_feature_engineering/
feature_engineered 与上述相同划分,但已进行特征工程(增加新特征,合并或删除部分原始列) data/after_feature_engineering/

可通过Hugging Face datasets 库按配置名称加载对应版本。

数据字典与辅助文件

数据字典参考文件存放于 data_dictionary/ 目录,各文件独立配置:

  • data_dictionary_summary.csv:每列一行,包含变量名、官方列定义、缺失值数量、缺失百分比及缺失程度标签
  • missing_values_summary.csv:各列缺失值数量与百分比汇总,用于建模前识别和删除结构性缺失列
  • missing_and_leakage_manual_review.csv:全部151个原始列的人工审查记录,包含是否保留、原因、以及该列是申请时可用(贷前)还是仅在贷款生命周期内可用(贷后)
  • missing_values_decisions.xlsx:经泄漏审查后保留的87列的逐列插补决策(中位数填充、中位数加缺失标记列、众数加标记、或删除行),附机制与理由
  • feature_engineering_data_dictionary.xlsx:4个工作表,涵盖特征工程后数据的字典、各列统计信息(含数值列的极值/均值/标准差/分位数、类别列的unique/top/freq、全部列的缺失计数)、特征间完整相关矩阵,以及与违约目标的相关系数

分析输出物

outputs/ 目录存放分析制品(不属于模型就绪数据集),目前包括特征间相关矩阵CSV文件及其热力图PNG。后续笔记本将补充SHAP图与评估曲线等产出。

相关人员

角色 姓名
项目负责人兼数据科学家 Nafisat Ibrahim
数据科学家 Marienne Dosso
数据科学家 Bintou Ba

相关链接

  • 项目仓库:https://github.com/BuildersLab/Credit-Risk-Default
  • 在线演示:https://portfolio-risk-prediction.streamlit.app/
  • 数据源:https://www.kaggle.com/datasets/wordsforthewise/lending-club
搜集汇总
数据集介绍
loan-application-dataset 数据集图片
构建方式
该数据集源自LendingClub 2007至2018年间的个人贷款申请记录,原始数据经Kaggle平台获取后,由BuildersLab团队执行了系统性的清洗与工程化处理。清洗阶段涵盖目标变量筛选、数据泄漏列剔除以及缺失值插补,并保留了一份详尽的列级审查档案,用以记录每一列的保留或弃用依据。在清洗后的基础上,团队进一步实施特征工程,通过衍生新特征、整合或删除部分原始字段,生成了适用于信用风险预测的增强版本。最终数据被划分为训练集、验证集与测试集,并以两种配置形式发布,分别对应特征工程前与特征工程后的数据形态。
使用方法
使用者可通过HuggingFace数据集库便捷加载该数据集,调用load_dataset函数时指定默认配置即可获取特征工程前的数据,传入feature_engineered配置名则加载特征工程后的版本。数据字典与缺失值审查文件以独立配置形式声明,需单独加载读取,各自遵循不同的表结构。加载后的数据集可直接用于表格分类任务,尤其适用于信用违约预测模型的训练与评估。配套的GitHub仓库提供了完整的清洗与特征工程笔记本,便于研究者复现处理流程或根据自身需求调整特征集,输出目录中还包含特征相关性矩阵等分析产物,可供进一步探索变量间关系。
背景与挑战
背景概述
信用风险预测长期是金融风控领域的核心议题,个人贷款违约的精准识别直接关系到信贷机构的资产质量与盈利能力。LendingClub作为全球知名的P2P借贷平台,其2007至2018年间积累的贷款申请与发放记录为学术与工业界提供了大规模真实借贷样本。BuildersLab团队基于Kaggle公开数据构建了loan-application-dataset,涵盖数百万条个人贷款申请,旨在服务于可解释的信用违约预测项目,以虚构银行NorthBay Bank为案例,强调仅使用贷款发起时可获取的借款人及贷款特征。该数据集通过CC0-1.0协议开放,为表格分类、风险预测及金融机器学习研究提供了重要的基准资源,推动了可解释模型在信贷决策中的应用。
当前挑战
该数据集所应对的领域挑战在于个人贷款违约预测本身的高度不平衡性与风险因素复杂性,传统模型难以在保持可解释性的同时实现精准判别。构建过程中,原始数据存在严重的结构缺失与信息泄漏问题,大量列在贷款生命周期结束后才可得,若不加甄别将导致模型在真实场景中失效。团队需对151个原始字段进行逐列人工审查,区分申请时点与事后信息,并针对87个保留列制定中位数填充、缺失标记或行删除等差异化插补策略,同时平衡特征工程前后的数据版本一致性。此外,类别型与数值型特征混合、目标变量定义及时间跨度带来的分布漂移,均为建模带来了额外困难。
常用场景
经典使用场景
在信用风险建模领域,贷款申请数据集的经典使用场景聚焦于二分类任务,即预测个人贷款是否会发生违约。研究者通常利用借款人申请时可得的人口统计特征、财务指标及贷款属性,构建逻辑回归、梯度提升树或神经网络等模型,以估计违约概率。该数据集提供的训练、验证与测试划分,使得模型能够进行严格的泛化性能评估,并支持特征重要性分析、概率校准等步骤,从而服务于可解释的信贷决策流程。
解决学术问题
该数据集有效回应了信用评分与违约预测研究中的若干核心问题,包括类别不平衡下的模型稳健性、高维表格数据的特征选择,以及信息泄露导致的乐观偏差。通过提供经过清洗、目标筛选及泄露移除的版本,它使研究者能够公平比较不同算法的预测能力,并推动可解释机器学习在金融风控中的应用。其规模与时间跨度亦有助于探究经济周期对违约行为的影响,为学术文献中的风险度量与监管政策讨论提供了实证基础。
实际应用
在实际金融业务中,该数据集被用于搭建可解释的信用风险平台,辅助信贷官员评估贷款申请的违约概率。基于申请时可得信息的模型能够集成至审批工作流,为自动化决策提供依据,并通过交互式仪表盘展示关键风险因子。此类应用有助于降低不良贷款率、优化风险定价,并满足监管对模型透明度的要求,在消费金融、小微信贷及投资组合风险管理中具有明确的落地价值。
数据集最近研究
最新研究方向
在信用风险预测领域,贷款申请数据集的近期研究聚焦于可解释性与公平性建模。基于LendingClub 2007-2018年数据,研究者致力于构建仅使用申请时可得特征的违约预测模型,避免未来信息泄漏,并借助SHAP等可解释性工具揭示关键风险因子。该数据集提供的特征工程前后版本及详细的缺失值与泄漏审查记录,为模型的可复现性和透明度设立了新标准,推动了金融风控从黑箱模型向可信人工智能的转型,对监管合规和普惠金融具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务