遇见数据集

Fannie_Mae_Single-Family_Loan_Performance

收藏
Hugging Face2026-07-26 更新2026-07-27 收录
官方服务:

资源简介:

Fannie Mae Single-Family Loan Performance数据集是一个用于抵押贷款违约预测和贷款表现分析的开源表格分类数据集。该数据集包含美国房利美(Fannie Mae)公司提供的单户住宅贷款在多个历史季度的表现数据,覆盖了从2000年第一季度到2020年第一季度的关键时间点。数据集提供了两种形式:原始数据和已处理数据。原始数据以CSV格式存储,包含六个不同季度的文件(2000Q1、2005Q1、2008Q1、2013Q1、2017Q1、2020Q1),文件大小从约2.3GB到17.2GB不等,总计规模在1000万到1亿条记录之间。这些文件记录了贷款的基本信息、借款人特征、房产属性以及随时间变化的还款表现。已处理数据则经过了清洗、预处理和特征工程,分为训练集(train_ready.csv,约80MB)和测试集(test_ready.csv,约75MB),便于直接用于机器学习模型的开发与评估。该数据集主要适用于金融风控、信用评分、贷款违约预测等表格分类任务,是研究住房抵押贷款市场和信用风险建模的重要资源。

The Fannie Mae Single-Family Loan Performance dataset is an open-source tabular classification dataset designed for mortgage default prediction and loan performance analysis. It includes performance data for single-family residential loans provided by Fannie Mae across multiple historical quarters, covering key time points from the first quarter of 2000 to the first quarter of 2020. The dataset is available in two forms: raw data and processed data. The raw data is stored in CSV format, comprising six quarterly files (2000Q1, 2005Q1, 2008Q1, 2013Q1, 2017Q1, 2020Q1) with file sizes ranging from approximately 2.3GB to 17.2GB, totaling between 10 million and 100 million records. These files document loan basic information, borrower characteristics, property attributes, and repayment performance over time. The processed data has been cleaned, preprocessed, and feature-engineered, divided into a training set (train_ready.csv, about 80MB) and a test set (test_ready.csv, about 75MB), facilitating direct use in machine learning model development and evaluation. This dataset is primarily suitable for tabular classification tasks such as financial risk control, credit scoring, and loan default prediction, serving as a valuable resource for researching the housing mortgage market and credit risk modeling.

创建时间:
2026-07-25
原始信息汇总

数据集概述

  • 名称: Fannie Mae Single-Family Loan Performance Dataset
  • 许可协议: MIT
  • 任务类别: 表格分类
  • 语言: 英语
  • 标签: 抵押贷款、贷款表现、房利美、金融、数据挖掘
  • 数据规模: 1000万至1亿条记录

数据结构

数据集包含原始数据和已处理数据两部分:

原始数据 (raw/)

文件 时间周期 大小
2000Q1.csv 2000年第1季度 约2.3 GB
2005Q1.csv 2005年第1季度 约6.5 GB
2013Q1.csv 2013年第1季度 约17.2 GB
2017Q1.csv 2017年第1季度 约8.4 GB
2020Q1.csv 2020年第1季度 约8.2 GB

已处理数据 (processed/)

文件 描述 大小
train_ready.csv 训练集(已预处理和特征工程) 约80 MB
test_ready.csv 测试集(已预处理和特征工程) 约75 MB

数据来源

数据来自房利美单户贷款表现数据

使用示例

可通过以下Python代码直接加载已处理数据:

python import pandas as pd

train = pd.read_csv("https://huggingface.co/datasets/Shlok112003/Fannie_Mae_Single-Family_Loan_Performance/resolve/main/processed/train_ready.csv") test = pd.read_csv("https://huggingface.co/datasets/Shlok112003/Fannie_Mae_Single-Family_Loan_Performance/resolve/main/processed/test_ready.csv")

搜集汇总
数据集介绍
Fannie_Mae_Single-Family_Loan_Performance 数据集图片
构建方式
该数据集汇集了房利美(Fannie Mae)自2000年第一季度至2020年第一季度间多个时间节点的单户贷款绩效原始数据,涵盖六个代表性季度的CSV文件,数据规模从数GB至十余GB不等。在原始数据基础上,数据集通过预处理与特征工程提取了关键变量,构建出约80MB的训练集与75MB的测试集,旨在为抵押贷款违约预测与贷款绩效分析提供高质量的规范化输入。
特点
数据集横跨近二十年的贷款周期,囊括了2000年、2005年、2008年、2013年、2017年及2020年等经济波动显著时期的样本,具有典型的时间跨度与市场代表性。其独特之处在于提供了经过清洗与特征工程优化的轻量化版本,大幅降低了分析门槛,同时保留了原始数据的深度信息,便于研究者直接应用于分类模型训练与评估。
使用方法
使用者可通过HuggingFace平台直接获取加工后的训练及测试集CSV文件,利用Pandas等库轻松加载至内存。推荐采用逻辑回归、随机森林或梯度提升等适用于表格数据的分类算法进行建模,以开展贷款违约风险预测任务。该数据集兼顾了科研探索与工程实践的便捷性,适合金融风控、数据挖掘等领域的深入研究。
背景与挑战
背景概述
在金融风险管理领域,抵押贷款违约预测是量化信用风险的核心议题之一,尤其在后危机时代,监管机构与金融机构对贷款组合的实时监控需求日益迫切。Fannie Mae Single-Family Loan Performance数据集由美国房利美公司于2000年首次发布,涵盖二十年间跨季度的大型贷款绩效记录,旨在为学术界与业界提供标准化的抵押贷款违约分析与绩效评估基准。该数据集由房利美资本市场部门维护,其原始数据规模从2000年第一季度的2.3 GB增长至2013年第一季度的17.2 GB,反映了美国房地产市场的动态演变。通过整合贷款发放、还款历史及违约事件等多维信息,该数据集已成为抵押贷款建模领域的权威资源,推动了机器学习和统计方法在信用风险评估中的深度应用,并对金融科技与风险监管政策产生了深远影响。
当前挑战
该数据集所解决的领域问题主要集中在抵押贷款违约预测的准确性提升与贷款绩效的时序分析。核心挑战在于处理高度不平衡的违约事件分布,以及捕捉宏观经济周期、区域房价波动与贷款条款之间的非线性交互效应。构建过程中面临的挑战包括:原始数据规模庞大且包含大量缺失值、异常值与多季度不一致的字段定义,需设计鲁棒的清洗与特征工程流水线以生成结构化训练集;此外,房利美数据涉及敏感的借款人信息,在保留统计效用的同时须严格遵循隐私合规要求。预处理后的数据最终被压缩为约80 MB的训练集与75 MB的测试集,在保留关键预测信息的前提下显著降低了计算资源开销,为高效模型迭代提供了可靠基础。
常用场景
经典使用场景
在金融风控与计量经济学研究领域,Fannie Mae单一家庭贷款绩效数据集被广泛用于构建抵押贷款违约预测模型与贷款绩效归因分析。研究者可基于该数据集丰富的贷款层面信息(如贷款金额、利率、住房抵押比、借款人信用评分、贷款期限等)与逐月绩效快照,训练诸如逻辑回归、随机森林、XGBoost或深度学习模型,以识别违约风险的关键驱动因素。经典的学术任务包括贷款违约时间序列预测、存活分析(如Cox比例风险模型)以及贷款提前偿还行为建模,这些任务对理解房地产市场波动与信贷风险传导机制具有重要价值。
解决学术问题
该数据集有效解决了金融学与经济学中贷款违约预测与信用风险评估这一核心学术问题,为验证贷款绩效的生命周期理论、借款人异质性对违约行为的非线性影响以及宏观经济变量(如利率、房价指数)与个贷风险之间的动态关系提供了大规模实证基础。其时间跨度涵盖2000年至2020年多个时期,包含2008年金融危机前后的贷款数据,使得研究者能够深入探讨危机前后贷款承销标准的变化及其对违约率的影响,并检验风险传染效应。此外,数据集的庞大规模(数十亿行记录)为训练高精度机器学习模型与开展可解释性分析创造了条件。
衍生相关工作
基于该数据集,学术界与工业界已衍生出多项经典工作。在方法层面,研究者提出了针对高维稀疏贷款特征的时间联邦学习框架,实现了跨机构违约预测模型协作而无需共享原始数据。在应用层面,衍生工作包括利用该数据集构建的贷款绩效归因解释性模型(如基于SHAP值的特征重要性分析)、用于预测次贷危机传染效应的系统性风险模型,以及将贷款数据与宏观经济指标结合的多模态风险预测范式。此外,房利美官方基于此数据定期发布《单一家庭贷款绩效报告》,成为监管机构与市场参与者评估住房金融市场健康度的权威参考资料。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务