遇见数据集

DenyTranDFW/3650R_2022_PF2_Commercial_Mortgage_Trust_1948175

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

3650R 2022-PF2 Commercial Mortgage Trust数据集包含美国证券交易委员会(SEC)ABS-EE资产级别的申报文件,涉及CIK 1948175的21个申报文件,82个Parquet文件,总大小为21.6 MB。数据覆盖的报告期为2022年11月14日至2024年7月11日。Parquet文件是从XML展品中提取的贷款级别/资产级别数据,并按特定方式组织。

The 3650R 2022-PF2 Commercial Mortgage Trust dataset contains SEC ABS-EE asset-level filings for CIK 1948175, comprising 21 filings, 82 Parquet files, with a total size of 21.6 MB. The reporting period spans from 2022-11-14 to 2024-07-11. Parquet files are loan-level / asset-level data extracted from XML exhibits, organised in a specific manner.

提供机构:
DenyTranDFW
搜集汇总
数据集介绍
DenyTranDFW/3650R_2022_PF2_Commercial_Mortgage_Trust_1948175 数据集图片
构建方式
本数据集聚焦于资产支持证券领域,具体针对3650R 2022-PF2 Commercial Mortgage Trust(SEC CIK编号1948175)的SEC ABS-EE资产层级申报文件进行了系统化提取与整理。数据源自美国证券交易委员会(SEC)的EDGAR系统,通过解析XML格式的展品文件,将其中蕴含的贷款级或资产级信息转化为高效的Parquet格式。构建过程以每次申报对应的唯一接入号(accessionNumber)为组织单位,将每个展品文件独立存储为一个Parquet文件,最终形成包含21份申报文件、82个Parquet文件、总容量21.6 MB的数据集合,全面覆盖2022年11月至2024年7月间的报告周期。
特点
该数据集的核心特点在于其结构化与粒度精细性,每一份Parquet文件均直接对应于资产支持证券底层资产的关键指标,使得研究者能够深入到单项贷款层面进行分析。数据来源的权威性得到SEC官方申报体系的保障,同时报告周期起止日期均源自XML元数据中的'reportingPeriodEndingDate'字段,确保了时序信息的准确与标准化。此外,数据集提供了完整的申报索引,涵盖表单类型、报告日期及原始URL链接,便于用户回溯至SEC原始文件进行交叉验证,兼具数据的一致性与可追溯性。
使用方法
使用该数据集时,研究人员可借助支持Parquet格式的数据处理框架(如Apache Arrow、Pandas)进行高效加载与分析。建议首先通过提供的申报索引表格筛选感兴趣的申报时间范围或特定展品,随后利用'accession_nodash'与展品名称的组合路径定位对应Parquet文件。为最大化数据价值,可结合SEC原始XML文件中的上下文信息,将多个文件中的贷款层级字段进行关联与聚合,构建跨时间序列的资产表现模型。推荐在分析过程中注重数据字段的统计特性,以挖掘商业抵押贷款支持证券的偿付行为与风险特征。
背景与挑战
背景概述
该数据集由SEC(美国证券交易委员会)基于ABS-EE(资产支持证券-电子化)项目收集,聚焦于3650R 2022-PF2 Commercial Mortgage Trust(CIK编号1948175)的资产层面披露信息。创建时间横跨2022年11月至2024年7月,涵盖21份备案文件,总计82个Parquet文件,数据规模约21.6 MB。核心研究问题在于通过标准化的XML展品数据,将商业抵押贷款支持证券(CMBS)的逐笔贷款信息转化为结构化格式,以提升金融市场的透明度和监管效能。该数据集填补了资产证券化领域公开细粒度数据的空白,为经济学家、监管机构及投资者提供了分析CMBS底层资产质量、风险特征和现金流模式的关键基准,对推动金融科技与实证研究具有里程碑意义。
当前挑战
领域内核心挑战在于商业抵押贷款支持证券(CMBS)的逐笔贷款数据长期分散于非结构化文档中,导致市场参与者难以高效评估资产池的信用风险与违约相关性。该数据集通过解析XML格式的SEC备案文件,解决了数据碎片化问题,但构建过程中面临两大障碍:一是不同备案时期的XML标签结构存在不一致性,需设计鲁棒的解析引擎以确保数据完整性;二是逾期指标、利率调整等关键字段的规范化程度参差,需结合领域知识进行清洗与对齐。此外,数据时效跨度仅20个月,尚不足以覆盖完整经济周期下的极端风险场景,限制了模型对尾部事件的预测能力。
常用场景
经典使用场景
3650R 2022-PF2 Commercial Mortgage Trust 数据集源自美国证券交易委员会(SEC)的ABS-EE(资产支持证券-增强电子化)强制性申报文件,聚焦于商用抵押贷款支持证券(CMBS)的逐笔资产层面信息。该数据集涵盖21份申报文件、82个Parquet格式文件,记录了自2022年11月至2024年7月期间每一笔底层贷款的详尽结构化数据,包括贷款余额、还款状态、利率特征等关键指标。经典使用场景在于构建标准化资产池画像,评估CMBS产品的信用风险分层与现金流穿透分析,为金融风险管理与资产定价研究提供高颗粒度的微观数据基础。
实际应用
在实际应用中,该数据集为投资机构、监管部门和信用评级机构提供了宝贵的决策支持工具。投资经理可据此构建动态压力测试模型,模拟利率上行或经济衰退情景下资产池现金流的波动性,优化CMBS投资组合的久期与信用风险敞口。监管部门能利用逐笔贷款信息监测系统性风险聚集,识别高杠杆或区域集中度过高的潜在隐患。评级机构则可将数据作为输入,校准评级模型中的参数假设,提升对CMBS产品信用等级预测的准确性与透明性,最终促进证券化市场的信息对称与定价理性。
衍生相关工作
该数据集衍生了多项经典工作,尤其在金融科技与计算金融交叉领域表现突出。其中,基于其资产层面数据开发的机器学习信用评分模型,可自动识别贷款逾期前兆特征,推动智能风控系统落地。另有研究以此数据为基准,构建了CMBS资产池的图神经网络模型,揭示贷款间依赖关系对违约传染效应的非线性影响。此外,结合自然语言处理技术分析SEC申报文件中的文本信息披露,学者们开发了信息含量指标,度量管理层对未来风险的预测能力,为另类数据在资产证券化分析中的应用开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务