遇见数据集

100x Private Credit Synthetic Dataset

收藏
github2026-09-10 更新2026-09-11 收录
官方服务:

资源简介:

一个包含755个工件、覆盖六个虚构借款人的合成数据集,用于测试信用监控工作流。

A synthetic dataset with 755 artifacts and covering six fictional borrowers, developed for testing credit monitoring workflows.

创建时间:
2026-09-08
原始信息汇总

100x Private Credit Synthetic Dataset

数据集概述

  • 包含六个虚构借款人文档文件夹,用于测试信用监控工作流。
  • 数据为合成数据,非真实借款人记录。公司、人员、交易、财务数值和事件均为虚构。
  • 该数据集为测试材料,不构成实际私人信贷表现证据或专业建议。
  • 包含六个借款人的755个制品(约8.7 MiB):财务工作簿、报告包、贷款文件和监控记录。
  • 可用于软件演示、测试、教育和研究,可配合或不配合Credit Monitoring插件使用。
  • 发布版本:v1.0.0,首个公开版本。

快速开始

  1. 通过 Code → Download ZIP 下载仓库并解压,或使用以下命令: sh git clone https://github.com/100xopensource/100x-credit-monitoring-synthetic-dataset.git

  2. 打开 dataset/Current Portfolio 并选择一个借款人。

  3. 在Credit Monitoring中,选择该借款人的文件夹作为只读源。选择一个数据集之外的结果文件夹。

text Downloaded repository ├── README.md ├── docs/ dataset card, methodology, limitations ├── meta/ catalog, artifact index, checksums └── dataset/ └── Current Portfolio/ ├── Asteron Care Partners/ ← select one borrower folder ├── Nemeris Field Systems/ ├── Orinth Vale Infrastructure/ ├── Selvara Industrial Services/ ├── Talvorn Technical Services/ └── Veyrona Decision Systems/

  • 不要将整个投资组合作为单个借款人选择。
  • 文件夹名称为实际下载结构的示例,非真实公司。
  • 文档密集的首次审查可能需要一小时或更长时间;这不是快速冒烟测试夹具。
  • 不提供精简下载。

首次发布下载

  • 首次发布在Releases页面提供 6-borrowers.zip
  • 包含相同的六个借款人文件夹以及检查所需的文档、许可证、元数据和验证工具。
  • 从版本 v1.0.0 选择 6-borrowers.zipSHA256SUMS.txt,或使用上述仓库下载。

场景

所有场景覆盖 Current Portfolio——贷后监控——而非潜在客户、承销或已还清贷款。“Current Portfolio”并不意味着每个借款人都表现无问题。

借款人 场景 制品数
Asteron Care Partners 医疗/护理服务;活跃重组/稳定修正 114
Nemeris Field Systems 用于公用事业和工业维护的现场服务设备 140
Orinth Vale Infrastructure 基础设施检查、施工支持、维修和维护 126
Selvara Industrial Services 工业服务;指定契约测试日期的有限豁免 127
Talvorn Technical Services 技术服务、维护计划和设备解决方案 140
Veyrona Decision Systems 决策智能和数据服务 108
总计 6个场景 755

格式:182 PDF、552 XLSX、2 PPTX、18 HTML 和 1 SpreadsheetML XLS.xls 是XML SpreadsheetML导出,不是重命名的XLSX。查阅每个借款人的文档以了解场景的详细状态和条款。

理解和验证数据

  • Dataset card:覆盖范围、单位、元数据和预期用途。
  • Methodology:合成来源及可复现内容。
  • Privacy和limitations:残余风险和边界。

Python 3.12或更高版本;无需第三方Python包:

sh python3 -B tools/validate_release.py python3 -B -m unittest discover -s tests -v

验证检查库存、校验和及指定的不安全内容模式。它证明财务正确性、隐私清除或适合真实贷款决策。保持下载的制品不变以实现可复现测试;将结果写入其他地方。

贡献和引用

  • 通过GitHub issues报告文档不一致或工具问题。包括版本、相对文件路径和预期与观察行为。
  • 切勿上传真实借款人文档、个人信息或凭证。
  • 使用CITATION.cff引用数据集;包括您使用的提交或发布校验和。
  • 维护为尽力而为,无承诺响应时间或更新时间表。

许可证

  • 仓库内容根据MIT License提供。
  • 预期用途和安全指导不是额外的许可证限制。
  • MIT不提供商标清除或专业建议。
  • 发布不是法律清除的证明;技术验证不建立此证明。
搜集汇总
数据集介绍
100x Private Credit Synthetic Dataset 数据集图片
构建方式
该数据集的构建以虚构的信贷监控场景为蓝本,通过合成生成方式模拟六家借款人的文档体系。每家借款人对应独立文件夹,内含财务报表、报告包、贷款文件及监控记录等工件,总计755项,涵盖PDF、XLSX、PPTX、HTML及SpreadsheetML XLS等多种格式。所有公司、人员、交易与财务数值均为人为编造,不涉及真实借款记录,旨在为信贷监控工作流测试提供可控且可复现的数据基础。
特点
数据集呈现多借款人、多格式与多场景的复合特征。六家虚构企业分别代表医疗护理、现场设备、基础设施、工业服务、技术维护及决策智能等领域,每家附有差异化信贷状态,如主动重组、有限豁免等。工件总量达755项,以XLSX和PDF为主,兼顾演示文稿与网页格式,支持从文档密集型审查到快速验证的多种测试需求。数据完全合成,不含真实隐私信息,附有校验和与验证工具,确保发布完整性。
使用方法
使用者可从代码仓库下载ZIP包或通过Git克隆获取数据,解压后进入数据集目录选择单一借款人文件夹作为只读源,并在外部指定独立结果文件夹以保持原始工件不变。配合信贷监控插件时,需将借款人文件夹设为监控输入,不可将整个投资组合作为单一借款人处理。验证环节依赖Python 3.12及以上环境,无需第三方包,可运行校验脚本检查清单、校验和及不安全内容模式。该数据集适用于软件演示、测试、教育及研究,但不得用于真实借贷决策。
背景与挑战
背景概述
私募信贷作为一种非公开市场融资方式,其贷后监控长期依赖人工审阅与经验判断,缺乏标准化、可复现的测试环境。100x Private Credit Synthetic Dataset 由 100x 开源社区于 2024 年首次发布(v1.0.0),包含六家虚构借款人的 755 份文档(约 8.7 MiB),涵盖财务工作簿、报告包、贷款合同及监控记录,旨在为信贷监控软件、测试、教学与研究提供合成语料。该数据集填补了私募信贷领域公开基准的空白,推动了监控流程的自动化与可验证性研究。
当前挑战
该数据集所应对的核心领域问题在于私募信贷贷后监控的自动化,即从多源异构文档中提取契约合规、财务健康与预警信号。其构建挑战在于:生成既符合行业逻辑又完全虚构的文档集合,需平衡真实性与隐私安全;确保跨借款人、跨文档类型(如 PDF、XLSX、PPTX)的语义一致性与可追溯性;同时避免任何真实借款人信息的残留。此外,文档密集型设计导致首次审阅耗时较长,且验证工具仅检查清单与校验和,无法保证财务正确性或适合真实信贷决策,这构成了使用中的固有局限。
常用场景
经典使用场景
在信贷监控工作流的研发与验证中,该数据集经典地充当端到端的仿真沙盘。研究人员与工程师将六个虚构借款人的文档文件夹作为只读源,模拟贷后监控场景,测试文档解析、财务数据提取、条款追踪与预警生成等核心功能。每个借款人的文件夹包含财务报表、报告包、贷款文件与监控记录,覆盖医疗、设备服务、基础设施、工业服务等多个行业,且嵌入了重组修正案、有限豁免等复杂条款,从而支持对信用监控系统在真实业务逻辑下的鲁棒性与准确性进行可重复的评估。
解决学术问题
该数据集直面信贷监控研究中长期存在的数据获取壁垒与隐私合规难题。真实借款人文档受限于保密协议与监管要求,难以公开用于学术基准测试,导致相关算法缺乏可比对、可复现的实验环境。本数据集以合成方式生成755份跨格式文档,并配套元数据、校验和与验证工具,使研究者能够在无隐私泄露风险的前提下,探究财务困境信号识别、契约条款合规性检查、多源异构文档一致性验证等基础问题。其发布为信贷风险分析、文档智能与金融科技交叉领域提供了可引用的基准资源,推动了可复现研究范式的建立。
衍生相关工作
该数据集的发布催生了一系列围绕信贷监控自动化的衍生工作。基于其六个借款人的多格式文档,研究者开发了面向金融文档的信息抽取模型、契约条款合规性检查工具以及多文档一致性验证框架。配套的Credit Monitoring插件亦成为相关开源生态的重要组成部分,支持对借款人文件夹的只读扫描与结果输出。这些工作进一步扩展至合成数据生成方法、文档级隐私保护技术以及贷后风险预警系统的设计与评估,为信贷科技领域提供了可复用的基准与工具链。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务