PersonaLedger
收藏资源简介:
PersonaLedger是由第一资本联合多家机构构建的大规模金融交易模拟数据集,包含23,000名用户生成的3000万条交易记录,平均每用户覆盖两年活动周期。数据集通过结合大语言模型生成能力和规则引擎约束,实现了行为多样性与财务逻辑严谨性的统一,包含丰富的人物画像、商户类型和时间特征。该数据集支持流动性风险分类和身份盗用检测等金融AI任务,为隐私敏感的金融研究提供了合规的基准资源。
PersonaLedger is a large-scale financial transaction simulation dataset developed by Capital One in collaboration with multiple institutions. It comprises 30 million transaction records generated by 23,000 users, with an average activity cycle of two years per user. By integrating the generative capabilities of Large Language Models (LLMs) and the constraints of rule engines, this dataset achieves a balance between behavioral diversity and strict financial logic, and contains rich user personas, merchant categories and temporal features. It supports financial AI tasks such as liquidity risk classification and identity theft detection, providing compliant benchmark resources for privacy-sensitive financial research.
PersonaLedger 数据集概述
数据集基本信息
- 数据集名称: PersonaLedger
- 发布机构: Capital One Research 等机构的研究人员
- 许可证: CC-BY-4.0
- 数据规模: 包含3000万条合成的金融交易记录
核心特征
- 采用角色驱动的大型语言模型生成数据,以确保行为多样性。
- 使用程序化引擎来强制保证会计正确性。
基准测试套件
任务定义
-
偿付能力预测
- 任务类型: 序列分类(用户级别)。
- 目标: 给定n个月的交易历史,预测用户是否会在近期内变得“缺乏流动性”。
- 偿付能力/流动性不足定义: 指在特定时刻,用户的信用卡余额超过其可用现金流和信用额度的状态。
-
身份盗窃检测
- 任务类型: 分割(事件级别)。
- 目标: 在用户的合法交易历史中识别隐藏的欺诈性交易。
- 数据构成: 数据集中将来自次要用户(盗窃者)的一天的、按时间顺序排列的交易记录注入到主要用户的历史记录中。
数据集结构
数据集包含以下目录和文件:
identity_theft_1months/: 身份盗窃检测数据(1个月周期),包含train.parquet和test.parquet文件。identity_theft_3months/: 身份盗窃检测数据(3个月周期),包含train.parquet和test.parquet文件。insolvency_prediction_1months/: 偿付能力预测数据(1个月周期),包含train.parquet、test.parquet和labels.json文件。insolvency_prediction_3months/: 偿付能力预测数据(3个月周期),包含train.parquet、test.parquet和labels.json文件。raw_generation/: 原始生成数据,包含insolvent/(偿付能力不足实体样本)和normal/(正常实体样本)子目录。
数据生成与基准测试说明
raw_generation/目录中的是由大型语言模型生成的原始交易记录。通过对这些生成数据进行后处理,生成了其余四个目录的数据。- 如需使用此数据集对流行的时间序列Transformer模型进行基准测试(如论文中表2和表3所示),请参考相关代码。




