遇见数据集

VynFi/vynfi-journal-entries-1m

收藏
Hugging Face2026-05-27 更新2026-04-26 收录
官方服务:

资源简介:

VynFi Journal Entries — 1M (v2, v5.29 SOTA模式) 是一个合成总账(GL)数据集,专为会计和欺诈检测研究设计。该数据集包含100万行日记账条目,基于10家公司×12个月×10万行的多货币框架生成。它是v1版本的升级版,采用了SOTA-N结构保真度改进和集中浓度抽象(ConcentrationPipeline),在13个结构指标上更接近参考基线,行为保真度(基于Sajja 2026 P1-P4框架)的波动校正综合指标相比v1提升了43%。数据集用于表格分类、表格回归等任务,具有合成、会计、审计、SAP、金融和基准等标签,适用于机器学习训练和探索。

VynFi Journal Entries — 1M (v2, v5.29 SOTA mode) is a synthetic general ledger (GL) dataset designed for accounting and fraud detection research. It contains 1 million journal entry lines, generated from a 10-company × 12-month × hundred_k multi-currency scaffold. This release replaces v1 (v5.27) with SOTA-N structural-fidelity improvements and the central concentration abstraction (ConcentrationPipeline). 13 measured structural metrics moved toward the reference baseline, and behavioral fidelity (Sajja 2026 P1-P4 framework) improved by 43% in the vol-corrected composite compared to v1. The dataset is used for tabular classification, tabular regression, and other tasks, with tags including synthetic, accounting, fraud detection, audit, SAP, financial, and benchmark, suitable for machine learning training and exploration.

提供机构:
VynFi
搜集汇总
数据集介绍
VynFi/vynfi-journal-entries-1m 数据集图片
构建方式
该数据集依托规则驱动与过程模拟相结合的生成框架,在十家公司、十二个月的多币种会计科目表基础上构建。通过引入集中度后处理管道,并集成行为杠杆模块,显著提升了结构保真度:账户行集中度、循环原型占比及冲销代理等指标均向参考基线靠拢。生成过程采用确定性种子(20260524),以SAP总账语义为蓝本,产出包含多币种行、分配行及贸易伙伴维度的百万行级日记账分录,每行金额中位数校准至约九千二百美元,符合Benford定律分布。
特点
数据集涵盖五十二个字段,逾一百零九万行日记账分录,核心特点在于结构层面与行为层面的双重高保真。结构上,前十账户行份额达零点九四六,循环原型占比零点八八五,多币种行与空白源占比均贴近真实总账特征。行为层面,在Sajja(2026)P1-P4框架下,经体积校正的复合退化比率为六十二点七倍,较前一版本改善百分之四十三,其中P3聚类间隙与P4均值间隙等指标均有显著优化。此外,数据集附有科目表、分录网络及试算平衡表等辅助文件,便于网络分析与审计追踪。
使用方法
用户可通过Hugging Face数据集库直接加载,调用load_dataset函数获取训练集,并访问五十二个字段与百万行数据。该数据集适用于表格分类、回归及欺诈检测等任务,尤其适合在笔记本电脑规模下进行探索性分析与模型原型验证。若需更大规模训练,可选用同系列的一千万行伴侣数据集。辅助文件如je_network.parquet支持构建分录网络图,trial_balances.parquet可用于试算平衡校验。生成配置与行为评分脚本均提供完整复现路径,确保研究可重复性。
背景与挑战
背景概述
在审计与反欺诈领域,高质量、带标注的真实总账数据长期稀缺,制约着机器学习模型的训练与评估。2026年,Michael Ivertowski与DataSynth贡献者发布VynFi Journal Entries 1M数据集,旨在以合成方式复现跨行业制造业总账的结构与行为特征。该数据集基于多公司、多币种、十二个月的凭证脚手架,通过规则、过程与后处理管道生成近百万条日记账分录,并首次引入集中度抽象以弥合多生成器覆盖问题。其核心研究问题在于:合成表格生成器能否在保留统计结构的同时,复现真实欺诈检测所依赖的行为模式。该数据集为会计、审计与欺诈检测社区提供了可复现的基准,推动了行为保真度评估框架的发展。
当前挑战
该数据集所解决的领域问题在于总账分录的表格分类与回归,尤其在欺诈检测与审计场景中,模型需从高维、多币种、含分配行的复杂结构中识别异常。其构建过程面临多重挑战:合成数据须在账户集中度、重复原型占比、逆向代理、流图熵等结构指标上逼近参考基线,同时保持行为模式的真实性;行为保真度评估框架P1-P4要求生成器维持事件时间分布、突发结构、共享基础设施图模体与速度规则触发率,而独立行采样范式无法满足此类要求;此外,单参考分片噪声底导致部分行为指标方差显著,如P1自相关变异系数高达103%,使得复合分数呈现较大波动,未来需多分片联合评分以提升稳健性。
常用场景
经典使用场景
在会计信息系统与审计分析领域,日记账分录数据构成了企业财务活动的底层记录。VynFi日记账分录百万级数据集最经典的使用场景在于为机器学习模型提供结构保真度与行为保真度兼备的合成总账语料,用以训练和评估异常检测、舞弊识别及审计风险评估算法。该数据集涵盖一百零九万余条分录行,覆盖十家公司十二个月的跨币种业务,并以SAP风格的多维凭证结构(包括业务单元、贸易伙伴、分配行等)模拟真实总账的复杂关联,使研究者得以在无需接触敏感真实财务数据的前提下,开展可复现的表格分类、回归及图网络分析实验。
衍生相关工作
围绕该数据集已衍生出若干经典工作方向。其十万级同构伴侣数据集vynfi-journal-entries-10m为研究规模扩展对行为保真度的影响提供了对照样本,揭示了大样本下综合退化比的收敛特性。Sajja于二〇二六年提出的P1至P4行为保真框架构成该数据集评估的方法论基石,其关于行独立生成器无法复现图模体与正自相关的命题在此得到实证检验与拓展。此外,多种子方差分析工作系统揭示了单分片噪声底导致的评估不稳定性,推动后续版本采用均值与标准差并报的规范化报告范式。这些衍生研究共同构筑了合成总账数据质量评估从单一结构指标走向结构行为双轨并重的学术脉络。
数据集最近研究
最新研究方向
在合成财务总账数据生成领域,如何提升生成数据的行为保真度与结构真实性已成为当前前沿研究的核心关切。VynFi Journal Entries 1M数据集的最新迭代(v5.29 SOTA模式)正是为回应这一挑战而设计,其研究动向聚焦于弥合生成数据与真实企业资源计划(ERP)系统(如SAP)中日记账分录数据之间的行为分布鸿沟。该数据集引入了Sajja(2026)提出的P1-P4行为保真度评估框架,系统性地量化生成样本在事件时间分布、突发结构、共享基础设施图模体以及速度规则触发率等维度的偏差,并通过中心化后处理管道与多杠杆结构保真策略,使体量校正后的综合退化比率较前版显著下降43%。这一工作不仅为欺诈检测、审计抽样与会计异常识别等下游任务提供了更具行为真实性的基准数据,也推动了表格生成模型从独立行采样向行感知、过程驱动的多实体状态机范式演进,对金融合成数据生态的评估标准与生成方法论均具有深远影响。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务