遇见数据集

Comprehensive U.S. Company Dataset for Financial Statement Fraud Detection

收藏
arXiv2026-07-22 更新2026-07-23 收录
官方服务:

资源简介:

该数据集是由Forvis Mazars与法国学术机构联合构建的综合性美国公司财务欺诈检测基准,整合了结构化财务数据与文本信息。数据集包含10,159条公司季度记录,涵盖2009-2024年期间13,332家公司的财务指标、经大语言模型提炼的管理层讨论与分析摘要文本,并通过人工审核方式关联了美国证监会发布的会计审计执行公告欺诈标签。其构建过程采用自动化提取与专家验证相结合的双阶段流程,确保标签的时序准确性。该数据集专为支撑公司隔离式财务欺诈检测任务而设计,旨在解决传统随机划分方法导致的泛化能力高估问题,推动金融风控领域模型评估范式的革新。

This dataset is a comprehensive U.S. corporate financial fraud detection benchmark jointly constructed by Forvis Mazars and French academic institutions, integrating structured financial data and textual information. It contains 10,159 quarterly corporate records, covering financial metrics of 13,332 firms across the 2009–2024 period, alongside executive discussion and analysis (MD&A) abstracts refined by large language models (LLMs). Fraud labels from the U.S. Securities and Exchange Commission’s (SEC) Accounting and Auditing Enforcement Releases (AAERs) are linked to these records via manual review. Its construction follows a two-stage workflow combining automated data extraction and expert validation, ensuring the temporal accuracy of the fraud labels. Specifically designed to support isolated corporate financial fraud detection tasks, this dataset aims to address the problem of overestimated generalization performance caused by traditional random data partitioning methods, and to drive the innovation of model evaluation paradigms in the financial risk management domain.

创建时间:
2026-07-22
原始信息汇总

数据集概述

该数据集用于金融报表欺诈检测研究,来源于论文《Read Between the Lines: A Robust Financial Statement Fraud Detection Framework》。

数据集内容

  • 17,863 份 经提炼的季度管理层讨论与分析(MD&A)报告(使用自托管 QWEN3 32B 模型生成)
  • 3,300 份 AAER 报告(会计与审计执法公告)
  • 269,097 份 季度财务报告
  • 最终可直接使用的预处理数据集,包含三种不同的划分策略:
    • 随机划分(Random Splitting)
    • 公司隔离划分(Company-isolated Splitting):论文指出该设置是金融报表欺诈检测任务中更严格的框架
    • 时间划分(Time Splitting)

每个数据集包含 5 折(folds),每折均提供 train.csvtest.csv 文件。

数据集获取

  • 预处理数据集:可从 Hugging Face 下载:https://huggingface.co/datasets/WaguyMZ/Financial_statements_fraud_dataset/tree/main
  • 完整原始数据集:需通过联系邮箱 guywaffo@gmail.com 获取

数据命名约定

  • v4:公司隔离划分的数据集
  • v5:随机划分的数据集
  • v6:时间划分的数据集
搜集汇总
数据集介绍
Comprehensive U.S. Company Dataset for Financial Statement Fraud Detection 数据集图片
构建方式
在财务报表舞弊检测领域,现有方法常因随机数据划分导致过乐观的性能评估,难以反映真实泛化能力。为应对这一挑战,本研究基于SEC的AAER违规公告,采用两阶段高保真流程构建标签:首先利用Qwen3 32B模型从3,300份AAER法律文档中自动提取舞弊公司、涉事季度及12种细粒度误述类型,再由人工专家逐一核验。结构化财务数据通过US-GAAP分类体系从2009-2024年季度报告提取,并工程化得到122个指标;非结构化MD&A文本经Qwen3 32B摘要压缩为平均3,800 tokens的SMD&A数据集。最终通过公司标识与季度对齐合并,并对非舞弊样本进行行业与时间分布保持的分层降采样,形成包含10,159条样本(511例舞弊)的最终数据集。
特点
该数据集的核心创新在于其公司隔离(CI-FSFD)评估范式,强制要求模型在完全未见过的公司上进行舞弊检测,杜绝了传统随机划分中因公司身份泄露导致的性能虚高。数据集深度融合了结构化财务指标与经摘要处理的非结构化MD&A文本,其中文本数据经专门提示工程优化,聚焦事实性财务异常而非语言风格变化。标签来源采用自动化提取与人工审计相结合的双重验证机制,确保了1,451个公司-季度舞弊标签的绝对准确。此外,数据集保留了12种细粒度误述类型标签(如收入操纵、资产估值等),为多标签分类研究提供基础,同时维持了5%的真实舞弊比例,模拟了金融领域固有的极端类别不平衡特性。
使用方法
数据集支持三类输入配置:纯财务指标(122维FIN)、纯摘要文本(SMD&A)及两者拼接(FIN+SMD&A)。模型微调时采用4-bit量化加载基座模型与LoRA参数高效微调,提示词设计为结构化的二分类任务,要求输出'YES'或'NO'。建议使用Fino1-8B等金融领域专用大语言模型在SMD&A模态上进行微调,其在CI-FSFD任务中达到0.74 AUC的最优性能。评估时应采用5折公司隔离交叉验证,每折确保同一公司的所有数据仅出现在训练集或测试集,并维持行业分布与5%舞弊比例。对于经典随机划分场景,数据集同样支持基础的舞弊检测基准测试,但需警惕其性能高估风险。
背景与挑战
背景概述
财务报表舞弊检测是维护资本市场诚信的核心议题,然而传统方法在应对日益复杂的欺诈手段时,往往因忽视非结构化文本数据的价值而表现欠佳。该数据集由Guy Stephane Waffo Dzuyo等人于2026年创建,分别来自Forvis Mazars、LORIA及巴黎北大学等机构,旨在解决现有评估框架因随机数据划分而高估模型泛化能力的根本缺陷。研究者提出了一种新颖的公司隔离式财务报表舞弊检测(CI-FSFD)任务,并构建了涵盖结构性财务指标、管理层讨论与分析摘要文本以及SEC处罚公告衍生标签的综合数据集。这一开源资源为发展更可靠、更具泛化能力的欺诈检测系统奠定了重要基准,对推动该领域的研究范式革新具有深远影响。
当前挑战
该数据集所应对的核心挑战在于,传统的随机数据分割方法使模型在训练时能够学习公司特异性模式,导致在面向全新公司时泛化能力急剧下降,实验表明传统评估下的AUC高达0.96,而在公司隔离场景下却骤降至0.74。数据集构建过程中亦面临严峻困难:舞弊标签严重失衡,原始数据中欺诈样本仅占约0.03%;SEC处罚公告缺乏直接的违规财年信息,需设计两阶段流水线——先由大语言模型自动提取可疑时间点,再经人工逐条校验以保障标签的绝对准确;此外,长达数万token的原始MD&A文本处理困难,不得不采用大模型摘要技术将其压缩至可管理长度,在这一过程中可能丢失微妙的语言风格异常信号。
常用场景
经典使用场景
在财务报表舞弊检测这一极具挑战性的领域,该数据集的经典使用场景在于提供一个融合结构化财务指标与非结构化管理层讨论与分析(MD&A)文本的多模态基准。研究者可借此训练与评估各类模型,包括传统的逻辑回归、随机森林以及前沿的大语言模型,以实现对财务欺诈的二元分类。尤为重要的是,该数据集支持一种新颖的评估范式——公司隔离的财务报表舞弊检测(CI-FSFD),要求模型在从未见过的公司数据上进行泛化,从而更真实地模拟实际部署场景中的模型表现。这一设计突破了传统随机划分可能带来的数据泄漏与乐观偏差,为欺诈检测模型的鲁棒性评估设立了更高标准。
解决学术问题
该数据集系统性地回应了现有研究中的两个核心挑战:其一,传统随机数据划分导致模型性能被过度乐观估计,无法反映对未见面公司或未来时间段的真实泛化能力;其二,财务报告中丰富的文本信息未能被有效挖掘。通过引入公司隔离评估任务,该数据集迫使学术研究从记忆公司特定模式转向学习跨公司通用的欺诈信号。同时,它通过整合经大语言模型精炼的MD&A摘要,揭示了文本模态在提升检测分辨率中的关键作用。这一贡献对于推动金融欺诈检测领域从方法论瑕疵走向严谨评估具有里程碑式的意义,促使学界重新审视模型评价的底层逻辑。
衍生相关工作
围绕该数据集的构建与新评估范式,衍生了一系列重要的后续工作。首先是提出了公司隔离的财务报表舞弊检测(CI-FSFD)这一全新基准任务,它推动了更真实的泛化能力评估,促使后续研究开发更鲁棒的跨实体欺诈检测模型。其次是探索了大语言模型在结构性财务数据与自由文本间的最佳融合策略,发现简单的序列化拼接可能造成噪声干扰,进而催生了诸如非线性跨模态门控架构等创新融合方法。此外,通过零样本实验证实了预训练大语言模型无法直接胜任欺诈检测,推动了面向金融领域的专项微调技术发展,并为多标签细粒度欺诈分类提供了新的研究切入点。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务