遇见数据集

uk-company-financial-extraction

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

UK Company Financial Extraction Dataset 是一个从英国公司注册处(Companies House)公开的 PDF 年度账目文件中,利用 Qwen2.5-VL-72B-Instruct 视觉语言模型提取并结构化财务数据的数据集。该数据集旨在为金融分析、公司风险评分、表格问答和文档问答等任务提供高质量的财务信息。数据集核心内容包含公司申报级别的资产负债表、损益表数据以及一系列计算得出的衍生财务信号,具体包含 124,273 条申报记录,覆盖 43,789 家独特的英国公司,其中 11,731 家公司拥有多个时期的申报数据。每条记录包含从 PDF 中直接提取的字段(如公司编号、总资产、营业额等)和衍生信号(如流动性指标、杠杆指标、风险评分等),并提供了平衡表恒等式检查和质量标志。根据评估,字段级提取准确率为 86.6%,文档级准确率为 56.9%,平衡表恒等式通过率为 97.7%。数据在 Open Government Licence v3.0 许可下提供。

UK Company Financial Extraction Dataset is a dataset that extracts and structures financial data from publicly available PDF annual account files of the UK Companies House using the Qwen2.5-VL-72B-Instruct vision-language model. It aims to provide high-quality financial information for tasks such as financial analysis, company risk scoring, table question answering, and document question answering. The core content includes company filing-level balance sheet and profit and loss statement data, along with a series of calculated derivative financial signals, specifically containing 124,273 filing records covering 43,789 unique UK companies, with 11,731 companies having multiple period filing data. Each record includes fields directly extracted from PDFs (such as company number, total assets, turnover, etc.) and derivative signals (such as liquidity indicators, leverage indicators, risk scores, etc.), and provides balance sheet identity checks and quality flags. According to evaluations, the field-level extraction accuracy is 86.6%, document-level accuracy is 56.9%, and balance sheet identity pass rate is 97.7%. The data is provided under the Open Government Licence v3.0.

创建时间:
2026-06-21
原始信息汇总

数据集概述

数据集名称:UK Company Financial Extraction Dataset
数据集地址:https://huggingface.co/datasets/devladpopov/uk-company-financial-extraction

语言:英语
任务类别:表格问答、文档问答
标签:金融、公司注册、英国公司、视觉语言模型、财务提取、资产负债表、风险评分

许可协议:开放政府许可证 v3.0(OGL-UK-3.0)


数据集描述

该数据集包含从英国公司注册处(Companies House)PDF年度账目中提取的结构化财务数据。提取过程使用了Qwen2.5-VL-72B-Instruct视觉语言模型,运行于NVIDIA GH200 Grace Hopper节点(Isambard-AI Phase 2, BriCS)。

数据来源

所有输入PDF均来自公司注册处,在开放政府许可证v3.0下公开可用,不包含专有或个人数据。


提取流程

  • 模型:Qwen2.5-VL-72B-Instruct(bfloat16,2×GH200 GPU张量并行)
  • 流程:v4.5c单次多层级提取
  • 准确率
    • 150文档开发集:字段级88.8%
    • 2,656文档保留集:字段级86.6%,文档级56.9%
  • 一致性:资产负债表恒等式通过率97.3%

文件内容

文件 记录数 说明
filing_signals.jsonl 124,273 每份申报的提取字段及衍生信号
company_signals.jsonl 43,789 每家公司的汇总及轨迹标签
inference_predictions_merged.jsonl 124,273 原始预测结果(信号输入)
schema.json 1 字段定义与类型

数据模式(filing_signals.jsonl)

提取字段(来自PDF):

  • company_numberfiling_datepdf_path
  • total_assetsnet_assetscurrent_assetscurrent_liabilities
  • cashdebtorsstockstangible_assetsintangible_assets
  • investmentsshare_capitalturnoveroperating_profit
  • profit_before_taxprofit_after_taxemployees

衍生信号(计算所得):

  • 流动性:current_ratioquick_ratiocash_ratioworking_capital
  • 杠杆:debt_to_equitygearing
  • 偿付能力:negative_net_assetsnegative_working_capitalinsolvency_proxy
  • 盈利能力:operating_marginpretax_marginnet_margin
  • 规模:size_class(micro/small/medium/large)
  • 质量:bs_identity_ok(资产负债表恒等式校验)
  • 综合:risk_score(0-100)、risk_band(clean/low/medium/high)

关键统计

  • 总申报数:124,273
  • 涵盖公司数:43,789
  • 多期公司数:11,731(占26.8%,至少有2份申报)

风险分布

风险等级 占比
clean 49.7%
low 8.8%
medium 15.7%
high 25.8%

多期轨迹(占多期公司比例):

轨迹 占比
stable 46.6%
improving 31.3%
deteriorating 20.1%

资产负债表恒等式通过率:97.7%

字段级准确率(2,656文档保留集)

  • cash 95.7%、current_assets 92.6%、share_capital 91.8%、turnover 91.5%
  • operating_profit 90.1%、tangible_assets 88.8%、debtors 88.2%
  • total_assets 87.8%、employees 84.9%、profit_before_tax 83.2%
  • net_assets 80.7%、intangible_assets 64.3%、profit_after_tax 49.4%
  • 总体:86.6%

版本历史

  • v3(2026年7月):124,273份申报。新增约53,500份历史申报,多期覆盖率从8.7%提升至26.8%
  • v2(2026年6月):70,722份申报,43,789家公司
  • v1(2026年6月):49,625份申报
搜集汇总
数据集介绍
uk-company-financial-extraction 数据集图片
构建方式
本数据集源自英国公司注册署(Companies House)公开的PDF年度账目文件,利用先进的视觉语言模型Qwen2.5-VL-72B-Instruct在NVIDIA GH200 Grace Hopper超级芯片节点(Isambard-AI Phase 2集群)上执行自动化信息抽取。抽取管线采用单次通过、多层次的架构,依次执行文档分类、字段提取、数据验证、衍生指标计算与自我修正步骤,最终以88.8%的字段级准确率完成对124,273份申报文件的处理,并汇总得到43,789家英国公司的结构化财务数据。
使用方法
数据集以JSON Lines格式提供,包含三个核心文件:filing_signals.jsonl(每份申报的原始字段与衍生信号)、company_signals.jsonl(每家公司汇总及轨迹标签)以及inference_predictions_merged.jsonl(原始模型预测)。用户可直接读取文件进行财务分析、风险评估或训练下游模型。数据集遵循开放政府许可v3.0,适用于学术研究、金融建模与商业智能场景,尤其适合用于表格式问答和文档理解任务的模型评估与微调。
背景与挑战
背景概述
在金融科技与会计信息化的交汇领域,结构化财务数据的自动抽取对于企业信用评估、风险建模及监管分析具有根本性意义。传统的财务数据获取往往依赖人工录入或XBRL格式披露,然而大量中小型企业仍以PDF形式提交年度账目,导致非结构化文档中的财务信息难以被高效利用。针对这一痛点,由Vladislav Popov主导、依托Isambard-AI Phase 2超级计算设施于2026年创建的UK Company Financial Extraction Dataset应运而生。该数据集利用Qwen2.5-VL-72B视觉语言模型,从英国Companies House公开的PDF年报中提取了逾12万份会计档案,涵盖资产负债表、损益表及衍生财务信号,覆盖超过4.3万家企业。其推出版本历经迭代,从v1的49,625条记录扩展至v3的124,273条记录,并纳入跨周期追踪能力,为金融文档理解与表格问答任务提供了高规模、高覆盖的基准资源。
当前挑战
该数据集的核心挑战首先在于领域问题层面:非结构化PDF年报中表格布局多样、字段标注缺失、数字格式不一,且存在跨页断表等复杂情况,对模型的结构化识别能力提出了严苛要求。传统OCR与规则方法在此场景下准确率低下,亟需视觉语言模型在字符级定位与语义理解间达成平衡。其次,构建过程中面临三方面显著挑战:其一,模型选择与管线设计,通过对比Qwen3-VL系列与Qwen2.5-VL-72B的朴素提示与多阶段抽取管线(分类-提取-验证-推导-自校正),发现后者虽单项准确率非最优,但管线集成后以86.6%的字段准确率与56.9%的文档准确率大幅领先朴素方法;其二,计算资源瓶颈,单次抽取需在2×GH200 GPU上以张量并行运行72B参数模型,且Qwen3-VL-32B在管线内速度慢20–30倍;其三,财务一致性校验,必须维持资产负债表恒等式(资产=负债+权益)通过率达97.3%,确保提取结果符合会计逻辑,避免因模型幻觉导致的财务信号失真。
常用场景
经典使用场景
在金融科技与会计信息处理领域,UK Company Financial Extraction Dataset 被广泛用作从非结构化的PDF年度账目中提取结构化财务指标的标准基准。研究人员利用该数据集训练和评估视觉语言模型在表格问答与文档问答任务上的表现,尤其侧重于资产负债表、损益表等核心财务报告的字段级精准抽取。其高达124,273份申报记录的规模与包含流动性、杠杆率、偿付能力等衍生信号的结构化设计,使得模型能够在多期财务报表间进行连贯的财务健康追踪与风险评估,成为检验多模态大模型在复杂文档理解与结构化抽取能力上的关键测试平台。
解决学术问题
该数据集解决了学术研究中长期存在的非结构化金融文档自动结构化难题,尤其针对英国公司注册处(Companies House)PDF年报中表格数据的细粒度抽取问题。传统方法依赖OCR与规则引擎,在版面多样性与字段歧义性上表现欠佳,而该数据集通过提供大规模、高质量的字段级标注与衍生的财务信号(如insolvency_proxy、risk_score),推动了基于视觉语言模型的零样本或少样本抽取范式发展。其高达97.3%的资产负债表恒等检验通过率与86.6%的字段级准确率,为评估抽取模型在真实金融场景下的稳健性提供了可靠基准,显著降低了中小微企业财务分析的数据获取门槛与成本。
实际应用
在实际金融业务中,该数据集被广泛应用于企业信贷风险评分、供应链金融尽职调查以及投资组合的财务健康监测。例如,银行与金融科技公司可以利用其中包含的43,789家英国公司的多期财务轨迹数据,构建动态的风险预警系统,识别出那些资产负债表持续恶化(如deteriorating轨迹占20.1%)或陷入技术性破产(基于negative_net_assets信号)的高风险企业。此外,审计机构与财务分析师借助该数据集衍生的流动性比率(current_ratio、quick_ratio)与杠杆指标(debt_to_equity),能够快速批量筛选出符合特定财务标准的企业样本,大幅提升年报审查与合规分析的自动化水平。
数据集最近研究
最新研究方向
该数据集聚焦于利用视觉语言模型从英国公司年度账目PDF中自动化提取结构化财务信号,代表了金融文档智能解析与公司风险量化评估的前沿方向。其核心创新在于构建了多阶段提取管线(分类-提取-验证-推导-自纠错),在124,273份档案上实现了86.6%的字段级准确率与97.7%的资产负债表恒等校验通过率,并衍生出涵盖流动性、杠杆、偿付能力及盈利能力的复合风险评分体系。研究紧密关联AI辅助金融监管、中小企业信用评估自动化及可解释财务预警等热点事件,其多周期轨迹分析(26.8%企业拥有2份以上档案)为动态风险建模提供了高质量基准,推动了文档级结构化金融知识图谱的规模化构建。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务