遇见数据集

filedfact-passages

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

FiledFact-Passages 是一个用于从美国证券交易委员会(SEC)财务报告中提取结构化事实的数据集。它专注于“段落完整、片段定位”的提取任务,旨在为金融自然语言处理和信息抽取提供高质量的标注数据。数据集包含 5,698 个经过清理的 SEC 文件段落,涵盖财务报表、附注和管理层讨论与分析(MD&A)等内容。在这些段落中,共标注了 101,899 个“目标事实”,这些事实是文件中以数字形式可视化呈现的 XBRL(可扩展商业报告语言)事实。每个目标事实都通过精确的字符偏移量(text_start, text_end)定位在段落文本中,并附有完整的元数据,包括:XBRL 概念(concept)、经过标准化和单位换算后的完整数值(value)、报告期间(period)、单位(unit)、以及维度信息(dimensions,如业务部门、地区等)。此外,每个事实还包含一个证据链接(evidence_url),可直接在原始 SEC 文件中定位到该数字。除了目标事实,数据集还对段落中所有其他数字片段进行了标注,包括年份、日期、引用、文本中的百分比以及未标记的金额等,这些被归类为“非目标数字片段”(non_target_spans)。数据集的构建确保了每个可见的数字标记都被明确分配到上述两类之一。数据集按公司进行了划分,包含 4,922 个训练段落(来自 4,113 家公司)和 776 个验证段落(来自 765 家公司),总计涉及 4,878 家不同的公司。数据以嵌套结构存储,每个数据行代表一个完整的段落及其所有标注。该数据集适用于训练和评估从财务文本中进行细粒度信息抽取、实体链接、表格理解和事实核实的模型。

FiledFact-Passages is a dataset designed for extracting structured facts from U.S. Securities and Exchange Commission (SEC) financial reports. It focuses on the extraction task of paragraph-complete, span-localization, aiming to provide high-quality annotated data for financial natural language processing and information extraction. The dataset includes 5,698 cleaned SEC document paragraphs, covering financial statements, footnotes, and Managements Discussion and Analysis (MD&A) sections. Within these paragraphs, a total of 101,899 target facts are annotated, which are XBRL (eXtensible Business Reporting Language) facts visually presented as numbers in the documents. Each target fact is localized in the paragraph text with precise character offsets (text_start, text_end) and accompanied by comprehensive metadata, including: XBRL concept, fully standardized and unit-converted numerical value (value), reporting period (period), unit (unit), and dimension information (dimensions, such as business segments, regions, etc.). Additionally, each fact includes an evidence link (evidence_url) that directly locates the number in the original SEC file. Beyond target facts, the dataset also annotates all other numerical spans in the paragraphs, such as years, dates, references, percentages in text, and unlabeled amounts, categorized as non-target numerical spans (non_target_spans). The dataset construction ensures that every visible numerical token is explicitly assigned to one of these two categories. The dataset is partitioned by company, comprising 4,922 training paragraphs (from 4,113 companies) and 776 validation paragraphs (from 765 companies), involving a total of 4,878 distinct companies. Data is stored in a nested structure, with each data row representing a complete paragraph and all its annotations. This dataset is suitable for training and evaluating models for fine-grained information extraction, entity linking, table understanding, and fact verification from financial texts.

创建时间:
2026-07-12
原始信息汇总

数据集概述:FiledFact-Passages

FiledFact-Passages 是一个面向金融领域的英文数据集,专为从美国证券交易委员会(SEC)EDGAR系统提交的XBRL格式文件中提取结构化财务事实而设计。该数据集提供了完整的文档段落级数据,每个财务事实都精确关联到原文中的具体字符位置(span grounding)。

核心数据规模

  • 总段落数: 5,698 条(涵盖财务报表表格、附注及管理层讨论与分析)
  • 覆盖公司: 4,878 家
  • 标注事实总数: 101,899 个(所有在文档中可见渲染的XBRL财务事实)
  • 非目标数字跨度: 50,658 个(包括年份、日期、引用、百分比及其他未标记数字)

数据划分

  • 训练集: 4,922 段落(87,539 个事实,来自 4,113 家公司)
  • 验证集: 776 段落(14,360 个事实,来自 765 家公司)
  • 特点: 训练集与验证集的公司不重叠

任务定义

输入: 一条财务文件段落(附带可选的上下文信息)。
输出: 段落中所有可见的XBRL金融事实(包括每个事实的概念、数值、单位、周期、维度以及精确的字符偏移量)。部分段落不包含任何目标事实,用于训练模型识别并返回空列表。

数据字段与结构

段落字段(Passage Fields)

字段 描述
chunk_id 稳定段落ID,作为扁平表连接键
cik, ticker, company_name, sic_code 发行实体身份信息
accession, form_type, filed_at 文件身份与提交时间
fiscal_year, fiscal_period 文件层面的会计期间
chunk_type, heading, pre_context 段落位置与邻近上下文
text 清洗后的段落文本(表格单位用竖线分隔)
source_url SEC文件链接
facts_count 目标事实数量
scale_cue_in_text, sample_stratum 展示与采样元数据
facts 嵌套的目标事实记录
non_target_spans 嵌套的非目标数字跨度记录

事实字段(Fact Fields)

字段 描述
fact_id 稳定事实ID
concept 带命名空间限定的XBRL概念
period 时间(instant:日期duration:开始..结束
value 保留精度并归一化后的完整单位数值
unit 单位类型(如 monetary:USD, per_share:USD, shares, pure
displayed_text 段落中展示的确切字符
text_start, text_end text中的半开字符偏移量
scale 展示时的10的幂次缩放
decimals, format 文件中的四舍五入与数字格式元数据
dimensions 维度范围(如业务分部、产品、地域)
evidence_url 定位到文件中对应数字的链接

非目标跨度字段: 每个记录包含 span_text, start, endclass

关键特性与标注策略

  • 段落完整性: 每个段落包含目标事实 (facts) 和非目标数字跨度 (non_target_spans),确保所有可见数字被分类。
  • 精确字符定位: text_starttext_end 确保每个事实可精确追溯到原文。
  • 值归一化: value 字段存储应用符号、缩放和数字格式后的归一化完整单位值。
  • 维度记录: dimensions 字段记录业务分部、产品、地域等维度范围。
  • 证据链接: evidence_url 可直接在SEC文件中打开对应数字位置。

数据来源与许可

  • 数据来源: 美国SEC EDGAR系统的XBRL财务文件(财务报表、附注、管理层讨论与分析)
  • 许可证: CC BY-NC 4.0(非商业用途)
  • 数据集版本: v1.2
  • 商业访问/定制数据: 联系 data@stockalloy.com

关联资源

  • 兄弟数据集: FiledFact-100K(每行一个接地事实)
  • 配套模型: FiledFact-Qwen3-8B(模型卡包含提取提示、输出格式、基准协议和结果)
搜集汇总
数据集介绍
filedfact-passages 数据集图片
构建方式
FiledFact-Passages数据集源自美国证券交易委员会(SEC)EDGAR系统中的XBRL财务报告,通过精准解析财务报表附注、管理层讨论与分析(MD&A)及表格段落构建而成。每一行数据对应一段经过清洁处理的原始文档片段,其中所有可视化呈现的XBRL数字事实均被标注至精确字符偏移位置,同时将年份、日期、参考文献、文本中的百分比及未标记的金额归类为非目标数值区间。数据集共收录5,698篇段落,涵盖4,878家上市公司,包含101,899个已标注事实与50,658个非目标数值区间,训练集与验证集在公司层面严格无重叠,确保跨公司泛化评估的公正性。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,调用`load_dataset("StockAlloy/filedfact-passages")`获取训练与验证分片。每一段落以嵌套结构存储其事实与目标区间,用户可利用`text_start`与`text_end`字符偏移量从段原文中截取对应文本以验证标注准确性。数据集支持多重任务范式,既可进行序列标注式的数字定位与分类,亦可训练生成式模型输出结构化的财务事实JSON记录。配套的FiledFact-Qwen3-8B模型虽基于本数据进行训练,但官方建议在独立测试集上评估模型泛化能力。
背景与挑战
背景概述
FiledFact-Passages数据集由StockAlloy Research于2026年创建,聚焦于金融领域的信息抽取任务,旨在从美国证券交易委员会(SEC)的EDGAR电子化归档系统中,精确提取XBRL格式的财务事实。该数据集包含5,698段SEC归档文本段落,涵盖101,899个标注的XBRL事实,每个事实均与其在原文中的字符位置精确对齐,并标注了概念、数值、期间、单位及维度信息。作为FiledFact-100K的配套数据集,它在细粒度金融信息提取领域具有重要影响力,为理解复杂结构化金融文档(如财务报表附注、管理层讨论与分析)提供了高质量的标注资源,推动了自然语言处理在金融合规与自动化分析中的应用边界。
当前挑战
该数据集面临的核心挑战之一在于处理财务文档中固有的歧义与复杂性:同一数值可能因上下文中的量纲提示(如“千元”单位)而代表不同真实值,需要模型在提取时融合远距离语义线索。此外,段落中约50,658个非目标数字(如年份、日期、百分比)与目标事实共存,且约5%的段落完全不包含目标事实,要求模型具备精确判别与空列表输出能力。在构建过程中,将XBRL标签与原始文本中离散、不规范呈现的数字(如带逗号格式)进行对齐,并处理多个XBRL事实共占同一文本位置的情况,构成了数据标注与校验的主要技术难点。
常用场景
经典使用场景
在金融自然语言处理领域,FiledFact-Passages数据集为从SEC EDGAR备案文件中精准提取结构化财务事实提供了高质量的语料库。该数据集包含5,698段经精细清洗的财务披露段落(涵盖财务报表、附注及管理层讨论与分析),每段文本中所有可视化呈现的XBRL财务事实均被标注至精确字符级偏移量,同时将年份、日期、引用及非目标数字区间标记为负样本。这种设计使得该数据集成为训练和评估段落级财务信息抽取系统的黄金标准,尤其适用于生成式模型在密集数字上下文中的结构化输出任务。
解决学术问题
该数据集核心解决的学术难题在于弥合非结构化文本与结构化XBRL语义之间的鸿沟。传统方法在处理财务报告时往往面临数值单位歧义、维度信息遗漏以及表格结构与自然语言交织的挑战。FiledFact-Passages通过提供完整的段落上下文、精确的字符跨度定位和归一化后的全量数值,使得研究者能够系统性地探索财务事实识别、跨度标注、维度推断及数值缩放解歧等关键问题。其价值在于为评估模型在真实金融报告中对复杂表格语义的理解能力设立了新的基准。
实际应用
在实际金融场景中,该数据集驱动的技术可深度赋能自动化财务分析管线。例如,投资机构的量化分析系统能够利用训练后的模型自动解析数千份季报中的分部门商誉、收入及资产数据,无需人工查阅原始PDF文件;审计与合规领域可借助此类工具快速验证XBRL标签与披露文本的一致性,提升监管报告的准确性。此外,财报智能搜索和财务数据集市构建也是落地方向,将非结构化的SEC文档转化为可查询的结构化知识库,从而加速金融决策支持系统的构建。
数据集最近研究
最新研究方向
该数据集聚焦于金融科技与自然语言处理的交叉前沿,精准服务于上市公司SEC财务报告的结构化信息抽取任务。FiledFact-Passages通过提供5,698篇涵盖财务报表附注、管理层讨论与分析等场景的完整段落,并精细标注每个XBRL财务事实在原文中的精确字符位置,为细粒度的数值文本对齐与跨模态表格理解提供了高保真度的训练与评估基准。这一资源有效回应了金融大语言模型在信息密度高、语境复杂的财经文本中表现欠佳的核心痛点,推动了从段落级事实检索到零样本财务数值抽取等前沿方向的研究。其与FiledFact-Qwen3-8B模型的协同发布,凸显了从高质量结构化标注到可部署系统的完整研究范式,在提升财务分析自动化、监管合规审查以及资本市场智能信息处理等热点领域具有显著的示范效应与实践价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务