遇见数据集

filedfact-100k

收藏
Hugging Face2026-07-09 更新2026-07-10 收录
官方服务:

资源简介:

FiledFact-100K 是一个包含 100,000 对数据的样本集,旨在将 SEC(美国证券交易委员会)财务文件中 XBRL(可扩展商业报告语言)标注的结构化财务事实,与文件中实际显示这些事实的精确文本片段进行关联和验证。该数据集的核心特点是确保每个记录都满足文本跨度精确匹配(`text[text_start:text_end] == displayed_text`)和数值验证,并提供可直接在原始 SEC 文件中高亮定位到具体数字的证据链接(`evidence_url`)以及官方文件 URL(`source_url`),实现了事实级别的可追溯性。每个数据记录包含一个经过清理的 SEC 文件文本段落(源自财务报表表格、附注、管理层讨论与分析等),以及一个对应的财务事实。事实信息详细记录了 XBRL 概念、报告期间、数值、单位、解码后的维度段(例如业务部门、地理区域),以及在文本段落中定位显示值的精确字符起始和结束位置(`text_start`, `text_end`)。此外,数据还包含呈现层信息,如数值缩放比例(`scale`,用于处理“以千计”等表述)、文本中的符号表示(`sign_in_text`,如括号表示的负数)等。数据集规模为 100,000 条记录,每条记录对应一个已验证的、有据可查的独立事实。数据来源于 5,668 家不同的公司,涵盖 54,452 份 SEC 文件(如 10-K、10-Q、20-F 等),涉及 2016 至 2027 财年,并包含遵循 US GAAP 和 IFRS 准则的申报者。数据以 Parquet 格式提供,按公司不重叠的原则划分为训练集(94,084 条)和验证集(5,916 条)。该数据集专为支持金融自然语言处理和文档理解研究而设计,特别适用于以下任务:1) **跨度定位**:根据给定的文本和事实身份信息,在文本中定位显示该事实的确切字符串。2) **数值归一化**:根据上下文和显示的文本,预测标准化的数值、单位、缩放比例和符号。3) **XBRL 语义基础**:根据文本和显示值,预测其对应的 XBRL 概念、报告期间和维度信息。此外,它也适用于微调信息提取模型、进行可验证来源的检索增强生成评估、表格理解研究以及构建金融 NLP 基准测试。数据质量方面,所有记录均通过了数值验证。一项针对 1,000 对随机数据的独立审计显示,语义标签错误率(如错误的概念、期间、符号或缩放比例)上界约为 2%。数据集中还保留了极少数(约 0.01%)申报者自身的 XBRL 标记错误,以忠实反映原始文件情况。需要注意的是,此公开样本是用于演示和研究的子集,其抽样偏向于在文本中清晰、明确呈现的事实,并非每个文本段落都包含其所有事实的完整集合。

FiledFact-100K is a sample set containing 100,000 data pairs, designed to associate and validate structured financial facts annotated with XBRL (eXtensible Business Reporting Language) in SEC (U.S. Securities and Exchange Commission) financial documents with the exact text snippets in the documents that display these facts. The core feature of this dataset is ensuring that each record satisfies precise text span matching (`text[text_start:text_end] == displayed_text`) and numerical validation, providing evidence links (`evidence_url`) that allow direct highlighting of specific numbers in the original SEC files, as well as official document URLs (`source_url`), achieving fact-level traceability. Each data record includes a cleaned text paragraph from SEC documents (derived from financial statement tables, footnotes, management discussion and analysis, etc.) and a corresponding financial fact. Fact information details XBRL concepts, reporting periods, values, units, decoded dimension segments (e.g., business segments, geographic regions), and precise character start and end positions (`text_start`, `text_end`) for locating displayed values in the text paragraph. Additionally, the data includes presentation layer information, such as numerical scaling (`scale`, for handling expressions like in thousands), sign representation in text (`sign_in_text`, e.g., parentheses for negative numbers), etc. The dataset size is 100,000 records, each corresponding to a verified, well-documented independent fact. Data is sourced from 5,668 different companies, covering 54,452 SEC documents (e.g., 10-K, 10-Q, 20-F) from fiscal years 2016 to 2027, and includes filers following US GAAP and IFRS standards. Data is provided in Parquet format, divided into training (94,084 records) and validation (5,916 records) sets based on a non-overlapping company principle. The dataset is specifically designed to support financial natural language processing and document understanding research, particularly suitable for tasks such as: 1) **Span Localization**: Locating the exact string displaying a fact in text based on given text and fact identity information. 2) **Numerical Normalization**: Predicting standardized values, units, scaling, and signs based on context and displayed text. 3) **XBRL Semantic Grounding**: Predicting corresponding XBRL concepts, reporting periods, and dimension information based on text and displayed values. Furthermore, it is applicable for fine-tuning information extraction models, conducting verifiable source-based retrieval-augmented generation evaluation, table understanding research, and building financial NLP benchmarks. In terms of data quality, all records have passed numerical validation. An independent audit of 1,000 random data pairs shows an upper bound of approximately 2% for semantic label error rates (e.g., incorrect concepts, periods, signs, or scaling). The dataset also retains a very small number (about 0.01%) of XBRL tagging errors from the filers themselves to faithfully reflect the original document conditions. Note that this public sample is a subset for demonstration and research purposes, with sampling biased towards facts that are clearly and explicitly presented in the text, and not every text paragraph includes a complete set of all its facts.

创建时间:
2026-07-07
原始信息汇总

数据集概述

FiledFact-100K 是一个面向金融自然语言处理(NLP)的 span-grounded(跨度定位)和 value-verified(数值验证)数据集,包含 100,000 对将 XBRL(可扩展商业报告语言)财务事实与 SEC(美国证券交易委员会)文件中显示这些事实的确切字符位置相关联的记录。

核心特性

  • 精确跨度:每条记录都保证 text[text_start:text_end] == displayed_text 成立。
  • 验证数值:每个标签都经过与文件自身机器可读数据的交叉验证,并公布了测量的错误率。
  • 事实级出处:每条记录都包含 evidence_url(可以直接打开文件并滚动到相应数值高亮位置)和 source_url(sec.gov 上的官方文档链接)。
  • 呈现层标签:提供 scale(如“千”为单位)、sign_in_text(如括号表示负数)等字段。
  • 解码后的段维度:45% 的记录包含维度信息(如业务部门、地理区域、产品),并带有人工可读的轴/成员标签。
  • 包含扩展概念:16.9% 的记录包含公司特定的概念(ext-*),这些信息在大多数结构化金融数据集中被丢弃。

数据集规模与组成

  • 记录数:100,000 对(训练集 94,084,验证集 5,916)。
  • 公司数:5,668 家。
  • 文件数:54,452 份。
  • 时间跨度:财年 2016-2027。
  • 文件类型:涵盖 10-K/Q、20-F、40-F、6-K 及其修订版。
  • 会计准则:包含 US GAAP(美国通用会计准则)和 IFRS(国际财务报告准则,针对 20-F 文件)。
  • 货币:支持多种货币。

数据格式与模式

数据集采用 parquet 格式,包含 trainvalidation 两个拆分。每条记录是一个扁平的 JSON-like 结构,包含以下关键字段:

字段 类型 说明/覆盖率
id string 稳定的 pair ID
ticker / company_name string 99.4% / 99.99%
form_type / filed_at string/date 文件身份标识
source_url string 100% — sec.gov 官方文档链接
evidence_url string 100% — StockAlloy 解析器链接,可直接定位到数值
text string 清理后的文件段落(表格已线性化,用 `
pre_context string 段落前的可见文本(99.2%),通常包含表格标题和规模线索
concept / concept_label string XBRL 概念及其人工可读标签(100%)
period string 规范的报告期间格式
value / value_num string/double 事实的数值(保留精度)和方便分析的数值字段
unit / unit_class / currency string 单位信息
displayed_text / text_start / text_end string/int 在段落中显示的文本及其精确字符位置(100% 经过验证)
scale / sign_in_text int32/bool 显示值的缩放比例(99.8%)和符号是否在文本中显示为负数
dimensions / dims_count JSON/int 解码后的维度信息
confidence float 文本↔事实配对的置信度(0.75-0.99)

支持的任务

该数据集支持以下三个主要任务,针对每条事实进行建模:

  1. Span Grounding(跨度定位):给定 text 和事实身份(conceptperioddimensions),预测 displayed_texttext 中的起始位置 text_start 和结束位置 text_end
  2. Value Normalization(数值规范化):给定 pre_contexttextdisplayed_text,预测 value_numunitscale 和符号。
  3. XBRL Semantic Grounding(XBRL语义定位):给定 pre_contexttextdisplayed_text,预测 conceptperioddimensions

数据质量与已知限制

  • 标签错误率:独立审计发现,约 2% 的记录存在语义错误,包括错误的概念(~1%)、错误的期间(~0.5%)等。
  • 文件忠实数值:所有数值、规模和单位均忠实复现文件编制者自己的 iXBRL 标签。约有 11 行(~0.01%)保留了文件编制者自身的错误标签。
  • 符号约定:约 8% 的配对中,括号显示为负数而实际数值为正(源自 XBRL 的流出/流入约定)。
  • 采样偏差:该样本仅保留了在段落中唯一出现的显示值,可能低估了重复值(如基本每股收益等于稀释每股收益)的情况。
  • 文本清洁度:不到 1% 的行的 text 字段中可能残留少量 HTML 片段。

许可与联系

  • 许可协议:CC BY-NC 4.0。
  • 商业访问:可通过 stockalloy.com/developer 获取免费 API 密钥(每月 500 次调用),或通过 data@stockalloy.com 获取完整语料库和商业许可。
  • 引用: bibtex @dataset{stockalloy_filedfact_2026, title = {FiledFact-100K: Span-Grounded, Value-Verified SEC Financial Facts}, author = {StockAlloy Research}, year = {2026}, url = {https://huggingface.co/datasets/stockalloy/filedfact-100k} }
搜集汇总
数据集介绍
filedfact-100k 数据集图片
构建方式
FiledFact-100K 数据集通过系统性地提取并验证美国证券交易委员会(SEC)EDGAR系统收录的企业XBRL标准化财务数据构建而成。每条数据记录均对应一个具体的XBRL财务事实,涵盖了其对应的概念、期间、数值、计量单位及解码后的细分维度信息。数据集的构建核心在于确保每一财务事实均能精确对应到原始SEC申报文本中的确切字符位置,通过记录字符起始与结束索引(text_start/text_end),实现了事实标注与文本显示值的严格匹配(text[text_start:text_end] == displayed_text)。每个事实同时附带了evidence_url深度链接,可直接跳转至原始申报文件中该数值的呈现位置并高亮显示,确保了从数据到源文档的可追溯性。该数据集从涵盖2016至2027财年、涉及5,668家企业的54,452份申报文件中精选出100,000对事实-文本配对,训练集与验证集按企业级分离以确保评估的公正性。
使用方法
该数据集可通过HuggingFace Datasets库便捷加载:`from datasets import load_dataset; ds = load_dataset("StockAlloy/filedfact-100k")`。其设计支撑三大核心任务:(1)跨度定位——给定文本和事实身份(概念、期间、维度),预测显示文本的精确起止位置;(2)数值归一化——将显示的文本数值转换为标准化数值、单位、缩放比例和符号;(3)XBRL语义定位——从文本和显示值中预测其对应的概念、期间和维度。每条记录提供包括文本的上下文脉络(pre_context)、段落类型(表格、附注、管理层讨论与分析)、并在部分记录中包含了人工标注的章节标题。为便于评估,数据集的基准测试采用全段落提取协议,模型接收完整的申报文本段落,需返回其中所有财务事实的结构化JSON表示,并按事实的召回率、精确率及各字段(概念、数值、单位、期间、维度)的准确度分别评分。
背景与挑战
背景概述
FiledFact-100K数据集由StockAlloy研究团队于2026年创建,专注于弥合金融文本中非结构化叙事与结构化XBRL事实之间的语义鸿沟。其核心研究问题在于如何精准地将SEC(美国证券交易委员会)文件中每个财务数值的显示文本与其对应的XBRL概念、时期、单位及维度信息相锚定,并确保字符级跨度验证的绝对可靠性。该数据集包含了约10万对经值验证的跨度锚定样本,覆盖超过5,600家公司的54,000余份文件,为金融自然语言处理领域提供了前所未有的细粒度标注资源。通过将证据链接直接映射至原始文件中的高亮数值,它在财务信息提取、表格理解与引用溯源等方向树立了新的精度标准,对推动金融领域的高可靠AI系统发展具有显著潜力。
当前挑战
该数据集所解决的领域挑战在于金融文档中数值信息的多重歧义性。首先,真实财务报表常出现同期邻近数值的混用(如'分别对应21.2百万与22.0百万'),或表头缩放单位(如'单位:千元')与单元格实际显示的不一致,导致标准模型难以正确配对数值所属概念或时间戳。其次,数据构建过程中面临高度的语义验证挑战:独立审计发现约2%的标签存在概念误标、时期对齐错误或符号翻转,且这些错误并未集中在低置信度样本中,而是均匀分布。此外,13.6%的公司特定扩展概念在主流结构化金融数据集中常被抛弃,而此处需通过解码的段维度信息进行准确恢复。构建时还需处理少数文件中保留的HTML残留、以及表外缩放提示信息缺失等边缘情况,确保每条记录同时满足字符跨度精确匹配与财务数值的算术一致性验证。
常用场景
经典使用场景
在金融自然语言处理领域,FiledFact-100K最经典的使用场景是作为细粒度信息抽取与语义推理的基准数据集。其核心设计围绕三项任务展开:其一是跨度定位(span grounding),即根据给定的财务事实身份(如概念、期间、维度)在文本中精确找出对应的显示值及其字符偏移;其二是数值归一化(value normalization),需要从上下文中解析出原始数值、单位、缩放比例及正负符号;其三是XBRL语义定位(XBRL semantic grounding),要求模型同时预测财务概念、报告期间及业务维度。这三项任务层层递进,共同构成了一个从原始文本到结构化财务事实的完整理解链路。
解决学术问题
该数据集精准回应了金融信息抽取领域中长期存在的两个核心学术难题:其一是“对齐模糊性”(alignment ambiguity),即同一段落中常出现多个相似数值,模型难以将每个数字精确匹配到对应的财务概念与报告期间;其二是“语义标签噪声”(semantic label noise),即传统结构化数据虽包含数值,却缺乏从文本中定位和验证这些数值的手段。FiledFact-100K通过提供经过值验证和精确字符跨度标注的10万对事实-文本配对,使得研究者可以量化评估模型在概念识别、期间匹配、维度解析等子任务上的真实表现,进而推动可解释金融AI的进展。其公布的约2%标注误差上限更为后续研究设定了清晰的性能基准。
实际应用
在实际产业应用中,FiledFact-100K支撑着多项关键的金融自动化流程。以监管申报分析为例,投资分析师和合规团队可以利用基于该数据集训练的模型,自动从10-K和10-Q年度和季度报告中提取结构化的财务数据,并直接链接到原始申报文档中对应的具体行文位置,极大提升了跨文档财务数据分析的效率与可审计性。此外,该数据集还可赋能企业内部的财务数据管理系统,实现从非结构化文本(如管理层讨论与分析部分)到XBRL标签体系的自动映射,减少手动录入错误,为财务报表的编报与复核提供智能化辅助。
数据集最近研究
最新研究方向
FiledFact-100K数据集以精确的文本跨度定位和经过数值验证的SEC财务事实为核心,开创了金融领域精细化信息抽取与语义对齐的研究范式。其前沿方向聚焦于跨度定位与值归一化、XBRL语义理解三大任务的协同优化,特别是在复杂表格和多维分段维度(如业务线、地理区域)的场景下,推动模型从简单数字识别迈向对财务概念、会计期间及上下文规模的深刻领悟。该数据集通过独立审计确认约2%的标签误差率,并公开了从文本到事实的完整证据链,为金融NLP中的可溯源推理与RAG评估提供了可靠基准。结合同期发布的微调模型,FiledFact-100K在持有验证集上将事实F1分数从0.295提升至0.787,显著缩小了开源模型与专业金融信息抽取需求之间的鸿沟,对提升财报智能分析、监管科技及投资决策辅助系统的可信度具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务