遇见数据集

us-public-company-financials-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集是美国上市公司的结构化财务事实、内部交易和13F机构持股数据,基于SEC EDGAR官方批量数据构建。数据集以分析就绪的表格形式提供,包含公司标识符、文件链接和完整的来源追溯信息。数据集包含多个配置表:companies(公司信息,10,432行)、filings(文件记录,27,066,032行)、financials(财务数据,272,123行)、formd_offerings(Form D发行,746,374行)、holdings_changes(持股变动,10,542,107行)、insider_signal_events(内部交易信号事件,378,110行)、insider_transactions(内部交易,8,446,676行)、institutional_holdings(机构持股,20,725,792行)。数据以Parquet格式存储,并提供CSV/JSONL副本。数据集适用于量化研究、因子模型、内部交易信号引擎、机构持股追踪和公司财务基准分析。语言为英语,采用CC BY-NC 4.0许可证,学术和个人使用免费,需注明出处和链接;商业使用需获得商业许可。

This dataset contains structured financial facts, insider transactions, and 13F institutional holdings of U.S. listed companies, built from official SEC EDGAR bulk data. The dataset is provided in analysis-ready tabular form, including company identifiers, file links, and complete source provenance information. It contains multiple configuration tables: companies (10,432 rows), filings (27,066,032 rows), financials (272,123 rows), formd_offerings (746,374 rows), holdings_changes (10,542,107 rows), insider_signal_events (378,110 rows), insider_transactions (8,446,676 rows), and institutional_holdings (20,725,792 rows). Data is stored in Parquet format, with CSV/JSONL copies available. The dataset is suitable for quantitative research, factor models, insider trading signal engines, institutional holdings tracking, and corporate financial benchmarking analysis. The language is English, licensed under CC BY-NC 4.0, free for academic and personal use with attribution and link; commercial use requires a commercial license.

创建时间:
2026-08-08
原始信息汇总

美国上市公司财务、内幕交易与13F持仓数据集(SEC EDGAR)

数据集概述

本数据集基于美国证券交易委员会(SEC)EDGAR批量数据构建,涵盖美国上市公司的结构化财务事实、内幕交易及机构13F持仓信息。数据集以分析就绪的表格形式呈现,包含公司标识符、文件链接和完整的溯源信息。该数据集由DataForge开放数据计划提供,适合学术和个人免费使用。

数据集配置与规模

配置(表名) 行数 Parquet分片数 大小
companies(公司) 10,432 1 0.7 MB
filings(文件) 27,066,032 3 1,174.9 MB
financials(财务数据) 272,123 1 21.4 MB
formd_offerings(Form D发行) 746,374 1 49.2 MB
holdings_changes(持仓变动) 10,542,107 1 495.7 MB
insider_signal_events(内幕信号事件) 378,110 1 10.2 MB
insider_transactions(内幕交易) 8,446,676 1 411.1 MB
institutional_holdings(机构持仓) 20,725,792 2 745.5 MB

数据集包

包名称 层级 行数 大小 SHA-256
sec_us_financials-tier1-S-2026-08-02.zip S 8,824,786 643.9 MB 957fd8a74636125db4ea1d6bfb6ee072180ded321c5ac5cb1a23ea871e29483c
sec_us_financials-tier1-M-2026-08-02.zip M 36,173,373 2.22 GB e8294eda849e4728935fa97fc06a769cdac51ae5c617835ac48915c4376a8c12
sec_us_financials-tier1-L-2026-08-02.zip L 68,187,646 4.32 GB 925d302c21f5bfa176f447d759564c43136fe1bc40bca0b21d79018e979c8693

各层级包内容说明:

  • S(内幕信号包):880万行内幕交易数据(Form 3/4/5)
  • M(研究包):3620万行财务事实、文件和内幕数据
  • L(完整包):含13F机构持仓,共6820万行

所有文件还通过机器可读的开放数据索引提供服务:https://dl.zalize.com/open-data

数据内容与特点

  • 公司标识符(CIK、股票代码)用于跨表连接
  • 每个包均包含数据字典、数据表(datasheet)和QA报告
  • 支持pandas、polars、duckdb等多种加载方式
  • 提供8种配置:companiesfilingsfinancialsformd_offeringsholdings_changesinsider_signal_eventsinsider_transactionsinstitutional_holdings

适用场景

  • 量化研究与因子模型
  • 内幕交易信号引擎
  • 机构所有权追踪
  • 公司财务基准分析

数据来源与方法

数据源自SEC EDGAR财务报表数据集、内幕文件和13F文件,覆盖范围、更新频率及完整的字段级数据字典详见数据集页面。

许可证

双重许可证

  • 学术/个人使用:采用CC BY-NC 4.0许可证,需注明来源并回链至https://data.zalize.com
  • 商业使用:需获得DataForge商业许可证,联系渠道见官网
  • 上游数据:为美国SEC EDGAR官方批量数据,属于公共领域(17 U.S.C. §105)

引用信息

引用格式:DataForge (data.zalize.com),基于SEC EDGAR官方批量数据构建 — https://data.zalize.com/datasets/us-public-company-financials-dataset

DOI(Zenodo镜像):10.5281/zenodo.21812587

相关数据集

  • SEC Form D私募发行与融资事件数据集
  • 全球LEI公司注册数据集(GLEIF)
  • 美国专利、引用与受让人图谱数据集(USPTO / PatentsView)
  • 商业POI与位置数据集(政府开放注册)
搜集汇总
数据集介绍
us-public-company-financials-dataset 数据集图片
构建方式
本数据集源自美国证券交易委员会(SEC)EDGAR系统的官方批量数据,经过系统化的抽取、清洗与整合,形成涵盖上市公司基本面、内部人交易及机构持仓的综合性结构化数据集。构建流程严格遵循数据溯源原则,每一张数据表均包含企业标识符(CIK、股票代码)以及对应的申报文件链接,确保信息的可追溯性与完整性。数据集以Parquet格式分片存储,共包含八个子集模块,分别对应公司信息、申报文件、财务指标、Form D发行、持仓变动、内部人信号事件、内部人交易及机构持仓,总计规模介于千万至亿级行,充分满足大规模量化分析与金融研究的需要。
特点
该数据集的显著特征在于其多维度的信息整合与精细化的层级划分。数据不仅囊括了上市公司详尽的财务数据与历史申报记录,更创新性地引入内部人交易信号事件与13F机构持仓变动模块,为洞察市场微观结构提供了独特视角。不同层级的数据包(S/M/L)分别聚焦于内部人交易、财务事实与完整持仓信息,便于研究者依据课题深度灵活选取。所有数据均附带完整的数据字典、数据说明文档与质量评估报告,确保字段定义清晰、来源可靠,极大增强了数据的可用性与分析结果的置信度。
使用方法
该数据集设计了多样化的加载路径以适配不同的研究环境。用户可通过Hugging Face的`load_dataset`接口直接调用指定的子集配置,快速获取数据;亦支持利用Pandas、Polars及DuckDB等主流数据分析工具,通过远程Parquet文件路径进行流式或批量读取。数据集中的企业标识符可有效串联各表,便于实现跨模块的关联分析。此外,原始发布压缩包内含CSV/JSONL格式副本及详尽文档,可满足常规下载需求;数据集采用CC BY-NC 4.0许可,学术与个人使用免费,商业应用需获取相应授权,使用合规性明确。
背景与挑战
背景概述
该数据集由DataForge开放数据计划于2026年构建,基于美国证券交易委员会(SEC)的EDGAR系统官方批量数据,整合了美国上市公司财务事实、内部交易记录及13F机构持仓信息。其核心研究问题在于为量化金融研究、内幕交易信号检测及机构持股追踪等领域提供结构化、可分析的数据基础。数据集涵盖公司档案、申报文件、财务报表、Form D发行、持仓变动及内部人交易等八类细分表格,总计超过6800万行,规模庞大且具备完整的数据溯源与质量保障体系。该数据集对金融数据科学社区具有显著影响力,其开源许可(学术及个人用途)降低了研究门槛,为相关领域的研究者提供了高质量的标准化数据资源,推动了金融数据驱动的实证研究与模型开发。
当前挑战
该数据集面临的挑战首先体现在领域问题的复杂性上,即如何从海量异构的SEC EDGAR原始文件中抽取并整合多源财务数据,涵盖公司基本面、内部人交易动态与机构持仓结构,以满足量化分析与信号构建对数据粒度、一致性与时效性的严苛要求。其次,构建过程中面临数据处理规模与质量保障的双重挑战,包括需处理数千万条记录并确保跨表连接(如CIK、股票代码)的准确性,同时需应对SEC文件格式的非标准化与信息提取的歧义性。此外,数据集的维护需定期与EDGAR同步更新,并兼顾原始数据的公共领域属性与DataForge增值内容的许可区分,以确保合规性与可用性。
常用场景
经典使用场景
该数据集整合了美国上市公司的财务数据、内部人交易记录与13F机构持仓信息,源自SEC EDGAR官方批量数据,为量化金融研究提供了结构化、可分析的数据基础。研究者常将其用于财务因子模型的构建与验证,如基于财务报表指标预测股票收益或评估企业信用风险。同时,数据集支持事件研究法,通过内部人交易信号或机构持仓变动来检验市场反应,成为资产定价与行为金融学领域的常用数据源。其覆盖广泛、字段完整,便于开展跨公司、跨时间维度的面板数据分析,是金融计量与实证资产定价研究中不可或缺的基准数据集。
解决学术问题
该数据集解决了金融研究中数据分散、口径不一、获取成本高昂等长期难题。在学术层面,它使得研究者能够系统性地检验内部人交易的信息含量及其对市场有效性的影响,深化对信息不对称理论的理解。同时,13F持仓数据为机构投资者行为研究提供了全貌视角,有助于揭示资金流动与股票收益之间的动态关系。财务数据的标准化整合则支持了公司金融领域关于资本结构、盈利质量与投资决策等经典命题的实证检验。其完整的数据溯源和可复现性,提升了研究结论的可信度,推动了金融学从理论推断向数据驱动的实证范式转变。
衍生相关工作
围绕该数据集,衍生出一系列具有影响力的研究与应用工作。在学术领域,研究者基于内部人交易数据构建了预测模型,探索其与公司治理、管理层激励之间的关联,形成了公司金融与劳动经济学的交叉议题。13F持仓数据则催生了关于机构投资者羊群行为、流动性提供及公司治理外部监督的丰富文献。财务数据的结构化形式支持了机器学习模型在财务困境预测、盈余管理检测等任务上的应用,推动了AI与会计金融领域的融合。此外,数据集的开放获取设计激发了开源社区开发各类金融分析工具与可视化平台,促进了金融数据科学的普及与协作创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务