遇见数据集

sec-fundamentals-pit

收藏
Hugging Face2026-07-23 更新2026-07-24 收录
官方服务:

资源简介:

SEC EDGAR Fundamentals (PIT) 数据集是一个点时间公司基本面数据集,专为金融回测设计。数据来源于美国证券交易委员会(SEC)EDGAR系统中的XBRL公司事实文件,属于美国政府的公共领域。该数据集提供按实际报告时间存储的公司财务数据,包括收入、稀释每股收益、净利润和总资产等关键指标,旨在避免在回测模拟中因数据重述或发布滞后导致的信息泄露。数据集覆盖93家美国上市发行人,包含23,580条记录,事件日期范围从2006年12月31日至2026年6月13日,知识日期(文件公开日期)从2009年5月7日至2026年7月9日。数据以ziplime Delta Lake包格式存储,按知识年份分区,每日更新以跟随EDGAR文件索引。主要字段包括实体ID(股票代码)、事件日期(财务期间结束日期)、知识日期、知识估计标志、摄取时间,以及数值字段如收入、稀释每股收益、净利润、总资产等,还包括财务期间、文件表格类型和SEC登记号。逻辑键为(实体ID, 事件日期),允许跟踪同一财务期间在不同知识日期的修订(如重述)。数据集适用于时间序列预测、回测策略开发等任务,支持在ziplime框架内通过as_of方法进行点时间访问,或通过Polars和delta-rs外部读取。

The SEC EDGAR Fundamentals (PIT) dataset is a point-in-time company fundamentals dataset designed for financial backtesting. It is sourced from XBRL company fact files in the U.S. Securities and Exchange Commission (SEC) EDGAR system and is in the public domain of the U.S. government. The datasets core purpose is to provide company financial data stored by actual reporting time, including key metrics such as revenue, diluted earnings per share, net income, and total assets, ensuring no information leakage in backtesting simulations due to data restatements or publication lags. The dataset covers 93 U.S. listed issuers, containing 23,580 records by reported facts, with event dates ranging from December 31, 2006, to June 13, 2026, and knowledge dates (i.e., file publication dates) from May 7, 2009, to July 9, 2026. The data is stored in ziplime Delta Lake package format, partitioned by knowledge year, and updated daily to follow the EDGAR file index. Key fields include entity ID (ticker), event date (financial period end date), knowledge date, knowledge estimate flag (always false), ingestion time, and numerical fields such as revenue, diluted EPS, net income, total assets, along with financial period, filing form type, and SEC accession number. The logical key is (entity ID, event date), allowing tracking of revisions (e.g., restatements) for the same financial period across different knowledge dates. The dataset is suitable for tasks like time series forecasting and backtesting strategy development, supporting point-in-time access via the as_of method within the ziplime framework or external reading via Polars and delta-rs.

创建时间:
2026-07-23
原始信息汇总

数据集概述:SEC EDGAR Fundamentals (PIT)

该数据集提供基于美国证券交易委员会(SEC)EDGAR系统XBRL公司事实的时点(Point-in-Time, PIT) 基本面数据,按提交时间(filing time) 而非会计期间进行键控,确保回测中不会因重述或发布延迟产生前瞻性偏差。

基本信息

  • 许可证: CC0-1.0(公共领域)
  • 语言: 英语
  • 数据类别: 基本面数据(SEC EDGAR/XBRL公司事实)
  • 实体域: 美国股票(us_equities),以股票代码(ticker)为键
  • 覆盖范围: 93个发行人,23,580条已报事实(含重述历史)
  • 时间范围: event_date(事件日期):2006-12-31 ~ 2026-06-13;knowledge_date(知晓日期):2009-05-07 ~ 2026-07-09
  • 数据来源: SEC EDGAR公司事实(XBRL),美国政府公共领域数据
  • 更新频率: 每日更新,遵循EDGAR提交索引(调度:0 5 * * *
  • 数据格式: ziplime Delta Lake捆绑包(数据类型:PIT_DATA),按knowledge_year分区

数据结构

主键列

列名 类型 说明
entity_id Utf8 发行人的股票代码
event_date Timestamp(UTC, µs) 事实所指的期末日期
knowledge_date Timestamp(UTC, µs) 事实公开的提交日期——仅用于时间点过滤
knowledge_estimated Boolean 提交日期是否为模拟(此处始终为false
ingested_at Timestamp(UTC, µs) 管道写入时间(仅用于审计)

值列

列名 类型 说明
revenue Float64 期间总营收
eps_diluted Float64 摊薄每股收益
net_income Float64 净利润
total_assets Float64 总资产(资产负债表日期)
fiscal_period Utf8 会计期间标识,如FY20242024Q3
form Utf8 提交表格类型:10-K10-Q10-K/A
accession_no Utf8 SEC受理号(用于溯源)

逻辑键: (entity_id, event_date)。修订(重述)表现为同一键值下knowledge_date更晚的新行。

时点(Point-in-Time)访问

  • ziplime内部:通过context.pit("sec-fundamentals-pit")加载,使用latest()as_of()方法获取特定时刻可知的数据,无需显式传入时间参数T
  • 外部读取(Polars + delta-rs):从Hugging Face下载数据后,对Delta表进行knowledge_date <= T过滤,并按(entity_id, event_date)分组取最后一条记录,以获得截至时间T的已知状态。
  • 数据按knowledge_year分区,knowledge_date过滤可以在分区层面进行剪枝。Delta表的时间旅行(AS OF <version>)可用于固定数据版本。

更新机制

  • recipe.py:从SEC公司事实接口获取数据(fetch(since) -> pl.DataFrame
  • ingest.py:去重并追加到Delta捆绑包(从不重写)
  • .github/workflows/update.yml:每日调度的持续集成任务

仓库文件结构

README.md # 数据集卡片 manifest.json # PIT清单(模式、来源、覆盖范围) recipe.py # 数据获取脚本 ingest.py # 去重与追加写入脚本 .github/workflows/update.yml # 每日更新调度 data/ # ziplime Delta捆绑包与注册清单 bundle_registry/sec_fundamentals_pit_1784818614.json data_bundle/sec_fundamentals_pit/1784818614/data.delta/ (按knowledge_year分区)

来源与许可证

数据源自SEC EDGAR XBRL公司事实(美国联邦政府作品,公共领域),经dartlab-data镜像重组为ziplime PIT模式。提交日期(filed)直接用作knowledge_date;事实期间根据各事实自身的报告窗口分类。未对任何数值进行填充或估算。

搜集汇总
数据集介绍
sec-fundamentals-pit 数据集图片
构建方式
该数据集源自美国证券交易委员会(SEC)EDGAR系统的XBRL公司事实数据,通过每日同步EDGAR申报索引进行更新。构建过程遵循严格的点时间(Point-in-Time)原则,每个财务指标(如收入、稀释每股收益、净利润、总资产)均按照其实际申报日期作为知识日期(knowledge_date)存储,而非财务周期。数据以ziplime Delta Lake格式组织,按知识年份(knowledge_year)分区,并通过增量追加方式写入,确保历史版本不被重写。数据集覆盖93家美国上市发行人,包含23,580条已申报事实(含重述历史),时间跨度从2006年至2026年。
使用方法
在ziplime回测框架中,可通过context.pit('sec-fundamentals-pit')加载数据集,并利用.latest()和.as_of()方法获取指定资产的最新或历史点时间数据,无需手动指定时间参数——模拟时钟自动充当知识日期边界。脱离ziplime使用时,可借助Polars和delta-rs库直接读取Delta表,通过knowledge_date <= T的过滤条件实现点时间查询,并结合分组排序获取每个事实的最新版本。数据集每日自动更新,用户可通过下载HuggingFace仓库中的数据包并配置ziplime目录来使用。
背景与挑战
背景概述
在量化金融与回测研究中,时间序列数据的时效性至关重要,历史财务报表的修订与重述常导致后见之明偏差,严重影响回测结果的可靠性。为应对此问题,ZipLime团队于近年构建了sec-fundamentals-pit数据集,该数据集源自美国SEC EDGAR系统的XBRL公司事实数据,涵盖93家发行人、约23,580条按报告时间而非会计期间索引的财务事实,时间跨度从2006年至2026年。其核心创新在于引入“时点”机制,确保每个财务数值仅在提交日之后才被观测,彻底消除重述信息对历史回测的污染。该数据集以Delta Lake格式每日更新,并集成于ziplime回测框架,为金融时间序列建模提供了严格无前瞻偏差的基础设施,对量化对冲基金与学术研究中的策略验证产生了深远影响。
当前挑战
该数据集致力于解决金融回测中普遍存在的后见之明偏差问题,传统财务数据表通常仅存储最终版本,导致回测策略可提前获知事后才重述的财务数据,从而产生虚假收益。sec-fundamentals-pit通过为每条事实记录精确的知识日期,确保模拟时点仅能访问该时刻已公开的信息。在构建过程中,面临的核心挑战包括:从SEC EDGAR海量XBRL原始数据中精准提取并标准化非结构化的公司事实,确保不同财务报表格式下的数据一致性;正确识别每个事实的原始提交日期而非报告期末日期,避免因延迟披露导致的时序错配;以及设计增量追加而非覆盖的写入策略,在支持大规模历史数据更新时保持严格的时点语义,同时通过知识年份分区优化查询性能以支撑实时回测任务。
常用场景
经典使用场景
该数据集的核心价值在于为量化金融研究提供了真正意义上的时间点(Point-in-Time)基本面数据。在传统的回测框架中,研究者往往只能获取经过后续修正的财务数据,这不可避免地引入了前视偏差。而SEC Fundamentals PIT数据集忠实记录了每一份SEC文件在公开披露时刻的原始数值,包括后续的财务重述历史。因此,其最经典的使用场景便是构建无偏见的回测系统,模拟在历史上任一交易日实际可获取的上市公司财务状况,从而准确评估基于基本面因子的交易策略的真实表现。
解决学术问题
该数据集精准地解决了金融计量与资产定价研究中一个长期存在的难题——回测中的前视偏差。许多经典的因子研究,如基于市盈率、市净率或盈利增长率的策略,在使用后定期调整的数据时,其有效性可能因信息泄露而被高估。通过提供按披露时间键控的会计数据,研究者能够严格区分“已知信息”与“未知信息”,从而在真实的信息集条件下检验各类会计异常现象,如盈余公告后漂移、应计异象等,为市场有效性假说提供了更为严谨的实证基础。
实际应用
在实际应用中,该数据集是量化对冲基金、资产管理公司以及个人量化研究者进行策略开发与风险管理的关键基础设施。它直接嵌入到ziplime等回测框架中,使得研究人员能够在模拟环境中使用与实盘交易完全一致的数据流。具体而言,可用于构建基于基本面排名的多空组合、事件驱动策略(如财报发布后的即时交易)以及风险模型中的因子暴露计算,确保策略在从回测过渡到实盘时,其表现不会因数据差异而发生系统性偏离。
数据集最近研究
最新研究方向
该数据集聚焦于金融时间序列预测中的无前瞻偏差回测,前沿研究方向主要围绕如何利用点及时(Point-in-Time)数据构建市场微观结构模拟,以避免终期财务重述导致的历史数据泄露。其关联热点事件包括SEC要求加速XBRL格式披露、高频量化交易对财务数据实时性的需求,以及Delta Lake等现代数据湖技术在对冲基金与量化平台中的应用。该数据集通过精确记录每次财报的原始申报时间而非最终重述值,使得回测系统能够真实复现当时市场的知情图谱,显著提升了基于基本面信号的策略验证可信度。对于监管科技和算法合规领域而言,这种时间对齐的数据源是解决回测过拟合与统计套利误判的关键基础设施,推动了金融AI从静态学习向动态因果推断的范式转换。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务