遇见数据集

sec-8k-market-reaction-dataset

收藏
Hugging Face2026-08-18 更新2026-08-19 收录
官方服务:

资源简介:

此数据集为 Historical SEC 8-K Market-Reaction Dataset,由 FlinchLab 发布,旨在量化美国公司 SEC 8-K 文件披露对股票市场的历史价格反应。数据集包含 29,331 份 8-K 文件,来自 660 家美国公司,时间跨度 48 个月(运行日期 2026-08-14)。其核心特色在于对官方 SEC 项目代码进行了更细粒度的重新分类,并针对每个类别通过市场模型事件研究计算了方向、幅度、隔夜/交易时段分解以及备案前基线等指标。所有已发表的发现均经过两个独立的样本外验证集(时间持久性和跨公司泛化性)的验证。公开版本(本仓库)提供 8 行预览数据、完整的数据字典(44 个字段)和方法论文档。完整数据集包含 1,668 个聚合单元(event_timing_aggregate.csv)和 104 个验证发现(validated_findings.csv),为一次性付费发布。数据格式为表格,每行代表一个聚合单元(公司规模/备案时间/披露延迟切片 × 8-K 项目代码 × 事件窗口),关键字段包括:bucket、bucket_type、item_code、item_label、window、window_type、n_events、sample_status、mean_car_pct、mean_abs_car_pct、direction_q_value、magnitude_q_value 等。数据仅包含聚合统计量,不包含发行人名称、股票代码、CIK、接入编号、单个事件或原始价格。适用任务包括:企业披露事件研究、SEC 8-K 文件周围异常收益估计的基准测试、按新闻类型(如盈利、管理层变动、并购、裁员等)量化公告效应,以及使用真实 EDGAR 数据教授事件研究方法论。数据集经过严格统计检验(BMP、Kolari-Pynnonen、Beaver、Corrado 秩检验),并采用 Benjamini-Hochberg 多重检验校正。局限性包括存活偏差、日频率、仅美国市场、48 个月窗口、子类型标签基于文件声明而非预期差等。

This dataset is the Historical SEC 8-K Market-Reaction Dataset, released by FlinchLab, designed to quantify the historical price reaction of the stock market to U.S. companies SEC 8-K filings. It contains 29,331 8-K filings from 660 U.S. companies spanning 48 months (run date: 2026-08-14). Its core feature is a finer-grained reclassification of official SEC item codes, with calculations of direction, magnitude, overnight/trading session decomposition, and pre-filing baseline for each category via market model event studies. All published findings are validated on two independent out-of-sample validation sets (time persistence and cross-firm generalizability). The public version (this repository) provides 8 rows of preview data, a complete data dictionary (44 fields), and methodology documentation. The full dataset includes 1,668 aggregated units (event_timing_aggregate.csv) and 104 validated findings (validated_findings.csv), released as a one-time paid product. Data is in tabular format, each row representing an aggregated unit (firm size/filing time/disclosure delay slice × 8-K item code × event window), with key fields including bucket, bucket_type, item_code, item_label, window, window_type, n_events, sample_status, mean_car_pct, mean_abs_car_pct, direction_q_value, magnitude_q_value, etc. Data contains only aggregate statistics, no issuer names, tickers, CIKs, accession numbers, individual events, or raw prices. Applicable tasks include corporate disclosure event studies, benchmarking abnormal return estimates around SEC 8-K filings, quantifying announcement effects by news type (e.g., earnings, management changes, M&A, layoffs), and teaching event study methodology using real EDGAR data. The dataset undergoes rigorous statistical tests (BMP, Kolari-Pynnonen, Beaver, Corrado rank test) with Benjamini-Hochberg multiple testing correction. Limitations include survivorship bias, daily frequency, U.S.-only market, 48-month window, and subtype labels based on filing statements rather than expectation gaps.

创建时间:
2026-08-18
原始信息汇总

数据集概述:Historical SEC 8-K Market-Reaction Dataset — by FlinchLab

基本信息

  • 名称:Historical SEC 8-K Market-Reaction Dataset
  • 提供方:FlinchLab
  • 语言:英文
  • 许可:FlinchLab Dataset Licence(商业、学术和个人研究均适用,一次性付费 $99)
  • 规模:少于 1,000 行(预览版);完整数据集包含 1,668 个聚合单元格和 104 个验证发现
  • 版本:0.1.1,运行日期为 2026-08-14
  • 标签:金融、事件研究、SEC 备案、8-K、异常收益、研究数据集、表格数据、时间序列、股票市场、EDGAR、公司事件、盈利、量化金融、市场数据、美国股票

数据内容

  • 覆盖范围:29,331 份 SEC 8-K 备案,来自 660 家美国公司,时间跨度为 48 个月
  • 数据粒度:每个数据行是一个聚合单元格,代表公司切片 × 8-K 项目代码 × 事件时间窗口的组合
  • 核心字段:包括数据桶(bucket)、SEC 8-K 项目代码(item_code)、事件窗口(window)、事件数量(n_events)、样本状态(sample_status)、平均累计异常收益(mean_car_pct)、平均绝对累计异常收益(mean_abs_car_pct)、隔夜/交易时段分解指标、方向显著性检验(BH-FDR 校正)、幅度显著性检验等
  • 数据文件:预览文件(preview.csv,8 行示例数据)和数据字典(data_dictionary.csv,44 个字段定义)

构建方法

  • 基于 SEC EDGAR 公开备案文件和公开市场数据 API
  • 每个事件采用 OLS 市场模型(交易日 −270 至 −21,最少 60 个观测值)计算异常收益,进而得到六个事件窗口的累计异常收益(CAR),从 [−10,−6] 到 [+2,+10]
  • 包含隔夜/交易时段分解分析
  • 使用多种显著性检验方法:BMP(Boehmer-Musumeci-Poulsen)、Kolari-Pynnonen 调整(日期聚类下)、Beaver 风格反应幅度检验、Corrado 秩检验(交错样本适应性调整)
  • 方向和幅度分别作为独立的 FDR 家族进行多重检验校正,预备案窗口作为第三个家族
  • 验证发现通过“发现 → 预注册 → 两个独立样本外保留集”的流程

主要发现示例

  • 所有 8-K 备案在备案当天 [0] 窗口的平均 CAR 为 −0.12%,典型幅度 3.50%
  • 官方“运营结果”(盈利)项目在 [0] 窗口的平均 CAR 为 −0.15%,典型幅度 6.10%
  • 按前瞻指引细分:指引下调的备案平均异常收益为 −5.2%(发现集),在两个独立保留集中分别为 −6.5% 和 −5.3%;指引上调的备案为 +2% 至 +3%

限制说明

  • 幸存者偏差(偏向当前指数成分股)
  • 日度分辨率
  • 仅限美国市场
  • 48 个月时间窗口
  • 子类型标签描述备案声称的内容,而非与预期的比较
  • 每次运行都会重建公司池,因此统计数量需注明运行日期

使用场景

  • 公司披露事件研究
  • 围绕 SEC 8-K 备案的异常收益估计基准测试
  • 按新闻类型(指引变更、高管离职、并购、裁员等)量化公告效应
  • 使用真实 EDGAR 衍生数据教授事件研究方法论

访问方式

  • 免费层:预览数据(8 行)、数据字典和方法论文档均在 Hugging Face 仓库中提供
  • 完整数据集:一次性付费 $99,通过 https://flinchlab.com/dataset 获取
  • 联系邮箱:data@flinchlab.com
  • 免费层已在 Zenodo 存档(DOI: 10.5281/zenodo.21986316)

引用方式

引用需包含数据集版本和运行日期,因为公司池每次运行会重建。具体 BibTeX 引用格式见 README 文件。

搜集汇总
数据集介绍
sec-8k-market-reaction-dataset 数据集图片
构建方式
该数据集基于SEC EDGAR公开的8-K文件,覆盖660家美国上市公司48个月内的29,331条申报事件。构建流程首先通过市场模型(OLS回归于交易日-270至-21)计算异常收益,进而生成六个事件窗口的累积异常收益(CAR),并分解为隔夜与盘中收益。随后,数据按公司规模、申报时间、披露滞后等维度划分切片,每个切片与SEC官方条目代码及精细化再分类标签交叉聚合,形成1,668个汇总单元格。所有统计检验(如BMP、Kolari-Pynnonen、Corrado秩检验)均经过Benjamini-Hochberg多重检验校正,并针对方向与幅度分别设立FDR家族。最终,通过时序持久性与跨公司泛化两条独立轴进行样本外验证,未通过验证的发现被明确标记为证伪而非删除。
使用方法
用户可通过一行Pandas代码加载免费预览样本(含完整列结构),快速评估数据适配性。典型应用包括企业披露事件研究、异常收益估计基准测试、按新闻类型(如指引变更、高管离职、并购)量化公告效应,以及教学场景中的事件研究法演示。完整数据包含1,668个聚合单元格与104项双重验证发现,需通过FlinchLab网站付费获取,并附带详细数据字典与方法学文档。使用时需注意:所有百分比列以百分点表示,样本量不足(n<10)的单元格仅提供计数;显著性指标限于同一FDR家族内比较。引用时需包含版本号与运行日期,以确保可复现性。
背景与挑战
背景概述
该数据集由FlinchLab于2026年发布,旨在系统性地量化美国公司SEC 8-K披露的市场反应。研究团队基于SEC EDGAR的29,331份8-K文件,覆盖660家美国公司48个月的数据,通过精细化的分类和事件研究法,揭示了官方条目代码下隐藏的市场信号。该数据集的核心研究问题在于超越传统的事件研究局限,提供更精确的异常收益估计,并验证不同新闻类型对股价的差异化影响。其影响力体现在为量化金融、公司金融及行为金融研究提供了标准化的实证基础,尤其适合用于教学和 benchmark 研究,推动了基于真实EDGAR数据的事件研究方法的严谨性和可复现性。
当前挑战
该数据集面临的挑战首先在于领域问题层面,即SEC 8-K披露的市场反应研究长期受限于官方条目代码的粗粒度,导致交叉信号被平均化而掩盖真实效应,例如‘经营成果’条目下的平均反应近乎为零,但细分指引调整后却能显现数个百分点差异。其次,构建过程中遭遇多重挑战:数据清洗需处理非结构化文本和类别重分,事件研究需控制市场模型估计窗口的幸存者偏差、日度数据分辨率限制、单市场(美国)代表性局限,以及多假设检验下的误发现风险。此外,数据集为一次性付费发布,其更新维护和跨周期的可扩展性构成持续挑战,而隐私与合规要求(不披露个体事件)也增加了数据标准化的难度。
常用场景
经典使用场景
该数据集以美国SEC 8-K披露事件为核心,构建了涵盖29,331起公司公告的市场反应量化基准。其经典使用场景聚焦于事件研究法(Event Study)的应用,研究者可基于市场模型计算的异常收益(CAR)及其隔夜/盘中分解,精确度量不同类别公司新闻对股价的即期冲击。数据集在官方项目代码基础上进行了更细致的语义重分类,使得诸如盈利指引调整、高管更迭、并购重组等细分事件类型的市场效应得以区分,为资产定价与信息披露领域的实证分析提供了高分辨率的数据基础设施。
解决学术问题
该数据集有效解决了公司金融与行为金融研究中长期存在的公告效应识别难题。传统研究往往因官方项目代码的粗粒度,将方向相反的市场反应混叠为不显著的均值,如盈利公告类型的平均CAR趋近于零。此数据集通过细粒度分类与双轴样本外验证,显著提升了异常收益估计的统计效力,并控制了多重假设检验的假阳性风险,为检验信息效率、市场异象及管理层信息披露动机等理论命题提供了更为纯净的经验证据,推动了事件研究范式从描述性分析向可验证性发现的转化。
实际应用
在实际应用中,该数据集为量化投资策略的研发与风控提供了关键的事件驱动信号。策略开发者可利用细粒度的公告分类与历史异常收益分布,构建基于盈余惊喜、管理层指引变化等事件的择时或选股模型,并参考隔夜与盘中收益分解来优化执行成本。同时,数据集支持对公告前异常交易行为的监测,服务于市场操纵的学术筛查与合规监控。对于资产管理机构,其外样本验证结果可用于评估策略稳健性,降低过拟合风险,从而在事件驱动的投资决策中实现更审慎的风险预算分配。
数据集最近研究
最新研究方向
该数据集聚焦于利用SEC 8-K文件进行精细化的市场反应事件研究,突破官方项目代码的分类局限,通过重新分类公司公告类型(如盈利指引变更、高管离职、并购、裁员等),并采用市场模型计算累计异常收益,结合隔夜与盘中分解、事前基准期及多重检验校正,系统量化各类公告对股价的短期影响。其前沿方向在于基于近三万份文件、六百余家公司的数据,验证传统官方分类下被掩盖的显著市场异动,并通过独立样本外验证增强结论的稳健性,为事件研究、量化交易策略及市场监管提供更精准的实证基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务