遇见数据集

sec-form-d-private-placements-dataset

收藏
Hugging Face2026-08-08 更新2026-08-09 收录
官方服务:

资源简介:

该数据集提供了美国证券交易委员会(SEC)Form D 私募发行文件的完整表格化数据,涵盖募资事件(含已提供和已售出的金额)、发行人档案以及相关人员信息。数据源自 SEC 官方结构化 Form D 数据(2008 年至今)及 EDGAR 增量提交文件,由 DataForge 开放数据计划整理并发布。数据集包含多个配置层级:S 层(最新 4,186 条募资事件)、M 层(约 113 万条事件与发行人数据)、L 层(约 409 万条完整历史数据,含发行人和相关人员)。关键字段包括募资金额、豁免类型、行业组以及发行人标识符(CIK)。该数据集适用于私募市场与风险投资研究、交易来源与投资者挖掘、Regulation D 豁免与市场结构分析,以及通过 CIK 将私募发行与公开公司数据关联等场景。数据以 Parquet 格式提供,许可协议为 CC BY-NC 4.0(学术/个人用途免费,商业使用需获得商业许可)。

This dataset provides complete tabular data of U.S. Securities and Exchange Commission (SEC) Form D private offering filings, covering offering events (including amounts offered and sold), issuer profiles, and related person information. The data originates from the SECs official structured Form D data (2008–present) and EDGAR incremental filings, compiled and released by the DataForge Open Data Initiative. The dataset includes multiple configuration tiers: S-tier (latest 4,186 offering events), M-tier (~1.13 million events and issuer data), and L-tier (~4.09 million complete historical data including issuers and related persons). Key fields include offering amount, exemption type, industry group, and issuer identifier (CIK). This dataset is suitable for private market and venture capital research, deal sourcing and investor prospecting, Regulation D exemption and market structure analysis, and linking private offerings to public company data via CIK. Data is provided in Parquet format under the CC BY-NC 4.0 license (free for academic/personal use; commercial use requires a commercial license).

创建时间:
2026-08-08
原始信息汇总

SEC Form D 私募配售与融资事件数据集

数据集概述

本数据集收录了美国证券交易委员会(SEC)所有Form D私募配售申报文件,整理为可直接分析的结构化表格,涵盖融资事件(含募集金额)、发行人档案及相关人员信息。数据源自SEC官方结构化Form D数据(2008年至今)以及EDGAR增量申报文件。

数据规模

层级 行数 大小
S(近期数据) 4,186 0.6 MB
M(研究包) 1,128,628 115.7 MB
L(完整历史) 4,085,050 240.8 MB

数据集配置(Configs)

  • S:提供1个配置(formd_events)
  • M:提供2个配置(formd_events、formd_issuers)
  • L:提供3个配置(formd_events、formd_issuers、formd_related_persons)

数据内容

  • 募集金额(拟发行额/已售额)
  • 豁免类型
  • 行业分类
  • 发行人标识(CIK)
  • 每包附带数据字典、数据说明书及QA报告

适用场景

  • 私募市场与风险融资研究
  • 交易源挖掘与投资者拓展
  • Regulation D豁免与市场结构分析
  • 通过CIK将私募配售与上市公司数据关联

数据来源与方法

SEC Form D季度结构化数据及EDGAR增量数据。

许可证

双重许可

  • 学术/个人用途:采用CC BY-NC 4.0许可(需注明出处并回链至https://data.zalize.com)
  • 商业用途:需获取DataForge商业许可证
  • 上游数据为SEC官方Form D结构化数据,属于公共领域

引用信息

text DataForge (data.zalize.com), built from official SEC Form D data — https://data.zalize.com/datasets/sec-form-d-private-placements-dataset

  • DOI(Zenodo镜像):10.5281/zenodo.21812580
  • GitHub Release镜像:https://github.com/wookat/dataforge-pipelines/releases/tag/open-data-sec-form-d

使用示例

python from datasets import load_dataset

ds = load_dataset("zalizedata/sec-form-d-private-placements-dataset", "S", split="train") print(ds[0])

数据下载

原生parquet文件位于HF仓库的data/<tier>/目录下,原始zip压缩包可通过DataForge开放数据CDN获取:https://dl.zalize.com/open-data

搜集汇总
数据集介绍
sec-form-d-private-placements-dataset 数据集图片
构建方式
该数据集依托美国证券交易委员会(SEC)官方Form D结构化申报数据构建,覆盖2008年至今的私募配售与基金募集事件,并整合EDGAR系统的增量申报文件以保障时效性与完整性。数据经系统化清洗与标准化处理,形成分析就绪的表格结构,按数据规模划分为S、M、L三个层级,分别对应近期切片、研究级数据包与全历史记录,每层级均包含募资事件、发行方档案及关联人员等核心实体表,并附有数据字典、数据说明书与质量评估报告。
特点
数据集以分层架构呈现,S层聚焦最新募资动态,M层提供百万级事件与发行方记录,L层则囊括逾四百万行全历史数据及关联人员信息。字段涵盖募集金额、豁免类型、行业分组及发行方CIK标识等关键维度,支持跨层级灵活调用。数据以Snappy Parquet格式存储,便于高效读取与大规模分析,且每份原始包均内置完整文档与校验信息,确保研究可复现。
使用方法
研究者可通过Hugging Face的datasets库直接加载指定配置,例如使用load_dataset函数并指定“S”、“M-formd_events”或“L-formd_issuers”等配置名与训练集划分,即可获取对应表格数据。原始生产包亦可从DataForge开放数据CDN下载,内含CSV、Parquet、数据字典、数据说明书及许可证文件。该数据集适用于私募市场与风险投资研究、交易寻源、Regulation D豁免分析,以及通过CIK标识与上市公司数据对接等场景。
背景与挑战
背景概述
私募融资活动的信息披露长期依赖美国证券交易委员会(SEC)的Form D申报文件,该文件依据Regulation D豁免条款记录证券发行与资金募集的关键信息。自2008年SEC推行结构化电子申报以来,Form D数据逐渐成为研究创业融资、风险投资及私募市场结构的重要来源。然而,原始数据分散于EDGAR系统,字段繁杂且缺乏统一整理,限制了大规模实证研究的开展。DataForge团队构建的sec-form-d-private-placements-dataset整合了2008年至今的官方结构化数据及EDGAR增量文件,形成涵盖募集事件、发行方档案与关联人员的分析级表格,为私募市场研究提供了系统化、可复用的数据基础设施。
当前挑战
该数据集所对应的核心领域问题在于私募融资信息的非标准化与碎片化:Form D申报表格虽为强制披露,但其字段填写存在大量自由文本、豁免类型多样、发行方标识需跨源匹配,使得自动化解析与实体对齐成为显著难题。构建过程中,挑战体现于多层级数据的整合与质量控制:需将SEC季度结构化数据与EDGAR增量申报持续融合,处理时间戳不一致、重复申报及字段缺失;同时,发行方与关联人员的关系抽取依赖CIK标识的准确映射,而历史数据中标识缺失或错误屡见不鲜。此外,数据规模跨越百万级行,对存储格式与查询效率提出工程性要求,需在保持原始信息完整性的同时提供分析就绪的表格结构。
常用场景
经典使用场景
在私募资本市场与风险投资研究的领域中,该数据集最为经典的运用场景在于对Regulation D豁免发行活动的系统性刻画与募集行为分析。研究者借助Securities and Exchange Commission(SEC)Form D申报文件所记录的发行事件,能够精确识别发行人身份、募集金额、豁免类型及行业归属等关键维度,从而构建起覆盖2008年至今的私募配售全景图谱。尤其是在创业融资与私募股权交易的研究中,该数据集凭借其结构化程度高、时间跨度完整、发行主体可追溯等优势,成为刻画非公开资本市场动态的核心基础设施。
解决学术问题
长期以来,私募资本市场因信息披露的非强制性而饱受数据匮乏之苦,学术研究在规避免疫于公开披露要求的私募发行活动时,往往受制于样本偏误与覆盖不足。该数据集通过整合SEC官方结构化Form D数据与EDGAR增量申报文件,有效缓解了私募融资研究中长期存在的样本选择偏差与时间序列断裂问题,使得学者得以在统一口径下考察Regulation D豁免机制下的融资规模演变、行业分布特征以及发行主体进入与退出市场的动态规律。其意义不仅在于拓展了公司金融与创业金融的实证边界,更在于为监管政策评估提供了可复现的数据基础。
衍生相关工作
该数据集已在私募市场与创业金融的交叉研究中催生了一系列衍生性工作。研究者将其与公开公司财务数据、专利引证网络及全球法人识别编码(LEI)注册信息相互联结,形成了覆盖私募融资、创新产出与企业生命周期的多层次分析框架。围绕Regulation D豁免发行的市场结构分析、私募配售的定价机制探讨以及创业企业融资路径的比较研究,均在不同程度上受益于该数据集所提供的丰富字段与可扩展结构,并推动了相关领域实证方法论的精进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务