PleIAs/SEC
收藏资源简介:
该数据集包含1993年至2024年的SEC年度报告(Form 10-K),提供了上市公司财务和业务信息的全面覆盖。报告以Parquet格式存储,确保高效存储和快速访问。该数据集通过EDGAR-Crawler工具包从EDGAR数据库中提取和处理SEC文件,并整合了1993年至2020年的现有数据集。数据集包含详细的字段,如文件名、唯一标识符、年份、公司CIK、文件全文、字数统计和字符数统计。数据集适用于学术研究、财务分析和NLP应用。
This dataset comprises SEC annual reports (Form 10-K) for the years 1993 to 2024, providing comprehensive coverage of publicly traded companies financial and business information. The reports are stored in Parquet format, ensuring efficient storage and quick access. This dataset was meticulously compiled using the EDGAR-Crawler toolkit, which facilitates the extraction and processing of SEC filings from the EDGAR database. Each Parquet file contains detailed fields that provide a comprehensive view of each report, including filename, unique identifier, year, Central Index Key, full text, word count, and character count. The dataset is invaluable for academic research, financial analysis, and NLP applications.
SEC Annual Reports (Form 10-K) 1993-2024
数据集概述
该数据集包含1993年至2024年的SEC年度报告(Form 10-K),涵盖了上市公司财务和业务信息的全面覆盖。报告以Parquet格式存储,确保高效存储和快速访问。该数据集使用EDGAR-Crawler工具包精心编译,该工具包有助于从EDGAR数据库中提取和处理SEC文件。
数据集结构
数据文件
数据集按年份组织成单独的Parquet文件,便于导航和使用:
- 1993.parquet
- 1994.parquet
- 1995.parquet
- 1996.parquet
- 1997.parquet
- 1998.parquet
- 1999.parquet
- 2000.parquet
- 2001.parquet
- 2002.parquet
- 2003.parquet
- 2004.parquet
- 2005.parquet
- 2006.parquet
- 2007.parquet
- 2008.parquet
- 2009.parquet
- 2010.parquet
- 2011.parquet
- 2012.parquet
- 2013.parquet
- 2014.parquet
- 2015.parquet
- 2016.parquet
- 2017.parquet
- 2018.parquet
- 2019.parquet
- 2020.parquet
- 2021.parquet
- 2022.parquet
- 2023.parquet
- 2024.parquet
摘要统计
这些年间,数据集总共包含7,245,966,226个单词,分布在245,211个条目中,平均每个条目包含34,324.36个单词。值得注意的是,有4,043个文档包含零个单词,反映了偶尔会出现没有文本内容的文件。
包含的字段
每个Parquet文件包含详细的字段,提供每个报告的全面视图:
filename:文件名(例如,"1089297_21929025_2004.htm")。id:文件的唯一标识符,格式为"cik_year"(例如,"1089297_2021")。year:文件的年份。cik:分配给公司的中央索引键(例如,"1089297")。text:文件的全文。word_count:文件文本中的单词数。character_count:文件文本中的字符数。
数据来源和方法论
数据来源
- 2020年之前:数据从https://zenodo.org/records/5528490收集。
- 2021年至2024年:数据使用EDGAR-Crawler工具包收集,该工具包有助于从EDGAR数据库中提取和处理SEC文件。
方法论
- 爬取:使用EDGAR-Crawler工具包下载每个指定年份的10-K文件。
- 提取和清理:提取并清理文件,确保数据集结构化和清洁。
- 整合:该数据集与1993年至2020年的现有数据集无缝整合,提供连续且全面的SEC年度报告记录,便于广泛的研究和分析。
使用案例
该数据集适用于多种应用,包括但不限于:
- 学术研究:经济学、金融和商业管理领域的研究人员可以利用该数据集进行详细和广泛的研究,通过强大的财务数据增强研究的广度和深度。
- 财务分析:金融专业人士可以利用详细的报告来加强财务分析、战略规划和决策过程,确保基于数据的洞察力。
- NLP应用:该数据集中的结构化文本数据支持自然语言处理(NLP)研究和应用,有助于开发先进的模型和工具,用于财务文档分析等。
数据集统计
- 总单词数:7,245,966,226
- 总条目数:245,211
- 每个条目的平均单词数:34,324.36
- 零单词文档数:4,043
数据集引用
如果您在研究中使用此数据集,请按如下方式引用:
@dataset{SecAnnual, title={SEC Annual Reports (Form 10-K) 1993-2024}, author={Pleias}, year={2024}, description={Collection of SEC annual reports (Form 10-K) for the years 1993 to 2024} }




