遇见数据集

sec-10k-markdown-uncompressed

收藏
Hugging Face2026-07-24 更新2026-07-27 收录
官方服务:

资源简介:

SEC 10-K Full Uncompressed Markdown Filings 数据集是一个金融领域的文本数据集,专门用于文本生成和特征提取任务。该数据集包含12,361份完整的、未经压缩的美国证券交易委员会(SEC)Form 10-K年度报告,这些报告已从原始的EDGAR HTML格式转换为清晰、结构化的Markdown格式。数据覆盖了1,379家不同的公司,时间跨度从2004年至2025年,其中2014年至2025年的数据为核心部分。数据集以未压缩的原始Markdown文件(.md)形式提供,总大小约为4.75 GB。数据按照公司股票代码(如AAPL、MSFT、NVDA)组织在子目录中,每个公司文件夹内包含按年份命名的10-K文件(例如10-K_2024.md)以及一个包含公司元数据的清单文件(manifest.json)。该数据集主要适用于自然语言处理任务,如基于金融文档的文本生成、信息提取、财务分析、文档摘要和语言模型预训练或微调。数据集语言为英语,采用MIT许可证发布。

The SEC 10-K Full Uncompressed Markdown Filings dataset is a text dataset in the financial domain, specifically designed for text generation and feature extraction tasks. It contains 12,361 complete, uncompressed U.S. Securities and Exchange Commission (SEC) Form 10-K annual reports, which have been converted from the original EDGAR HTML format into clear, structured Markdown format. The data covers 1,379 distinct companies, spanning from 2004 to 2025, with the core portion from 2014 to 2025. The dataset is provided as uncompressed raw Markdown files (.md), with a total size of approximately 4.75 GB. The data is organized into subdirectories by company stock ticker (e.g., AAPL, MSFT, NVDA), with each company folder containing 10-K files named by year (e.g., 10-K_2024.md) and a manifest file (manifest.json) that includes company metadata. This dataset is primarily suitable for natural language processing tasks, such as text generation based on financial documents, information extraction, financial analysis, document summarization, and pre-training or fine-tuning of language models. The dataset language is English, and it is released under the MIT license.

创建时间:
2026-07-23
搜集汇总
数据集介绍
sec-10k-markdown-uncompressed 数据集图片
构建方式
该数据集基于美国证券交易委员会(SEC)EDGAR系统上公开的原始HTML格式10-K年度报告,通过自动化流程将其转换为清洁的Markdown格式,并保持文件未经压缩。数据集涵盖了从2004年至2025年(核心区间为2014至2025年)共12,361份完整长度的报告,涉及1,379家上市公司。每个公司以其股票代码建立独立子目录,内部按年份命名的Markdown文件存储历年报告,并附带一份manifest.json元数据清单。整个过程完全由机器自动生成,确保了数据的高效处理与标准化。
特点
数据集最显著的特点在于其海量规模与高质量的结构化呈现:总容量达4.75 GB,包含12,361份无压缩的纯文本Markdown文档,为金融文本分析提供了丰富的语料基础。文件以公司代码为单位的目录层级组织,便于按实体进行检索与批量处理。所有报告均为英文,且采用了MIT开源协议,突破了商业数据库的许可壁垒。此外,时间跨度覆盖二十余年,能够支持长期趋势分析与时序建模,在金融科技与自然语言处理交叉领域具有独特的研究价值。
使用方法
用户可通过Hugging Face的datasets库便捷地加载整个数据集,仅需调用load_dataset函数即可获得一个包含文本内容与路径信息的数据集对象。若需针对特定公司进行研究,亦可利用huggingface_hub库的snapshot_download方法,通过设置allow_patterns参数精准下载单个公司的完整子目录,例如AAPL文件夹下的所有历年10-K报告。加载后,既可直接对文本内容进行字符串分析与模型输入,也可结合路径信息进行文件级别的索引与管理,灵活适配从简单统计到复杂语言模型训练等多种应用场景。
背景与挑战
背景概述
在金融自然语言处理领域,企业的年度财务报告(即10-K文件)是信息挖掘的基石,承载着公司财务状况、经营成果与风险因素的详尽叙述。由研究者Tim Condello于2026年发布在HuggingFace平台上的SEC 10-K Markdown Uncompressed数据集,系统性地整理了来自1,379家美国上市公司、横跨2004年至2025年(核心时段为2014-2025年)的12,361份完整10-K报告。该数据集将原本EDGAR系统中的HTML格式文件转换为整洁的Markdown格式,按股票代码组织子目录,并配备公司元数据清单,为金融文本分析、信息抽取与生成式模型的研究提供了标准化、大规模且易于获取的英文语料库,填补了高质量、长文本金融报告数据集在开源社区中的空白。
当前挑战
该数据集旨在解决金融领域内非结构化文本数据利用效率低下的核心问题:原始10-K文件格式繁杂、噪声较多,缺乏统一的机器可读格式,制约了量化分析、风险建模及大语言模型在金融报告理解与生成任务上的发展。在构建过程中,面临的主要挑战包括:跨越二十余年时间跨度的海量HTML文档的批量爬取与格式兼容性问题,需处理不同历史时期EDGAR系统模板的差异;将复杂表格、脚注及特殊符号从HTML精确转换为Markdown的解析难题,以避免信息丢失或结构扭曲;以及保证1,379家公司按年度报告有序归档时的元数据准确性与文件命名一致性,从而支持高效检索与多公司、跨时间维度的联合分析。
常用场景
经典使用场景
在金融自然语言处理领域,SEC 10-K年度报告是承载公司财务健康状况、经营风险与战略动向的核心文本载体。本数据集将逾1.2万份完整的10-K原始HTML文件转换为结构清晰、易于解析的Markdown格式,覆盖1379家上市公司跨越二十余年的财务披露。其典型应用场景包括但不限于:基于长文本的财务风险因子抽取、管理层讨论与分析(MD&A)的情感倾向分析、公司间相似度度量以及财务文本预训练语言模型的构建。研究者可直接以公司股票代码为索引,按年度加载文档,进行时间序列分析或跨公司横向对比,极大降低了财务文本预处理的门槛。
衍生相关工作
本数据集的发布催生了一系列衍生研究与资源。基于该语料,研究者已开发出专用于财务披露的文本嵌入模型(如FinBERT的强化版本),以及能够从长文档中抽取结构化事实的抽取式问答系统。在标注数据匮乏的背景下,该数据集被用于预训练财务领域的大语言模型,并通过指令微调衍生出面向SEC披露的摘要、翻译与合规问答助手。此外,结合时点信息构建的企业文本相似度网络,为金融网络分析与系统性风险传导研究提供了新颖的文本视角。这些工作共同推动了金融自然语言处理从词汇级分析向量级语义理解的范式转变。
数据集最近研究
最新研究方向
该数据集汇聚了2004至2025年间逾千家上市公司完整的10-K年报,以纯净Markdown格式呈现,为金融自然语言处理研究提供了高质量、长序列的语料基石。当前前沿方向聚焦于利用大语言模型对年报中管理层讨论、风险因素等非结构化文本进行深层语义解析,以自动化预测财务舞弊、量化企业ESG表现、构建智能投资决策辅助系统。伴随SEC加速推动结构化数据披露与AI监管工具落地,此类机器可读的金融档案正成为连接传统财务分析与前沿大模型应用的关键桥梁,其影响不仅在于提升信息提取效率,更将重塑金融合规与价值判断的自动化范式。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务