遇见数据集

arthrod/sec-ex10-exhibits

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

SEC EX-10重要合同附件数据集是一个实时镜像,从美国证券交易委员会(SEC)的EDGAR系统中捕获EX-10(重要合同)附件。该数据集由arthrod/sec-ex10-api维护,作为上游SQLite存储的并行可查询SQL目标,并以单个Parquet文件(data/exhibits.parquet)形式快照。数据集包含列如id、accession、cik、form_type、doc_type、filename、description、sequence、filing_url、found_at、markdown_status、has_markdown、filing_metadata(JSON)和markdown,仅包含公开SEC文件数据,不提供法律或投资建议,且与SEC无关联。

SEC EX-10 Material Contract Exhibits dataset is a live mirror of EX-10 (material contract) exhibits captured from the SEC EDGAR system. It is maintained by arthrod/sec-ex10-api, serving as a permanent, queryable SQL destination running in parallel with the upstream SQLite store, and snapshotted as a single Parquet file (data/exhibits.parquet). The dataset includes columns such as id, accession, cik, form_type, doc_type, filename, description, sequence, filing_url, found_at, markdown_status, has_markdown, filing_metadata (JSON), and markdown, containing only public SEC filing data, not legal or investment advice, and not affiliated with the SEC.

提供机构:
arthrod
搜集汇总
数据集介绍
arthrod/sec-ex10-exhibits 数据集图片
构建方式
该数据集源自美国证券交易委员会(SEC)的EDGAR系统,通过arthrod/sec-ex10-api接口实时捕获EX-10重大合同附件。数据以SQLite存储库为上游,同步构建了一个持久化、可查询的SQL目标副本,并最终以单一Parquet文件格式进行快照保存。数据集镜像了ex10_exhibits表结构,涵盖id、accession、cik、form_type、doc_type、filename、description、sequence、filing_url、found_at、markdown_status、has_markdown、filing_metadata(JSON格式)及markdown等字段,确保了信息的完整性与结构化。
特点
该数据集具备实时镜像特性,与SEC EDGAR的EX-10附件保持同步更新,为金融与法律研究提供了动态、可靠的数据源。其以Parquet列式存储格式封装,显著提升了查询效率与存储压缩比。此外,数据字段丰富且包含JSON元数据与Markdown文本内容,便于用户进行深度分析,如合同条款抽取、公司间比较及市场趋势挖掘。数据集仅收录公开的SEC申报信息,不涉及非公开或保密材料。
使用方法
用户可通过DuckDB直接查询该数据集,利用SQL接口从Parquet文件中高效检索,例如筛选特定accession、cik或doc_type,并按时间排序获取最新附件。数据亦可导入Pandas或Spark等框架进行进一步处理,适用于自然语言处理、法律文本分析及财务建模等场景。推荐使用DuckDB的hf://协议无缝访问HuggingFace上的文件,避免本地下载带来的存储开销。查询结果可导出为CSV或Parquet格式,便于集成到下游工作流中。
背景与挑战
背景概述
该数据集由研究者arthrod创建,旨在从美国证券交易委员会(SEC)的EDGAR系统中捕获并镜像EX-10(重大合同)附件。核心研究问题在于为金融、法律及监管科技领域提供结构化、可查询的公开合同数据源。数据集以Parquet格式持久化存储,并支持通过DuckDB等工具进行高效分析,填补了传统SEC文本数据非结构化、难以批量获取的空白,对量化金融、合规自动化及合同条款分析等研究方向具有显著推动力。
当前挑战
领域任务层面,解决了SEC EDGAR海量非结构化附件(如EX-10重大合同)难以自动提取、标准化与实时查询的痛点,这些数据对金融风险建模、法律条款对比及市场事件研究至关重要。构建过程中面临诸多技术挑战,包括:上游SQLite数据源的并发更新与同步稳定性、不同格式附件(PDF/HTML/文本)的解析与Markdown标准化、多源元数据(如filing_metadata JSON)的融合一致性,以及公开接口在高频访问下的速率限制与容错机制。
常用场景
经典使用场景
在金融与法律交叉研究领域,sec-ex10-exhibits数据集为分析美国上市公司重大合同披露行为提供了结构化数据基石。它完整收录了SEC EDGAR系统中EX-10格式的材料合同附件,涵盖从合同类型、描述到时间戳的元信息。研究者常将其与公司财务数据或治理指标关联,以探究合同条款与市场反应、企业绩效之间的内在联系。
解决学术问题
该数据集有效解决了传统上分散于非结构化文档中的重大合同信息的整合难题,使学者得以系统性考察高管薪酬契约、并购协议等关键条款的披露模式。其贡献在于揭示了合同细节与公司治理质量、信息不对称程度之间的统计学关联,推动了法律与金融跨学科领域的实证研究进程。
衍生相关工作
基于该数据集衍生的经典工作包括:构建合同条款数据库以训练法律文本分析模型,开发量化契约异质性的指标,以及联合企业事件数据库研究重大合同公告对股价的影响。这些研究进一步催生了面向SEC文本的自动化信息提取工具和实时合规预警系统。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务