遇见数据集

morpho-finance-data

收藏
Hugging Face2026-09-06 更新2026-09-07 收录
官方服务:

资源简介:

Morpho Finance Data Corpus 是一个大规模、真实世界的金融数据集语料库,专为训练金融AI模型而设计。该数据集汇集了来自多个权威来源的金融与经济数据,包括美国证券交易委员会(SEC)EDGAR系统的公司提交文件(涵盖10,412家美国上市公司)、美联储(FRED)的49个经济指标(时间范围从1990年至今)、世界银行的38个发展指标(覆盖200多个国家)、欧洲央行(ECB)的统计数据、国际货币基金组织(IMF)的全球数据,以及CoinGecko的10种加密货币市场数据。此外,还提供了经过处理的高质量数据集,如超过8,000只美国股票的OHLCV历史数据(2,600万+行)、300种加密货币的市场数据、1,075个期权链数据、SEC文件元数据等。数据规模约为10GB至100GB,以原始格式(JSON、CSV)和Parquet等高效格式存储。该数据集适用于金融预测、宏观经济分析、风险建模、市场情绪分析、公司财务信息提取、加密货币研究等多种金融AI任务。许可证为MIT,允许自由使用和分发。

Morpho Finance Data Corpus is a large-scale, real-world financial dataset corpus designed for training financial AI models. It aggregates financial and economic data from multiple authoritative sources, including SEC EDGAR corporate filings (covering 10,412 US listed companies), 49 economic indicators from the Federal Reserve (FRED) (from 1990 to present), 38 development indicators from the World Bank (covering 200+ countries), European Central Bank (ECB) statistics, International Monetary Fund (IMF) global data, and market data for 10 cryptocurrencies from CoinGecko. Additionally, it provides processed high-quality datasets such as OHLCV historical data for over 8,000 US stocks (26 million+ rows), market data for 300 cryptocurrencies, 1,075 option chain datasets, and SEC filing metadata. The data size ranges from approximately 10GB to 100GB, stored in raw formats (JSON, CSV) and efficient formats like Parquet. This dataset is suitable for various financial AI tasks including financial forecasting, macroeconomic analysis, risk modeling, market sentiment analysis, corporate financial information extraction, and cryptocurrency research. The license is MIT, allowing free use and distribution.

创建时间:
2026-09-04
原始信息汇总

Morpho Finance Data Corpus 数据集详情

基本概况

  • 语言:英文
  • 许可证:MIT
  • 数据规模:约 10GB 至 100GB
  • 任务类型:其他(金融 AI 模型训练)
  • 标签:金融、经济、股票市场、SEC EDGAR、宏观经济、另类数据

数据集结构

数据集分为 raw(原始数据)processed(处理后数据) 两大类:

raw/ 原始数据目录

子目录 数据来源 主要内容
sec_edgar/ SEC EDGAR 10,412 家美国上市公司的提交文件、JSON 格式的公司提交记录
sec_search/ SEC 全文搜索元数据
sec_full_index/ SEC EDGAR 1993-2024 年主索引
sec_filings/ SEC 备案 HTML 文档
fred/ 美联储 49 项经济指标 CSV(GDP、失业率、CPI、利率、收益率、油价等),时间范围 1990 年至今
ecb/ 欧洲央行 汇率、利率、货币总量等统计数据
imf/ 国际货币基金组织 各国 GDP、通胀、失业率数据
worldbank/ 世界银行 200+ 国家的 38 项发展指标(GDP、人口、健康、教育、贸易),JSON 格式
crypto/ CoinGecko 10 种加密货币的历史价格与市值数据(JSON)
hexscr_sec_filings/ Hexscr SEC 备案文件

processed/ 处理后数据目录

子目录 内容描述
yfinance_ohlcv/ 8,000+ 美国股票的 OHLCV 数据,超过 2600 万行(Parquet 格式)
crypto_market/ 300 种加密货币市场数据(Parquet)
options_chains/ 1,075 个期权链数据(Parquet)
sec_filings_meta/ SEC 备案元数据(Parquet)
sec_xbrl_facts/ SEC XBRL 公司事实数据(Parquet)
worldbank_indicators/ 世界银行处理后指标(Parquet)

使用示例

数据集可通过 Hugging Face 的 hf:// 路径直接加载,示例包括:

  • 读取股票 OHLCV 数据:使用 pandas.read_parquet() 加载 processed/yfinance_ohlcv/ohlcv_shard_00.parquet
  • 读取 FRED 经济指标:使用 pandas.read_csv() 加载 raw/fred/GDP.csv
  • 读取 SEC 公司提交文件:使用 json.load() 加载 raw/sec_edgar/submissions/AAPL.json

数据特点

  • 覆盖面广:涵盖美国上市公司、宏观经济指标、国际组织数据、加密货币市场等多元金融数据
  • 来源权威:数据来自 SEC、美联储、世界银行、欧洲央行、国际货币基金组织等官方机构
  • 格式多样:包含 CSV、JSON、Parquet、HTML 等多种数据格式
  • 数据量大:处理后数据包含数千万行级别的结构化数据,适合大规模金融 AI 模型训练
搜集汇总
数据集介绍
morpho-finance-data 数据集图片
构建方式
该数据集由Morpho Finance精心构建,其构建过程遵循了严谨的分层架构,旨在汇聚海量、多元且真实的金融数据。原始数据层(raw)系统性地集成了来自美国证券交易委员会(SEC EDGAR)的上万家公司文件、联邦储备经济数据(FRED)、欧洲中央银行、国际货币基金组织及世界银行等权威机构发布的宏观指标,同时囊括了加密货币市场数据。加工数据层(processed)则运用自动化流水线,对原始数据进行清洗、结构化与标准化处理,最终形成以柱状存储格式(如Parquet)呈现的高效分析型数据集,涵盖股票OHLCV、期权链、XBRL公司事实等关键字段。
特点
数据集的核心特点在于其极致的全面性与维度多样性。横向上,整合了传统证券市场、宏观经济、国际组织统计与新兴数字资产等不同金融子领域,纵向上,时间跨度覆盖了自1990年代至今的长期历史数据,在规模上已达到数十GB级别。此外,其数据颗粒度精细,不仅包含日频的市场交易数据,更深入到公司申报的原始文本与结构化财务事实,为多模态金融分析及语言模型的预训练提供了丰饶的语料土壤。
使用方法
使用时,研究人员可通过HuggingFace的数据集加载机制便捷地获取数据。数据文件在目录结构中按来源与处理阶段清晰划分,用户既可直接利用Python的Pandas库以流式方式读取Parquet或CSV格式的加工后数据,进行量化模型构建与回测,亦可加载如SEC公司申报文件等原始JSON数据,用于自然语言处理任务或微观财务研究。加载路径遵循标准的'hf://datasets/...'协议,确保了与主流数据科学工作流的无缝对接。
背景与挑战
背景概述
该数据集由Blue Morpho Limited机构于近年创建,旨在为金融AI模型提供大规模、真实世界的数据支撑。其核心研究问题聚焦于整合多元金融数据源,涵盖SEC EDGAR企业申报、FRED经济指标、世界银行发展指标、欧洲央行与IMF统计数据以及加密货币市场数据,以构建全面、多维的金融语料库。该数据集规模庞大,包含超过一万家美国上市公司的申报文件、八千余只股票的OHLCV数据及众多宏观经济指标,对金融自然语言处理、量化分析及经济预测等领域具有显著推动作用,为研究者提供了丰富的数据资源,促进了金融AI模型的训练与评估。
当前挑战
该数据集面临的挑战主要包括:一是领域整合难题,即需融合来自不同机构、格式各异的数据源,如SEC的结构化XBRL事实、FRED的CSV时间序列及世界银行的JSON指标,确保数据的一致性与可比性;二是数据质量与更新问题,需处理历史数据的缺失、异常值及时间戳不统一,并维持自1990年至今的长期序列的完整性;三是规模与计算压力,26M+行的股票数据与10GB级存储量对处理效率提出高要求;四是隐私与合规性,需妥善处理企业敏感信息与市场数据版权,确保符合MIT许可及金融数据使用规范。
常用场景
经典使用场景
Morpho Finance Data数据集是一座汇聚多元金融信息的宏伟宝库,其内容横跨美国证券交易委员会(SEC)的官方申报文件、美联储的经济指标、世界银行的发展数据,以及加密货币市场的行情记录。这一数据集最为经典的应用场景,当属金融领域大规模语言模型与人工智能系统的预训练与微调。研究者和开发者可利用其涵盖的逾万家企业申报文档、数十项宏观经济时间序列,以及数百万条股票交易行情,构建能够理解金融术语、把握市场动态、生成合规报告的专业模型。该语料库为模型提供了真实且结构化的金融文本与数值数据,使其在语义理解与数值推理方面均能获得扎实的训练基础。此外,多源异构数据的融合特性,也为跨市场、跨资产类别的综合性金融分析模型研究提供了理想的实验场。
实际应用
在实际应用中,此数据集为量化投资、风险管理和监管科技等领域注入了强劲动力。资产管理机构可利用其丰富的OHLCV与期权链数据,训练模型以识别市场微观结构中的交易信号,优化算法交易策略。银行与信贷机构则可借助其中的宏观经济与行业财务指标,构建更精准的信用风险评估系统,提升对市场波动的预见性。对于金融监管机构而言,SEC文件的时序文本分析能力有助于实现自动化合规审查,高效监测信息披露的完整性与时效性。此外,加密货币数据的纳入为数字资产的风险计量与投资组合配置提供了新视角。基于该数据集的AI应用,正逐步改变从投资决策到风险控制的各个环节,驱动金融行业的智能化转型,提升运营效率与决策质量。
衍生相关工作
该数据集的发布催生了一系列金融AI领域的创新性后续工作。围绕其多源语料,研究者已开展金融领域大语言模型的专项训练,生成了能熟练进行财务问答、情绪分析与报告撰写的专业模型变体。基于其长达三十余年的宏观经济时间序列,衍生了众多关于经济周期预测、通胀趋势建模的实证研究。SEC文件的结构化解析推动了金融知识图谱的自动构建,为关系推理与深度问答提供了新资源。与此同时,跨市场数据集激发了关于股债联动、加密资产与传统市场溢出效应的量化分析。这些衍生工作不仅丰富了金融文本挖掘的方法论,还促进了数据驱动型金融研究生态的繁荣,使Morpho Finance Data成为连结原始数据与高端学术产出的关键枢纽,持续释放其内在的科研与商业价值。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务