oyi77/OpenMedallion
收藏官方服务:
资源简介:
OpenMedallion金融数据集是一个综合性金融数据集,专为量化研究和机器学习设计。它包含超过460万行数据,分布在54个Parquet文件中,覆盖22个金融领域,包括股票、外汇、加密货币、宏观经济学、去中心化金融(DeFi)、期权、市场情绪和人工智能训练数据。
Comprehensive financial dataset for quantitative research and machine learning — 4.6M+ rows across 54 parquet files covering 22 domains including equities, forex, crypto, macroeconomics, DeFi, options, sentiment, and AI training data.
提供机构:
oyi77搜集汇总
数据集介绍

构建方式
OpenMedallion金融数据集通过整合全球十余个权威数据源构建而成,涵盖FRED宏观经济指标、FinMind台美股及期货数据、FinanceDatabase多元金融工具、Binance加密货币K线、Deribit期权链、DefiLlama去中心化协议池、Yahoo Finance指数与ETF、SEC EDGAR企业文件、Etherscan链上数据及Google Trends搜索热度。所有原始数据经清洗、对齐与标准化后,存储为54个Apache Parquet列式文件,总计约461万行、370 MB,横跨22个金融子领域,形成一个层次分明、领域完备的量化研究资源库。
特点
该数据集最显著的特点在于其多维度的覆盖广度与深度,既包含传统股票、外汇、大宗商品的OHLCV时序数据,也囊括宏观经济指标、国债收益率曲线、期权 Greeks、DeFi TVL、链上指标及情感分析等新兴数据。此外,数据集特设了专用于大型语言模型微调的金融指令遵循数据(如finance_instruct系列及金融Alpaca格式样本),覆盖市场微观结构推理、知识三元组提取与交易思维链训练,兼具计量分析与AI建模的双重实用性。
使用方法
研究人员可通过Hugging Face datasets库一键加载整个数据集,或利用Pandas、Polars等工具直接读取单个Parquet文件,如使用`pd.read_parquet('hf://datasets/paijo77/OpenMedallion/data/fred_mega.parquet')`获取宏观经济序列。数据集适用于多任务场景:时间序列预测可选用`hf_5min.parquet`进行细粒度回测,因子建模可依托`financedb_equities.parquet`的21维特征,而NLP任务则可调用`financial_qa_10k.parquet`与`hf_trading_reasoning.parquet`训练金融领域语言模型。所有文件均以MIT协议开源,便于学术与商业场景下的二次开发。
背景与挑战
背景概述
OpenMedallion金融数据集由BerkahKarya团队于2026年创建,旨在为量化研究与机器学习提供全面、多源的金融数据基础。该数据集整合了来自FRED、Yahoo Finance、Binance、DefiLlama、SEC EDGAR等十余个权威数据源,涵盖股票、外汇、加密货币、宏观经济学、DeFi、期权、商品、情绪及AI训练数据等22个领域,总计超过460万行数据,存储为高效的Apache Parquet格式。其核心研究问题在于弥合传统金融数据与机器学习模型之间的鸿沟,为时间序列预测、文本生成、表格回归等任务提供统一、高质量的数据支撑。凭借其广泛的覆盖面与开放的许可证,OpenMedallion有望成为金融AI研究社区的重要基准资源,推动金融领域深度学习、大语言模型微调及多模态分析的发展。
当前挑战
OpenMedallion数据集所解决的领域问题在于金融量化建模中的数据碎片化与多源异构挑战。传统金融数据分散于不同平台,格式、频率与质量参差不齐,限制了模型的泛化能力与复现性。该数据集通过统一整合逾460万行数据,跨越22个领域,旨在为时间序列预测、文本生成、表格回归等任务提供标准化、可复现的研究基底。在构建过程中,团队面临了显著的数据融合挑战,包括不同API接口的速率限制、数据清洗与对齐(如时间戳标准化、异常值剔除)、跨市场跨资产类别的特征工程,以及隐私合规与版权许可的协调。此外,确保数据集的时效性、完整性与低成本可访问性,亦构成了持续的技术与资源挑战。
常用场景
经典使用场景
OpenMedallion数据集汇聚了跨越宏观经济学、股票、外汇、加密货币、衍生品、去中心化金融及市场情绪等22个金融领域的逾460万条结构化数据,为量化金融研究提供了多维度、长时序的丰富素材。其经典使用场景涵盖因子挖掘与多因子模型构建、统计套利策略开发与回测,以及基于深度学习的时序预测任务,如股价趋势预测、波动率建模与宏观经济指标关联分析。研究者可直接利用其中的OHLCV数据、收益率曲线、期权希腊值及链上指标等,快速搭建从数据管线到策略评估的完整实验框架,显著降低金融数据获取与清洗的时间成本。
衍生相关工作
基于OpenMedallion丰富的结构化与非结构化金融数据,已衍生出一系列具有里程碑意义的工作。研究团队利用其包含的50万条金融指令微调数据与Alpaca格式训练对,大幅改进了开放域大语言模型在财务报告解读、市场动态问答等垂直任务上的指令遵循能力。另一方面,其提供的跨交易所套利价差与期权隐含波动率曲面数据,催生了专门针对流动性挖矿策略优化、衍生品定价偏差捕捉的轻量化强化学习框架。此外,该数据集还推动了面向金融领域的命名实体识别基准测试集构建,以及融合新闻情感与链上活动的多模态市场情绪预测模型设计,成为计算金融交叉学科创新的重要数据基石。
数据集最近研究
最新研究方向
OpenMedallion数据集以超过460万行、覆盖22个金融领域的高质量时序与横截面数据,正成为量化金融与人工智能交叉研究的前沿枢纽。当前最受关注的方向是利用其丰富的宏观经济指标(如FRED百年序列)、多资产价格(股票、外汇、加密货币)及衍生品数据(期权、期货未平仓量)构建多模态预测模型,尤其是结合机器学习与因果推断方法挖掘跨市场套利与风险传导机制。同时,该数据集包含的大规模金融指令微调样本(如finance_instruct系列)为大型语言模型在金融领域的垂直适应提供了基石,推动了智能投研、实时情感分析与合规风控等应用的发展。值得注意的是,其涵盖DeFi协议TVL、去中心化交易所交易量以及链上指标的数据,支撑了传统金融与去中心化金融融合视角下的前沿探索,对于理解市场微观结构、优化算法交易策略具有重要的理论与实践意义。
以上内容由遇见数据集搜集并总结生成



