fed-pulse-training-package
收藏官方服务:
资源简介:
该数据集是fed-pulse FOMC文本分析项目的训练语料库,旨在支持货币政策相关的研究和分析。它包含多个核心文件:events.parquet(规范FOMC事件数据集)、数据分割和折叠清单、rates_panel.parquet(利率面板)、linguistic_features.parquet(语言特征)、mp_surprises.parquet(货币政策意外数据)、macro_state.parquet(宏观状态数据)和registry_normalized.jsonl(规范化注册表),以及质量报告。数据来源于多个公开渠道:FOMC声明、会议纪要和新闻发布会从美联储理事会网站抓取,并整合了来自gtfintechlab/fomc_communication和drlexus/fed-statements-and-minutes的监督标签;国债收益率和宏观系列来自FRED;股票和波动率价格通过yfinance从Yahoo Finance获取;货币政策意外系列基于Acosta MPS及相关公共数据集。数据集适用于文本分析、金融时间序列预测、货币政策影响评估等任务,支持机器学习和自然语言处理应用。
创建时间:
2026-05-27
原始信息汇总
数据集概述:yusufizzetmurat/fed-pulse-training-package
基本信息
- 许可证:MIT
- 标签:fed-pulse, monetary-policy, fomc
- 来源代码:https://github.com/yusufizzetmurat/fed-pulse
- 在线演示:https://fedpulse.yusufizzetmurat.com
数据集内容
该数据集是联邦公开市场委员会(FOMC)文本分析项目“fed-pulse”的训练语料库,包含以下文件:
events.parquet:规范化FOMC事件数据集- 数据划分与折叠清单文件
rates_panel.parquet:利率面板数据linguistic_features.parquet:语言特征数据mp_surprises.parquet:货币政策意外数据macro_state.parquet:宏观经济状态数据registry_normalized.jsonl:规范化的注册数据- 质量报告文件
训练命令
使用以下命令准备全部数据: bash python -m app.data.pipeline_data_prep --all-sources
数据来源与归属
- FOMC声明、会议纪要和新闻发布会:来自美联储理事会官网(美国政府公共领域),监督标签合并自
gtfintechlab/fomc_communication数据集和历史上的drlexus/fed-statements-and-minutesKaggle档案 - 国债收益率和宏观经济序列:来自FRED数据库
- 股票/波动率价格:通过yfinance从雅虎财经获取
- 货币政策意外序列:来自Acosta MPS及相关公开数据集
搜集汇总
数据集介绍

构建方式
该数据集依托联邦公开市场委员会(FOMC)的文本分析项目构建,核心语料源自美联储官网爬取的会议声明、纪要与新闻发布会记录,并融合了gtfintechlab的监督标签以及Kaggle历史档案。此外,数据集整合了来自FRED的美国国债收益率与宏观序列、Yahoo Finance的权益与波动率数据,以及Acosta MPS的货币政策冲击系列。通过统一的流水线脚本`python -m app.data.pipeline_data_prep --all-sources`,将上述多源异构数据清洗、对齐并合并为标准的Parquet和JSON格式文件,以确保数据的一致性与可复现性。
特点
数据集以事件驱动为核心,涵盖FOMC会议日期、分组信息、利率面板、语言特征、货币政策冲击及宏观状态等多维结构化数据。其独特之处在于模型训练包的完整性,包含数据分割清单、折叠清单及质量报告,便于进行交叉验证与鲁棒性评估。数据来源兼具权威性(美联储官方与FRED)与时效性,标签经过人工与历史档案的双重校验,为货币政策的文本量化分析提供了可靠的高质量基准。
使用方法
用户可通过HuggingFace Datasets库直接加载该数据集,或利用提供的数据准备脚本复现整个建库流程。推荐使用`datasets.load_dataset('yusufizzetmurat/fed-pulse-training-package')`一键获取处理完成的训练包。研究人员可基于事件序列、语言特征与利率变量进行时间序列建模、情绪分析或政策效应识别。同时,项目提供的在线演示平台(fedpulse.yusufizzetmurat.com)支持交互式探索,降低了非技术用户的使用门槛。
背景与挑战
背景概述
在宏观经济分析与货币政策研究领域,美联储联邦公开市场委员会(FOMC)的沟通文本蕴含了丰富的政策信号,对金融市场波动与预期管理具有深远影响。为系统性地解析这些非结构化数据,fed-pulse-training-package数据集应运而生,由研究者Yusuf Izzet Murat于近期构建并公开。该数据集整合了FOMC声明、会议纪要及新闻发布会等核心文本,并融合了来自gtfintechlab等权威来源的监督标签,以及源自FRED、Yahoo Finance等平台的宏观与市场数据,旨在为文本驱动的货币政策分析提供标准化的训练语料。其影响力在于填补了金融自然语言处理领域中高质量、多模态FOMC事件数据集的空白,为学术研究与量化策略开发奠定了坚实基础。
当前挑战
该数据集面临的核心挑战首先在于领域问题的复杂性:FOMC沟通文本蕴含微妙的语义变化与前瞻性指引,传统文本分析难以捕捉其中隐含的货币政策立场转变及市场冲击,需要模型具备对经济语境与政策逻辑的深层理解。其次,构建过程中的挑战显著,包括跨来源数据(如FOMC文本、国债收益率、股票波动率及货币政策惊喜指数)的时间对齐与异构整合,以及从公开网页(如美联储官网)进行大规模、持续性的文本爬取与质量核验。此外,历史标签的合并与监督信号的标准化需处理不同数据源间的标注偏差,确保训练语料的一致性与可靠性,这对数据管道的稳健性提出了极高要求。
常用场景
经典使用场景
在金融文本分析与货币政策研究领域,联邦公开市场委员会(FOMC)的官方沟通文本——如声明、会议纪要及新闻发布会实录——是洞察美联储政策倾向的关键信息源。fed-pulse-training-package数据集正是为此而生,它将上述原始文本与经过严格标注的监管标签、宏观经济状态指标及货币政策意外冲击数据相融合,构成了一个结构完整、多维对齐的训练语料库。研究者可借助该数据集训练自然语言处理模型,从历史政策文本中提取语义特征,识别不同时期FOMC的沟通风格与措辞变化,进而构建预测美联储利率决策走向的文本基准模型,这是其最为经典的核心应用场景。
实际应用
在实际金融场景中,该数据集的价值体现在高频自动交易策略和宏观风险预警系统中。资产管理机构可以基于此数据集微调大型语言模型,实时解析FOMC会议期间的声明文本,将释放出的政策信号转化为量化交易信号,从而在利率决议公布后的关键几分钟内优化国债期货与外汇敞口的配置。此外,中央银行及国际金融机构亦能利用该数据集构建内部监控仪表盘,对历史与当下的美联储沟通进行标准化情绪评分,辅助判断市场预期的非理性波动,为风险合规部门提供事前预警。这种基于文本驱动的决策支持,正在改变传统依靠人工分析师逐一解读会议纪要的作业模式。
衍生相关工作
围绕fed-pulse-training-package数据集,学术界与工业界已衍生出多项标志性工作。项目本身的GitHub仓库提供了完整的fed-pulse文本分析流水线,展示了如何通过管道式数据预处理清洗FOMC原始文档。此外,该数据集的监管标签借用了gtfintechlab/fomc_communication项目的标注成果,而历史语料部分则参考了drlexus/fed-statements-and-minutes存档,形成了跨项目的数据复用生态。在方法层面,已有研究利用该数据集训练基于BERT的金融领域语言模型,并对比其与关键词统计方法在货币政策意外预测上的表现,推动了从简单词典法向深度学习语义理解范式的迁移。这些衍生工作共同构筑了一个以高质量标签和多模态数据为支点的研究社区,持续拓展着中央银行沟通分析的边界。
以上内容由遇见数据集搜集并总结生成



