遇见数据集

fenrix-pm-decision-news-staging

收藏
Hugging Face2026-07-02 更新2026-07-03 收录
官方服务:

资源简介:

FENRIX PM Decision News是一个专为学术研究人员(教授)设计的金融新闻数据集,主要用于投资组合经理决策研究。数据集根据文章意义进行组织,支持文本分类和特征提取等自然语言处理任务。当前版本(teammate切片)包含来自2026年7月teammate事件包的已验证数据,覆盖2019年7月1日至2026年6月30日期间的数据,总计44,904行,存储在656个Parquet文件中(其中572个为新闻文件,84个为结构化数据文件)。数据源多样,包括Guardian、IMF、FRED、Federal Register、GDELT、Census、EIA、BEA、FDA、CFPB、FDIC和BLS等权威机构。数据集主要分为两部分:新闻数据(按主题分类为宏观经济、行业板块、单只股票、多公司背景和市场背景等文件夹)和结构化数据(官方经济/监管序列)。包含41个字段,关键字段有文章ID、文章组、文章类型、主题、市场范围、发布时间、事件日期、标题、描述、正文、股票代码、公司、行业板块、宏观标签、发布者、许可类别和再分发状态等。需要注意的是,该版本不包含原始的ZIP、JSONL或TXT摄入文件,也不包含完整的仓库数据(37.57M行)。数据许可因来源而异,使用前需检查行级许可信息,并附带了详细的QA报告以供验证。

FENRIX PM Decision News is a financial news dataset designed for academic researchers (professors), specifically for portfolio manager decision research. Its content is organized based on article meaning to support natural language processing tasks such as text classification and feature extraction. The current released version (teammate slice) contains validated data from the July 2026 teammate event package, covering the period from July 1, 2019, to June 30, 2026. The data scale is 44,904 rows, stored in 656 Parquet files (572 news files and 84 structured data files). Data sources are diverse, including authoritative institutions such as Guardian, IMF, FRED, Federal Register, GDELT, Census, EIA, BEA, FDA, CFPB, FDIC, and BLS. The dataset mainly consists of two parts: news data (categorized into folders by topic such as macroeconomics, industry sectors, single stocks, multi-company context, and market context) and structured data (official economic/regulatory sequences). It includes 41 fields, with key fields such as article ID, article group, article type, topic, market scope, publication time, event date, title, description, body, ticker, company, industry sector, macro tags, publisher, license category, and redistribution status. Note that this version does not include original ZIP, JSONL, or TXT ingestion files, nor the full repository data (37.57M rows). Data licenses vary by source, and row-level license information should be checked before use. The dataset comes with a detailed QA report for validation.

创建时间:
2026-07-02
原始信息汇总

数据集概述:FENRIX PM Decision News

简要描述
面向投资组合经理决策研究的金融新闻产品,按文章语义组织,当前发布版本为已验证的团队成员产品切片(teammate product slice)。

许可证:MIT

任务类别:文本分类、特征提取

语言:英语

数据集大小:约44,904行(10K < n < 100K)

配置

  • teammate_news:新闻数据,Parquet格式,路径 Data/News/**/*.parquet
  • teammate_structured:结构化数据,Parquet格式,路径 Data/Structured/**/*.parquet

当前发布范围

指标 数值
已接受行数 44,904
日期覆盖范围 2019-07-01 至 2026-06-30
Parquet文件总数 656
Data/News Parquet文件 572
Data/Structured Parquet文件 84

数据来源

  • Guardian, IMF, FRED, Federal Register, GDELT, Census, EIA, BEA, FDA, CFPB, FDIC, BLS 等新闻行。

未包含内容

  • 原始zip、jsonl或txt intake文件
  • 完整仓库支持的产品构建(37,571,131行银层数据)——计划作为独立暂存构建
  • API密钥或导出的Parquet中的本地文件系统路径

文件夹布局

文件夹 内容
Data/News/Economic_Macro/ 宏观发布、利率、GDP、全球宏观
Data/News/Sector_Industry/ 能源、行业主题
Data/News/Single_Stock/ 公司特定Guardian和标记行
Data/News/Multi_Company/ 多公司上下文
Data/News/Market_Context/ 监管、银行、地缘政治、未分类上下文
Data/Structured/ 官方结构化经济/监管序列
Reports/ 团队成员摄取对账与QA报告
Docs/ 产品说明与教授指南

验证说明

使用Hugging Face API文件树和 Reports/Teammate_* 文件作为此发布的事实依据。不依赖数据集查看器预览,因其可能显示早期暂存状态的过时样本。

必需QA报告

  • Reports/Teammate_Ingest_Summary.csv
  • Reports/Teammate_Source_Row_Counts.csv
  • Reports/Teammate_Date_Coverage.csv
  • Reports/Teammate_Product_Path_Counts.csv
  • Reports/Teammate_Article_Group_Counts.csv
  • Reports/Teammate_Full_Text_Join_Report.csv
  • Reports/Teammate_Duplicate_Report.csv
  • Reports/Teammate_Secret_Scan_Report.csv
  • Reports/Teammate_Guardian_Ingest_Summary.csv
  • Reports/Teammate_Staging_Upload_Manifest.csv
  • Reports/Professor_Summary_Teammate_Update.md
  • Docs/Teammate_Data_Notes.md

快速加载示例

python import pandas as pd from huggingface_hub import hf_hub_download

path = hf_hub_download( repo_id="Scottswi/fenrix-pm-decision-news", filename="Data/News/Economic_Macro/Global_Macro/Imf/year=2020/month=01/part-imf-2020-01-00000.parquet", repo_type="dataset", ) df = pd.read_parquet(path) print(df.columns.tolist()) print(len(df))

模式(41列)

关键字段:article_id, article_group, article_type, topic, market_scope, published_at, event_date, title, description, body, body_available, tickers, companies, sectors, macro_tags, canonical_url, publisher, source_id, license_class, redistribution_status, provenance_uri, source_record_id, source_package, ingested_at_utc

许可与转载

来源有多种条款。在外部共享前,请使用行级 license_classredistribution_status。Guardian及部分新闻行可能为 restricted_or_unknown 或需非商业审查。官方宏观/监管结构化行通常为公共领域,需注明出处。

相关数据集

搜集汇总
数据集介绍
fenrix-pm-decision-news-staging 数据集图片
构建方式
该数据集名为FENRIX PM Decision News,面向投资组合管理决策研究,聚焦于财经新闻的语义组织。当前发布版本为经过验证的teammate产品切片,源自2026年7月的事件处理包。数据构建包含新闻与结构化两大模块:新闻部分涵盖经济宏观、行业板块、个股、多公司及市场背景等子领域,结构化部分则为官方经济与监管的时间序列数据。数据存储采用Parquet格式,共计656个文件,其中新闻文件572个,结构化文件84个,收录有效行数44,904条,时间跨度覆盖2019年7月至2026年6月。数据来源包括Guardian、IMF、FRED、Federal Register、GDELT、Census、EIA、BEA、FDA、CFPB、FDIC及BLS等权威机构。
特点
该数据集的核心特点在于其面向投资组合管理者的语义组织方式,将新闻按文章意义归类,而非简单按时间或来源排列。数据集包含41个字段,关键元数据包括文章ID、文章分组、类型、主题、市场范围、发布时间、事件日期、标题、描述、正文、相关股票代码、公司、行业、宏观标签、规范URL、发布者、来源ID、许可类别、再分发状态、溯源URI等,为细粒度的金融研究提供结构化支持。此外,数据集中每行均附带许可类别与再分发状态标签,便于用户在使用前评估版权与合规风险。当前版本仅为产品切片,完整的仓库后端数据(3757万行)将另行发布。
使用方法
用户可通过Hugging Face API快速加载该数据集,推荐使用`hf_hub_download`函数下载指定Parquet文件,并结合`pandas.read_parquet`读取。例如,可下载路径`Data/News/Economic_Macro/Global_Macro/Imf/`下的文件进行宏观分析。数据集配置文件包含`teammate_news`与`teammate_structured`两个子集,分别对应新闻与结构化数据,用户可按需加载。使用前建议查阅`Reports/`目录下的QA报告(如摄取摘要、来源行计数、日期覆盖、重复检测等)以确保数据完整性。需注意,部分新闻源(如Guardian)可能受限制或需非商业审查,用户应依据行级`license_class`和`redistribution_status`字段决定是否进行外部共享。
背景与挑战
背景概述
在金融科技迅猛发展的当下,海量异构金融新闻与非结构化数据的涌现,为投资组合管理者的决策研究带来了前所未有的信息过载挑战。FENRIX PM Decision News数据集由FENRIX团队于2026年创建,旨在通过语义组织与精细化标注,为基金经理提供高质量、可解释的财经新闻产品化数据支撑。该数据集涵盖2019年至2026年间的44,904条精选记录,整合了来自Guardian、IMF、FRED、GDELT等十余个权威数据源的新闻与结构化经济序列,并引入41列精细化Schema以描述文章的行业归属、宏观标签、公司关联与版权状态。其核心研究问题聚焦于如何将原始财经信息转化为面向组合管理决策的语义化特征,从而提升金融预测模型的可信度与可解释性。作为金融自然语言处理与量化投资交叉领域的前沿资源,该数据集为探索新闻事件与资产价格之间的因果关联提供了标准化实验平台,对推动金融AI从文本挖掘向可操作决策智能演进具有开创性意义。
当前挑战
该数据集所解决的领域挑战主要体现为:其一,金融新闻的语义异质性问题——来自不同源头的财经报道在主题粒度、市场范围与时间维度上高度不一致,传统分类方法难以有效映射至投资决策框架;其二,版权与再分发限制带来的合规风险,需在每行数据中标注license_class与redistribution_status以支持差异化使用。在构建过程中,团队面临多重挑战:首先,需从37.57M行的原始银湖仓库中筛选出经过终端用户验证的产品切片,涉及海量数据的去重、全文连接、秘密扫描与日期覆盖验证;其次,数据格式从zip、jsonl到Parquet的转换过程中,需确保字段无损且路径一致性;此外,多源数据的时间对齐与主题聚类也构成工程复杂性,最终仅保留满足教授验证标准的44,904行高质量子集,体现了在数据质量与规模之间寻求最优平衡的艰难取舍。
常用场景
经典使用场景
在金融投资研究领域,FENRIX PM Decision News数据集的核心经典用途在于为投资组合管理者构建基于语义理解的金融新闻决策支持系统。该数据集通过将来自Guardian、IMF、FRED、GDELT等多元权威信源的新闻与结构化经济序列进行语义对齐,形成按经济宏观、行业板块、个股事件、市场背景等维度精细划分的语料库。研究者常利用其41个标注字段(包括article_group、topic、market_scope、tickers、macro_tags等),开展金融新闻的文本分类任务,例如识别影响资产定价的关键事件类型、划分新闻的市场影响范围。同时,其丰富的元数据支持特征提取研究,可训练面向投资决策的嵌入模型,将非结构化的新闻文本转化为可供量化策略使用的语义特征向量。
衍生相关工作
基于FENRIX PM Decision News的设计理念与数据架构,已衍生出一系列具有影响力的研究工作。其中最核心的是其技术上游仓库FENRIX Financial News Lake(包含37.57M行经清洗的银级数据),为大规模金融预训练语言模型的训练提供了高质量语料基座。研究者依托该数据集的多元标注体系,发展出事件驱动型投资策略的端到端评估框架,将新闻语义特征纳入传统的因子模型进行实证检验。此外,数据集中article_group与market_scope的层级结构启发了金融领域知识图谱构建的探索,不少工作尝试利用其跨信源的信息关联来扩充事件因果链。最后,许可协议与重新分发策略的精细化设计(如license_class和redistribution_status字段)也为后续金融数据集的开源治理与合规使用树立了实践参照,推动了负责任的数据共享标准在金融自然语言处理社区中的普及。
数据集最近研究
最新研究方向
该数据集聚焦于面向投资组合管理决策的金融新闻语义结构化,整合了Guardian、IMF、FRED、GDELT等多元权威信源的宏观、行业及个股级文本与结构化数据,覆盖七年时间跨度。前沿研究方向正围绕事件驱动的资产定价、多源异构财经信息的特征融合、以及基于叙事经济的宏观风险建模展开。作为经人工验证的高质量产品切片,它不仅服务于量化策略中的新闻情绪因子构建,更成为连接非结构化财经文本与结构化的宏观经济序列之间的桥梁,为推动'新闻驱动型投资决策'从理论走向大规模实证提供了关键的数据基础设施。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务