遇见数据集

fenrix-pm-decision-news

收藏
Hugging Face2026-07-03 更新2026-07-04 收录
官方服务:

资源简介:

FENRIX PM决策新闻数据集是一个专为教授和研究者设计的金融新闻产品,旨在支持投资组合经理的决策研究。该数据集通过按意义组织新闻文章,促进金融分析和投资决策任务。当前版本为队友产品切片,包含从2026年7月队友事件包中提取的已验证数据。数据集共有44,904行数据,时间覆盖从2019年7月1日至2026年6月30日,存储于656个Parquet文件中。内容分为两大配置:teammate_news(包含572个文件)提供新闻文章内容,按主题细分为经济宏观(如宏观发布、利率、GDP、全球宏观)、行业板块(如能源、行业主题)、单只股票(如公司特定的Guardian新闻和标记行)、多公司背景以及市场背景(如监管、银行、地缘政治、未分类背景);teammate_structured(包含84个文件)提供官方的结构化经济和监管数据系列。数据来源于多个权威机构,包括Guardian、国际货币基金组织(IMF)、美联储经济数据(FRED)、联邦公报、GDELT项目、美国人口普查局、美国能源信息署(EIA)、美国经济分析局(BEA)、美国食品药品监督管理局(FDA)、消费者金融保护局(CFPB)、联邦存款保险公司(FDIC)和美国劳工统计局(BLS)。数据集包含41个字段,关键字段包括:article_id(文章ID)、article_group(文章组)、article_type(文章类型)、topic(主题)、market_scope(市场范围)、published_at(发布时间)、event_date(事件日期)、title(标题)、description(描述)、body(正文)、body_available(正文是否可用)、tickers(股票代码)、companies(公司)、sectors(行业板块)、macro_tags(宏观标签)、canonical_url(规范URL)、publisher(发布者)、source_id(来源ID)、license_class(许可证类别)、redistribution_status(再分发状态)等。该数据集适用于文本分类、特征提取等自然语言处理任务,特别适用于金融新闻分析、市场情绪研究、事件驱动投资策略以及经济指标跟踪等应用场景。使用前需注意数据来源具有混合的许可条款,应检查每行的license_class和redistribution_status字段,部分新闻内容(如Guardian)可能受到限制或需要非商业用途审查,而官方的宏观/监管结构化数据通常属于公共领域但需注明引用。

The FENRIX PM Decision News Dataset is a financial news product designed for professors and researchers, specifically tailored for portfolio manager decision-making research. It organizes news articles by meaning to support financial analysis and investment decision tasks. The current released version is the teammate product slice, containing verified data extracted from the July 2026 teammate event package. The dataset includes 44,904 rows of data, covering the period from July 1, 2019, to June 30, 2026, stored in 656 Parquet files. The content is divided into two main configurations: teammate_news (with 572 files) provides news article content, subdivided into topics such as economic macro (macro releases, interest rates, GDP, global macro), industry sectors (energy, industry themes), individual stocks (company-specific Guardian news and ticker lines), multi-company context, and market context (regulation, banking, geopolitics, unclassified context); teammate_structured (with 84 files) provides official structured economic and regulatory data series. Data sources include multiple authoritative institutions, such as Guardian, International Monetary Fund (IMF), Federal Reserve Economic Data (FRED), Federal Register, GDELT Project, U.S. Census Bureau, U.S. Energy Information Administration (EIA), U.S. Bureau of Economic Analysis (BEA), U.S. Food and Drug Administration (FDA), Consumer Financial Protection Bureau (CFPB), Federal Deposit Insurance Corporation (FDIC), and U.S. Bureau of Labor Statistics (BLS). The dataset contains 41 fields, with key fields including: article_id (article ID), article_group (article group), article_type (article type), topic (topic), market_scope (market scope), published_at (publication time), event_date (event date), title (title), description (description), body (body text), body_available (body availability), tickers (ticker symbols), companies (companies), sectors (sectors), macro_tags (macro tags), canonical_url (canonical URL), publisher (publisher), source_id (source ID), license_class (license class), redistribution_status (redistribution status), etc. This dataset is suitable for natural language processing tasks such as text classification and feature extraction, particularly for financial news analysis, market sentiment research, event-driven investment strategies, and economic indicator tracking. Before use, note that data sources have mixed licensing terms; users should check the license_class and redistribution_status fields for each row, as some news content (e.g., Guardian) may be restricted or require non-commercial use review, while official macro/regulatory structured data is typically in the public domain but requires proper citation.

创建时间:
2026-07-02
原始信息汇总

数据集概述

FENRIX PM Decision News 是一个为投资组合管理(PM)决策游戏设计的高容量数据集,旨在为PM提供经济、行业、市场、SEC文件及个股相关信息,帮助其做出“买入、卖出、重新配置或按兵不动”的决策。

数据集核心信息

  • 时间窗口:2019年7月至2026年7月。
  • 语言:英语。
  • 许可协议:MIT。
  • 任务类别:文本分类、特征提取、表格分类。
  • 标签:金融、金融新闻、市场新闻、投资组合管理、PM决策、宏观经济、SEC EDGAR、结构化数据、非结构化数据、Parquet、文本、表格、时间序列。

数据集规模

指标 数值
最终公开仓库 Scottswi/fenrix-pm-decision-news
完整技术档案(Parquet文件数) 3,249
技术档案大小 52.746 GB
最终仓库审核后总文件数/Parquet文件数 105,373 / 105,327
Data/ 目录下产品Parquet文件数 102,078
教学就绪紧凑子集(行/列) 51,326行 / 33列
官方SEC/EDGAR扩展(行数) 15,033
最终32家公司Apify/新闻冲刺(行数) 1,402
PM窗口内Apify行数 1,382 / 1,402
受限本地CSV隔离文件(CSV数/行数) 229 / 1,764,593(私有)

数据配置

数据集提供多个配置,均以Parquet格式存储,使用load_dataset函数加载。

  • teaching_ready_compact:教学就绪紧凑子集,包含33列标准化记录,适合快速课堂使用。
  • product_news:完整新闻产品树,包含所有新闻类别数据。
  • sec_edgar:SEC/EDGAR文件数据。

数据目录结构

Data/ News/ Economic_Macro/ (通货膨胀、利率、增长等宏观经济新闻) Sector_Industry/ (零售、能源、半导体等行业新闻) Single_Stock/ (个股盈利、指引、法律等新闻) Multi_Company/ (同行比较、供应链事件等) Market_Context/ (收益率、波动率、地缘政治等市场背景) Structured/ (官方宏观数据、CFTC、GDELT等结构化数据) SEC/ (目标公司SEC文件,如8-K、EX-99等) Teaching_Ready_Compact/ (33列标准化教学子集) _SAMPLES/ (小样本文件) Docs/ Reports/ Archive/

数据来源与覆盖

数据集融合了多种来源,而非单一数据源:

  1. 高容量金融新闻源湖:包括FNSPID(大规模金融新闻骨干)、Kaggle大规模股票新闻、Hugging Face金融新闻数据集、GitHub金融新闻数据集等。其中FNSPID涉及1999年至2023年间4,775家标普500公司的1,570万条金融新闻。
  2. 官方及半官方市场数据:包括SEC/EDGAR文件、CFTC头寸数据、美联储/宏观政策文本、GDELT元数据、Guardian元数据。
  3. 最终32家公司Apify新闻冲刺:针对32家目标公司进行的定向新闻抓取,新增1,402条记录,其中1,382条在PM时间窗口内。
  4. 受限/私有数据源:229个、共1,764,593行的本地Bloomberg类CSV文件,仅在私有仓库中保存,不公开分发。

目标公司清单

数据集涵盖32家目标公司,列表如下:

股票代码 公司名称
CL Colgate-Palmolive
PEP PepsiCo
TJX TJX Companies
PM Philip Morris International
AMZN Amazon
HBAN Huntington Bancshares / Huntington Bank
BLK BlackRock
GOOGL Alphabet / Google
AAPL Apple
SBUX Starbucks
NRG NRG Energy
DIS Disney / Walt Disney
ETSY Etsy
RL Ralph Lauren
TSLA Tesla
NKE Nike
AMD Advanced Micro Devices
SNDK SanDisk / Sandisk
APP AppLovin
MCK McKesson
NFLX Netflix
PLTR Palantir
GM General Motors
KR Kroger
TGT Target Corporation
BAC Bank of America
ORCL Oracle
GIS General Mills
AXP American Express
JNJ Johnson & Johnson
ADBE Adobe
FDX FedEx

行记录类型

每一行数据可能代表以下类型之一:

  • 新闻文章/标题(公司、宏观、行业、市场事件)
  • SEC文件/披露(8-K、EX-99等)
  • 结构化市场/事件数据(CFTC、GDELT元数据、事件日历)
  • 仅元数据的新闻引用(URL/标题/发布者/日期,无全文)
  • 教学就绪标准化记录(33列)

使用建议与限制

  1. Hugging Face网页视图可能低估文件大小或禁用预览,建议以报告和直接文件检查为准。
  2. 并非每一行都包含完整的文章正文,部分来源仅提供标题/元数据/URL级别信息。
  3. 受限的本地CSV文件不公开,仅供内部项目审查。
  4. 不同来源具有不同的使用许可,需参考行级别来源和再分发字段。
  5. 公司特定行并非为使游戏容易被识别而设计,后续游戏构建应匿名化公司身份。
  6. 技术档案体积庞大,建议课堂原型设计使用紧凑/教学子集。

验证报告

数据集包含以下验证报告,用于确认数据完整性与可用性:

报告路径 目的
Reports/Final_Product_Closeout_20260703.md 最终交付摘要
Reports/final_product_closeout_20260703.json 机器可读的最终验证
Reports/final_repo_tree_path_audit_after_archive_20260703.json 归档复制后的最终树审计
Reports/Technical_Warehouse_Archive_Copy_20260703.md 归档复制报告
Reports/final_dataset_inventory_compact.csv 紧凑型清单
Reports/usability_remote_validation_20260703.json 远程加载验证
Reports/Apify_32_Company_Sprint_20260703.md Apify冲刺摘要
Reports/Final_One_Hour_Expansion_Status_20260703.md SEC/隔离扩展摘要
搜集汇总
数据集介绍
fenrix-pm-decision-news 数据集图片
构建方式
该数据集专为投资组合管理决策场景设计,整合了多维度的金融信息源。其构建以投资经理的日常决策问题为核心驱动——即根据现有信息判断买入、卖出、重新配置或按兵不动。数据采集跨越2019年7月至2026年7月,融合了大规模金融新闻源湖(如FNSPID、Kaggle海量股票新闻)、官方披露文件(SEC/EDGAR的8-K和EX-99事件)、半官方市场数据(CFTC持仓、美联储政策文本、GDELT元数据)以及针对32家目标公司的Apify定向抓取冲刺。最终形成一个包含10万余个Parquet文件、总容量超过52GB的庞大数据架构,并从中提炼出精简的教学子集。
特点
该数据集最为显著的特征在于其高度结构化的层次体系与决策导向性。数据并非原始新闻的简单堆砌,而是精心划分为宏观经济、行业动态、个股事件、多公司比较和市场背景五大新闻类别,辅以结构化事件数据与SEC申报文件。每一行数据均承载明确的投资决策相关性,涵盖新闻标题、SEC披露、结构化市场指标或标准化教学记录等类型。数据集尤为强调时间分布的均匀性,确保信息跨越七年而非集中于单一时期,从而支持真实投资情境的模拟。32家目标公司涵盖消费品、科技、金融、工业等多个领域,且包含如APP、GM等易混淆代码的公司名称标注,防止机器学习过程中的简单匹配谬误。
使用方法
用户可通过HuggingFace Datasets库便捷加载该数据集,推荐优先使用教学就绪精简子集进行原型探索。加载时通过指定Parquet数据文件路径,如`Data/Teaching_Ready_Compact/*.parquet`,即可获得包含33个标准化列、51,326条记录的高质量子集。高级用户可加载完整新闻产品树、SEC/EDGAR专项集或Apify公司冲刺数据,以满足不同研究深度需求。数据集中包含的标准化字段如`source_id`、`published_at`、`tickers`、`article_group`等,便于进行时序分析、主题建模或情感与市场反应的关联研究。需注意HuggingFace Web界面可能因数据规模庞大而低估文件大小,应以直接加载和验证报告为事实依据。
背景与挑战
背景概述
该数据集由Scottswi团队于2026年7月创建,旨在模拟投资组合经理(PM)在真实市场环境中的决策过程。其核心研究问题为:在给定时间范围内可获得的经济、行业、市场及公司特定信息下,PM应如何执行买入、卖出、再平衡或按兵不动的操作。数据集跨越2019年7月至2026年7月,整合了包括FNSPID金融新闻、SEC/EDGAR官方文件、Apify新闻抓取及GDELT宏观事件元数据在内的多源异构数据,覆盖32家目标公司。作为FENRIX PM决策游戏的核心支撑,该数据集在金融自然语言处理与量化投资教学领域具有开创性意义,为构建动态、真实的市场模拟环境提供了标准化数据基础。
当前挑战
该数据集所解决的领域问题核心在于金融时间序列决策中的信息过载与噪声干扰,传统模型难以从海量、多源、非结构化的新闻与文件中提取有效信号用于自动化投资决策。构建过程中面临三大挑战:首先,数据源的异构性与合规性冲突,需调和FNSPID、SEC/EDGAR等不同许可协议的公共数据与私有受限CSV,并构建隔离的检疫工作流;其次,大规模数据清洗与归一化,需处理52.7GB的Parquet文件,确保时间对齐、公司实体消歧(如歧义股票代码‘APP’对应AppLovin)、以及教学子集与完整仓库的一致性;最后,实时决策模拟的时序完整性,需确保事件分散于七年窗口而非聚集于单一时段,同时规避通过公司特定信息反向识别游戏目标的反向工程风险。
常用场景
经典使用场景
在金融与投资管理的研究与教学中,该数据集被广泛用于构建投资组合经理(PM)的决策模拟环境。其核心价值在于提供了一个整合宏观经济新闻、行业动态、企业特定事件及SEC披露的多源异构信息库,覆盖2019年至2026年间32家代表性公司。研究者可通过该数据集训练模型,在时间序列上模拟'买入、卖出、重新配置或持有'等经典操作决策,从而探索信息冲击下的资产定价逻辑与最优组合策略。
解决学术问题
该数据集有效解决了金融学术研究中长期存在的'信息-决策'映射难题。传统研究常受限于单一数据源或小样本窗口,难以捕捉多维度市场信息对组合管理决策的复杂影响。FENRIX PM Decision News通过提供结构化的新闻、宏观数据与SEC文件,使学者能够系统性地量化新闻情绪、行业关联与政策事件对投资决策的因果效应,为行为金融学、市场微观结构与资产定价理论提供了实证基石。
衍生相关工作
围绕该数据集已衍生出多项经典学术与工程工作。FNSPID作为其核心新闻源之一,推动了金融时间序列与新闻文本对齐的基准研究;SEC/EDGAR子集催生了面向公司监管文本的异常检测模型,如基于8-K文件的实时欺诈信号提取。教学子集则被多所商学院纳入案例库,衍生出拍卖式投资竞赛的课堂框架,以及结合GDELT元数据的全球宏观风险因子构建方法,形成了从数据到策略验证的完整闭环。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务