fenrix-pm-decision-news
收藏资源简介:
FENRIX PM决策新闻数据集是一个专为教授和研究者设计的金融新闻产品,旨在支持投资组合经理的决策研究。该数据集通过按意义组织新闻文章,促进金融分析和投资决策任务。当前版本为队友产品切片,包含从2026年7月队友事件包中提取的已验证数据。数据集共有44,904行数据,时间覆盖从2019年7月1日至2026年6月30日,存储于656个Parquet文件中。内容分为两大配置:teammate_news(包含572个文件)提供新闻文章内容,按主题细分为经济宏观(如宏观发布、利率、GDP、全球宏观)、行业板块(如能源、行业主题)、单只股票(如公司特定的Guardian新闻和标记行)、多公司背景以及市场背景(如监管、银行、地缘政治、未分类背景);teammate_structured(包含84个文件)提供官方的结构化经济和监管数据系列。数据来源于多个权威机构,包括Guardian、国际货币基金组织(IMF)、美联储经济数据(FRED)、联邦公报、GDELT项目、美国人口普查局、美国能源信息署(EIA)、美国经济分析局(BEA)、美国食品药品监督管理局(FDA)、消费者金融保护局(CFPB)、联邦存款保险公司(FDIC)和美国劳工统计局(BLS)。数据集包含41个字段,关键字段包括:article_id(文章ID)、article_group(文章组)、article_type(文章类型)、topic(主题)、market_scope(市场范围)、published_at(发布时间)、event_date(事件日期)、title(标题)、description(描述)、body(正文)、body_available(正文是否可用)、tickers(股票代码)、companies(公司)、sectors(行业板块)、macro_tags(宏观标签)、canonical_url(规范URL)、publisher(发布者)、source_id(来源ID)、license_class(许可证类别)、redistribution_status(再分发状态)等。该数据集适用于文本分类、特征提取等自然语言处理任务,特别适用于金融新闻分析、市场情绪研究、事件驱动投资策略以及经济指标跟踪等应用场景。使用前需注意数据来源具有混合的许可条款,应检查每行的license_class和redistribution_status字段,部分新闻内容(如Guardian)可能受到限制或需要非商业用途审查,而官方的宏观/监管结构化数据通常属于公共领域但需注明引用。
The FENRIX PM Decision News Dataset is a financial news product designed for professors and researchers, specifically tailored for portfolio manager decision-making research. It organizes news articles by meaning to support financial analysis and investment decision tasks. The current released version is the teammate product slice, containing verified data extracted from the July 2026 teammate event package. The dataset includes 44,904 rows of data, covering the period from July 1, 2019, to June 30, 2026, stored in 656 Parquet files. The content is divided into two main configurations: teammate_news (with 572 files) provides news article content, subdivided into topics such as economic macro (macro releases, interest rates, GDP, global macro), industry sectors (energy, industry themes), individual stocks (company-specific Guardian news and ticker lines), multi-company context, and market context (regulation, banking, geopolitics, unclassified context); teammate_structured (with 84 files) provides official structured economic and regulatory data series. Data sources include multiple authoritative institutions, such as Guardian, International Monetary Fund (IMF), Federal Reserve Economic Data (FRED), Federal Register, GDELT Project, U.S. Census Bureau, U.S. Energy Information Administration (EIA), U.S. Bureau of Economic Analysis (BEA), U.S. Food and Drug Administration (FDA), Consumer Financial Protection Bureau (CFPB), Federal Deposit Insurance Corporation (FDIC), and U.S. Bureau of Labor Statistics (BLS). The dataset contains 41 fields, with key fields including: article_id (article ID), article_group (article group), article_type (article type), topic (topic), market_scope (market scope), published_at (publication time), event_date (event date), title (title), description (description), body (body text), body_available (body availability), tickers (ticker symbols), companies (companies), sectors (sectors), macro_tags (macro tags), canonical_url (canonical URL), publisher (publisher), source_id (source ID), license_class (license class), redistribution_status (redistribution status), etc. This dataset is suitable for natural language processing tasks such as text classification and feature extraction, particularly for financial news analysis, market sentiment research, event-driven investment strategies, and economic indicator tracking. Before use, note that data sources have mixed licensing terms; users should check the license_class and redistribution_status fields for each row, as some news content (e.g., Guardian) may be restricted or require non-commercial use review, while official macro/regulatory structured data is typically in the public domain but requires proper citation.
数据集概述
FENRIX PM Decision News 是一个为投资组合管理(PM)决策游戏设计的高容量数据集,旨在为PM提供经济、行业、市场、SEC文件及个股相关信息,帮助其做出“买入、卖出、重新配置或按兵不动”的决策。
数据集核心信息
- 时间窗口:2019年7月至2026年7月。
- 语言:英语。
- 许可协议:MIT。
- 任务类别:文本分类、特征提取、表格分类。
- 标签:金融、金融新闻、市场新闻、投资组合管理、PM决策、宏观经济、SEC EDGAR、结构化数据、非结构化数据、Parquet、文本、表格、时间序列。
数据集规模
| 指标 | 数值 |
|---|---|
| 最终公开仓库 | Scottswi/fenrix-pm-decision-news |
| 完整技术档案(Parquet文件数) | 3,249 |
| 技术档案大小 | 52.746 GB |
| 最终仓库审核后总文件数/Parquet文件数 | 105,373 / 105,327 |
Data/ 目录下产品Parquet文件数 |
102,078 |
| 教学就绪紧凑子集(行/列) | 51,326行 / 33列 |
| 官方SEC/EDGAR扩展(行数) | 15,033 |
| 最终32家公司Apify/新闻冲刺(行数) | 1,402 |
| PM窗口内Apify行数 | 1,382 / 1,402 |
| 受限本地CSV隔离文件(CSV数/行数) | 229 / 1,764,593(私有) |
数据配置
数据集提供多个配置,均以Parquet格式存储,使用load_dataset函数加载。
teaching_ready_compact:教学就绪紧凑子集,包含33列标准化记录,适合快速课堂使用。product_news:完整新闻产品树,包含所有新闻类别数据。sec_edgar:SEC/EDGAR文件数据。
数据目录结构
Data/ News/ Economic_Macro/ (通货膨胀、利率、增长等宏观经济新闻) Sector_Industry/ (零售、能源、半导体等行业新闻) Single_Stock/ (个股盈利、指引、法律等新闻) Multi_Company/ (同行比较、供应链事件等) Market_Context/ (收益率、波动率、地缘政治等市场背景) Structured/ (官方宏观数据、CFTC、GDELT等结构化数据) SEC/ (目标公司SEC文件,如8-K、EX-99等) Teaching_Ready_Compact/ (33列标准化教学子集) _SAMPLES/ (小样本文件) Docs/ Reports/ Archive/
数据来源与覆盖
数据集融合了多种来源,而非单一数据源:
- 高容量金融新闻源湖:包括FNSPID(大规模金融新闻骨干)、Kaggle大规模股票新闻、Hugging Face金融新闻数据集、GitHub金融新闻数据集等。其中FNSPID涉及1999年至2023年间4,775家标普500公司的1,570万条金融新闻。
- 官方及半官方市场数据:包括SEC/EDGAR文件、CFTC头寸数据、美联储/宏观政策文本、GDELT元数据、Guardian元数据。
- 最终32家公司Apify新闻冲刺:针对32家目标公司进行的定向新闻抓取,新增1,402条记录,其中1,382条在PM时间窗口内。
- 受限/私有数据源:229个、共1,764,593行的本地Bloomberg类CSV文件,仅在私有仓库中保存,不公开分发。
目标公司清单
数据集涵盖32家目标公司,列表如下:
| 股票代码 | 公司名称 |
|---|---|
| CL | Colgate-Palmolive |
| PEP | PepsiCo |
| TJX | TJX Companies |
| PM | Philip Morris International |
| AMZN | Amazon |
| HBAN | Huntington Bancshares / Huntington Bank |
| BLK | BlackRock |
| GOOGL | Alphabet / Google |
| AAPL | Apple |
| SBUX | Starbucks |
| NRG | NRG Energy |
| DIS | Disney / Walt Disney |
| ETSY | Etsy |
| RL | Ralph Lauren |
| TSLA | Tesla |
| NKE | Nike |
| AMD | Advanced Micro Devices |
| SNDK | SanDisk / Sandisk |
| APP | AppLovin |
| MCK | McKesson |
| NFLX | Netflix |
| PLTR | Palantir |
| GM | General Motors |
| KR | Kroger |
| TGT | Target Corporation |
| BAC | Bank of America |
| ORCL | Oracle |
| GIS | General Mills |
| AXP | American Express |
| JNJ | Johnson & Johnson |
| ADBE | Adobe |
| FDX | FedEx |
行记录类型
每一行数据可能代表以下类型之一:
- 新闻文章/标题(公司、宏观、行业、市场事件)
- SEC文件/披露(8-K、EX-99等)
- 结构化市场/事件数据(CFTC、GDELT元数据、事件日历)
- 仅元数据的新闻引用(URL/标题/发布者/日期,无全文)
- 教学就绪标准化记录(33列)
使用建议与限制
- Hugging Face网页视图可能低估文件大小或禁用预览,建议以报告和直接文件检查为准。
- 并非每一行都包含完整的文章正文,部分来源仅提供标题/元数据/URL级别信息。
- 受限的本地CSV文件不公开,仅供内部项目审查。
- 不同来源具有不同的使用许可,需参考行级别来源和再分发字段。
- 公司特定行并非为使游戏容易被识别而设计,后续游戏构建应匿名化公司身份。
- 技术档案体积庞大,建议课堂原型设计使用紧凑/教学子集。
验证报告
数据集包含以下验证报告,用于确认数据完整性与可用性:
| 报告路径 | 目的 |
|---|---|
Reports/Final_Product_Closeout_20260703.md |
最终交付摘要 |
Reports/final_product_closeout_20260703.json |
机器可读的最终验证 |
Reports/final_repo_tree_path_audit_after_archive_20260703.json |
归档复制后的最终树审计 |
Reports/Technical_Warehouse_Archive_Copy_20260703.md |
归档复制报告 |
Reports/final_dataset_inventory_compact.csv |
紧凑型清单 |
Reports/usability_remote_validation_20260703.json |
远程加载验证 |
Reports/Apify_32_Company_Sprint_20260703.md |
Apify冲刺摘要 |
Reports/Final_One_Hour_Expansion_Status_20260703.md |
SEC/隔离扩展摘要 |




