遇见数据集

AgenticFinLab/PortBench-Market

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

PortBench市场基础数据集是一个为期十年(2015年1月至2025年12月)的每日金融数据集,覆盖了六个异质资产类别(包括股票、债券、商品、房地产、加密货币和现金)的183种金融工具,专为多资产投资组合管理研究和大型语言模型评估设计。数据包含价格、成交量、收益率等字段,并整合了宏观经济指标(如联邦基金利率、CPI、失业率等)、新闻文本以及跨资产相关性结构。数据集以单个CSV文件形式提供,包含4,017行(交易日)和1,087列,严格遵循时间完整性约束,无前瞻偏差。它还突出了三个历史压力窗口(如2015年中国冲击、2020年COVID崩溃和2022年加密货币崩盘),支持静态问答生成、动态市场回放评估、压力测试和投资组合优化研究。

A ten-year (Jan 2015–Dec 2025) daily financial dataset covering 183 instruments across six heterogeneous asset classes, designed for multi-asset portfolio management research and LLM evaluation. It includes price, volume, return fields, macroeconomic indicators (e.g., Fed funds rate, CPI), news text, and cross-asset correlation structures. The dataset is provided as a single CSV file with 4,017 rows (trading days) and 1,087 columns, adhering to strict temporal integrity with no look-ahead bias. It highlights three historical stress windows (e.g., 2015 China Shock, 2020 COVID Crash, 2022 Crypto Collapse) and supports static QA generation, dynamic market replay evaluation, stress testing, and portfolio optimization research.

提供机构:
AgenticFinLab
搜集汇总
数据集介绍
AgenticFinLab/PortBench-Market 数据集图片
构建方式
PortBench-Market数据集基于十年(2015年1月至2025年12月)的日频金融数据构建,覆盖六大类异质性资产共计183种工具,包括股票、债券、大宗商品、房地产、加密货币及现金。数据源整合了Yahoo Finance的OHLCV行情与收益率、FRED的宏观经济指标(如联邦基金利率、CPI、失业率等),并辅以月度聚合的财经新闻文本及跨资产相关性矩阵,所有特征严格遵循时点约束,杜绝前视偏差。原始数据以单一CSV文件存储,包含4017个交易日及1087列字段,列名按资产类别_代码_字段进行统一编码,便于程序化调用。
使用方法
PortBench-Market专为双层次评估框架设计。用户可直接加载CSV文件,利用日期索引对齐日频时序数据,进行时序预测或因子生成。静态场景下,可基于数据随机生成金融推理问答题,测试模型知识推理能力。动态场景则内置五阶段管道评估,包括实时市场重放、投资组合优化及风格化压力测试,再现历史危机事件。跨资产相关性矩阵作为配套元数据,支持相关系数计算与协整检验,适用于量化套利策略回测与分散化研究。推荐结合HuggingFace数据集API或Pandas直接解析,实现零门槛快速实验。
背景与挑战
背景概述
PortBench-Market数据集由Zhao、Chen和Su等研究人员于2026年构建,隶属于PortBench基准体系,旨在为多资产投资组合管理与大语言模型评估提供标准化数据支撑。该数据集覆盖2015年至2025年共十年的日频金融数据,包含股票、债券、大宗商品、房地产、加密货币及现金六大类183种资产,并整合了宏观经济指标与月度新闻文本,为金融时序预测与文本生成任务奠定了坚实基础。通过引入点时间约束(Point-in-Time)和危机窗口(如2020年新冠崩盘),PortBench-Market在金融AI领域内促进了相关性感知与全流程评估的研究范式。
当前挑战
该数据集所解决的领域问题聚焦于多资产投资组合管理中模型对异质资产间动态相关性建模的不足,以及对历史危机情景缺乏系统性压力测试的挑战。在构建过程中,主要挑战包括:跨资产类别数据源的异构性与频率不一致(如日频资产价格与低频率宏观指标的对齐),新闻文本的月度汇总与市场事件间时滞的权衡,以及在确保无前瞻偏差的前提下对衍生特征进行严格的时间戳约束。此外,覆盖十年跨度且包含多种危机时期的数据整合还需应对碎缺失值处理与资产停牌期等实际难题。
常用场景
经典使用场景
PortBench-Market数据集专为多资产组合管理研究而构建,其经典使用场景涵盖时间序列预测与投资组合优化两大核心领域。研究人员可基于该数据集涵盖的183只金融工具(横跨股票、债券、商品、房地产、加密货币及现金六大资产类别)的日频数据,开展跨资产动态关联分析。数据集中包含的宏观经济指标(如联邦基金利率、消费者价格指数、失业率、收益率曲线利差等)与新闻文本特征,为构建融合基本面分析与市场情绪的量化模型提供了丰富素材。其严格的时间点约束(Point-in-Time)确保了所有特征均无前瞻性偏差,适合用于开发与回测真实交易环境下的投资策略。
解决学术问题
该数据集有效解决了金融时间序列研究中长期存在的多资产协同建模难题与数据稀疏性问题。传统金融数据集多侧重于单一资产类别(如仅股票或仅债券),难以捕捉跨市场风险传导效应。PortBench-Market通过提供六大资产类别的同步日频数据及交叉相关性矩阵,使研究者得以系统性探索资产间的时变联动关系。其所包含的三个历史压力窗口(2015年中国冲击、2020年新冠疫情崩盘、2022年加密货币崩盘)为压力测试提供了标准化基准,有助于揭示极端市场条件下投资组合的脆弱性。数据集中嵌入的宏观经济变量与新闻情绪特征,进一步推动了将自然语言处理与量化金融结合的交叉学科研究,显著提升了市场异常波动预测与风险管理的学术深度。
实际应用
在实际金融场景中,PortBench-Market支撑着从智能投顾到风险管理的多层次应用。金融机构可借助该数据集训练基于大语言模型(LLM)的智能投资助手,实现实时市场解读、资产配置建议与压力情景推演。数据集的标准化结构使得量化交易团队能够快速部署多资产配对交易策略、跨品种套利模型以及基于相关性矩阵的动态风险平价组合。此外,其包含的宏观经济指示器与新闻文本数据,可直接用于构建中央银行政策预期的预测系统或企业司库部门的流动性管理模型。数据集在设计上刻意覆盖了2020年疫情等极端市场事件,使其特别适用于开发保险公司的偿付能力压力测试与养老基金的长期资产负债匹配优化工具。
数据集最近研究
最新研究方向
PortBench-Market数据集为多资产组合管理与大语言模型(LLM)评估提供了前沿的基准框架,其覆盖2015至2025年间183种金融工具,横跨股票、债券、商品、房地产、加密货币及现金六大资产类别,并整合宏观指标与新闻文本,显著推动了金融领域时间序列预测与文本生成任务的交叉研究。当前研究方向聚焦于利用该数据集进行LLM驱动的动态投资组合优化,尤其是在市场压力窗口(如2020年COVID崩盘与2022年加密市场崩溃)下的抗压测试与跨资产相关性分析,通过严格遵守无前瞻偏差的时间完整性约束,确保了模型评估的因果真实性。这一工作紧密结合了资产配置智能化与生成式AI应用的热点事件,为量化金融与自然语言处理融合提供标准化评测平台,对发展更具鲁棒性的自主交易系统具有深远意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务