遇见数据集

AgenticFinLab/PortBench-QA

收藏
Hugging Face2026-05-28 更新2026-05-31 收录
官方服务:

资源简介:

PortBench QA数据集包含6,269个结构化问答对,用于探究基于相关性的多资产投资组合管理金融推理。该数据集从PortBench市场基础数据集生成,涵盖7个任务模板(T1-T7),复杂度从1(单资产)到4(完整投资组合),包括回报预测、风险评估、头寸规模调整、成对分配、多资产优化、再平衡决策和状态检测等任务。数据分为训练集(2015-01-02至2022-12-31,1,941对)、验证集(2023-01-01至2024-12-31,2,700对)和测试集(2025-01-01至2025-12-31,1,628对)。每个JSONL记录包含唯一标识符、模板、复杂度、分割、市场状态、资产类别、资产列表、决策日期、市场上下文摘要、问题、答案、数值答案、解释和元数据等字段。85.3%的问答对在上下文窗口中包含相关新闻文本(平均3,997字符)。数据按市场状态(牛市、熊市、横盘、危机)分层,以支持按状态分解性能。数据集旨在评估LLM的金融推理能力、基准测试基于相关性的多资产决策,并比较静态知识(问答准确率)与动态管道性能(CEPS)。所有问题仅使用决策日期或之前的信息,真实答案基于未来实现数据计算,但未包含在问题或上下文中。

--- 语言: - 英语(en) 许可证:apache-2.0 任务类别: - 问答(question-answering) - 文本生成(text-generation) 标签: - 金融 - 投资组合管理(portfolio-management) - 多资产(multi-asset) - 基准(benchmark) - 金融推理(financial-reasoning) - 相关性(correlation) 数据规模类别: - 100万<样本量<1000万 --- [![论文](https://img.shields.io/badge/arXiv-2605.27887-b31b1b)](https://arxiv.org/abs/2605.27887) [![代码](https://img.shields.io/badge/GitHub-PortBench-blue)](https://github.com/AgenticFinLab/portbench) # PortBench问答数据集 ## 数据集描述 本数据集包含6269组结构化问答样本,用于探究多资产投资组合管理中的相关性驱动金融推理能力,数据源自PortBench市场基础数据集。 ### 任务模板 | 任务模板 | 任务内容 | 复杂度 | 样本量 | |----------|----------|:------:|-------:| | T1 | 收益预测——未来N个交易日的涨跌方向 | 1(单资产) | 1000 | | T2 | 风险评估——给定置信水平下的风险价值(VaR) | 1 | 1000 | | T3 | 头寸规模确定——给定最大回撤约束 | 1 | 1000 | | T4 | 两两资产配置——双资产组合的方差最小化 | 2(两两资产) | 1000 | | T5 | 多资产优化——3种及以上资产的夏普比率最大化 | 3(多资产) | 1000 | | T6 | 再平衡决策——基于阈值的触发条件 | 3 | 778 | | T7 | 市场状态检测——识别多头/空头/盘整行情并调整配置 | 4(全投资组合) | 491 | ### 数据集划分 | 数据集划分 | 时间区间 | 样本量 | |------------|----------|-------:| | 训练集 | 2015-01-02 – 2022-12-31 | 1941 | | 验证集 | 2023-01-01 – 2024-12-31 | 2700 | | 测试集 | 2025-01-01 – 2025-12-31 | 1628 | ### 数据字段 | 字段名 | 数据类型 | 字段说明 | |--------|----------|----------| | `id` | 字符串 | 唯一标识符,格式为`{template}_{class}_{date}_{seq}` | | `template` | 字符串 | 任务模板(T1至T7) | | `complexity` | 整数 | 难度等级(1至4) | | `split` | 字符串 | 数据集划分(训练集/验证集/测试集) | | `market_regime` | 字符串 | 市场行情状态(多头/空头/盘整/危机) | | `asset_class` | 字符串 | 目标资产类别 | | `assets` | 字符串列表 | 涉及的标的代码(ticker) | | `decision_date` | 字符串 | 时点决策日期,格式为YYYY-MM-DD | | `context_summary` | 字符串 | 市场上下文窗口,包含价格、宏观经济、相关性、新闻等信息 | | `question` | 字符串 | 包含所有必要数值上下文的问题文本 | | `answer` | 字符串 | 标准答案 | | `answer_numeric` | 浮点数 | 数值化标准答案,用于模型评估 | | `explanation` | 字符串 | 答案的分步推导说明 | | `metadata` | 对象类型 | 额外元数据字段,包含未来收益、预测周期、波动率、文本覆盖度等 | ### 示例 json { "id": "T1_all_20251226_0002", "template": "T1", "complexity": 1, "split": "test", "market_regime": "sideways", "assets": ["DBB"], "decision_date": "2025-12-26", "question": "Asset: DBB Historical prices (past 60 trading days): start=20.40, end=22.01, cumulative_return=+7.9%, annualized_volatility=14.0% ... Predict whether the return of DBB over the next 21 trading days will be: positive (>+1%), negative (<-1%), or flat (within ±1%).", "answer": "flat", "answer_numeric": 0.0, "explanation": "The actual 21-day forward return for DBB starting 2025-12-26 was +0.00%, which classifies as 'flat'." } ### 文本覆盖度 85.3%的问答样本的上下文窗口中包含关联新闻文本,平均长度为3997个字符。 ### 市场行情状态分布 本数据集按照市场行情状态(多头/空头/盘整/危机)进行分层,以支持分行情下的模型性能拆解分析。 ### 预期用途 - 评估大语言模型(LLM)在四个难度等级下的金融推理能力 - 为基于相关性的多资产决策任务提供基准测试 - 对比静态知识问答准确率与动态流水线(CEPS)的性能表现 ### 时点(PiT)约束 所有问题仅使用决策日期`decision_date`当天或更早的可用信息,标准答案基于已实现的未来数据计算得出,且该未来数据不会出现在问题或上下文之中。

提供机构:
AgenticFinLab
搜集汇总
数据集介绍
AgenticFinLab/PortBench-QA 数据集图片
构建方式
PortBench-QA数据集源自PortBench市场基础数据集,通过精心设计的七类任务模板(T1至T7)生成总计6,269个结构化问答对。这些模板涵盖了从单资产回报方向预测到全组合制度检测的递进式复杂度,每一问答对均严格遵循时间点约束,仅使用决策日期前可获取的信息。地面实况答案则基于未来实现的真实数据计算,从而确保了评估的客观性与前瞻性。
特点
该数据集的核心特点在于其层次化的复杂度设计,包括单资产、双资产、多资产及全组合四个难度等级,使得模型在相关性驱动的金融推理能力评估上具有广泛的覆盖度。此外,数据根据市场制度分为牛市、熊市、震荡市和危机四类,便于进行分场景性能分解。有趣的是,85.3%的问答对融合了平均3,997字符的关联新闻文本,进一步丰富了上下文信息。
使用方法
使用PortBench-QA时,研究者可直接加载JSONL格式的记录,每个字段如问题、答案及逐步解释均清晰定义。数据划分为训练、验证和测试集,分别对应2015至2025年不同时间窗口。该数据集适用于评测大语言模型在投资组合管理中的推理能力,既可独立用于静态问答准确率评估,也可与动态流水线(如CEPS)结合进行端到端基准测试。
背景与挑战
背景概述
PortBench-QA数据集由Zhao、Chen与Su等研究者于2026年构建,旨在评估大语言模型在多资产组合管理中的相关性感知推理能力。该数据集覆盖2015至2025年间的市场数据,包含6,269个结构化问答对,横跨从单资产收益预测到全组合制度检测的七个任务模板。通过引入点时间约束与市场制度分层抽样,PortBench-QA为量化金融领域提供了一套严谨的基准,推动了语言模型在动态投资决策中的可解释性与鲁棒性研究。
当前挑战
该数据集主要应对两大挑战:其一,金融领域长期缺乏兼顾相关性建模与多资产交互的高质量问答基准,现有数据集多聚焦于简单文本理解,难以评估模型在波动率约束、夏普比优化等复杂任务中的推理能力;其二,构建过程中需确保所有问题仅依赖决策日前的可用信息,同时生成涵盖牛市、熊市、震荡市及危机等不同市场制度的平衡样本,这要求数据生成算法兼具时序一致性、制度多样性以及数值精度,以避免前瞻性偏差和样本不平衡问题。
常用场景
经典使用场景
PortBench-QA 是专为评估大型语言模型在多资产组合管理领域中基于相关性的金融推理能力而设计的结构化问答基准。该数据集包含6269个覆盖七种任务模板的问答对,难度从单一资产的价格方向预测(T1)到全投资组合层面的市场状态探测与动态调整(T7),为模型在金融决策链条上的逐步推理能力提供了系统化测试平台。研究者通常利用其分层设计,考察模型在风险度量(如VaR计算)、头寸规模设定、两两资产配置优化以及多资产夏普比率最大化等经典组合管理任务中的表现,从而填补了通用问答数据集在专业金融推理评估方面的空白。
解决学术问题
该数据集的核心贡献在于解决了金融与人工智能交叉领域中一个关键痛点:缺乏一个能够系统评估大语言模型在真实投资决策场景下进行多步推理、相关性分析和鲁棒性判断的标准化基准。传统金融数据集多聚焦于价格预测或情感分类,忽视了资产间动态相关性对组合构建与风险管理的影响。PortBench-QA 通过引入市场状态分层(牛、熊、震荡、危机)和点时间约束,使得研究者能够深入剖析模型在不同市场环境下的决策偏差与推理缺陷。它推动了从静态知识测试向动态决策能力评估的范式转变,为构建可信、可解释的金融AI代理提供了重要度量工具。
衍生相关工作
PortBench-QA 的发布催生了一系列围绕大语言模型金融推理能力的后续研究。有工作在此基础上构建了复合评估框架(CEPS),用于比较模型在纯问答模式与端到端流水线模式下的表现差异,揭示了知识调用与工具交互间的互补关系。另一些研究则借鉴其任务模板,开发了面向特定资产类别(如商品或外汇)的衍生数据集,扩展了多资产相关性分析的评估边界。此外,基于该数据集的难度分层设计,研究者提出了自适应提示策略,通过动态调整模型推理深度来提升复杂任务(T6、T7)的解答准确率。这些衍生工作共同推动了金融AI代理从简单预测向智能决策的实质性跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务