遇见数据集

INVESTLOGICBENCH2026

收藏
arXiv2026-08-06 更新2026-08-08 收录
官方服务:

资源简介:

INVESTLOGICBENCH2026是一个面向大型语言模型投资逻辑评估的基准数据集,由论文作者构建。该数据集包含201,247条结构化决策记录,源自151位真实投资者的投资逻辑链,详细标注了市场事件、推理过程、决策行动及市场验证结果。数据集通过多源数据采集、双重逻辑提取(包括显性陈述分析与隐性模式推断)、基于真实市场数据的检索增强验证等四阶段流水线创建。其应用领域为金融智能体评估,旨在解决现有模型在动态市场环境中缺乏真实投资逻辑推理能力的问题,弥补静态问答基准与市场绩效之间的鸿沟。

INVESTLOGICBENCH2026 is a benchmark dataset for evaluating the investment reasoning capabilities of large language models (LLMs), developed by the authors of the corresponding research paper. This dataset contains 201,247 structured decision-making records derived from the investment reasoning chains of 151 real-world investors, with detailed annotations covering market events, reasoning processes, decision-making actions, and market validation outcomes. It was constructed via a four-stage pipeline encompassing multi-source data collection, dual logic extraction (including explicit statement analysis and implicit pattern inference), retrieval-augmented validation based on real market data, and additional standardized processing steps. Its targeted application is the evaluation of financial AI Agents, aiming to address the issue that existing models lack authentic investment logical reasoning capabilities in dynamic market environments, and bridge the gap between static question-answering benchmarks and actual market performance.

创建时间:
2026-08-06
搜集汇总
数据集介绍
INVESTLOGICBENCH2026 数据集图片
构建方式
INVESTLOGICBENCH2026的构建基于真实世界投资者的动态决策过程,通过四阶段流水线实现。首先,数据准备阶段摄取多源异构数据,包括视频评论、基金报告等;其次,代理逻辑处理阶段采用双通道分析,一方面提取投资者明确表述的投资逻辑,另一方面利用专有的股票投资逻辑引擎从交易历史中推断隐含逻辑模式,构建全面的行为画像;随后,检索增强生成验证阶段依托通用搜索引擎、金融数据库及事件预测市场进行逻辑保真度校验;最终,基准组装阶段将验证后的决策与代理画像整合为结构化的可查询知识图谱,每个数据实例包含代理画像及一系列决策,完整实例化E→R→D→O投资逻辑链。
特点
INVESTLOGICBENCH2026作为首个基于真实投资者事件驱动推理轨迹的基准,涵盖201,247条结构化决策,源自151位真实世界投资者,平均每位决策者约1332.8条决策。数据集突出事件驱动策略(占67.5%),兼顾长期价值、技术分析及宏观策略,覆盖多元资本规模与资产类别。其核心特点在于引入P→E→R→D→O完整逻辑链,每条决策均附带市场事件、推理过程、决策行动及市场验证结果,并通过RAG增强验证确保逻辑与现实市场数据高度一致。此外,基准提供三层次递进任务,支持从逻辑理解到端到端投资模拟的诊断性评估,揭示了能力-性能悖论,为量化投资逻辑缺口提供了可复现的市场对齐标准。
使用方法
INVESTLOGICBENCH2026的使用方法围绕三个递进任务展开:逻辑理解任务要求模型从给定代理文本中提取并概括投资逻辑;逻辑与论点生成任务要求模型依据当前事件和代理画像生成合理的投资逻辑及决策;端到端投资模拟任务则根据决策结合真实市场数据评估结果。评估过程采用高容量LLM作为自动裁判,从保真度、连贯性、合理性和一致性四个维度打分。用户可依据具体研究目标选择相应任务,通过对比模型输出与专家基准,诊断推理质量与决策成效,进而量化投资逻辑缺口,推动个性化金融代理的研发。
背景与挑战
背景概述
随着大语言模型在金融领域的广泛应用,从情感分析到宏观经济预测,其能力虽令人瞩目,但在真实交易环境中的表现却暴露出显著局限。现有评估体系大多聚焦于静态问答任务,忽视了对投资决策核心逻辑的考量。为此,INVESTLOGICBENCH2026基准于2026年由Yuanhong Jiang等研究者构建,旨在填补这一空白。该基准基于151位真实投资者的20余万条结构化决策记录,提炼出从投资者特征到市场事件、推理、决策及结果的全链路逻辑链条,首次实现了对模型投资逻辑的量化诊断。其发布标志着评估范式从被动知识回忆向主动推理转变,为开发个性化、市场契合的金融智能体奠定了坚实基础。
当前挑战
该基准揭示出当前大语言模型面临的核心挑战:其一,模型普遍存在能力-性能悖论,即在通用基准上表现优异的模型在真实交易中往往收益平平,暴露出静态知识与动态决策间的鸿沟;其二,模型在构建过程中遭遇信息整合难题,难以从嘈杂且非平稳的市场信号中提取关键事件,并维持逻辑连贯性,尤其易受共识偏差与推理碎片化的影响;此外,数据构建本身复杂,需从多源异构语料中提取并验证专家逻辑,涉及大量人工审核与事实验证,成本高昂且极易引入噪声,这些均成为阻碍模型迈向可靠金融智能体的关键瓶颈。
常用场景
经典使用场景
INVESTLOGICBENCH2026作为首个基于真实投资者决策轨迹构建的基准,其核心应用场景在于评估大语言模型在动态、不确定市场环境下的投资逻辑推理能力。该数据集通过结构化的P→E→R→D→O链条,将投资者画像、市场事件、推理过程、决策行动及市场验证结果有机整合,为研究者提供了一个可量化、可复现的测试平台。典型使用方式包括逻辑理解任务,要求模型从投资者文本中提取并概括投资逻辑;逻辑与论题生成任务,要求模型根据给定事件和投资者画像合成合理的投资推理与决策;以及端到端投资模拟任务,通过真实市场数据评估模型决策的收益表现。这些任务全面检验了模型从信息感知到决策执行的全链路能力,弥补了传统静态问答基准的不足。
解决学术问题
该数据集解决了现有金融基准评估范式与真实投资智能需求之间的根本性错配问题。传统基准如FinQA、FinanceBench等侧重知识检索与计算能力,无法反映投资者在不确定性下的主动推理与决策能力,导致出现'能力-表现悖论'。INVESTLOGICBENCH2026通过引入投资逻辑链概念,将评估焦点从被动知识回忆转向主动推理过程,首次实现了对模型在事件噪声辨别、跨源信息整合、长期一致性维护等关键认知能力的诊断性评估。实证结果揭示,即使顶尖模型在专家逻辑锚定下的推理得分仅1.8/5,显著暴露了其与人类专家在变异性认知上的差距,为理解大语言模型在金融领域的本质局限提供了可靠的量化依据。
衍生相关工作
INVESTLOGICBENCH2026的开创性工作已衍生出一系列具有深远影响的后续研究。在评测方法论方面,其条件化评分框架启发了后续工作开发更细粒度的推理质量评估指标,如将事件绑定度与逻辑连贯性分离考核的复合评分体系。在模型优化领域,研究者利用该数据集的专家逻辑轨迹进行监督微调与强化学习,探索如何通过逻辑链对齐提升模型的投资决策能力,相关成果表明经过逻辑对齐的模型在实盘模拟中能显著缩小与人类专家的收益差距。此外,该基准还促进了多智能体协作框架的研究,通过模拟不同投资风格的智能体交互来增强决策多样性。围绕事件驱动的推理碎片化与共识偏差问题,后续工作提出了注意力掩码机制与反事实推理训练等改进方案,为构建具备变异性认知的下一代金融智能体奠定了理论基础。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务