遇见数据集

IRAB — Investment Research Agent Benchmark

收藏
github2026-07-01 更新2026-07-09 收录
官方服务:

资源简介:

IRAB是一个用于评估投资研究代理在真实投资研究环境中表现的基准,包含公司深度分析、行业研究、同行比较、估值与建模、市场评论、宏观与政策、事件/机制分析、策略回测、筛选与监控、可视化和工具等任务。数据来源于真实分析师查询的脱敏版本,每个答案由LLM评委根据多维评分标准和专家编写的黄金参考进行评分。初始覆盖中国股市(A股/港股/中国政策),同时涉及美国股票、商品和全球宏观。

IRAB is a benchmark for evaluating the performance of investment research agents in real-world investment research scenarios. It encompasses a range of tasks including in-depth corporate analysis, industry research, peer group comparison, valuation and modeling, market commentary, macroeconomics and policy analysis, event/mechanism analysis, strategy backtesting, screening and monitoring, visualization tools and related utilities. The dataset is sourced from de-identified records of actual analyst inquiries, with each answer being scored by an LLM judge against multi-dimensional evaluation criteria and gold-standard references developed by domain experts. Initially focused on the Chinese stock market (A-shares, H-shares and China-related policies), the benchmark also covers US equities, commodities and global macroeconomic topics.

创建时间:
2026-06-30
原始信息汇总

数据集概述

IRAB(投资研究智能体基准测试)是一个用于评估智能体在真实投资研究工作流中表现的基准数据集。

核心目标

IRAB 衡量智能体在真实投资研究环境中的表现,评估的是买方分析师为支持决策所做的开放式、多步骤工作,而非合成式问答。任务来源于真实分析师查询的脱敏版本,每个答案由 LLM 评审员根据多维评分规则和专家编写的参考答案进行评分。

任务范围

任务涵盖以下领域:

  • 公司深度研究
  • 行业研究
  • 同行比较
  • 估值与建模
  • 市场回顾
  • 宏观与政策分析
  • 事件/机制分析
  • 策略回测
  • 筛选与监控
  • 数据可视化
  • 工具使用

初始覆盖范围以中国股市(A股/港股/中国政策)为主,同时涉及美国股票、大宗商品和全球宏观。

数据内容

该仓库包含的是IRAB的公开样本集,用于审查和开发:

路径 内容
data/tasks/ 投资研究问题
data/rubrics/ 每项任务的评分维度和权重
data/gold/ 用于根据每项评分规则打分的参考答案

不包含在仓库中的内容:剩余的保留测试集以及详细的评分标准。

排行榜

官方结果在完整基准测试(包括私有的保留集)上运行,以确保即使公开样本被广泛使用,分数仍具有意义。

许可协议

本仓库中的数据采用 CC BY 4.0 许可发布,允许自由分享和改编,包括商业用途,但需给予适当署名。

引用

一份论文/技术报告即将发布,出版时将在此添加引用详情。

维护方

Rabyte Technology 维护。联系 fangst01@rabyte.cn 或提交 issue

搜集汇总
数据集介绍
构建方式
IRAB(Investment Research Agent Benchmark)基准测试数据集,旨在评估智能体在真实投资研究场景中的表现。其构建方式基于真实的买方分析师工作流程,任务源自经过脱敏处理的真实分析师查询。每个任务配备多维评分规则与专家撰写的黄金参考答案,由大型语言模型裁判依据既定维度进行打分。数据集涵盖公司深度研究、行业分析、同业对比、估值建模、市场回顾、宏观政策、事件机制、策略回测、筛选监控、可视化与工具应用等多种任务类型,初始重点覆盖中国A股、港股及政策领域,并扩展至美股、商品和全球宏观。
特点
该数据集的核心特征在于其高度的真实性与复杂性。IRAB并非合成式问答,而是模拟了开放式、多步骤的投资研究工作流,强调对智能体在真实环境下的推理、分析与决策能力的评测。每个任务均附有细粒度的评分维度和权重,确保评估的全面性与客观性。此外,数据集分为公开样本集与私有保留测试集,公开集用于开发与初步检验,完整评测需在私有集上进行,从而保证排行榜分数的有效性与公正性。
使用方法
使用IRAB数据集时,研究者可首先从仓库中获取公开的任务、评分规则与黄金参考答案,用于开发与调试智能体。完整的评估需将模型提交至官方平台,在包含私有保留集的完整基准上运行。排行榜结果及模型提交可通过指定网站与邮箱进行。数据集遵循CC BY 4.0许可协议,允许自由分享与改编,但需注明出处。
背景与挑战
背景概述
在金融科技迅猛发展的当下,投资研究领域长期依赖于分析师手动进行公司深度分析、行业研究、估值建模等多步骤开放式工作,这一过程不仅耗时且高度依赖专家经验。为衡量智能体在真实投资研究环境中的表现,Rabyte Technology团队于2024年创建了IRAB(Investment Research Agent Benchmark)基准数据集。该数据集的核心研究问题聚焦于评估智能体执行真实买方分析任务的能力,涵盖公司深研、行业扫描、估值建模、策略回测及宏观政策分析等11类复杂场景,初始覆盖中国A股、港股及美国股市。IRAB通过专家撰写参考答案与多维度评分准则,借助大语言模型裁判进行自动化评估,为量化评估智能体在金融领域的实际应用效能提供了标准化框架,对推动金融AI从合成问答向真实工作流的演进具有重要影响力。
当前挑战
IRAB数据集面临双重挑战。在领域问题方面,投资研究任务具有高度的开放式与多步推理特性,不同于传统的单轮问答,要求智能体具备长期规划、多源信息整合及逻辑推断能力,以应对公司深度分析与市场研判中的不确定性。在构建过程中,首要挑战是数据的脱敏与标注:所有查询源自真实分析师提问,需在不泄露敏感信息的前提下保留任务的专业复杂度,同时编写多维评分准则与参考答案,确保评判的客观性与一致性。此外,保持私有测试集的公平性是另一难题,需在公开样本仅供开发参考的同时,通过隐藏测试集防止过拟合并维持排行榜的评估可靠性,这要求严密的数据分区与隐私保护机制。
常用场景
经典使用场景
IRAB(Investment Research Agent Benchmark)是一款专为评估智能体在真实投资研究环境中表现而设计的基准测试。其经典使用场景聚焦于模拟买方分析师在开放式、多步骤工作流中的决策支持任务,涵盖公司深度剖析、行业研究、同行比较、估值建模、市场回顾、宏观政策分析、事件机制研究、策略回测、筛选监控、数据可视化及工具调用等十一大类别。该基准以中国A股、港股及政策动态为核心,同时延伸至美股、大宗商品及全球宏观领域,通过脱敏的真实分析师查询构建任务,并借助多维评判标准与专家撰写的黄金参考答案进行评分,为智能体在实际投资研究流程中的能力提供了严谨且可量化的评估框架。
衍生相关工作
IRAB基准的发布催生了一系列衍生研究工作,推动了智能体评估与金融科技的交叉探索。围绕该基准,研究者开发了针对投资研究领域的增强型评判器(如领域微调的LLM Judge)以提升评分一致性,并探索了多智能体协作框架(如分析师-研究员-回测员分工模式)在股票筛选与策略生成中的优势。此外,基于IRAB的任务分类,相关团队进一步构建了专用数据集用于训练投资研究助手,例如结合情感分析与量化因子的混合模型。这些工作不仅验证了IRAB在评估中的有效性,还拓展了其在可解释性报告生成、市场异常检测等子领域的应用,形成了以基准为核心的金融智能体研究生态,持续反哺学术与工业界的发展。
数据集最近研究
最新研究方向
当前,随着大型语言模型在金融领域的渗透,投资研究自动化成为炙手可热的前沿方向。IRAB作为首个聚焦买方分析师真实工作流的基准测试,精准填补了现有评估体系仅关注合成问答或浅层文本任务的空白。其任务设计覆盖公司深度挖掘、行业轮动、估值建模、宏观政策解析及策略回测等复杂环节,紧密对标券商与基金内部的研究场景。该基准通过多维评分准则与专家撰写的黄金参考答案,确保对智能体推理深度与工具调用能力的严格度量。尤其在中国A股、港股及全球宏观领域,IRAB的出现为量化投研与AI驱动决策的融合提供了可信的评测标尺,推动了智能体从概念验证迈向实际生产的关键跨越。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务