遇见数据集

Trata Hedge-Bench

收藏
github2026-06-19 更新2026-06-20 收录
官方服务:

资源简介:

Hedge-Bench是一个用于评估智能体在复杂推理任务上的基准测试,这些任务来源于投资专业人士网络。它包含102个任务,涵盖估值、增长与扩张、并购、竞争定位和运营执行等主题,通过提取分析师的显式推理轨迹进行确定性评分。

Hedge-Bench is a benchmark for evaluating AI Agents on complex reasoning tasks, which originate from networks of investment professionals. It consists of 102 tasks covering topics such as valuation, growth and expansion, mergers and acquisitions, competitive positioning, and operational execution, with deterministic scoring implemented by extracting explicit reasoning trajectories of analysts.

创建时间:
2026-05-30
原始信息汇总

数据集概述:Trata Hedge-Bench

简介 Hedge-Bench 是一个用于评估智能体在复杂金融推理任务上表现的基准测试。其任务来源于一群全职受雇于知名投资机构的投资专家网络。该基准从这些分析师处理相关信息源的显式推理轨迹中提取内容,并用于对原本开放性问题进行确定性评分。

任务规模与主题 该基准包含 102 个任务,涵盖多个反复出现的主题:

  • 估值 (Valuation)
  • 增长与扩张 (Growth & Expansion)
  • 并购 (M&A)
  • 竞争定位 (Competitive Positioning)
  • 运营执行 (Operational Execution)

任务构成 每个 Hedge-Bench 环境由以下部分组成:

  1. 指令 (instruction):描述智能体需在 Docker 容器中完成的任务,表述为开放式的请求。
  2. 封闭的材料集:一组相关的文档和材料。
  3. 示例解决方案 (example solution):供参考的解决方案。
  4. 测试集 (tests):用于验证智能体生成的推理轨迹是否与人类专家分析师的操作相匹配。

任务交互性 任务是交互式的。智能体收到指令和 Docker 容器后,需要通过阅读提供的文件来构建背景信息并产生相关的推理。所有任务均为原创,参考解决方案源自与行业专业人士合作开发的专有流程,而非来自任何公开来源,旨在测试智能体解决新颖、现实问题的能力,而非机械记忆或检索。

任务格式 环境使用 Harbor 任务格式,典型结构如下:

  • task.toml:元数据,包括验证器配置、资源限制和关键词。
  • instruction.md:智能体看到的提示。
  • environment/:包含 Dockerfile 和挂载到 /app/data 的数据。
  • tests/:包含评分入口点 (test.sh)、评分脚本 (grade.py) 和评分标准 (ground_truth.txt)。

评分方法 测试验证智能体推理轨迹与人类分析师操作步骤的匹配程度。Hedge-Bench 评分侧重于概念匹配而非精确答案,检测是否采取了某个操作需要语义判断。其采用 LLM-as-a-Judge 方法,并结合评分标准 (rubric) 进行评分。

环境数据内容 每个环境中的 environment/data/ 目录包含智能体可访问的金融数据,例如:

  • 多季度财报电话会议记录 (earnings_call/)
  • 财务报表 (利润表、资产负债表、现金流量表) (financials/)
  • SEC 文件 (10-K / 10-Q / S-1) (sec_filings/)
  • 公司新闻稿 (press_releases/)
  • 内部人和机构持股情况 (ownership/)
  • 公司及竞争对手的实时档案 (company_profiles.json)

快速启动

  • 前提条件:安装 Harbor,运行 Docker,并设置 GEMINI_API_KEY

  • 运行单个环境示例: bash harbor run -p trata-hedge-bench/environments/flyw-2026-04-13-immigration-headwinds-and-student-demand -a gemini-cli -m google/gemini-3.1-pro-preview -y -k 8 -n 4 --ae GEMINI_CLI_TRUST_WORKSPACE=true

  • 运行整个基准测试套件: bash harbor run -p trata-hedge-bench/environments -a gemini-cli -m google/gemini-3.1-pro-preview -y -k 8 -n 4

引用信息 如果您在研究中使用了 Hedge-Bench,请引用其论文:

  • 标题:Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning
  • 作者:Eric Cho, Shawn Huang, Alice Lu, Andy Lyu
  • 年份:2026
  • 预印本:https://arxiv.org/abs/2606.03918
搜集汇总
数据集介绍
Trata Hedge-Bench 数据集图片
构建方式
Trata Hedge-Bench 数据集依托于与多家知名投资机构的全职分析师合作网络,通过提取专家在真实工作场景中的显性推理轨迹来构建。每项任务包含一个开放式指令、一组封闭的相关文档与资料、一个专家解决方案以及一系列验证测试。任务被划分为三至四个主题,每个主题再细分为四至五个子主题,以模拟分析师将广泛议题分解为可操作推理环节的工序。所有任务均为原创,基于专有流程与行业专家协作生成,而非复制或改编自任何公开资源。环境采用 Harbor 任务格式封装,包含元数据配置、指令提示、Docker 容器环境及测试验证模块,确保推理过程的可复现与确定性评估。
特点
该数据集的核心特色在于其真实性与原创性,任务直接源自资深分析师在现实投资决策中的推理实践,而不是简单的信息检索或公式计算。它强调概念匹配而非精确答案,采用基于规则评分框架的 LLM-as-a-Judge 评估方法,对代理的推理动作进行语义层面的判断。任务设计反映了金融分析的策展特性:代理需摄入大量信息,识别关键问题,并在信息不完美的条件下生成连贯推理。数据集涵盖估值、增长与扩张、并购、竞争定位及运营执行等多个反复出现的主题,共计102项任务,为评估代理在复杂金融推理场景中的能力提供了严谨且具有挑战性的基准。
使用方法
使用者需首先安装 Harbor 框架并确保 Docker 运行环境可用,同时设置 GEMINI_API_KEY 以供评分器调用。通过克隆 GitHub 仓库后,可使用命令行执行单个任务或完整套件。例如,运行单个环境时需指定任务路径、代理类型与模型名称,并通过参数控制采样次数与并行度。Harbor 框架设计为代理与模型无关,支持灵活替换不同的 CLI 代理或语言模型。评估时,系统会验证代理生成的推理轨迹是否与专家分析师的行动步骤匹配,评分自动执行,无需人工干预。数据集在 Hugging Face 上也可获取,便于研究者直接下载与集成到自己的工作流中。
背景与挑战
背景概述
金融分析师的工作本质上是策展性的,他们需在庞杂的信息中识别关键问题,并生成合理的推理链条。然而,现有基准测试多聚焦于封闭式问答或机械计算,难以评估智能体在真实金融场景中的复杂推理能力。为此,Trata公司研究团队(Eric Cho、Shawn Huang、Alice Lu、Andy Lyu)于2026年推出了Hedge-Bench基准测试。该数据集包含102个任务,覆盖估值、增长与扩张、并购、竞争定位、运营执行等关键主题,所有任务均源自资深投资专业人士的真实推理轨迹。通过从400余名分析师的专业对话中提取显式推理步骤,Hedge-Bench为评估智能体在开放式金融推理问题上的表现提供了可验证的标注标准,填补了现有基准在现实金融推理评估上的空白。
当前挑战
Hedge-Bench的核心挑战在于其任务的开放性与复杂性。金融推理本身要求智能体从大量非结构化数据(如财报电话会议记录、SEC文件、新闻稿等)中自主识别信息要点,这不同于传统封闭式问答的简单检索或公式计算。具体而言,每个任务需智能体在Docker容器中按主题分解为三至四个模块,每模块再细分为四至五个动作子步骤,以模拟分析师从宏观到微观的推理分解过程。构建过程中,团队面临确保证据集原创性及与真实工作流一致的挑战:每项任务均为原创,依据行业专家的专有推理流程制作,而非改编自现有公开数据集。此外,采用LLM-as-a-Judge评分方法对概念匹配进行语义判定,而非简单答案匹配,进一步增加了评估的难度与复杂性。
常用场景
经典使用场景
在金融推理与智能体评估的研究领域,Trata Hedge-Bench被广泛用于评测大语言模型驱动的智能体在复杂、开放式的投资分析任务中的表现。该基准涵盖估值、并购、竞争定位等102个真实任务,要求智能体在Docker环境中自主阅读财报、电话会议记录等非结构化材料,并生成与资深分析师一致的分析推理轨迹。其独特之处在于不依赖简单的答案匹配,而是通过专家轨迹的语义对齐进行评分,从而检验模型在真实金融场景下的深度推理与信息整合能力。
衍生相关工作
Hedge-Bench的发布催生了一系列衍生研究。一方面,研究者基于其任务范式开发了专用的智能体框架,如引入多源信息对齐、动态子目标分解的金融推理代理;另一方面,该基准也被用于对比不同推理策略(如思维链、树搜索)在金融领域的迁移效果。此外,有工作借鉴其“概念匹配”评估思路,构建了针对医疗、法律等垂直领域的类似基准,推动了专业领域智能体评估从答案正确性向推理轨迹合理性的进化。
数据集最近研究
最新研究方向
在金融推理领域,前沿研究正聚焦于构建能够模拟专业分析师思维过程的智能体系统。Trata Hedge-Bench应运而生,它并非传统意义上的问答基准,而是一个植根于真实对冲基金投研实践的交互式评估框架。该数据集通过拆解估值、并购、竞争定位等核心主题为可操作的分析动作,要求智能体在封闭文档环境中自主梳理信息、识别关键问题并生成结构化的推理轨迹。其独特之处在于,基准测试不追求答案的精确性,而是借助LLM-as-a-Judge方法论与语义判分规则,严格比对智能体的推理节点与资深分析师的实际操作步骤。这一设计直指当前大语言模型在长链条推理、信息甄别及领域知识应用方面的痛点,为金融领域智能体的能力边界提供了现实且严峻的检验场。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务