Trata Hedge-Bench
收藏资源简介:
Hedge-Bench是一个用于评估智能体在复杂推理任务上的基准测试,这些任务来源于投资专业人士网络。它包含102个任务,涵盖估值、增长与扩张、并购、竞争定位和运营执行等主题,通过提取分析师的显式推理轨迹进行确定性评分。
Hedge-Bench is a benchmark for evaluating AI Agents on complex reasoning tasks, which originate from networks of investment professionals. It consists of 102 tasks covering topics such as valuation, growth and expansion, mergers and acquisitions, competitive positioning, and operational execution, with deterministic scoring implemented by extracting explicit reasoning trajectories of analysts.
数据集概述:Trata Hedge-Bench
简介 Hedge-Bench 是一个用于评估智能体在复杂金融推理任务上表现的基准测试。其任务来源于一群全职受雇于知名投资机构的投资专家网络。该基准从这些分析师处理相关信息源的显式推理轨迹中提取内容,并用于对原本开放性问题进行确定性评分。
任务规模与主题 该基准包含 102 个任务,涵盖多个反复出现的主题:
- 估值 (Valuation)
- 增长与扩张 (Growth & Expansion)
- 并购 (M&A)
- 竞争定位 (Competitive Positioning)
- 运营执行 (Operational Execution)
任务构成 每个 Hedge-Bench 环境由以下部分组成:
- 指令 (instruction):描述智能体需在 Docker 容器中完成的任务,表述为开放式的请求。
- 封闭的材料集:一组相关的文档和材料。
- 示例解决方案 (example solution):供参考的解决方案。
- 测试集 (tests):用于验证智能体生成的推理轨迹是否与人类专家分析师的操作相匹配。
任务交互性 任务是交互式的。智能体收到指令和 Docker 容器后,需要通过阅读提供的文件来构建背景信息并产生相关的推理。所有任务均为原创,参考解决方案源自与行业专业人士合作开发的专有流程,而非来自任何公开来源,旨在测试智能体解决新颖、现实问题的能力,而非机械记忆或检索。
任务格式 环境使用 Harbor 任务格式,典型结构如下:
task.toml:元数据,包括验证器配置、资源限制和关键词。instruction.md:智能体看到的提示。environment/:包含 Dockerfile 和挂载到/app/data的数据。tests/:包含评分入口点 (test.sh)、评分脚本 (grade.py) 和评分标准 (ground_truth.txt)。
评分方法 测试验证智能体推理轨迹与人类分析师操作步骤的匹配程度。Hedge-Bench 评分侧重于概念匹配而非精确答案,检测是否采取了某个操作需要语义判断。其采用 LLM-as-a-Judge 方法,并结合评分标准 (rubric) 进行评分。
环境数据内容
每个环境中的 environment/data/ 目录包含智能体可访问的金融数据,例如:
- 多季度财报电话会议记录 (
earnings_call/) - 财务报表 (利润表、资产负债表、现金流量表) (
financials/) - SEC 文件 (10-K / 10-Q / S-1) (
sec_filings/) - 公司新闻稿 (
press_releases/) - 内部人和机构持股情况 (
ownership/) - 公司及竞争对手的实时档案 (
company_profiles.json)
快速启动
-
前提条件:安装 Harbor,运行 Docker,并设置
GEMINI_API_KEY。 -
运行单个环境示例: bash harbor run -p trata-hedge-bench/environments/flyw-2026-04-13-immigration-headwinds-and-student-demand -a gemini-cli -m google/gemini-3.1-pro-preview -y -k 8 -n 4 --ae GEMINI_CLI_TRUST_WORKSPACE=true
-
运行整个基准测试套件: bash harbor run -p trata-hedge-bench/environments -a gemini-cli -m google/gemini-3.1-pro-preview -y -k 8 -n 4
引用信息 如果您在研究中使用了 Hedge-Bench,请引用其论文:
- 标题:Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning
- 作者:Eric Cho, Shawn Huang, Alice Lu, Andy Lyu
- 年份:2026
- 预印本:https://arxiv.org/abs/2606.03918





