BankerToolBench (BTB)
收藏资源简介:
BankerToolBench是一个包含100个端到端投资银行任务的基准数据集,用于评估AI代理。每个任务模拟初级银行家的实际工作,如构建财务模型、准备推介材料、撰写备忘录等,并产生多文件交付物(Excel、PowerPoint、Word),这些交付物会根据专家制定的评分标准进行评分。该基准数据集是与包括高盛、摩根大通和Evercore在内的502名投资银行家共同开发的。
BankerToolBench is a benchmark comprising 100 end-to-end investment banking tasks for evaluating AI Agents. Each task simulates the real-world responsibilities of entry-level investment bankers, such as constructing financial models, preparing pitch materials, drafting memoranda, and producing multi-format deliverables including Excel, PowerPoint, and Word files. These deliverables are scored against expert-defined grading rubrics. This benchmark was co-developed with 502 investment bankers from leading investment banking firms including Goldman Sachs, JPMorgan Chase, and Evercore. The average completion time per task is 5 hours, with a maximum duration of 21 hours, and each task follows an average of 150 grading criteria.
BankerToolBench (BTB) 数据集概述
数据集基本信息
- 数据集名称:BankerToolBench (BTB)
- 主要用途:一个包含100个端到端投资银行任务的基准测试,用于评估AI智能体。
- 任务特点:每个任务模拟真实的初级银行家工作(如构建金融模型、准备推介材料、撰写备忘录),并产生多文件交付成果(Excel、PowerPoint、Word),这些成果将根据专家制定的评分标准进行评分。
- 开发背景:该基准测试是与来自高盛、摩根大通和Evercore等公司的502名投资银行家共同开发的。人类完成每个任务的平均时间为5小时(最长可达21小时),每个任务的平均评分标准约为150条。
数据集结构与内容
数据集托管在Hugging Face平台(handshake-ai-research/bankertoolbench),并通过适配器自动下载到btb-data/目录中。
核心文件结构如下:
├── tasks.jsonl # 任务元数据(100个任务) ├── task-data/ # 每个任务的输入文件 │ └── <task_id>/Inputs/ # 提供给智能体的.xlsx、.pdf文件 ├── golden-outputs/ # 部分任务的参考输出 │ └── <task_id>/ # .pdf、.pptx、.xlsx文件 └── shared-tools/ # 共享金融数据(Git LFS) ├── logos.tar.gz # 公司徽标数据 ├── sec_edgar.tar.gz # SEC EDGAR文件(约1 GB) └── vdr.tar.gz # 虚拟数据室文件
任务元数据 (tasks.jsonl) 字段说明:
| 字段 | 类型 | 描述 |
|---|---|---|
task_id |
字符串 | 唯一任务标识符(UUID) |
final_prompt |
字符串 | 核心任务指令 |
prompt_context |
字符串 | 额外的背景/上下文信息(可能为空) |
formatting_context |
字符串 | 输出样式和格式要求 |
product |
字符串 | 产品领域(DCM、ECM、Levfin、M&A) |
workflow_cat |
字符串 | 工作流程类别 |
workflow_subcat |
字符串 | 工作流程子类别 |
aggregated_rubric_json |
字符串(JSON) | 评估标准:[{criterion, weight, category}] |
canary |
字符串 | 用于检测基准测试数据泄露的字符串 |
评估机制
- 评分系统:使用名为“Gandalf the Grader”的智能体验证器进行评分。该验证器以编程方式打开电子表格、检查公式并解析幻灯片,以评估每个评分标准。每个标准为二元(通过/失败)并按重要性加权(1/3/5/10)。任务得分是已通过标准的加权比例。
- 工具访问:每个任务为智能体提供提示、可选的输入文件,并允许访问三个MCP工具服务器以获取真实的金融数据:
工具 描述 SEC EDGAR SEC文件数据库(约690家美国上市公司的10-K、10-Q、8-K、代理声明文件) Virtual Data Room 市场数据平台API(约690家美国上市公司的财务数据、价格历史、分析师预测) Company Logos 搜索公司信息,如徽标图像
使用与运行
- 运行环境:BTB被打包为Harbor任务套件,可与任何兼容Harbor的智能体框架(如OpenHands、OpenCode、Goose等)一起运行。
- 主要步骤:
- 安装必要的软件(Docker Desktop, uv, Harbor >=0.3.0)。
- 进行冒烟测试以确保环境配置正确。
- 运行完整的基准测试(100个任务)。
- 任务筛选:支持通过任务ID、通配符、排除或数量限制来运行特定任务。
- 结果查看:结果写入
jobs/<job-name>/目录,包含任务得分、每个标准的通过/失败详情、完整的智能体轨迹以及交付成果文件。
配置与自定义
- 运行通过作业YAML文件(如
job.yaml)进行配置,可指定智能体框架、模型、任务路径等。 - BTB附带一个自定义的系统提示模板(
prompts/system_prompt.j2),为智能体提供关于工具、工作空间布局和约束的上下文。 - 可通过适配器CLI标志控制每个任务的设置(超时、验证器模型、评分标准)。
许可信息
- 代码采用Apache-2.0许可证。
- 数据集采用CC-BY-4.0许可证。
引用
如需在学术工作中引用此数据集,请使用提供的BibTeX条目。




