PROBE benchmark
收藏资源简介:
PROBE(主动解决瓶颈)基准测试评估AI代理在主动性方面的能力:通过持续观察预测用户需求,并在现实的多文档工作场景中自主解决问题。该数据集包含1,000个测试样本,涵盖简单/中等/困难难度,使用来自LinkedIn专业档案的真实人物角色,并提供多文档上下文(如电子邮件、日历和文档)。
PROBE (Proactive Bottleneck-Solving) benchmark evaluates the proactive capabilities of AI Agents: it assesses their ability to continuously observe and predict user needs, and independently solve problems in realistic multi-document work scenarios. This dataset includes 1,000 test samples covering three difficulty levels: easy, medium and hard, adopts real personas sourced from LinkedIn professional profiles, and provides multi-document contexts such as emails, calendars and documents.
PROBE 基准数据集概述
数据集简介
PROBE(Proactive Resolution of Bottlenecks)基准用于评估AI代理的主动性能力:通过持续观察预测用户需求,并在真实的多文档工作场景中自主解决问题。主动代理必须搜索未指定的问题,识别关键瓶颈并执行适当的解决方案。
核心能力评估
- 搜索 — 在个性化数据存储中查找相关信息
- 识别 — 在检索内容中检测特定瓶颈
- 解决 — 执行适当操作以解决问题
数据集规模
- 1,000个测试样本,涵盖简单/中等/困难难度级别
- 真实人物角色来自LinkedIn专业档案
- 多文档上下文包含电子邮件、日历和文档
- 能力上限:即使最先进的模型也只能达到40%端到端成功率
数据集获取
推荐方式:从Hugging Face下载预生成数据集 bash huggingface-cli download gilfastino/PROBE --repo-type dataset --local-dir data/probe_benchmark
备选方式:生成自定义数据 bash python run.py --mode batch --count 5 --difficulty medium
评估指标
| 组件 | 测试内容 | 指标 |
|---|---|---|
| 搜索 | 检索相关文档 | F1分数(精确率×召回率) |
| 识别 | 检测正确瓶颈 | 精确匹配或LLM判断相似度 |
| 解决 | 选择正确操作+参数 | 操作匹配+参数准确率 |
| 总体 | 端到端性能 | 所有三个组件的平均值 |
基准测试运行
支持两种推理方式:
- LLM基线:单次传递,使用原生批量API
- 代理基线:多步推理,支持ReAct、Reflexion、ReWOO等代理
技术配置
- 要求:Python 3.12+,OpenAI API密钥
- 可选扩展:代理基线、注释界面
- 环境变量:支持OpenAI、Anthropic、Google、HuggingFace等API密钥
引用信息
bibtex @article{pasternak2025probe, title={Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents}, author={Pasternak, Gil and Rajagopal, Dheeraj and White, Julia and Atreja, Dhruv and Thomas, Matthew and Hurn-Maloney, George and Lewis, Ash}, journal={arXiv preprint arXiv:XXXX.XXXXX}, year={2025} }
许可证
MIT许可证




