STATE-Bench
收藏资源简介:
STATE-Bench是一个用于评估具有代理记忆的AI代理的多领域基准测试。它测量代理是否能够从先前的轨迹中学习并在现实企业任务中改进。该基准目前包含3个企业领域的450个任务:旅行、客户支持和购物助手。公共发布包括300个用于记忆提取的训练任务轨迹和150个带有测试环境的测试任务定义,用于锁定评估。
STATE-Bench is a multi-domain benchmark designed for evaluating AI agents equipped with agent memory. It measures whether agents can learn from prior trajectories and improve their performance in real-world enterprise tasks. Currently, the benchmark contains 450 tasks across three enterprise domains: travel, customer support, and shopping assistance. The public release includes 300 training task trajectories for memory extraction, and 150 test task definitions paired with test environments for locked evaluation.
数据集概述:STATE-Bench
核心定位
STATE-Bench 是一个用于评估具备智能体记忆能力的 AI 智能体的多领域基准测试,旨在衡量智能体能否从先前的轨迹中学习并在真实的企业级任务上取得改进。
数据集规模与领域
该基准测试当前包含 450 个任务,覆盖 3 个企业级领域。公开版本提供 300 条训练任务轨迹(用于记忆提取)和 150 个测试任务定义(附带测试环境,用于锁定评估)。
| 领域 | 任务总数 | 公开训练轨迹 | 公开测试任务 | 领域描述 |
|---|---|---|---|---|
| 旅行 (Travel) | 150 | 100 | 50 | 涵盖航班、酒店和汽车租赁的取消、改签、费用计算、政策推理及多步骤预订流程。 |
| 客户支持 (Customer Support) | 150 | 100 | 50 | 涵盖退货、退款、换货、保修、运输索赔,以及包含政策门槛和两步强制执行的挑战场景。 |
| 购物助手 (Shopping Assistant) | 150 | 100 | 50 | 涵盖产品搜索、比较、购物车管理、促销代码和兼容性检查。 |
评估指标
| 指标 | 计算方法 |
|---|---|
| 任务完成率 | 每个任务运行五次,取平均完成率。状态变更类任务通过确定性最终状态评分;非状态变更的过程和推理类任务由 LLM 评估器判断。 |
| 可靠性 (Reliability) | pass^5:在所有五次运行中均成功完成的任务百分比。 |
| 用户体验 (UX) 分数 | LLM 评定的对话质量(1-5 分),聚焦于用户体验而非任务完成情况。 |
| 单任务成本 | 任务运行的平均成本,基于服务商报告的使用量和锁定的 GPT-5.1 定价计算。 |
数据生成与许可
- 数据集中的轨迹均由大语言模型合成生成,仅供研究使用。
- 本基准测试采用 MIT 许可证 发布。




