遇见数据集

STATE-Bench

收藏
github2026-05-21 更新2026-05-22 收录
官方服务:

资源简介:

STATE-Bench是一个用于评估具有代理记忆的AI代理的多领域基准测试。它测量代理是否能够从先前的轨迹中学习并在现实企业任务中改进。该基准目前包含3个企业领域的450个任务:旅行、客户支持和购物助手。公共发布包括300个用于记忆提取的训练任务轨迹和150个带有测试环境的测试任务定义,用于锁定评估。

STATE-Bench is a multi-domain benchmark designed for evaluating AI agents equipped with agent memory. It measures whether agents can learn from prior trajectories and improve their performance in real-world enterprise tasks. Currently, the benchmark contains 450 tasks across three enterprise domains: travel, customer support, and shopping assistance. The public release includes 300 training task trajectories for memory extraction, and 150 test task definitions paired with test environments for locked evaluation.

创建时间:
2026-05-12
原始信息汇总

数据集概述:STATE-Bench

核心定位

STATE-Bench 是一个用于评估具备智能体记忆能力的 AI 智能体的多领域基准测试,旨在衡量智能体能否从先前的轨迹中学习并在真实的企业级任务上取得改进。

数据集规模与领域

该基准测试当前包含 450 个任务,覆盖 3 个企业级领域。公开版本提供 300 条训练任务轨迹(用于记忆提取)和 150 个测试任务定义(附带测试环境,用于锁定评估)。

领域 任务总数 公开训练轨迹 公开测试任务 领域描述
旅行 (Travel) 150 100 50 涵盖航班、酒店和汽车租赁的取消、改签、费用计算、政策推理及多步骤预订流程。
客户支持 (Customer Support) 150 100 50 涵盖退货、退款、换货、保修、运输索赔,以及包含政策门槛和两步强制执行的挑战场景。
购物助手 (Shopping Assistant) 150 100 50 涵盖产品搜索、比较、购物车管理、促销代码和兼容性检查。

评估指标

指标 计算方法
任务完成率 每个任务运行五次,取平均完成率。状态变更类任务通过确定性最终状态评分;非状态变更的过程和推理类任务由 LLM 评估器判断。
可靠性 (Reliability) pass^5:在所有五次运行中均成功完成的任务百分比。
用户体验 (UX) 分数 LLM 评定的对话质量(1-5 分),聚焦于用户体验而非任务完成情况。
单任务成本 任务运行的平均成本,基于服务商报告的使用量和锁定的 GPT-5.1 定价计算。

数据生成与许可

  • 数据集中的轨迹均由大语言模型合成生成,仅供研究使用。
  • 本基准测试采用 MIT 许可证 发布。
搜集汇总
数据集介绍
STATE-Bench 数据集图片
构建方式
STATE-Bench是一个面向企业级AI智能体记忆能力评估的多领域基准数据集。其构建基于三大企业典型交互场景:旅行、客户支持和购物助手,每个领域精心设计了100个训练任务与50个测试任务,共计450个任务。每个任务部署于独立的即时沙盒环境,包含任务专属用户及领域制品,如航班预订、客户订单、购物车与产品记录。训练任务提供了完整的执行轨迹,用于智能体提取可复用的过程性知识;测试任务则采用锁定环境进行盲评,确保评估的公平性与客观性。数据集通过标准化工具集与交互策略约束智能体的行为空间,为记忆机制的研究提供了严谨的试验平台。
使用方法
使用STATE-Bench前需安装Python 3.12+及uv包管理器,通过`uv sync`安装依赖。核心使用方式为继承`StateBenchAgent`基类,实现`retrieve_learnings(query, top_k=3)`方法注入自定义记忆逻辑。执行基准测试时,系统自动将记忆检索方法注册为智能体可调用的工具,并复用领域工具集、用户模拟器、裁判及评分协议等标准化组件。用户可参照`RUN_BENCHMARK.md`完成GPT-5.1凭证配置后启动评估流程。评分结果支持按领域粒度分析并提交至官方排行榜,为记忆增强型智能体的性能对比提供统一标尺。
背景与挑战
背景概述
STATE-Bench是由微软研究院于2026年推出的一款面向AI代理记忆能力的多领域基准测试数据集。该数据集旨在评估具备代理记忆的AI系统能否从先前的任务轨迹中学习,并在类似的企业级任务中持续提升性能。核心研究问题聚焦于如何通过结构化记忆机制增强AI代理在复杂、多步骤的企业场景中的任务完成率、可靠性与用户体验。STATE-Bench涵盖了旅行、客服与购物助手三大企业域,共包含450项任务,其中300项训练轨迹用于记忆提取,150项测试任务用于闭卷评估,为代理记忆领域的研究提供了标准化、可复现的评估平台。其发布对深入理解AI代理的记忆机制及其在现实场景中的泛化能力具有重要推动作用。
当前挑战
STATE-Bench所解决的领域问题包括:在企业级任务中,AI代理需要应对多步骤流程推理、策略约束与状态变更等复杂场景,例如旅行域中的取消与改签、客服域中的退货与保修索赔、购物域中的商品比较与兼容性检查,这些任务不仅要求代理准确执行工具调用,还需处理用户意图的隐含规则与动态环境变化。构建过程中面临的主要挑战包括:确保任务场景的真实性与多样性,同时保证合成数据的逻辑一致性;设计公正的内存逻辑与基准框架的隔离机制,以避免评估偏差;以及构建稳定的沙盒环境与评分协议,从而支持对任务完成率、可靠性、用户体验与运行成本的多维量化评估。
常用场景
经典使用场景
STATE-Bench是一个专为评估具备智能体记忆能力的AI智能体而设计的多领域基准测试集。其经典使用场景在于模拟企业环境中常见的交互式任务,涵盖旅行预订、客户支持与购物助手三大领域。每个领域都提供了固定工具集与政策规则,智能体需在沙盒环境中执行诸如航班改签、退款处理、商品比价等复杂任务。基准测试包含450个任务,其中300个训练轨迹用于记忆提取,150个测试任务用于锁定评估,研究者可借此衡量智能体能否从历史轨迹中学习并提升任务执行性能。
解决学术问题
STATE-Bench有效解决了当前AI智能体研究中缺乏标准化、多领域、可复现的记忆评估方法的问题。现有基准大多聚焦于单轮问答或静态任务,难以刻画智能体在连续交互中利用经验改进表现的能力。该数据集通过提供统一的训练轨迹、任务定义、模拟器与评分协议,使研究者能够定量评估记忆机制对任务完成率、可靠性、用户体验及成本的影响。其公开的训练轨迹与锁定测试集确保了公平对比,推动了记忆增强型智能体在学术研究中的可验证进展。
实际应用
在实际应用层面,STATE-Bench模拟的企业场景与真实业务流程高度吻合,例如旅行领域的多步预定与政策推理、客户支持中的退货与保修处理、购物助手中的促销码与兼容性检查。这些任务直接映射到客服自动化、智能旅游助手、电商推荐等商业场景中。智能体可通过记忆学习用户的偏好与常见操作模式,从而在真实部署时减少人工干预、提升响应速度与用户满意度。该基准还为评估智能体的运营成本提供了量化指标,帮助企业权衡性能与资源消耗。
数据集最近研究
最新研究方向
当前,人工智能体的记忆与持续学习能力成为业界瞩目的前沿焦点,STATE-Bench 应运而生,它聚焦于多领域企业级场景中智能体从历史轨迹中提取程序性知识并提升任务执行效率的评测。该基准涵盖旅行、客服及购物助手三大典型业务领域,包含 450 个交互式任务,创新性地隔离了记忆逻辑与基准流程,通过 GPT-5.1 锁定测试环境衡量任务完成率、可靠性、用户体验及成本效益,为智能体记忆机制的标准化评估树立了新标杆,对推动企业自动化智能体的实用化演进具有里程碑意义。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务