Enterprise-Bench
收藏官方服务:
资源简介:
企业AI代理的开放基准测试——衡量生产数据规模下的可靠性。
Open Benchmark for Enterprise AI Agents: Measuring Reliability Under Production-Scale Data Volumes
创建时间:
2026-07-17
原始信息汇总
Enterprise-Bench: L1-L2 Suite 数据集详情
数据集概述
Enterprise-Bench 是一个面向企业级 AI 智能体的开放基准测试数据集,由 DevRev 首席技术官办公室于 2026 年 7 月发布。该数据集旨在衡量企业 AI 智能体在生产数据规模下的可靠性,覆盖跨职能工作流中的 14 项任务,基于一个代表中型市场企业多年运营历史的数据集构建。
核心评估维度
Enterprise-Bench 同时衡量三个关键属性:
- 精确性(Precision):通过可验证路径进行正确检索
- 效率(Efficiency):成本扩展特性,预测生产经济性
- 安全性(Safety):权限保真度、幻觉检测和可审计性
自主性框架(Autonomy Framework)
任务按 L1-L4 自主性框架 分类,按能力类型而非难度划分:
| 级别 | 名称 | 描述 |
|---|---|---|
| L1(反应式) | 确定性检索 | 单步或链式操作,答案可客观验证,无需解读或判断;包括窄(单系统)和宽(跨系统连接)两种变体 |
| L2(分析式) | 多步推理 | 条件逻辑、多源综合、业务规则应用和模糊情况下的判断 |
| L3(战略性) | 主动协调 | 跨领域编排、冲突解决、自主检测(未来发布) |
| L4(自主式) | 自我指导操作 | 扩展的无监督规划、监控和适应(未来发布) |
"宽 L1" 区分是该框架的关键创新:跨四个数据源的系统连接仍属于 L1,因为每项操作都是确定性的——挑战在于架构而非认知。
任务构成
工程任务(5 项)
| 任务 | 级别 | 类型 | 要求 |
|---|---|---|---|
| eng-l1-a | L1 | 宽 | 对每个开放的 P1 工单识别产品组件、相关未解决问题的存在性,以及账户名称和 ARR |
| eng-l1-b | L1 | 窄 | 按账户显示工单总数,按开放/进行中工单排序 |
| eng-l1-c | L1 | 宽 | 对每个开放的高/严重工程问题,查找同一产品领域有开放工单的所有账户 |
| eng-l2-a | L2 | 分析 | 计算所有开放/进行中 P0 和 P1 工单的 ARR 风险总额,按产品领域细分 |
| eng-l2-b | L2 | 分析 | 按潜在收入影响对未解决的工程问题进行排名 |
销售任务(5 项)
| 任务 | 级别 | 类型 | 要求 |
|---|---|---|---|
| sales-l1-a | L1 | 窄 | 对 Marcus Webb 的业务账户显示工单总数 |
| sales-l2-a | L2 | 综合 | 总结 Marcus Webb 业务的当前健康状况 |
| sales-l2-b | L2 | 跨来源 | 识别阻碍 Vantara 扩展交易的因素及推进条件 |
| sales-l2-c | L2 | 转录 | 查找 Marcus Webb 在近期通话中对客户的未兑现承诺 |
| sales-l2-d | L2 | 综合 | 总结 Sandra Park 销售团队在 2026 年 2 月 9-14 日当周的活动 |
支持任务(4 项)
| 任务 | 级别 | 类型 | 要求 |
|---|---|---|---|
| support-l1-a | L1 | 窄 | 列出提及"退款"的开放工单账户并排序 |
| support-l1-b | L1 | 宽 | 查找同时存在 P0 问题和开放工单的产品领域,评估收入影响 |
| support-l1-c | L1 | 窄 | 对 2+ 个开放工单的账户计算工单年龄中位数并排名 |
| support-l2-a | L2 | 业务规则 | 根据 MSA 等级 SLA 时间表,查找违反首响阈值的开放 P1 工单(基准日期 2026-04-13) |
数据集:Maple Payments
基准测试基于一个中型市场 B2B 支付平台建模,该平台提供 API 驱动的基础设施,用于支付处理、计费自动化和订阅管理。所有团队数据都与收入影响相关联。
合成数据声明: Maple Payments 及其账户、用户、电子邮件、工单、机会、转录、知识文章和内部文档均为合成基准数据,不允许贡献真实客户数据。
数据规模
| 系统 | 对象 | 数量 |
|---|---|---|
| 支持(CRM) | 工单、账户、联系人 | 32,768 张工单 · 42 个账户 |
| 工程 | 问题、组件、冲刺 | 8,448 个问题 · 40 个产品部件 |
| 销售(CRM) | 机会、联系人 | 8,704 个机会 |
| 知识 | 转录、文章、内部文档 | 3 份通话转录 · 22 篇文章 |
信号事实
- 开放工单:51 张(31 张 P1 + 20 张其他)
- 开放高优先级问题:20 个(18 个高 + 2 个严重)
- 活跃机会:30 个
- 账户:42 个
- 产品部件:40 个
数据集设计方法论
答案保持型设计:在生成规模的噪声数据中保持正确答案不变,仅有约 0.16% 的数据与给定任务相关。正确查询的智能体只检索信号,广泛检索的智能体需处理数万条记录,付出相应 token 成本和更高的出错机会。
多层级工具接口
基准测试隔离了现有基准未控制的变量——智能体访问数据的接口复杂性:
- 精选工具(Curated tools):为任务领域优化的专用接口
- 协议逼真 API(Protocol-realistic APIs):生产 API 表面的复制品(Salesforce REST + SOQL、Jira REST v3、Google Drive v3)
从精选到协议逼真界面会降低 18-19 个百分点的准确率并使 token 成本翻倍,工具接口效应比模型版本效应大一个数量级。
评分机制
- 每个任务由独立 LLM 评审员根据任务成功标准评判
- 必需标准:全部通过才能获得 PASS 判定(二元制,无部分分数)
- 加权标准:不影响二元分数的诊断性质量信号
- 评估为语义化(接受等效表述)和 ID 无关(识别实体名称和关系)
- 奖励:
1.0(通过)或0.0(失败) - 试验方法:每项任务 10 次独立试验(pass@k 可靠性),每次智能体配置共 140 次观察
运行要求
- Python 3.12+
- uv(Python 包管理器)
- Harbor CLI
- Docker Desktop(分配 8GB+ RAM)
- OpenAI API 密钥(LLM 评审员使用 GPT 评分)
- 凭据(取决于要基准测试的智能体)
已发布的基准测试结果
| 智能体 | 模型 | 结果链接 |
|---|---|---|
| DevRev Computer | Claude Opus 4.8 | 查看任务 |
| DevRev Computer | Claude Opus 4.6 | 查看任务 |
| Claude Code | Claude Opus 4.8 | 查看任务 |
| Claude Code | Claude Opus 4.6 | 查看任务 |
其他资源
搜集汇总
数据集介绍

构建方式
Enterprise-Bench以一家虚构的中型企业级B2B支付平台Maple Payments为蓝本,精心构建了一个涵盖客户关系管理、工程管理、销售与知识管理四大系统的合成数据集。数据规模宏大,包含32,768张工单、8,448个工程问题、8,704个商机以及文档与通话记录,全面模拟了企业多年运营的复杂历史。其核心构建哲学在于‘答案恒定性’设计,即仅在约0.16%的数据中蕴含与任务相关的信号,其余均为已解决或无关的历史噪声,从而在真实生产数据规模下精准评估智能体的检索能力。同时,该基准引入了多层级工具接口,从定制化工具到协议级API镜像,用于隔离并量化接口复杂度对性能的影响。
特点
该数据集最显著的特点是其开创性的L1-L4自主性框架,尤其强调L1反应式与L2分析式能力的严格区分,其中‘宽L1’概念独树一帜——跨系统确定性检索虽无需高阶认知,却对架构集成能力提出严苛挑战。评估体系亦别具匠心,采用独立LLM评判器,依据必要与加权标准进行语义级、与ID无关的评判,同时从精确性、效率、安全性三个轴衡量智能体的生产部署就绪度。此外,数据集揭示了工具接口复杂度对性能的显著影响,其效应量级远超模型版本差异,已成为衡量企业级智能体生产性能的关键预测指标。
使用方法
使用该数据集时,研究者需遵循一套完整的操作流程:首先通过Harbor CLI下载数据集,并利用Make命令依次完成依赖安装、文件提取、Docker镜像构建及MCP服务器启动,以模拟CRM、PM及文件服务器的REST与MCP接口。随后,配置智能体的MCP连接,并执行Harbor运行命令评估14项任务,每项任务进行10次独立试验以获取可靠的性能分布。基准测试支持多种主流智能体框架,如Claude Code、aider等,并可通过SKILL.md为AI编码智能体提供自动化执行指引,大幅简化了基准的复现与扩展过程,使研究者能便捷地评估不同智能体架构在生产级数据规模下的效能。
背景与挑战
背景概述
Enterprise-Bench是由DevRev首席技术官办公室的Jeff Smith等人于2026年7月推出的首个面向企业级AI智能体的开放式基准测试,旨在衡量智能体在生产数据规模下的可靠性。该数据集以中型B2B支付平台为建模蓝本,整合了客户支持、工程、销售和知识管理等多系统数据,共包含14项任务,覆盖L1反应式与L2分析式两个自动化层级。其核心创新在于保持正确答案不变的同时,在约0.16%的相关数据中掺入大规模噪声,模拟真实企业累积的历史运营数据,从而评估智能体在数据检索、多步推理、业务规则应用等方面的能力。该基准同时测量精度、效率与安全性三个维度,填补了现有基准在真实企业工作流评估上的空白,为智能体的生产部署提供了重要参考。
当前挑战
该数据集面临的挑战主要体现在领域问题解决与构建过程两个层面。在领域层面,针对企业AI智能体,核心挑战是确保其在海量数据中精准检索相关信息,同时保持计算成本可控,并严格遵循权限约束,防止数据泄露。构建过程中,挑战包括设计跨系统数据关联(如账户-工单-产品组件-商机),确保数据关系贴近真实企业结构;保持正确答案在噪声数据中的隐蔽性,避免评测偏差;以及模拟多层级工具接口(从定制API到协议级真实接口)对智能体性能的影响。此外,未来扩展至L3战略与L4自治层级,还需应对更复杂的自主决策与跨域协调评估,这要求评测方法论的持续演进。
常用场景
经典使用场景
Enterprise-Bench作为首个面向企业级AI代理的开放式基准测试套件,其经典使用场景聚焦于评估代理在跨职能工作流中的可靠性表现,例如诊断销售阻碍、识别受漏洞影响的客户群,以及回溯通话中的承诺事项。该套件基于中型B2B支付平台的合成数据构建,涵盖工程、销售与支持部门的14项任务,模拟代理在真实生产数据规模下的检索与推理能力。其L1-L2层级设计区分了确定性检索与多步分析推理,尤其通过'宽泛L1'任务考察代理跨系统数据整合的架构性挑战,为衡量企业级AI代理的部署就绪度提供了标准化测试环境。
解决学术问题
该数据集解决了现有基准测试缺乏对生产规模数据可靠性与工具接口复杂度控制的学术问题。通过维持正确答案在约0.16%的相关数据中而不变,强制代理在过滤噪声时展现精确的检索能力,从而量化精度与效率。其多层级工具接口(精选工具与协议真实API)隔离了工具复杂度变量,揭示出检索架构比模型选择对性能影响更大,填补了AI代理在成本可扩展性、访问安全及审计性等维度评估的空白,为研究代理在生产环境中的部署经济学与鲁棒性提供了方法论基础。
衍生相关工作
该数据集衍生了一系列关于企业级AI代理评估与优化的经典工作,包括对协议真实API与精选工具接口的性能对比研究,揭示工具复杂度对准确率的显著影响(约18-19点下降)及成本翻倍效应。基于此,研究者探索了提升代理数据访问架构的策略,如查询过滤优化与记忆机制设计。此外,L1-L2框架的提出激励了未来L3战略与L4自治层级的研究,推动自主代理在跨域协调与长期监控方面的发展。该基准还催生了社区贡献机制,促进合成数据生成与任务设计的规范化,为持续改进评估方法论奠定了协作基础。
以上内容由遇见数据集搜集并总结生成




