遇见数据集

APIEval-20

收藏
github2026-05-27 更新2026-06-06 收录
官方服务:

资源简介:

APIEval-20是一个用于黑盒API测试套件生成的基准数据集,包含20个精心设计的API场景,覆盖电子商务、支付、认证、用户管理、调度、通知以及搜索与过滤等多个应用领域。每个场景都植入了3到8个错误,根据复杂程度分为简单、中等和复杂三类,旨在评估AI代理在仅给定API请求模式和示例负载的情况下生成有效测试套件以发现实际错误的能力。

APIEval-20 is a benchmark dataset for black-box API test suite generation. It contains 20 meticulously designed API scenarios covering multiple application domains including e-commerce, payment, authentication, user management, scheduling, notification, search and filtering, etc. Each scenario is implanted with 3 to 8 bugs, and is categorized into three levels: simple, medium and complex based on complexity. It aims to evaluate the capability of AI Agents to generate effective test suites to discover real-world bugs when only provided with API request patterns and example payloads.

创建时间:
2026-05-27
原始信息汇总

APIEval-20 基准测试概述

APIEval-20 是一个面向黑盒 API 测试套件生成的任务基准测试,旨在评估 AI 代理在仅提供 API 请求 Schema 和示例请求体(Payload)的情况下,生成能够发现实际 Bug 的测试套件的能力。

基准测试范围

  • 数据集规模:包含 20 个精心设计的 API 测试场景。
  • 覆盖领域:涵盖电商、支付、认证、用户管理、日程、通知、搜索和筛选共 7 个应用领域。
  • 任务输入:代理仅接收每个场景的 JSON Schema 及一个示例请求体,无源代码、文档或其他上下文信息。
  • 任务输出:代理需生成一个测试用例列表,每个用例包含测试名称和完整的 JSON 请求体。

错误(Bug)分类

每个场景包含 3 至 8 个植入的错误,按发现所需的推理复杂度划分为三个等级:

  • 简单错误:无需领域语义理解,检测基本结构问题(如缺失必填字段、空值、数据类型错误)。
  • 中等错误:需理解字段含义及约束(如数值越界、格式无效、枚举边界值)。
  • 复杂错误:需理解字段间关系或操作语义(如互斥字段同时存在、不适用折扣)。

评估方法

所有 20 个参考 API 实现已部署并运行。通过自动化执行代理生成的测试用例,分析响应以判断哪些植入错误被触发。一个错误被认为被检测到,当至少一个测试用例产生的响应与正确行为出现偏差。

评分体系

最终得分由三个加权指标构成,取所有 20 个场景的平均分:

组件 权重 描述
Bug 检测得分 70% 检测到的错误数量占总植入错误数的比例。
覆盖率得分 20% 测试套件对请求 Schema 字段的覆盖比例,仅统计参数覆盖。
效率得分 10% 信噪比,即每个测试检测到的错误数(最多为 1)。

最终得分公式0.7 × Bug Detection Rate + 0.2 × Coverage Score + 0.1 × Efficiency Score

得分解释

  • 0.0 – 0.3:弱,发现错误极少,覆盖有限。
  • 0.3 – 0.5:发展中,能发现部分简单和中等错误,但遗漏居多。
  • 0.5 – 0.7:熟练,能发现大部分简单和中等错误,复杂错误仍有遗漏。
  • 0.7 – 1.0:强,能发现所有复杂度层级的错误,覆盖全面且测试套件精简。

基准排行榜

排名 系统 类别 最佳工作流 Bug 检测率 覆盖率 效率 最终得分 标准差
1 KushoAI API 测试代理 原生 KushoAI 0.89 1.00 0.14 0.83 +/-0.03
2 Claude Code 编程代理 提示链 0.76 0.98 0.18 0.76 +/-0.05
3 Cursor 编程代理 提示链 0.70 0.95 0.16 0.70 +/-0.07
4 GitHub Copilot 编程代理 结构化提示 0.64 0.92 0.14 0.64 +/-0.08
5 Claude Sonnet 4.6 通用大语言模型 结构化提示 0.60 0.90 0.20 0.62 +/-0.09
6 GPT-5 通用大语言模型 结构化提示 0.56 0.88 0.18 0.58 +/-0.08
7 Gemini 2.5 Pro 通用大语言模型 结构化提示 0.49 0.82 0.17 0.51 +/-0.10

详细报告地址:https://resources.kusho.ai/ai-agent-benchmark-api-bug-detection

运行评估器

  • 前提:Python 3.8 或更高版本。
  • 设置:从 Hugging Face 数据集仓库克隆代码并安装依赖。
  • 配置:需设置 APIEVAL_BASE_URL 环境变量,可选设置 APIEVAL_GRADE_URL
  • 评估单个场景:使用 eval/evaluate.py 并指定测试套件文件路径和场景 ID。
  • 评估全部 20 个场景:将所有命名规范的套件文件放入同一目录,运行批处理评估命令。

数据集可用性

  • 数据仓库:https://github.com/kusho-co/api-eval-20
  • 场景 Schema 和示例请求体位于 scenarios/ 文件夹内。
  • 所有引用实现由 KushoAI 托管和维护。
搜集汇总
数据集介绍
APIEval-20 数据集图片
构建方式
APIEval-20基准测试的构建过程基于对现实世界应用领域API测试痛点的深刻洞察。其选取了来自电子商务、支付、认证、用户管理、日程安排、通知以及搜索过滤等七大领域的20个代表性API场景,每个场景均附带JSON Schema和一个有效样本载荷。研究团队在参考实现中精心埋入了3至8个故障,这些故障依据发现所需推理复杂度被划分为简单、中等和复杂三个层级,从而构建了一个能够全面评估AI代理在黑盒条件下生成测试套件能力的任务基准。
特点
该数据集的核心特点在于其严格的“黑盒”设定与多维评估体系。代理仅能依据请求模式与样本载荷进行推理,无法访问源码或文档,这模拟了真实的工程场景。评估框架综合考量故障检测率(70%权重)、模式字段覆盖率(20%)以及测试效率(10%),其中效率通过每测试发现的缺陷数来衡量,以鼓励生成精炼且有信息量的测试用例。这种设计使得基准能够区分仅做简单结构变异的代理与具备深层语义理解的代理。
使用方法
使用该基准进行评测时,首先需克隆Hugging Face上的数据集仓库并安装Python依赖。针对每个场景,AI代理需生成一个包含测试名称与请求载荷的JSON文件。用户可通过`evaluate.py`脚本对单个场景进行评分,或将所有20个场景的测试套件置于统一目录下执行批量评估。最终得分由故障检测、覆盖率及效率三部分加权计算得出,输出包含每个场景的详细评分与总体平均分,从而直观反映代理在API测试任务上的综合能力。
背景与挑战
背景概述
APIEval-20是由KushoAI团队于2026年创建的一项开创性基准,旨在评估人工智能代理在仅凭API请求模式与示例负载的情况下,以黑盒方式自动生成测试套件并发现真实缺陷的能力。该基准弥补了现有评估体系仅关注文档完整性或模式合规性而忽视实际缺陷检测能力的空白。包含20个来自电子商务、支付、认证、用户管理等七个真实应用领域的精心设计场景,每个场景内置3至8个跨越简单、中等与复杂层次的缺陷。APIEval-20已成为衡量AI代理在有限信息推理、无监督边界案例发现与针对性测试策略设计等维度表现的公认标准,在软件测试与人工智能交叉领域产生了深远影响。
当前挑战
APIEval-20所面临的挑战主要体现在两个层面。在领域问题层面,传统API测试工具依赖源代码或详尽文档,而APIEval-20要求代理在仅有模式与示例负载的黑盒条件下,自主推断API语义关系,发现涉及多字段约束与业务逻辑的复杂缺陷,这对代理的推理能力提出了极高要求。在构建过程层面,团队需精心设计覆盖广泛领域且缺陷类型多样的场景,同时确保每个缺陷无法通过简单的结构检查发现,还须部署稳定且能实时运行的标准实现以支持自动化评估,并在评分中平衡缺陷检测率、覆盖度与效率三者权重,避免大规模测试集产生的噪声对结果的影响。
常用场景
经典使用场景
APIEval-20被设计用于评估AI智能体在仅拥有API请求模式和示例负载的黑盒场景下生成测试套件的能力。研究者和开发者可以部署该基准测试,通过提交20个覆盖电商、支付、认证、用户管理、排程、通知及搜索过滤等真实应用领域的API场景,令智能体在无源代码、文档或任何先验知识的约束下,构造能够发现隐藏漏洞的测试用例。经典用法是提供JSON Schema与一个有效负载样本,要求智能体输出一组包含名称和完整请求体的测试列表,随后在线上参考实现上自动执行并计算漏洞检测率、参数覆盖率和效率得分,从而系统性地衡量智能体在有限信息下推理、设计针对性测试策略与发掘多层级缺陷的综合能力。
实际应用
APIEval-20在实际工程中直接模拟了开发者和QA工程师常遭遇的黑盒API测试场景——在仅有接口模式和示例负载时,快速且有效地生成测试套件以暴露生产级缺陷。例如,在微服务架构中,团队频繁接手第三方或遗留系统的API端点,而完整的文档或实现源码往往缺失;此时,APIEval-20所评估的智能体便能够作为自动化测试助手,通过推理字段约束、字段间依赖关系及领域语义,产出针对性测试用例。该基准的应用不仅加速了回归测试与集成验证流程,还启发企业级工具(如KushoAI)优化其AI测试策略,将人力从繁琐的手动用例编写中解放出来,从而在保障软件质量的同时显著提升交付效率。
衍生相关工作
基于APIEval-20的评估框架,一系列衍生工作正逐步展开,以拓展黑盒API测试的边界。首先是APIEval-Security,它沿用相同的黑盒设置,聚焦于评估智能体在OWASP API Security Top 10类别(如认证缺陷、授权漏洞与注入攻击)上的安全监测能力,推动测试从功能正确性向安全威胁检测延伸。其次,APIEval-50作为更大规模的场景集,包含50个API,并引入并发错误、状态依赖故障及多步工作流等更复杂的漏洞类型,旨在检验智能体在更深层业务逻辑中的推理韧性。此外,一项针对主要编码与测试智能体(包括Cursor、GitHub Copilot、Devin及KushoAI)的综合对比基准已被规划,为团队提供基于实证的API测试能力横评,从而促进行业在AI辅助测试方向上的竞争与创新。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务