遇见数据集

VAKRA

收藏
arXiv2026-08-13 更新2026-08-14 收录
官方服务:

资源简介:

VAKRA(eValuating API and Knowledge Retrieval Agents)是一个由IBM研究院创建的基准数据集,旨在评估AI代理在多源异构环境下的组合推理能力。该数据集包含超过8000个可执行API,覆盖62个领域,总计9484个任务样本,按难度分为三类:多样API交互风格、结构化API多跳推理、以及结合自然语言工具使用策略的多源推理。数据集构建基于BIRD-SQL数据库扩展API,并融合ClapNQ和Wikidata5M文档构建检索索引,通过四阶段流水线生成2-5跳推理链,同时经人工质量评估确保语义连贯性。VAKRA主要用于测试代理在实体消歧、跨源信息对齐和策略遵守等方面的语言中介推理瓶颈,弥补了现有基准孤立评估API调用、检索或策略能力的不足,为真实企业场景(如客户支持、业务智能)中的智能体部署提供可靠评估框架。

VAKRA (eValuating API and Knowledge Retrieval Agents) is a benchmark dataset created by IBM Research, aiming to evaluate the compositional reasoning capability of AI Agents in multi-source heterogeneous environments. This dataset contains over 8000 executable APIs covering 62 domains, with a total of 9484 task samples, which are divided into three categories based on difficulty: diverse API interaction styles, structured API multi-hop reasoning, and multi-source reasoning integrated with natural language tool use strategies. The dataset is constructed by extending APIs based on the BIRD-SQL database, fusing ClapNQ and Wikidata5M documents to build retrieval indexes. A four-stage pipeline is employed to generate 2-5 hop reasoning chains, and manual quality evaluation is carried out to ensure semantic coherence. VAKRA is mainly used to test the language-mediated reasoning bottlenecks of AI Agents in entity disambiguation, cross-source information alignment, policy compliance and other aspects, filling the gap that existing benchmarks only evaluate API calling, retrieval or policy capabilities in isolation, and providing a reliable evaluation framework for the deployment of intelligent agents in real enterprise scenarios such as customer support and business intelligence.

提供机构:
IBM
创建时间:
2026-08-13
原始信息汇总

VAKRA 数据集概述

基本信息

  • 数据集名称:VAKRA(eValuating API and Knowledge Retrieval Agents using multi-hop, multi-source dialogues)
  • 许可协议:cc-by-nc-sa-4.0
  • 任务类型:问答、文本检索、文本生成
  • 语言:英语
  • 数据规模:1K < n < 10K 样本
  • 标签:LLM Agent、工具调用、多跳推理、多源检索、RAG

数据集简介

VAKRA 是一个面向 AI 代理(Agent)的可执行基准测试,用于评估其在企业场景中端到端的多跳、多源工具调用能力。它不测试孤立的技能,而是衡量代理跨 API 和文档的组合推理能力,并通过完整的执行轨迹来验证代理能否可靠完成多步骤工作流。

该数据集提供可执行环境,代理可交互的 API 超过 8,000 个(源自 LiveAPIBench[1]),这些 API 由覆盖 62 个领域的真实数据库(源自 BIRD-SQL[2])支撑,并配有领域对齐的文档集(源自 CLAPnq[3] 和 Wikidata5M[4])。

核心特性

  • 8,000+ 可执行 API,由覆盖 62 个领域的真实数据库支撑
  • 多跳推理(3–7 步),结合 API 调用和文档检索
  • 跨源基础,通过结构化 API + 非结构化文档实现
  • 轨迹级验证,支持可重放的执行路径
  • 确定性评估,使用本地托管的工具

基准结构

数据集按四种能力组织评估,对应三种复杂度递增的设置:

1. 多样化的 API 交互风格

  • capability_1_bi_apis(API 链式调用):嵌套和组合式 API 链
  • capability_2_dashboard_apis(工具选择):大规模的查询对齐端点工具选择

2. 结构化 API 上的多跳推理

  • capability_3_multihop_reasoning(多跳 API 推理):需要 1–3 个 API 的依赖推理链,前序输出需被解释和转换以用于后续调用

3. 带工具使用策略的多跳、多源推理

  • capability_4_multiturn(多跳多源策略遵守):结合 API 和文档检索的多轮对话,并包含关于工具使用的自然语言约束。推理链 1–4 个工具,是难度最高的设置。

数据统计

训练集

能力 领域数 样本数 平均工具调用 最大工具调用 平均轮次 最大轮次
Capability_1(API 链式) 33 1,324 4.05 12
Capability_2(工具选择) 40 1,860 1.00 1
Capability_3(多跳推理) 28 346 2.05 3
Capability_4(多源策略) 36 898 1.05 3 2.06 5

测试集

能力 领域数 样本数 平均工具调用 最大工具调用 平均轮次 最大轮次
Capability_1(API 链式) 54 2,077 3.96 10
Capability_2(工具选择) 17 1,597 1.00 1
Capability_3(多跳推理) 38 869 2.04 5
Capability_4(多源策略) 41 644 1.34 4 2.01 7

目录结构

<base_path>/ ├── indexed_documents/ ├── databases/ │ └── <domain>/ │ ├── database_description/ │ └── domain.sqlite ├── test/ │ └── capability-X/ │ └── input/ └── train/ └── capability-X/ ├── input/ └── output/

数据格式

输入示例

json { "uuid": "str", "domain": "str", "num_turns": 2, "dialogue": { "turns": [ {"turn_id": 0, "query": "str", "answer": "str"}, {"turn_id": 1, "query": "str"} ] }, "additional_instructions": "str" }

注:additional_instructions 字段仅存在于 capability_4_multiturn 中;非多轮输入文件中不会出现历史轮次和该字段。

输出 Schema

json { "uuid": "str", "domain": "str", "output": [ { "turn_id": 0, "query": "str", "answer": "str", "sequence": { "tool_call": [{"name": "str", "arguments": {"key": "value"}}], "tool_response": [{"name": "str", "response": {"key": "value"}}] } } ], "additional_instructions": "str" }

评估与评分

评估代码、评分脚本和字段排除列表维护在 GitHub 仓库(github.com/ibm/vakra)中。基准使用瀑布式评判器,包含三个组件:

  • PolicyJudge:程序化评估策略遵守情况
  • ExactMatchJudge:程序化评估预测工具响应与真实工具响应之间的顺序不变精确匹配(基于子集)
  • GroundednessJudge:LLM 作为评判者,评估答案对工具响应和查询的忠实度

资源链接

  • 排行榜:https://ibm-research-vakra.hf.space/
  • 环境与设置:https://github.com/IBM/vakra/blob/main/setup.md
  • 评估与评分:https://github.com/IBM/vakra
  • 提交结果:https://github.com/IBM/vakra/issues/new?template=leaderboard_submission.yml

参考文献

  • [1] Elder, Benjamin, et al. "Live API-Bench: 2500+ Live APIs for Testing Multi-Step Tool Calling."
  • [2] Li, Jinyang, et al. "Can llm already serve as a database interface? a big bench for large-scale database grounded text-to-sqls."
  • [3] Rosenthal, Sara, et al. "CLAPnq: Cohesive Long-form Answers from Passages in Natural Questions for RAG systems."
  • [4] Wang, Xiaozhi, et al. "KEPLER: A unified model for knowledge embedding and pre-trained language representation."
  • [5] Shlomov, Segev, et al. "From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production."
搜集汇总
数据集介绍
VAKRA 数据集图片
构建方式
VAKRA基准数据集建立在BIRD-SQL真实数据库之上,覆盖62个领域,包含超过8000个可执行API。其构建过程采用四阶段流水线:首先从BIRD-SQL查询中提取命名实体并映射到Wikidata5M标识符,构建领域特定的知识图谱;其次通过深度优先遍历查询连接图生成2-5跳的推理链,并利用大型语言模型将各跳查询合并为自然语言问题;再次引入ClapNQ和Wikidata5M文档,通过LLM过滤确保RAG问题无法仅通过API回答,反之亦然;最后生成纯检索的多轮对话,并通过跨源可回答性筛选保证数据纯净。整个构建过程还辅以人工评估,确保生成问题的连贯性与可回答性。
特点
VAKRA的独特之处在于首次在单一基准中整合了工具调用、多跳推理、跨源检索与工具使用策略遵循,且所有API均可本地执行,确保验证的确定性。任务设计为三个递进难度场景:多样化的API交互风格(SLOT、SEL、Dashboard)、仅涉及结构化API的多跳推理、结合API与文档检索的多源多跳推理,其中部分任务附带自然语言工具使用策略。基准采用轨迹级评估,通过重执行预测的工具调用来验证正确性,且允许存在多个有效路径。其规模庞大,涵盖62个领域,工具数从6到328不等,为评估不同工具空间下的智能体能力提供了丰富素材。
使用方法
VAKRA的标准使用方式为:将任务数据加载至自托管的Docker容器中,通过MCP协议与工具交互。评估时,使用固定ReAct框架包裹被测试模型,统一接口以隔离模型能力与架构差异。智能体在未知跳数或检索需求的情况下,仅依据提供的工具和策略(如果存在)进行推理。评估过程采用级联流程:首先验证预测工具序列的正确性(通过重执行和LLM判别),其次评判最终回答的忠实度与正确性,最后对策略约束任务进行确定性违规检查。该基准支持多种模型接入(如OpenAI、Anthropic),并可灵活调整工具集规模,有助于研究模型在不同API交互范式下的表现差异。
背景与挑战
背景概述
VAKRA基准由IBM研究院于2026年推出,旨在解决企业级智能代理在多源异构环境中进行复杂推理的评估难题。该基准由Ankita Rajaram Naik等学者构建,将BIRD-SQL数据集转化为涵盖62个领域、超过8000个可执行API的测试平台,并配套领域相关的文档集合。其核心研究问题在于:如何评估代理在结构化API与自然语言工具使用策略约束下的多跳推理能力。VAKRA通过三个递进难度的任务设置,系统性地衡量了从基础的API交互风格到复杂的跨源多跳推理,填补了此前基准将工具调用、文档检索和策略遵循孤立评估的空白,为agentic系统研究提供了全面且可复现的评测框架。
当前挑战
VAKRA基准面临的核心挑战源自代理推理能力的复合性。领域问题层面,现有模型在组合式API任务中表现不佳,最佳模型仅达50-51%准确率,而多跳推理深度的增加导致性能下降超过50%。策略遵循尤为困难,当地查询不可回答时,前沿模型准确率骤降至2.4%,暴露了模型在约束解释上的根本缺陷。构建过程中,自动生成的多跳查询面临幻觉约束、推理链不一致和检索捷径等数据质量问题,需人工精心标注和严格的过滤管道以确保跨源不可回答性。最终,评估框架需验证完整工具调用轨迹,允许多种有效路径,这要求动态重新执行预测调用并采用瀑布式评估机制,进一步增加了基准设计的复杂度。
常用场景
经典使用场景
VAKRA基准的核心使用场景在于评测大型语言模型在复杂企业级任务中的工具调用与跨源推理能力。该数据集通过提供超过8000个可执行API及62个领域的文档集合,构造了从单跳端点式API交互到多跳跨源推理(结合结构化API与文档检索)的递进式任务体系。研究者可借助这一平台,在统一的可执行环境中,标准化地评估模型在多轮推理、参数对齐及策略约束下的表现。其经典用法包括利用固定ReAct框架隔离模型能力与架构差异,横向对比前沿及开源模型在多样化API风格(如SEL、SLOT、Dashboard)上的性能,从而精细定位语言模型在工具调用流程中的薄弱环节。
实际应用
在实际应用中,VAKRA所模拟的企业场景极具现实价值,尤其在客户支持、商业智能与财务运营等领域。智能体常需在客户关系管理系统、物流追踪API及退款政策文档之间进行多步协调,这一过程涵盖实体识别、参数映射及合规性判断。通过在该基准上的评测,开发者能够识别并优化模型在工具选择、参数填充与策略遵循上的缺陷,从而提升自动化Agent在真实业务中的可靠性与效率。此外,VAKRA的本地化部署与确定性验证机制(重新执行调用来验证结果)为企业在不泄露内部数据的前提下,提供了安全、可复现的模型选型与优化依据,有助于加速可信赖的企业级AI助手落地。
衍生相关工作
VAKRA的发布催生了一系列后续研究工作。其构建方法论,尤其是将结构化数据库查询转化为可执行API以及构造多跳推理链的技术,已被后续基准如LiveAPIBench所借鉴和扩展。以其为基线,研究者们开始探索更高效的代理架构,例如改进的ReAct变体、检索策略优化或策略推理增强模块,以应对跨源推理中的语言歧义问题。此外,VAKRA揭示的模型在策略遵循上的严重不足,直接促进了面向工具使用约束的专门评测与训练方法的发展,如SOP-Bench等。该数据集还常被用作微调训练集,通过其多样化任务帮助模型强化参数抽取、实体链接及跨库一致性判断等能力,进一步推动了智能体在复杂工具环境中的泛化性能研究。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务