遇见数据集

KOPA-BENCH

收藏
arXiv2026-09-05 更新2026-09-08 收录
数据链接:
官方服务:

资源简介:

KOPA-BENCH是由LG CNS构建的多步工具调用基准数据集,旨在评估开源大语言模型在韩国公共开放API上的链式调用能力。该数据集包含145个真实世界的任务,覆盖交通、金融、教育、法律、政治和行政区划六个领域,涉及10个平台和2318个工具函数。创建过程基于领域专家设计的链式工具集,通过两阶段验证(专家审计与前沿模型执行检查)确保任务质量。数据集主要用于测试模型在依赖调用、高基数响应处理等复杂场景下的表现,解决开源模型在实时政府API环境中性能不佳的问题。

KOPA-BENCH is a multi-step tool calling benchmark dataset developed by LG CNS, which aims to evaluate the chain-of-tool invocation capabilities of open-source large language models (LLMs) on South Korea's public open APIs. This dataset includes 145 real-world tasks covering six domains: transportation, finance, education, law, politics, and administrative divisions, involving 10 platforms and 2318 tool functions. Its development is based on a chained tool suite designed by domain experts, and two-stage verification including expert audit and state-of-the-art model execution check is adopted to ensure task quality. The dataset is primarily used to test model performance in complex scenarios such as dependency-aware tool invocation and high-cardinality response processing, aiming to address the poor performance issue of open-source models in real-time government API environments.

提供机构:
LG CNS
创建时间:
2026-09-05
原始信息汇总

数据集核心信息

该数据集为 EDGE-KOPA,包含一套基准测试(KOPA-Bench)与数据合成方法(EDGE),聚焦于针对韩国开放公共 API 的多步骤工具调用场景。数据集简介与标题为 “Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe”,已被 EMNLP 2026 Industry Track 接收。


数据集设计动机与独特性

现有工具调用数据集大多基于模拟、仿真或冻结的 API 快照,而本数据集面向真实环境,其关键差异在于:

  • 实时与不稳定API:工具端点为实时、有限速、偶发不可用的韩国政府开放 API。
  • 执行依赖:工具间的依赖关系必须通过实际调用才能确认。
  • 高输出基数:单次工具调用最多可返回 224,958 条记录。
  • 链式入口:多数查询须先进行实体编码(如 API key、企业代码、区域代码)的查找。

这使得小规模开放模型在跳过前置查找、或从分页结果的第一页过早作答时,易失败。


KOPA-Bench 基准组件

  • 规模:包含 145 个专家编写任务,覆盖 2,318 个实时工具,分布于 10 个韩国公共开放 API 平台,涉及 6 个领域。
  • 任务性质:每项任务需串联多个依赖调用,一个调用的输出作为下一调用的输入。每任务最多包含 14 次工具调用,平均每次任务需 4.92 次工具调用、平均 3.32 步。
  • 领域统计
领域 任务数 平均步骤 平均工具调用数 效率裕度 (Headroom) 可用工具数 并行度 %
交通 (Traffic) 22 3.64 5.14 2.21 7.5 55%
金融 (Finance) 29 3.69 5.65 2.24 6.6 83%
教育 (Education) 30 2.93 4.30 2.79 7.7 57%
法律 (Law) 22 3.00 3.55 3.63 6.7 27%
政治 (Politics) 25 3.72 5.48 2.10 8.7 52%
行政区划 (District Admin.) 17 2.76 5.41 1.55 8.0 82%
总计 / 平均值 145 3.32 4.92 2.45 7.5 59%
  • 任务格式:包含任务ID、领域、韩语查询语句、系统状态(预设上下文与起始动作如获取 API key)、黄金动作序列(含参数及需要比较值的参数)、奖励依据(RESPONSE / ACTION)、最终答案(可为数字等类型)、最大允许调用数。
  • 评估轴
    • RESPONSE:检查最终答案是否正确;通过提取答案、归一化、精确/近似匹配,以及 LLM-as-a-Judge 兜底。
    • ENVIRONMENT:验证结果导致的服务器状态变化;通过 SHA-256 哈希与黄金状态比对。
    • ACTION:评估使用轨迹的质量,计算公式为 (Corr + Eff)/2,其中 Eff = (CR + MPC)/2;该指标从不单独使用,需结合结果验证。

EDGE 数据合成管线

EDGE(Execution-grounded Dynamic Graph)包含两个阶段,旨在生成与基准同样约束条件的训练数据。

阶段 A — 执行锚定的动态图构建

  1. 从 2,318 个工具构建依赖图骨架(检索器限制邻居范围)。
  2. 用 LLM 对每条候选边打分并预设先验参数。
  3. 通过 Thompson 采样等策略,对实时 API 执行探测路径,根据执行结果更新后验;结构性错误惩罚大,环境噪声惩罚小。
  4. 剪除不满足置信条件的边。

阶段 B — 基于类型(基数)的轨迹合成 核心挑战在于高基数连接字段不唯一决定下游绑定,因此对连接字段的基数类型进行分类:

类型 条件 行为
SEQ n_i = 1 传递单个值
FAN 2 ≤ n_i ≤ 5 对每个不同值执行一次下游调用
DRV n_i > 5 插入处理节点(如 max、min、等式、日期后相等),缩减至最多 5 个值

此外,还有三种非序列化模板:SEM(独立工具、共享参数)、CMP(相同工具、不同参数)、COND(基于中间结果分支)。每个轨迹之后配韩语查询与可验证答案,并经过三阶段过滤:

  1. 规则过滤(不可复现、错误、冗余、异常)。
  2. LLM 静态过滤(不可评分、答案泄露、装饰性链条;需两名独立评审一致)。
  3. 独立重新解答;正确答案可主动替换原存储答案。

训练中,仅开源模型的输出成为训练标签,闭源模型仅用于验证。


实验结果

在 KOPA-Bench 上与 pass@1(4次rollout最优结果)及分布外 BFCL 的表现对比:

  • 专有模型
    • Claude Sonnet 4.6:命中 119/145,pass@1 = 0.4655。
    • GPT-5.1:命中 68/145,pass@1 = 0.3706。
  • 大型开源模型
    • Qwen3.5-27B:命中 82/145,pass@1 = 0.4482。
    • gemma-4-26B-A4B-it:命中 68/145,pass@1 = 0.3534。
    • EXAONE-4.5-33B:命中 56/145,pass@1 = 0.2586。
  • 小型开源模型
    • Qwen3.5-9B:命中 68/145,pass@1 = 0.3275。
    • Qwen3.5-4B:命中 45/145,pass@1 = 0.1758。
    • Ministral-3-8B-Instruct:命中 19/145,pass@1 = 0.0568。
  • EDGE 微调 + GRPO 的模型
    • Qwen3.5-9B(EDGE):命中 80/145,pass@1 = 0.4310(较原版 +10.4pp);BFCL MultiTurn 分项 58.12(+5.87)。
    • Qwen3.5-4B(EDGE):命中 68/145,pass@1 = 0.3094(较原版 +13.4pp);Action 分项高于所有小型与部分大型模型。

训练细节

  • 方法:GRPO 强化学习,二进制奖励(RESPONSE 和 ENVIRONMENT 维度)。
  • 框架:使用 verl 库(Megatron-LM 策略、vLLM 推理),在单机 8×H100 80GB 上训练。

发布状态与许可

  • 发布日期:截至 2026 年 08 月,论文被接收,但代码、基准、检查点均未公开,库仅为占位符;待发布内容含任务、MCP 服务器、评测工具、轨迹、模型等。
  • 许可:代码将按 MIT 许可证;基准任务和合成语料基于韩国开放政府许可(KOGL)的公共数据,须遵守各平台条款并提供自身 API 密钥。

引用格式

bibtex @inproceedings{TODO2026edge, title = {Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe}, author = {TODO}, booktitle = {Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing: Industry Track}, year = {2026} }

搜集汇总
数据集介绍
KOPA-BENCH 数据集图片
构建方式
针对数据主权法规推动公共机构部署开源大语言模型代理的需求,KOPA-BENCH基准应运而生。其构建依托十个韩国公共API平台,覆盖交通、金融、教育、法律、政务及行政区划六大领域,汇聚145项真实世界任务。每项任务均需串联多次工具调用,即前序工具输出成为后续工具输入,且多数中间结果呈现高基数特性,如分页数据或大型记录集。为保证任务的真实性与有效性,领域专家依据API文档设计链式工具集,并标注黄金操作轨迹、目标响应及环境状态。经双重验证流程——非作者专家审计与前沿模型执行校验——确保全部任务无偏差后,方纳入基准。同时,通过MCP服务器封装2,318个实时终端功能,提供类型化签名与自然语言描述,支撑标准函数调用接口的直接调用。
特点
KOPA-BENCH的显著特征在于其动态性与执行导向性。与基于模拟服务或手工脚本的传统基准不同,它扎根于实时开放的公共API,要求代理应对真实端点故障、接口漂移及高基数数据扇出等挑战。平均而言,任务需约五次工具调用,部分长达十四次,其中59%涉及并行执行,显著考验多步规划能力。评估体系采用三维度框架:RESPONSE核对最终答案,ENVIRONMENT比对状态哈希,ACTION融合正确性与效率指标,全面衡量轨迹质量。针对韩国语环境,基准涵盖70余项实体编码查找,每个任务需解析依赖链并聚合多页记录,有效反映开源模型在高复杂度工具调用场景下的性能短板。
使用方法
KOPA-BENCH的使用旨在评估并指导多步工具调用代理的优化。研究人员可将其作为标准化测试床,衡量不同规模开源模型在实时公共API上的指令遵循与规划能力,具体包括单轮成功率的pass@1、多轮稳健性的pass@4及动作精确度等指标。基准允许对比基础模型与经GRPO等强化学习算法微调后的模型性能,如通过EDGE合成数据训练的小参数模型可逼近大模型效果。评估时,每个任务在隔离的MCP实例中启动,确保环境状态无串扰。此外,用户的细粒度奖励标注支持强化学习过程的奖励塑造,且与BFCL等基准的联合使用可验证迁移泛化性能。最终,研究结论可为公共机构部署高效、可靠的本地化AI代理提供实证依据。
背景与挑战
背景概述
随着数据主权法规的日益严格,韩国公共机构愈发依赖在本地部署的开源大语言模型(LLM)代理,以通过实时政府API执行多步骤工具调用。然而,现有开源模型在此类多步推理场景中表现欠佳,且缺乏能够量化这一性能差距的基准。为填补这一空白,LG CNS的研究团队于2026年构建了KOPA-BENCH基准,该基准涵盖交通、金融、教育、法律、政治及地区行政六大领域的145个真实任务,每个任务均需将前序工具的输出作为后续调用的输入,形成依赖链式推理。KOPA-BENCH的提出不仅揭示了当前模型在处理实体代码查询与高基数响应时的显著短板,也为评估LLM代理在真实公共API环境中的工具调用能力提供了标准化平台,对推动开源模型在政务场景中的可靠部署具有重要意义。
当前挑战
KOPA-BENCH所面对的挑战既来自领域任务的固有复杂性,也源于基准构建过程的严苛要求。领域层面,工具调用常需先执行实体代码查找(如获取API密钥),将简单查询转化为多步依赖链;同时,API响应往往包含大量记录,模型需要具备数据归约或扇出处理能力,而开源模型常因跳过前置步骤或仅依据部分分页结果即草率作答而失败。构建层面,基准必须锚定于实时公共API,这要求处理端点漂移、认证错误等不稳定因素,并在合成训练数据时验证每一条工具间依赖链条的真实可执行性。此外,如何在保证任务可复现性的同时跨越10个平台、2,318个函数构建多样化且高难度的任务集,亦是设计中的一大难题。
常用场景
经典使用场景
KOPA-BENCH作为韩国公共开放API领域的首个多步骤工具调用基准,其经典使用场景聚焦于评估大语言模型在实时、高基数数据环境下的复合工具编排能力。该基准精心设计了涵盖交通、金融、教育、法律、政治及行政区划六大领域的145项任务,每项任务均需模型通过代码查询与分页聚合等操作,将多次相互依赖的API调用链式串联,从而严格检验模型在真实公共服务接口上的规划与执行水平。
衍生相关工作
该数据集催生了以EDGE为代表的执行落地式动态图数据合成管线,并衍生出一系列与多步骤函数调用相关的经典工作。EDGE通过实时执行验证工具依赖关系,基于基数类型化策略合成可复现的高阶训练轨迹,有效提升了小规模模型在KOPA-BENCH及分布外基准上的表现。此思路启发了后续对于实时API环境下数据合成、执行反馈及模型微调范式的研究,显著促进了工具调用智能体的泛化能力与工程落地。
数据集最近研究
最新研究方向
在数据主权法规与本地化部署需求日益凸显的背景下,KOPA-BENCH聚焦于评估开源大语言模型在实时韩国公共API上的多步骤工具调用能力,揭示了小型模型在实体代码查找与高基数响应处理上的显著短板。前沿研究由此转向执行驱动的数据合成方法,如EDGE框架通过动态图构建与实时验证,确保合成轨迹的可执行性,并利用GRPO强化学习显著提升小型模型的跨域泛化性能,使之逼近甚至超越大型模型的基准表现。该方向不仅弥合了开源与专有模型在公共部门部署中的效能鸿沟,还为构建可靠、合规且具备多步推理能力的智能体提供了可复制的范式与评估基石。
相关研究论文
  • 1
    Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis RecipeLG CNS · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务