KOPA-BENCH
收藏资源简介:
KOPA-BENCH是由LG CNS构建的多步工具调用基准数据集,旨在评估开源大语言模型在韩国公共开放API上的链式调用能力。该数据集包含145个真实世界的任务,覆盖交通、金融、教育、法律、政治和行政区划六个领域,涉及10个平台和2318个工具函数。创建过程基于领域专家设计的链式工具集,通过两阶段验证(专家审计与前沿模型执行检查)确保任务质量。数据集主要用于测试模型在依赖调用、高基数响应处理等复杂场景下的表现,解决开源模型在实时政府API环境中性能不佳的问题。
KOPA-BENCH is a multi-step tool calling benchmark dataset developed by LG CNS, which aims to evaluate the chain-of-tool invocation capabilities of open-source large language models (LLMs) on South Korea's public open APIs. This dataset includes 145 real-world tasks covering six domains: transportation, finance, education, law, politics, and administrative divisions, involving 10 platforms and 2318 tool functions. Its development is based on a chained tool suite designed by domain experts, and two-stage verification including expert audit and state-of-the-art model execution check is adopted to ensure task quality. The dataset is primarily used to test model performance in complex scenarios such as dependency-aware tool invocation and high-cardinality response processing, aiming to address the poor performance issue of open-source models in real-time government API environments.
数据集核心信息
该数据集为 EDGE-KOPA,包含一套基准测试(KOPA-Bench)与数据合成方法(EDGE),聚焦于针对韩国开放公共 API 的多步骤工具调用场景。数据集简介与标题为 “Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe”,已被 EMNLP 2026 Industry Track 接收。
数据集设计动机与独特性
现有工具调用数据集大多基于模拟、仿真或冻结的 API 快照,而本数据集面向真实环境,其关键差异在于:
- 实时与不稳定API:工具端点为实时、有限速、偶发不可用的韩国政府开放 API。
- 执行依赖:工具间的依赖关系必须通过实际调用才能确认。
- 高输出基数:单次工具调用最多可返回 224,958 条记录。
- 链式入口:多数查询须先进行实体编码(如 API key、企业代码、区域代码)的查找。
这使得小规模开放模型在跳过前置查找、或从分页结果的第一页过早作答时,易失败。
KOPA-Bench 基准组件
- 规模:包含 145 个专家编写任务,覆盖 2,318 个实时工具,分布于 10 个韩国公共开放 API 平台,涉及 6 个领域。
- 任务性质:每项任务需串联多个依赖调用,一个调用的输出作为下一调用的输入。每任务最多包含 14 次工具调用,平均每次任务需 4.92 次工具调用、平均 3.32 步。
- 领域统计:
| 领域 | 任务数 | 平均步骤 | 平均工具调用数 | 效率裕度 (Headroom) | 可用工具数 | 并行度 % |
|---|---|---|---|---|---|---|
| 交通 (Traffic) | 22 | 3.64 | 5.14 | 2.21 | 7.5 | 55% |
| 金融 (Finance) | 29 | 3.69 | 5.65 | 2.24 | 6.6 | 83% |
| 教育 (Education) | 30 | 2.93 | 4.30 | 2.79 | 7.7 | 57% |
| 法律 (Law) | 22 | 3.00 | 3.55 | 3.63 | 6.7 | 27% |
| 政治 (Politics) | 25 | 3.72 | 5.48 | 2.10 | 8.7 | 52% |
| 行政区划 (District Admin.) | 17 | 2.76 | 5.41 | 1.55 | 8.0 | 82% |
| 总计 / 平均值 | 145 | 3.32 | 4.92 | 2.45 | 7.5 | 59% |
- 任务格式:包含任务ID、领域、韩语查询语句、系统状态(预设上下文与起始动作如获取 API key)、黄金动作序列(含参数及需要比较值的参数)、奖励依据(RESPONSE / ACTION)、最终答案(可为数字等类型)、最大允许调用数。
- 评估轴:
- RESPONSE:检查最终答案是否正确;通过提取答案、归一化、精确/近似匹配,以及 LLM-as-a-Judge 兜底。
- ENVIRONMENT:验证结果导致的服务器状态变化;通过 SHA-256 哈希与黄金状态比对。
- ACTION:评估使用轨迹的质量,计算公式为
(Corr + Eff)/2,其中Eff = (CR + MPC)/2;该指标从不单独使用,需结合结果验证。
EDGE 数据合成管线
EDGE(Execution-grounded Dynamic Graph)包含两个阶段,旨在生成与基准同样约束条件的训练数据。
阶段 A — 执行锚定的动态图构建
- 从 2,318 个工具构建依赖图骨架(检索器限制邻居范围)。
- 用 LLM 对每条候选边打分并预设先验参数。
- 通过 Thompson 采样等策略,对实时 API 执行探测路径,根据执行结果更新后验;结构性错误惩罚大,环境噪声惩罚小。
- 剪除不满足置信条件的边。
阶段 B — 基于类型(基数)的轨迹合成 核心挑战在于高基数连接字段不唯一决定下游绑定,因此对连接字段的基数类型进行分类:
| 类型 | 条件 | 行为 |
|---|---|---|
| SEQ | n_i = 1 |
传递单个值 |
| FAN | 2 ≤ n_i ≤ 5 |
对每个不同值执行一次下游调用 |
| DRV | n_i > 5 |
插入处理节点(如 max、min、等式、日期后相等),缩减至最多 5 个值 |
此外,还有三种非序列化模板:SEM(独立工具、共享参数)、CMP(相同工具、不同参数)、COND(基于中间结果分支)。每个轨迹之后配韩语查询与可验证答案,并经过三阶段过滤:
- 规则过滤(不可复现、错误、冗余、异常)。
- LLM 静态过滤(不可评分、答案泄露、装饰性链条;需两名独立评审一致)。
- 独立重新解答;正确答案可主动替换原存储答案。
训练中,仅开源模型的输出成为训练标签,闭源模型仅用于验证。
实验结果
在 KOPA-Bench 上与 pass@1(4次rollout最优结果)及分布外 BFCL 的表现对比:
- 专有模型:
- Claude Sonnet 4.6:命中 119/145,pass@1 = 0.4655。
- GPT-5.1:命中 68/145,pass@1 = 0.3706。
- 大型开源模型:
- Qwen3.5-27B:命中 82/145,pass@1 = 0.4482。
- gemma-4-26B-A4B-it:命中 68/145,pass@1 = 0.3534。
- EXAONE-4.5-33B:命中 56/145,pass@1 = 0.2586。
- 小型开源模型:
- Qwen3.5-9B:命中 68/145,pass@1 = 0.3275。
- Qwen3.5-4B:命中 45/145,pass@1 = 0.1758。
- Ministral-3-8B-Instruct:命中 19/145,pass@1 = 0.0568。
- EDGE 微调 + GRPO 的模型:
- Qwen3.5-9B(EDGE):命中 80/145,pass@1 = 0.4310(较原版 +10.4pp);BFCL MultiTurn 分项 58.12(+5.87)。
- Qwen3.5-4B(EDGE):命中 68/145,pass@1 = 0.3094(较原版 +13.4pp);Action 分项高于所有小型与部分大型模型。
训练细节
- 方法:GRPO 强化学习,二进制奖励(RESPONSE 和 ENVIRONMENT 维度)。
- 框架:使用 verl 库(Megatron-LM 策略、vLLM 推理),在单机 8×H100 80GB 上训练。
发布状态与许可
- 发布日期:截至 2026 年 08 月,论文被接收,但代码、基准、检查点均未公开,库仅为占位符;待发布内容含任务、MCP 服务器、评测工具、轨迹、模型等。
- 许可:代码将按 MIT 许可证;基准任务和合成语料基于韩国开放政府许可(KOGL)的公共数据,须遵守各平台条款并提供自身 API 密钥。
引用格式
bibtex @inproceedings{TODO2026edge, title = {Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe}, author = {TODO}, booktitle = {Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing: Industry Track}, year = {2026} }

- 1Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis RecipeLG CNS · 2026年




