Ko-AgentBench
收藏资源简介:
Ko-AgentBench 是一个用于评估人工智能代理在韩国语言环境中表现的数据集。数据集分为七个级别(L1 到 L7),每个级别针对代理的不同能力,例如基本工具调用、工具选择、顺序和并行工具推理、错误处理、高效工具利用和长期上下文推理。数据集的功能包括 18 个韩国特定 API 和基于现实生活情况的场景。数据集用韩语和英语描述,文件包括使用 Hugging Face 数据集库在 Python 中加载数据集和使用数据集的说明。
Ko-AgentBench is a dataset designed to evaluate the performance of AI Agents in the Korean language environment. The dataset is divided into seven levels (L1 to L7), with each level targeting distinct capabilities of AI Agents, including basic tool invocation, tool selection, sequential and parallel tool reasoning, error handling, efficient tool utilization, and long-term contextual reasoning. Its features encompass 18 Korea-specific APIs and scenarios based on real-life situations. Descriptions of the dataset are available in both Korean and English, and the accompanying documentation provides instructions for loading and utilizing the dataset via the Hugging Face Datasets library in Python.
Ko-AgentBench 数据集概述
基本信息
- 语言:韩语
- 许可证:Apache-2.0
- 任务类别:问答
- 标签:智能体、基准测试、工具使用、韩语
数据集配置
- 配置名称:default
- 数据文件分割:
- L1分割:data/L1-*
- L2分割:data/L2-*
- L3分割:data/L3-*
- L4分割:data/L4-*
- L5分割:data/L5-*
- L6分割:data/L6-*
- L7分割:data/L7-*
数据集特征
- 特征字段:
- instruction:字符串类型
- tools:字符串列表
- 数据集统计:
- 下载大小:20447字节
- 数据集大小:13783字节
- 各分割统计:
- L1:1551字节,11个示例
- L2:4655字节,30个示例
- L3:1433字节,10个示例
- L4:1567字节,10个示例
- L5:2091字节,20个示例
- L6:1184字节,15个示例
- L7:1302字节,10个示例
核心特点
- 阶段性任务设计:将智能体能力分为7个阶段进行立体分析
- 18种韩式API使用:基于韩国实际使用环境的API构建现实问题解决场景
- 缓存基础重复评估及强固性测试:解决现有基准测试的固有问题
- 阶段性独特精确指标:分阶段评估问题解决过程
任务分类阶段
单轮对话
L1(单一工具调用)
- 目标:验证最基本的API调用能力
- 特点:评估准确性
L2(工具选择)
- 目标:验证从多个候选工具中选择最优API的能力
- 特点:评估准确工具映射
L3(工具顺序推理)
- 目标:验证通过多阶段推理的计划和执行能力
- 特点:评估有计划性的工具链
L4(工具并行推理)
- 目标:并行收集信息并综合得出结论
- 特点:评估多源聚合能力
L5(错误处理与强固性)
- 目标:验证错误情况下的应对能力
- 细项:附加提问请求、防止幻觉、回避机动
多轮对话
L6(高效工具利用)
- 目标:验证有效重用先前工具结果的能力
- 特点:评估合理选择能力
L7(长期上下文推理)
- 目标:验证在多轮对话中维持长期上下文的能力
- 特点:评估上下文维护能力
评估范围
- 评估对象:支持工具调用的开放权重sLLM、商业API
- 评估范围:单轮及多轮对话情境中作为智能体执行工具调用的能力
- 应用API:18种韩式开放API
相关资源
- 排行榜:https://huggingface.co/spaces/huggingface-KREW/Ko-AgentBench
- GitHub仓库:https://github.com/Hugging-Face-KREW/Ko-AgentBench
- 数据集页面:https://huggingface.co/datasets/huggingface-KREW/Ko-AgentBench




