遇见数据集

keerthanaSubru57/mcp-bench

收藏
Hugging Face2026-05-29 更新2026-05-31 收录
官方服务:

资源简介:

MCP-Bench任务数据集(v0.1)是一个包含70个任务的基准测试数据集,用于支持MCP-Bench项目——一个基于Anthropic的模型上下文协议(MCP)评估开源大型语言模型(LLM)代理可靠性的基准测试。数据集覆盖了多种MCP服务器类型,包括fetch(13个任务)、filesystem(14个任务)、github(10个任务)、memory(10个任务)、postgres(10个任务)和sqlite(13个任务)。任务按难度分为简单(24个)、中等(34个)和困难(12个),并按技能分为选择(40个)、组合(23个)和恢复(7个)。每个任务以JSON对象形式存储,包含唯一ID、描述、用户提示、所需服务器、设置操作、检查操作、标签、难度和技能等字段。数据集通过确定的检查操作符(如文件存在检查、内容匹配、SQL查询结果验证等)实现可复现的通过/失败判定,适用于工具使用、代理和基准测试研究。

The 70-task dataset behind MCP-Bench — a reliability benchmark for open-source LLM agents using Anthropics Model Context Protocol (MCP). It covers multiple MCP server types including fetch (13 tasks), filesystem (14 tasks), github (10 tasks), memory (10 tasks), postgres (10 tasks), and sqlite (13 tasks). Tasks are categorized by difficulty: easy (24), medium (34), and hard (12), and by skill: selection (40), composition (23), and recovery (7). Each task is structured as a JSON object with fields such as unique ID, description, user prompt, required servers, setup operators, check operators, tags, difficulty, and skill. The dataset uses deterministic check operators (e.g., file existence checks, content matching, SQL query validation) for reproducible pass/fail decisions, suitable for tool-use, agent, and benchmarking research.

提供机构:
keerthanaSubru57
搜集汇总
数据集介绍
keerthanaSubru57/mcp-bench 数据集图片
构建方式
MCP-Bench 数据集精心构建了70个任务,旨在评估基于模型上下文协议(Model Context Protocol, MCP)的开源大语言模型代理的可靠性。每个任务均以JSON对象形式呈现,包含唯一标识符、人类可读摘要、精确的用户提示、所需的MCP服务器、用于初始化沙箱环境的设置算子序列、决定任务通过与否的检查算子,以及标签、难度和技能类别等元数据。设置算子涵盖文件写入、目录创建、SQLite与内存初始化等操作,而检查算子则确保判定过程完全确定性,无需借助大语言模型评判,从而保障评估结果的稳定与可复现。
使用方法
用户可通过Hugging Face Datasets库便捷加载MCP-Bench数据集,使用一行代码即可获取任务列表。加载后,每个任务实例均包含完整提示与评估标准,研究人员可基于此开展代理系统的可靠性测试。数据集采用CC-BY 4.0许可协议,配套测试框架代码则遵循Apache 2.0许可,便于学术与工业界自由使用与扩展。引用时请参考数据集提供的BibTeX条目,以规范学术引用。
背景与挑战
背景概述
MCP-Bench 数据集由 Keerthana S 于2026年创建,旨在评估基于 Anthropic 的模型上下文协议(MCP)构建的开源大语言模型代理的可靠性。随着大语言模型在工具调用与自主代理领域的快速发展,MCP 作为统一协议的重要性日益凸显,但现有代理系统在复杂多步操作中仍存在显著的不可靠性。该数据集包含70个精心设计的任务,覆盖 fetch、filesystem、github、memory、postgres 和 sqlite 六类 MCP 服务器,并依据难度(简单至困难)与技能维度(选择、组合、恢复)进行分层。MCP-Bench 填补了代理可靠性基准测试方面的空白,为系统比较代理在不同场景下的鲁棒性提供了标准化工具,对推动可信赖代理系统的发展具有重要意义。
当前挑战
MCP-Bench 主要应对大语言模型代理在工具使用中的可靠性挑战,尤其是多服务器协调、动态环境适应性以及从错误中恢复的能力。领域内代理系统常因工具选择失误、指令组合偏差或上游状态异常而失败,该数据集通过涵盖选择、组合和恢复三类技能的任务,量化这些脆弱性。在数据集构建过程中,挑战在于设计可自动验证且无偏的确定性检查算子,确保评估的客观性;同时,需为每个任务预定义沙盒环境与精确的检查逻辑,以支持可复现的实验。此外,任务的难度分层与技能分类需平衡覆盖度与代表性,避免基准偏向某一特定能力,从而全面反映代理的可靠性格局。
常用场景
经典使用场景
MCP-Bench数据集是专为评估开源大语言模型智能体在遵循模型上下文协议(MCP)时的可靠性而设计的基准测试集。其经典使用场景涵盖了文件系统操作、数据库查询、GitHub交互、内存管理和网络抓取等多元化的工具调用任务。数据集包含70个精心构造的任务,按照难度等级(简单、中等、困难)和技能维度(工具选择、任务组合、错误恢复)进行分层设计,能够系统性地检验智能体在面对单一工具调用、多步骤协同操作以及异常情况恢复时的表现能力。研究者可通过标准化的提示词和确定性检查函数,对智能体在真实MCP环境中的行为进行可重复的量化评测。
解决学术问题
该数据集致力于解决开源LLM智能体在结构化工具调用场景中的可靠性评估这一关键学术挑战。在现有研究中,智能体往往在简单任务上表现良好,但面对需要多工具组合、上下文依赖或异常恢复的复杂场景时,其行为稳定性与决策准确性难以保证。MCP-Bench通过引入涵盖选择(selection)、组合(composition)和恢复(recovery)三类技能维度的测试任务,揭示了智能体在不同复杂度级别下的能力边界与薄弱环节。这一基准为研究人员提供了标准化评估框架,有助于深入理解模型在工具使用中的失败模式,推动更鲁棒的智能体架构设计与训练策略的发展,对提升AI系统在实际部署中的可信赖性具有重要学术价值。
实际应用
在实际应用层面,MCP-Bench所评测的能力直接映射到智能体在软件开发、数据处理和自动化运维等领域的真实工程场景。例如,在软件工程中,智能体可能需要同时读写文件系统、查询数据库并通过GitHub API完成Issue管理与代码审查;在数据科学工作流中,则需调用SQLite或Postgres数据库执行复杂查询,并结合内存工具维护对话状态。该数据集的难度分级机制使得企业可以针对不同应用场景筛选合适的模型:简单任务适合日常辅助工具,中等任务对应常规自动化流程,而困难任务则考验在极端条件下的智能体稳定性。这些能力对于构建能够独立完成复杂工作流的AI助手,如智能编程伴侣、自动化测试工具和人机协作平台,均具有直接指导意义。
数据集最近研究
最新研究方向
MCP-Bench作为首个基于Model Context Protocol(MCP)的开源LLM智能体可靠性基准数据集,聚焦于评估智能体在工具调用、多步骤任务编排与错误恢复等核心能力上的表现。其精心设计的70个任务覆盖fetch、filesystem、github、memory、postgres及sqlite等多种主流MCP服务器,并按照技能维度(选择、组合、恢复)与难度层级(简单、中等、困难)进行系统划分。在MCP协议日益成为大模型与外部工具交互的标准范式背景下,该数据集通过提供确定性检查算子,实现了对智能体任务完成质量的客观、可复现评估,为构建更稳健、可靠的自主智能体系统奠定了重要基准,也推动了LLM智能体在真实工具使用场景中的应用验证与能力提升。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务