MCP-Universe
收藏资源简介:
MCP-Universe是一个全面评估大型语言模型(LLMs)在现实世界任务中性能的基准数据集。该数据集由Salesforce AI Research创建,旨在评估LLMs与外部数据源和工具的交互能力。数据集包含11个MCP服务器,涵盖了6个核心领域,包括位置导航、仓库管理、财务分析、3D设计、浏览器自动化和网络搜索。MCP-Universe数据集包含231个任务,旨在评估LLMs在处理真实世界数据、导航复杂信息、管理版本控制流程和执行实时票价分析等场景下的能力。数据集的创建过程包括执行基于评估的评估器,包括格式评估器、静态评估器和动态评估器,以确保严格的评估。MCP-Universe数据集的应用领域是评估LLMs与外部数据源和工具的交互能力,旨在解决LLMs在实际应用中的性能限制问题。
MCP-Universe is a benchmark dataset for comprehensively evaluating the performance of large language models (LLMs) in real-world tasks. Developed by Salesforce AI Research, this dataset is designed to assess the ability of LLMs to interact with external data sources and tools. It comprises 11 MCP servers spanning six core domains, including location navigation, warehouse management, financial analysis, 3D design, browser automation, and web search. The MCP-Universe dataset contains 231 tasks, which aim to evaluate LLMs' capabilities in scenarios such as processing real-world data, navigating complex information, managing version control workflows, and conducting real-time fare analysis. During its development, evaluation-based assessors including format assessors, static assessors and dynamic assessors were adopted to ensure rigorous evaluation. The core application of MCP-Universe is to evaluate the interaction capabilities of LLMs with external data sources and tools, with the goal of addressing the performance limitations of LLMs in real-world practical applications.
MCP-Universe 数据集概述
数据集简介
MCP-Universe 是一个用于开发、测试和基准测试 AI 智能体的综合框架。该框架提供了一个强大的平台,用于在各种任务环境中构建和评估 AI 智能体及大型语言模型(LLMs)。支持与外部 MCP 服务器的无缝集成,并促进复杂的智能体编排工作流。
核心特点
- 真实世界场景评估:通过与实际 MCP 服务器交互,在真实应用场景中评估 LLMs
- 多领域支持:涵盖网络搜索、位置导航、浏览器自动化、金融分析、仓库管理和 3D 设计等多个领域
- 动态评估:支持时间敏感的实时环境评估
- 长时程推理:能够处理多步骤任务的长期推理
- 大规模工具空间:支持多样化的 MCP 服务器工具空间
性能表现
当前最先进模型在真实世界 MCP 交互中表现如下:
- GPT-5:43.72% 成功率
- Grok-4:33.33% 成功率
- Claude-4.0-Sonnet:29.44% 成功率
架构组成
应用层
- Dashboard (Gradio)
- Web API (FastAPI)
- Python 库
- 基准测试套件
编排层
- 工作流系统 (Chain, Router 等)
- 基准测试运行器 (评估引擎)
智能体层
- BasicAgent
- ReActAgent
- FunctionCall Agent
- 其他智能体类型
基础层
- MCP 管理器 (服务器和客户端)
- LLM 管理器 (多模型支持)
- 内存系统 (RAM, Redis)
- 追踪器 (日志记录)
技术需求
系统要求
- Python:3.10 或更高版本
- Docker:用于运行 Docker 化的 MCP 服务器
- PostgreSQL (可选):用于数据库存储和持久化
- Redis (可选):用于缓存和内存管理
API 密钥要求
核心 LLM 提供商
- OpenAI API 密钥 (GPT 模型)
- Anthropic API 密钥 (Claude 模型)
- Google API 密钥 (Gemini 模型)
领域特定服务
- SerpAPI 密钥 (网络搜索)
- Google Maps API 密钥 (地理位置服务)
- GitHub 个人访问令牌 (仓库操作)
- Notion API 密钥 (工作空间访问)
评估领域
支持的基准测试领域
- 网络搜索:搜索引擎和信息检索任务
- 位置导航:地理和地图相关查询
- 浏览器自动化:网络交互和自动化场景
- 金融分析:市场数据分析和金融计算
- 仓库管理:Git 操作和代码仓库任务
- 3D 设计:基于 Blender 的 3D 建模和设计任务
基准测试配置
配置文件位置
所有基准测试配置文件位于:mcpuniverse/benchmark/configs/test/
主要配置文件
web_search.yaml:网络搜索基准测试location_navigation.yaml:位置导航基准测试browser_automation.yaml:浏览器自动化基准测试financial_analysis.yaml:金融分析基准测试repository_management.yaml:仓库管理基准测试3d_design.yaml:3D 设计基准测试
自定义基准测试
任务定义格式
任务定义采用 JSON 格式,包含以下字段:
- category:任务类别
- question:主要问题
- mcp_servers:支持的 MCP 服务器列表
- output_format:期望的输出格式
- evaluators:评估测试列表
基准测试定义格式
基准测试定义采用 YAML 格式,包含:
- LLM 配置:指定使用的语言模型
- 智能体配置:定义智能体类型和配置
- 基准测试配置:指定要评估的任务列表
安全注意事项
- 建议使用专用的测试 GitHub 账户进行评估
- 安全存储和管理 API 密钥
- 授予最小必要权限
- 在隔离环境中运行 Blender 操作
相关资源
- 论文:https://arxiv.org/abs/2508.14704
- 官方网站:https://mcp-universe.github.io/
- 排行榜:https://mcp-universe.github.io/#results
- Discord 社区:https://discord.gg/t9tU77GF

- 1MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol ServersSalesforce AI Research · 2025年



