遇见数据集

MCP-Persona

收藏
arXiv2026-06-02 更新2026-06-03 收录
官方服务:

资源简介:

MCP-Persona是由上海交通大学等机构联合创建的首个专注于评估大型语言模型代理在真实世界个性化应用中的性能基准数据集。该数据集涵盖173项经过人工验证的高质量任务,覆盖社交媒体、协作平台及内容管理等多个领域,数据来源于对12个真实MCP服务器的工具遍历与上下文模拟,包含丰富的工具链与个性化上下文分布。数据集通过创新的工具遍历、上下文树及人物生成方法构建,模拟了用户账户与本地数据库的交互,旨在解决个性化工具使用中因隐私和操作限制导致的评估难题,推动智能代理在沟通与协作场景中的实用化发展。

MCP-Persona is the first benchmark dataset jointly created by institutions including Shanghai Jiao Tong University for evaluating the performance of large language model agents in real-world personalized applications. This dataset covers 173 high-quality tasks that have been manually verified, spanning multiple domains such as social media, collaboration platforms and content management. The data is derived from tool traversal and context simulation across 12 real MCP servers, and contains rich toolchains and personalized context distributions. The dataset is constructed through innovative methods of tool traversal, context tree and persona generation, simulating the interaction between user accounts and local databases. It aims to address the evaluation challenges caused by privacy and operational constraints in personalized tool usage, and promote the practical development of intelligent agents in communication and collaboration scenarios.

创建时间:
2026-06-02
原始信息汇总

MCP-Persona 数据集概述

基本信息

MCP-Persona 是用于评估大语言模型(LLM)智能体在真实世界个性化MCP工具和任务上表现的基准数据集,已被 ICML 2026 接收。相关论文可在 arXiv 获取。

核心特点

1. 模拟工具与状态化个性化上下文

构建了沙盒化模拟环境,所有工具操作稳定、可复现且安全,无需使用真实凭据或用户数据。

2. 上下文填充策略

通过四种互补方法生成真实多样的用户状态:

  • Enumerate(枚举)
  • Free-Form(自由格式)
  • Random(随机)
  • Authentic(真实)

3. 覆盖范围

作为唯一同时提供真实世界工具、个性化上下文,并覆盖以下领域的MCP基准:

  • 社交媒体
  • 协作平台
  • 电子邮件
  • 内容管理

数据集统计

  • 任务数量:173个工具链任务
  • 工具数量:139个独特工具
  • MCP服务器数量:18个
  • 包含多种链长度和必要的上下文计数

流水线三阶段

  1. Tool-Traverse:爬取真实MCP服务器,为每个工具合成稳定、可验证的模拟代码。
  2. Context-Tree:从工具文档构建结构化实体层次结构,并用现实个性化上下文数据填充。
  3. Persona-Gen:生成模糊的、基于人物角色的任务指令,需要多步工具链解决。

数据与代码结构

类别 路径 描述
任务 ./data/tasks 用于评估智能体的基准任务
模拟工具 ./data/simulated_tools 模拟MCP服务器行为的Python工具(含状态化上下文)
上下文架构 ./data/context_schema/ 填充用户/上下文状态的架构定义(如Lark、小红书)
源代码 ./src/ 构建和部署模拟MCP服务器的核心脚本
评估代码 ./eval/ 运行基准评估的脚本(检查点和执行)

安装方式

bash git clone https://github.com/wh0411/MCP-Persona.git cd MCP-Persona pip install -r requirements.txt

引用

bibtex @misc{wang2026mcppersonabenchmarkingllmagents, title={MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation}, author={Wenhao Wang and Peizhi Niu and Gongyi Zou and Xiyuan Yang and Jingxing Wang and Haoting Shi and Yaxin Du and Jingyi Chai and Xianghe Pang and Shuo Tang and Yanfeng Wang and Siheng Chen}, year={2026}, eprint={2606.02470}, archivePrefix={arXiv}, primaryClass={cs.AI}, url={https://arxiv.org/abs/2606.02470}, }

搜集汇总
数据集介绍
MCP-Persona 数据集图片
构建方式
MCP-Persona的构建基于三大核心组件:工具、上下文与任务。在工具方面,采用Tool-Traverse方法,通过先遍历真实MCP服务器收集函数调用与响应,再借助LLM自动生成可执行的Python代码模拟器,精确复现工具行为。上下文构建通过Context-Tree方法,为每个应用定义层次化实体结构(如User→Calendar→Event),并注入真实或合成内容以模拟个性化用户档案。任务生成则采用Persona-Gen流水线,从工具调用链中自动合成指令原型,经上下文注入、指令模糊化处理及人工精修,最终产出173个高质量、经过人工验证的个性化任务。
特点
MCP-Persona的核心特点在于其真实性与综合性。它首次将评估范围从通用信息检索工具扩展到社交平台(如Reddit、小红书)、企业协作套件(如飞书、Slack)等真实个人应用,覆盖社交、协作、邮件和内容管理四大领域。其模拟工具通过比对真实服务器行为验证,F1得分达93.8%,响应相似度指标(如METEOR)提升近三倍。基准包含单服务器与跨服务器任务,后者要求协调多个个性化工具,极大考验智能体的跨工具协同与长程状态维护能力。实验表明,即使是GPT-5等顶尖模型,整体准确率也未能突破50%。
使用方法
MCP-Persona支持两种评估方式:基于检查点与基于执行结果的评估。检查点评估将任务分解为子步骤,由LLM裁判对每一步的输入参数与输出进行评分。执行结果评估则直接测量模拟环境中文档状态的CRUD操作成功率。所有工具和上下文均封装为Python代码,研究人员可轻松部署本地沙盒环境,通过标准化API调用测试智能体。该基准还提供丰富的任务示例与评估指标(如成功率和执行准确率),便于复现实验。项目代码与数据已在GitHub开源,支持社区扩展与定制。
背景与挑战
背景概述
随着大语言模型与外部工具集成的需求日益增长,模型上下文协议应运而生,成为连接智能体与数据源的核心标准。然而,现有基准评测大多聚焦于通用信息检索工具,忽视了个人社交应用场景中工具与用户账户、本地数据库深度耦合所带来的独特挑战。为填补这一空白,上海交通大学、浙江大学、伊利诺伊大学厄巴纳-香槟分校及牛津大学的研究人员于2026年联合推出了MCP-Persona基准。该基准首次面向真实世界个性化MCP工具构建,涵盖Reddit、小红书等社交媒体以及飞书、Slack等企业协作平台,系统评估智能体在个性化工具调用中的表现,对推动个性化AI助手的发展具有里程碑意义。
当前挑战
MCP-Persona面临的核心挑战源于个性化工具使用的固有复杂性。首先,真实部署个性化MCP服务器需访问私有用户数据并投入大量人力搭建环境,导致大规模实验成本高昂且难以复现。其次,隐私与安全限制严重制约了个人上下文的收集、共享与复用,阻碍了开源基准的构建。此外,维护一个稳定可执行的仿真环境,以支撑大量异构用户、保障受控公平的评测,构成了非平凡的技术挑战。最后,实验揭示现有顶尖智能体在跨工具协调、隐式上下文推理与多步状态维护方面表现欠佳,凸显了该基准在识别与弥补能力短板上的关键价值。
常用场景
经典使用场景
MCP-Persona 作为首个专门针对真实世界个性化 MCP 工具场景设计的基准测试,其经典应用在于评估大语言模型智能体在实际个人应用中的工具调用与任务执行能力。该数据集覆盖了从社交媒体平台(如 Reddit、小红书)到企业协作套件(如飞书、Slack)等多种主流个性化应用,通过构建高保真的模拟环境与用户上下文树,系统性地检验智能体在跨平台、多步骤、隐式依赖的个性化任务中的表现。无论是单服务内的日历管理、消息发送,还是跨服务的文档整理与社交平台发布,MCP-Persona 都为研究者提供了可复现且隐私保护的实验平台,成为衡量智能体个性化工具使用能力的权威标杆。
衍生相关工作
MCP-Persona 的提出催生了一系列相关的经典研究工作,推动了个性化智能体评估与工具模拟技术的深入发展。在方法层面,Tool-Traverse 的遍历-模拟范式启发了后续的高保真工具模拟研究,如基于代码生成的可执行仿真内核;Context-Tree 的层次化上下文建模则为多轮状态跟踪提供了标准化的数据组织方案。在评估层面,该基准促使 MCP-Universe、ToolAthlon 等后续工作更加关注真实世界中具有状态和个性化特征的工具场景,而 PersonaBench 和 AppWorld 等基准也在此基础上进一步完善了个人信息的利用与评估维度。此外,该工作对隐式上下文解耦和指令模糊化的处理,为技能文档增强(如 OpenClaw Skills)和多候选工具消融实验提供了重要的参考框架。
数据集最近研究
最新研究方向
MCP-Persona专注于大语言模型在真实世界个性化应用中的智能体评估,尤其是通过环境模拟技术,构建了首个针对个性化模型上下文协议工具的基准测试平台。当前前沿研究方向聚焦于模拟状态化、账户绑定的MCP工具(如Slack、小红书、飞书等),并提出Tool-Traverse、Context-Tree和Persona-Gen三大方法,分别用于高保真工具仿真、用户上下文树构建和个性化任务生成。该研究揭示了现有顶尖智能体在隐式环境理解、多步状态维持和跨工具协调方面的显著不足,推动了个性化、隐私保护型智能体评估范式的发展,对于加速MCP生态下的用户中心智能应用落地具有关键意义。
相关研究论文
  • 1
    MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation上海交通大学·多智能体治理与智能团队; 浙江大学·计算机科学与技术系; 伊利诺伊大学厄巴纳-香槟分校; 牛津大学; 上海人工智能实验室 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务