遇见数据集

A Large-Scale Dataset of MCP Implementations on GitHub

收藏
arXiv2026-07-11 更新2026-07-14 收录
官方服务:

资源简介:

该数据集由奥克兰大学和北卡罗来纳大学威明顿分校的研究团队构建,是一个大规模、基于证据的GitHub上模型上下文协议(MCP)实现的数据集。它包含2,297个经过验证的MCP项目,通过混合管道从GitHub REST和GraphQL API收集,并经过多阶段验证,涵盖客户端、服务器和网关三种操作角色,数据以JSONL模式组织。数据集创建过程涉及初始仓库发现、活跃维护过滤、多阶段验证管道以及手动验证与规则细化,确保高精度和可重复性。该数据集旨在支持对现实世界MCP生态系统的研究,应用于软件工程、数据挖掘和机器学习领域,帮助解决协议实现、集成、兼容性和演化分析等问题。

This dataset was constructed by a research team from the University of Auckland and the University of North Carolina Wilmington. It is a large-scale, evidence-based dataset of Model Context Protocol (MCP) implementations hosted on GitHub. The dataset contains 2,297 validated MCP projects, which were collected via a hybrid pipeline from GitHub REST and GraphQL APIs and subjected to multi-stage validation. It covers three operational roles: client, server, and gateway, and is organized in JSONL format. The dataset creation process involves initial repository discovery, active maintenance filtering, multi-stage validation pipelines, manual validation and rule refinement, ensuring high accuracy and reproducibility. This dataset is designed to support research on real-world MCP ecosystems, with applications in software engineering, data mining, and machine learning, to aid in addressing issues including protocol implementation, integration, compatibility, and evolutionary analysis.

创建时间:
2026-07-11
搜集汇总
数据集介绍
A Large-Scale Dataset of MCP Implementations on GitHub 数据集图片
构建方式
该数据集基于GitHub平台,通过混合使用REST与GraphQL API,结合自定义Python验证脚本构建。研究团队首先设计了五组针对性搜索查询,捕获2024年1月至2025年10月间与模型上下文协议相关的候选仓库,经去重与筛选后获得3,238个唯一仓库。随后,通过移除文档类、无近期提交及未修改分支等非活跃仓库,保留3,058个候选。最后,采用多层证据验证流程,涵盖依赖清单指纹(如mcp/sdk)、目录结构入口点及CI/CD与环境配置,经人工校验后最终确认2,297个已验证的MCP实现项目。
特点
该数据集的核心特征在于其基于源代码级证据的精确角色分类与结构化验证。每个仓库依据客户端、服务器或网关三类操作角色进行规则评分,结合强信号(如源代码路径)与弱信号(如README文本)进行多维判定,支持多角色共存与未分类标记。数据采用可重复的JSONL模式组织,记录了角色分配、语言构成、开发活动及提交历史,涵盖2,297个已验证项目。统计显示,Python与TypeScript主导开发,网关角色中Go语言显著,且多数仓库呈现小步迭代的协作模式。
使用方法
研究人员可通过公开访问的数据集链接获取完整内容,支持使用JSONL格式加载与分析。使用方法包括按仓库角色(客户端、服务器、网关)进行筛选,结合EVIDENCE_SUMMARY表中的证据强度进行可信度评估,利用COMMITS与PULL_REQUESTS表进行代码演化与协作模式研究。数据集适用于验证MCP生态系统的集成模式、跨语言兼容性及安全维护分析,用户可基于提供的Python脚本复现分类流程,并可扩展用于追踪协议实现的演进轨迹与开发者行为挖掘。
背景与挑战
背景概述
随着大型语言模型从纯粹文本生成迈向工具调用与实时数据交互的智能体范式,模型上下文协议(Model Context Protocol, MCP)应运而生,为连接语言模型与外部工具及服务提供了统一标准。2026年,来自奥克兰大学与北卡罗来纳大学威尔明顿分校的研究团队构建了首个大规模、基于证据的MCP实现数据集,旨在填补对开源生态中MCP实际实现方式系统性认知的空白。该数据集以GitHub为数据源,通过混合管道集成REST与GraphQL API及自定义验证脚本,从3,238个候选仓库中经多阶段证据核查,最终保留了2,297个经过验证的MCP项目。研究不仅按运行角色(客户端、服务器、网关)对项目进行分类,还揭示了Python与TypeScript主导M开发生态、混合架构成为最普遍设计模式等关键发现,为研究真实世界MCP生态系统奠定了可复现基准,对推动集成、连通性与兼容性研究具有重要影响力。
当前挑战
该数据集所应对的核心领域挑战在于,MCP协议虽被快速采纳,但开源社区中缺乏对其实现规模、结构及维护状况的系统性理解,此前依赖注册表或市场列表的方法无法提供基于代码证据的可验证事实。构建过程中面临多重挑战:首先,需设计五组精准搜索查询以捕获广泛协议引用及具体实现上下文,并应对近3,200个候选仓库中大量的重复项与假阳性结果;其次,过滤阶段需排除维护停滞、纯文档及未修改复刻的仓库,以确保数据集反映活跃开发状态;再次,多阶段验证需跨JavaScript、Python、Rust等多种语言解析清单文件、目录结构与入口点,并整合CI/CD、容器化及环境配置信号,过程中有660个无操作伪影的仓库被剔除;最后,手工验证揭示非MCP相关指代(如Minecraft Coder Pack)、仅引用无执行代码及模板占位项目等假阳性来源,经规则精炼后移除90个误匹配项,才得以确保最终数据集的精确性。
常用场景
经典使用场景
在模型上下文协议(MCP)迅速成为连接大型语言模型与外部工具及服务之新兴标准的背景下,该数据集作为首个基于GitHub大规模实证收集的MCP实现仓库资源,为研究者提供了系统审视MCP在实际开发中如何被部署、构建及维护的宝贵窗口。其最经典的用途在于支撑对MCP生态系统进行全景式的量化剖析,包括对客户端、服务器与网关三类角色的分布统计、主流编程语言(如Python与TypeScript)的采纳趋势分析,以及揭示混合架构作为最普遍设计模式的实证发现,从而为理解MCP从理论规范向软件实践的转化过程奠定了坚实的数据基础。
解决学术问题
该数据集直接回应了学术界长期以来因缺乏代码级真实证据而难以系统研究MCP生态的困境。它解决的核心学术问题包括:如何借助多阶段、基于证据的验证流水线,从海量候选仓库中精确识别功能性的MCP实现,并区分其操作角色;如何通过结构化证据标签(如依赖指纹、入口点模式与CI/CD配置)建立可复现的数据组织范式,以支持对实现质量、安全漏洞及维护性的实证分析。其意义在于为后续关于MCP集成性、互操作性与兼容性的纵深研究提供了基准基准,推动了对协议驱动型代理系统软件工程特性的严谨探索。
衍生相关工作
该数据集为MCP研究领域催生了一系列衍生工作。首先,它可支撑对MCP服务器安全性及可维护性的系统化分析,通过结合静态扫描工具识别协议特定漏洞,并与类似规模的MCP语料库(如MCPCorpus)进行对比,以验证基于市场和基于仓库两种抽样策略的互补性。其次,数据集收录的提交历史与拉取请求记录,为研究MCP实现随时间演化的模式、开发者协作特征(如小型团队主导的迭代式开发)以及版本发布节奏提供了宝贵素材。未来工作可进一步围绕角色与子类型分类的精细化、数据集的时效性更新,以及跨语言实现模式的比较研究展开。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务