遇见数据集

mcp-registry

收藏
Hugging Face2026-06-23 更新2026-06-24 收录
官方服务:

资源简介:

Vinkius MCP Registry数据集是Vinkius开放数据计划的一部分,提供了对Vinkius模型上下文协议(MCP)目录的访问。该数据集包含5,127个以上独特的VCP服务器记录,每12小时自动同步更新,确保数据的最新性。数据以UTF-8编码的CSV文件格式提供,包含13个结构化字段,如唯一服务器标识符(slug)、显示标题、主要分类、描述性标签、能力摘要、完整描述、工具数量、工具名称列表、真实使用提示示例、自动化质量等级(A+至F)、数值可靠性评分、创建时间戳和直接链接。该数据集专为AI研究人员、数据科学家和语言模型开发者设计,支持多种研究应用,包括LLM微调(用于高级函数调用和工具使用的真实模式)、代理框架研究(多代理编排和系统桥接的操作元数据)、语义分析(分析外部软件平台和企业系统如何映射到自然语言接口的大规模数据集)、多标签分类、推荐系统、异常检测、生态系统智能分析、提示工程研究、质量与可靠性分析以及市场与竞争研究。数据集采用CC0 1.0公共领域许可,允许商业和非商业用途,无需署名但鼓励引用。

The Vinkius MCP Registry dataset is part of the Vinkius Open Data Initiative, providing access to the Vinkius Model Context Protocol (MCP) directory. It contains over 5,127 unique VCP server records, automatically synchronized and updated every 12 hours to ensure data freshness. The data is provided in UTF-8 encoded CSV format with 13 structured fields, including unique server identifier (slug), display title, primary category, descriptive tags, capability summary, full description, number of tools, list of tool names, real-world usage prompt examples, automated quality grade (A+ to F), numerical reliability score, creation timestamp, and direct link. Designed for AI researchers, data scientists, and language model developers, it supports various research applications such as LLM fine-tuning (for real patterns in advanced function calling and tool usage), agent framework research (operational metadata for multi-agent orchestration and system bridging), semantic analysis (large-scale dataset for analyzing how external software platforms and enterprise systems map to natural language interfaces), multi-label classification, recommendation systems, anomaly detection, ecosystem intelligence analysis, prompt engineering research, quality and reliability analysis, and market and competition research. The dataset is licensed under CC0 1.0 Public Domain Dedication, allowing both commercial and non-commercial use without attribution, though citation is encouraged.

创建时间:
2026-06-21
原始信息汇总

数据集概述

  • 数据集名称: Vinkius MCP Registry — Open Data Initiative
  • 数据集语言: 英语 (en)
  • 许可证: CC0 1.0 (公有领域)
  • 规模: 5,141+ 条记录,文件大小在 1K 到 10K 之间

数据集内容

  • 数据来源: 从 Vinkius 平台自动提取
  • 更新频率: 每 12 小时自动同步一次
  • 文件格式: CSV (UTF-8 编码),文件名为 vinkius_mcp_servers.csv
  • 数据字段:
列名 类型 描述
slug string 唯一的服务器标识符
title string 服务器显示名称
category string 主要分类(如 Development, Data Analytics, Communication 等)
tags string 逗号分隔的描述性关键词
short_description string 单行能力摘要
description string 完整的功能和集成细节
tools_count integer 该服务器暴露的工具数量
tool_names string 逗号分隔的工具名称列表
prompt_examples string 针对该服务器的真实使用提示示例
debugger_grade string 自动化的质量等级(A+ 到 F)
debugger_score float Vinkius Debugger 给出的数值可靠性评分
created_at datetime 列表创建时间戳
url string 指向 Vinkius 目录中 MCP 服务器页面的直接链接

数据用途

该数据集适用于以下研究和应用领域:

  • LLM 微调: 提供真实世界的模式,用于训练模型掌握高级函数调用和工具使用
  • Agent 框架: 提供操作元数据,用于研究多智能体编排和系统桥接
  • 语义分析: 为分析外部软件平台和企业系统如何映射到自然语言接口提供大规模语料
  • 生态系统情报: 追踪 MCP 服务器类别的增长轨迹,识别扩展最快的工具类型
  • 提示工程: 分析 prompt_examples,研究针对不同 LLM 集成的工具使用指令设计
  • 质量与可靠性分析: 探索 debugger_gradedebugger_score 的分布,识别高质量与低维护服务器的模式
  • 机器学习:
    • 多标签分类:基于 description 预测 categorytags
    • 推荐系统:基于标签相似性、嵌入距离或协同过滤构建工具推荐器
    • 异常检测:在不同快照间标记异常评分模式或等级突变的服务器
  • 市场与竞争研究: 追踪新服务器注册速率,作为 MCP 生态系统采用的指标;按行业垂直领域对标服务器类别

引用信息

bibtex @dataset{vinkius_mcp_registry, title = {Vinkius MCP Registry — Global Model Context Protocol Dataset}, author = {Vinkius}, year = {2026}, url = {https://huggingface.co/datasets/Vinkius/mcp-registry}, note = {Updated every 12 hours. 5,141+ MCP servers indexed.} }

其他信息

  • 数据完整性:每次快照保证唯一 slug
  • 数据验证:每次上传前执行最小阈值验证
  • 任务类型:文本分类 (text-classification)、特征提取 (feature-extraction)
  • 标签:mcp, model-context-protocol, ai-tools, llm, agentic-ai, claude, chatgpt, copilot, prompt-engineering, ai-infrastructure, developer-tools
搜集汇总
数据集介绍
mcp-registry 数据集图片
构建方式
该数据集源自Vinkius平台,通过程序化方式从Vinkius MCP注册表中自动提取,每12小时同步一次,确保数据的实时性与完整性。每项记录均保持严格的结构一致性,涵盖5,141个独特的MCP服务器。数据以UTF-8编码的CSV格式存储,包含从服务器标识符、分类标签到工具数量、质量评分等14个字段的详尽模式(Schema),旨在为研究者提供一个低噪声、高组织性的语料库。
特点
数据集的核心特点在于其结构的高度规范性与丰富的元数据,为人工智能研究提供了多维度支撑。它覆盖了从Development到Communication等广泛分类,并包含质量等级(debugger_grade)与可靠性评分(debugger_score),便于进行质量分析与模式识别。此外,每条记录都提供了真实世界的使用提示(prompt_examples),直接关联到LLM工具调用场景,使其在生态智能分析、提示工程以及多标签分类等机器学习任务中展现出独特的应用价值。
使用方法
使用者可直接加载`vinkius_mcp_servers.csv`文件进行探索。适用于多种研究场景:可利用`description`与`tags`列开展多标签分类或语义分析;借助`debugger_score`与`tools_count`探究复杂度与可靠性之间的权衡;通过`prompt_examples`构建提示模板语料库用于微调或评测。数据集以CC0 1.0公有领域许可发布,允许任意商业或非商业用途,且支持通过Hugging Face的`datasets`库便捷加载。
背景与挑战
背景概述
随着大型语言模型(LLM)与外部工具的深度整合,模型上下文协议(Model Context Protocol, MCP)作为连接AI智能体与多样化软件生态的关键桥梁,其标准化与可扩展性需求日益凸显。在此背景下,Vinkius团队于2026年发布了mcp-registry数据集,该数据集由Vinkius平台自动抓取并持续更新,收录了超过5,141个独特的MCP服务器记录。该数据集以结构化语料库的形式,为研究者提供了丰富的工具元数据、质量评分及实际使用提示,成为研究LLM工具调用、多智能体编排、语义映射以及生态演化分析的基石资源,对推动Agentic AI基础设施的发展具有重要影响力。
当前挑战
该数据集所应对的核心领域挑战在于:LLM在实际部署中缺乏统一、高质量的工具调用接口规范,导致智能体与外部系统对接效率低下且可靠性不足。具体而言,数据集构建过程中面临多重难题:首先,需从海量、异构的MCP服务器中提取并统一结构化字段(如工具名称、质量评分、分类标签),确保数据的一致性与噪声最小化;其次,需建立自动化的质量评价体系(如Debugger Grade与Score),以量化服务器的可靠性,这要求设计严谨的检测算法;最后,数据每12小时自动同步的机制要求流水线具备高容错性与去重能力,以维护数据时效性与完整性。
常用场景
经典使用场景
在人工智能与自然语言处理研究的前沿领域,mcp-registry 数据集为大规模工具调用与大语言模型(LLM)微调提供了结构精良的语料基础。该数据集收录了超过5,100个独特的模型上下文协议(MCP)服务器,每一记录均包含类别标签、工具配置、质量评分及真实提示词示例,使其成为研究函数调用能力、多智能体编排与语义映射的经典基准。研究者可借助该数据集进行多标签文本分类,从工具描述预测其所属类别和标签;亦可用于构建工具推荐系统,通过嵌入相似度或协同过滤算法实现智能检索。其结构化元数据还支持异常检测实验,通过分析调试分数与质量等级的分布规律,揭示服务器稳定性与复杂度之间的微妙权衡。
解决学术问题
该数据集直面当前AI研究中的关键瓶颈:如何让大语言模型高效理解并调用外部工具。通过提供高信噪比的MCP服务器元数据,它系统性地解决了工具语义表示与函数调用泛化能力的训练难题。学术界长期困扰于缺少大规模、标准化的工具描述语料,导致模型在复杂工具链任务中表现欠佳。mcp-registry 的公开与结构化特性,使得研究者能够开展细粒度的提示工程分析,从真实提示词示例中提炼工具指令的设计范式,进而推动提示模板库的标准化构建。更重要的是,它为多智能体系统研究提供了可复现的操作元数据,助力探索智能体间协作、系统桥接与任务分解的底层机制,对构建自主化AI基础设施具有深远意义。
衍生相关工作
围绕这一数据集,已涌现出一系列富有影响力的衍生工作。在开源领域,Vinkius实验室发布的MCP Fusion框架为TypeScript开发者提供了构建MCP服务器的底层设施,而MCP Desktop和Discover MCP项目则分别降低了客户端集成与服务器发现的准入门槛。学术探索方面,研究者开始基于该数据集训练专用嵌入模型,用于工具语义匹配与跨域迁移学习;提示模板自动生成系统也由此衍生,通过解析prompt_examples字段,实现工具指令的自动归纳与泛化。此外,数据集中debugger_score的分布规律催生了关于MCP服务器质量动态监测的研究,尝试建立时空维度上的稳定性预测模型。这些工作共同构筑起围绕MCP协议的研究生态,持续推动AI工具调用自主化的边界拓展。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务