遇见数据集

npm-ai-agent-mcp-packages-enriched

收藏
Hugging Face2026-06-01 更新2026-06-02 收录
官方服务:

资源简介:

npm AI Agent和MCP包增强数据集整合了npm注册表中与AI代理、模型上下文协议(MCP)、编排和模型工具相关的公共包的注册表元数据和下载记录,形成一个分析就绪的数据框。该数据集旨在简化开发者工具市场研究、生态系统映射、依赖发现、包筛选和AI工具分析,避免了手动合并搜索结果的繁琐过程。数据集包含60个样本(行),每个样本代表一个通过重叠npm搜索词发现的包,并提供了56个丰富的特征字段(列)。核心内容包括:包标识信息(如包名、作用域、描述、版本、许可证)、发布信息(发布时间、维护者数量、包龄、是否近期发布)、下载指标(周下载量、月下载量、下载排名和层级)、搜索相关信息(匹配的搜索词、搜索排名、搜索分数)、技术特征(依赖项数量、是否包含CLI二进制文件、是否包含TypeScript类型定义、导出信息、Node引擎要求)、仓库和主页链接、生态系统分类(如开发者工具/CLI、MCP基础设施、AI工具/集成、代理框架),以及AI相关信号(提供商标识、是否包含核心AI信号、MCP信号、代理信号、SDK信号、商业化术语)。数据以Parquet格式存储,适用于表格分类等任务,为分析npm生态系统中AI和MCP相关工具包的流行度、技术栈、维护活跃度和市场趋势提供了结构化基础。

The npm AI Agent and MCP Package Enhanced Dataset integrates registry metadata and download records of public packages related to AI agents, Model Context Protocol (MCP), orchestration, and model tools from the npm registry into an analysis-ready data frame. This dataset aims to simplify developer tool market research, ecosystem mapping, dependency discovery, package filtering, and AI tool analysis, avoiding the tedious process of manually merging search results. It contains 60 samples (rows), each representing a package discovered through overlapping npm search terms, with 56 rich feature columns. Core content includes: package identification information (e.g., package name, scope, description, version, license), release information (release time, number of maintainers, package age, whether recently released), download metrics (weekly downloads, monthly downloads, download rank and tier), search-related information (matched search terms, search rank, search score), technical features (number of dependencies, inclusion of CLI binaries, TypeScript type definitions, export information, Node engine requirements), repository and homepage links, ecosystem classification (e.g., developer tools/CLI, MCP infrastructure, AI tools/integration, agent frameworks), and AI-related signals (provider identification, inclusion of core AI signals, MCP signals, agent signals, SDK signals, commercialization terms). Data is stored in Parquet format, suitable for tasks like tabular classification, providing a structured foundation for analyzing the popularity, tech stack, maintenance activity, and market trends of AI and MCP-related tool packages in the npm ecosystem.

创建时间:
2026-06-01
原始信息汇总

数据集概述:npm AI Agent and MCP Packages Enriched Dataset

该数据集是一个经过富化的、面向AI Agent、MCP(模型上下文协议)、编排及模型工具类npm包的表格数据集,整合了公共npm注册表信息和下载记录,以便于开发者工具市场研究、生态系统映射和依赖发现。

数据集基本信息

  • 语言: 英语 (en)
  • 许可证: MIT (mit)
  • 访问控制: 需要付费许可,通过链接购买后申请访问
  • 任务类别: 表格分类 (tabular-classification)
  • 数据集大小: n<1K (60行)
  • 配置: 一个默认配置 (default),数据文件为 data/data.parquet

数据集结构

  • 总行数: 60
  • 总列数: 56
  • 数据拆分:
    • data: 60行

数据列及描述(部分关键列)

列名 数据类型 描述
record_id 字符串 基于npm包名的唯一稳定标识符
package_name 字符串 规范的npm包名
package_scope 字符串 有作用域的包的前缀(如 @modelcontextprotocol
unscoped_name 字符串 去除作用域后的包名
package_description 字符串 npm元数据中的公开包描述
latest_version 字符串 npm注册表报告的最新版本号
license_name 字符串 包元数据中的许可证标识符
author_name 字符串 包作者名称
publisher_name 字符串 最新版本的发布者用户名
maintainer_count 整数 维护者数量
published_at 日期时间字符串 最新版本的发布时间戳
first_published_at 日期时间字符串 包在npm注册表中的首次创建时间戳
package_age_days 整数 自首次发布至收集时间的总天数
days_since_publish 整数 自最新版本发布至收集时间的总天数
is_recently_published_90d 布尔值 最新版本是否在最近90天内发布
is_deprecated 布尔值 最新版本是否被标记为弃用
weekly_downloads 整数 官方npm上周下载量
monthly_downloads 整数 官方npm上月下载量
search_score 浮点数 跨匹配搜索词的最大npm搜索得分
matched_search_terms 字符串 以管道符分隔的、返回该包的搜索词列表
matched_search_term_count 整数 返回该包的不同搜索词数量
primary_search_term 字符串 作为包主要来源标签的首个匹配搜索词
best_search_rank 整数 所有匹配搜索词中的最佳搜索排名
mean_search_rank 浮点数 所有匹配搜索词的平均搜索排名
keywords 字符串 以管道符分隔的包关键词
keyword_count 整数 包关键词数量
dependency_count 整数 最新版本的生产依赖数量
dev_dependency_count 整数 开发依赖数量
peer_dependency_count 整数 对等依赖数量
bin_command_count 整数 CLI二进制命令数量
has_cli_bin 字符串 是否有CLI二进制文件
has_typescript_types 字符串 是否包含TypeScript类型声明
has_exports 字符串 是否有导出声明
repository_url 字符串 仓库URL
ecosystem_segment 字符串 生态系统分类(如 Developer Tooling / CLI, MCP Infrastructure, Agent Framework
provider_mentions 字符串 提及的AI提供商名称(如 OpenAI, Anthropic, Claude, Gemini
has_core_ai_signal 字符串 是否包含核心AI信号
has_mcp_signal 字符串 是否包含MCP信号
has_agent_signal 字符串 是否包含Agent信号
has_sdk_signal 字符串 是否包含SDK信号
commercial_readiness 字符串 商业化准备程度(如 high
last_collected_at 日期时间字符串 最后一次数据收集时间
monthly_download_rank 整数 月下载量排名
weekly_download_rank 整数 周下载量排名
downloads_tier 字符串 下载量等级(如 1m+

数据预览(前5行示例)

包名 (package_name) 描述 周下载量 生态分类 提供商提及 MCP信号
openai OpenAI API 的官方TypeScript库 23,430,731 Developer Tooling / CLI OpenAI
ai Vercel 的 AI SDK,支持多种大模型 12,944,419 MCP Infrastructure OpenAI, Anthropic, Claude, Gemini
@anthropic-ai/claude-code-linux-x64 Claude Code 的 Linux x64 原生二进制 9,308,309 AI Utility / Integration Anthropic, Claude
@anthropic-ai/claude-code 在终端中使用 Claude 8,661,516 Developer Tooling / CLI Anthropic, Claude
@anthropic-ai/claude-agent-sdk 构建AI Agent的SDK 7,066,332 Agent Framework Anthropic, Claude

数据集用途

该数据集适用于:开发者工具市场研究、生态系统映射、依赖发现、包筛选、AI工具分析。

搜集汇总
数据集介绍
npm-ai-agent-mcp-packages-enriched 数据集图片
构建方式
该数据集通过整合npm注册表中的公开信息与下载记录,针对AI代理、MCP、编排及模型工具类包构建而成。构建过程中,首先利用重叠的npm搜索词发现相关包,随后对每个包进行元数据丰富处理,涵盖注册表元数据、发布时效、维护者数量、依赖关系表面积、CLI与TypeScript信号、供应商提及、商业化线索以及官方下载指标等信息。最终将这些数据整合为一个可直接用于分析的数据框,共计60行56列,以Parquet格式存储。
特点
数据集的特点在于其高度丰富和结构化的特征集合。每一条记录包含56个字段,从包名、描述、版本、许可证等基础元数据,到下载量、搜索排名、关键词、依赖计数等性能与生态指标,再到供应商提及、商业化准备度、AI信号(如核心AI、MCP、代理、SDK)等高级衍生标签,全面覆盖了开发者工具市场分析与生态图谱构建所需的维度。此外,数据集还提供了发布间隔、最近90天是否发布等时间特征,便于进行动态分析。
使用方法
该数据集可直接通过Pandas等数据分析库加载Parquet文件进行使用。用户可依据具体的分析任务,如市场调研、依赖发现、包筛选或AI工具分析,筛选或聚合相关字段。例如,通过'has_mcp_signal'或'has_agent_signal'列快速识别具备MCP或代理能力的包,或使用'downloads_tier'列进行流行度分层比较。数据集设计为即用型,避免了手动拼接多个npm API端点的繁琐过程。
背景与挑战
背景概述
随着大型语言模型与智能体技术的迅猛发展,npm生态系统中涌现出大量面向人工智能、模型上下文协议(MCP)及智能体编排的软件包。然而,开发者与市场研究人员在筛选、评估这些工具时,常因数据分散于多个搜索端点、元数据接口与下载统计服务而面临信息碎片化的困境。为应对这一需求,该数据集于2026年由匿名维护者或机构构建,通过跨搜索词匹配与富化处理,将60个高相关npm包的注册元数据、发布时效、维护者规模、依赖特征、CLI/TypeScript信号、提供商提及、商业化线索及官方下载指标整合为一份可直接分析的数据表格。这一资源填补了开发者工具市场研究、生态系统映射与依赖发现领域缺乏系统化结构化数据的空白,为AI工具链的筛选与对比提供了可复用的基准。
当前挑战
该数据集致力于解决的领域问题在于:npm生态中AI与MCP相关包的搜索通常依赖手动组合多个关键词,且返回结果混杂大量无关条目,导致开发者难以高效识别高价值工具并评估其生态地位与商业化成熟度。构建过程中面临的挑战包括:搜索词的设计需兼顾覆盖广度与语义精准度,避免遗漏新锐包或引入噪声;跨多个npm API端点的数据采集需处理限流、版本冲突与元数据不一致;下载统计与搜索排名等动态指标的时效性控制要求严格,否则分析结论可能滞后于生态变迁;此外,维护者数量、依赖规模等非结构化字段的标准化清洗,以及商业化线索(如license类型、提供商提及)的规则化提取,均对数据处理流程的鲁棒性提出了较高要求。
常用场景
经典使用场景
npm-ai-agent-mcp-packages-enriched数据集汇聚了JavaScript与TypeScript生态中与AI代理、模型上下文协议及编排工具相关的包信息,为研究者提供了一个结构清晰、特征丰富的分析型数据框。其经典使用场景在于对新一代开发者工具进行系统性的市场扫描与生态绘图,通过整合元数据、下载量、维护活跃度及商业成熟度等指标,实现从庞大npm注册表中精准筛选出具有前沿技术属性的包,进而剖析AI工具链的演进脉络与扩散规律。
衍生相关工作
该数据集衍生的相关工作主要体现在对npm包生态的元分析工具与自动化筛选流水线的构建上。例如,研究者可基于其结构化字段开发出用于预测包生命周期阶段或商业转化概率的分类模型。此外,该数据集也可作为基准,用于对比不同搜索策略(如下游依赖深度与关键词广度)对发现AI相关包的召回率与精确度的影响,从而催生出一系列关于开源AI工具发现算法优化的学术探讨与实践指南。
数据集最近研究
最新研究方向
该数据集聚焦于npm生态系统中与人工智能代理、MCP协议及模型工具包相关的包注册与下载记录,为开发者工具市场研究、生态系统图谱绘制及依赖关系挖掘提供了结构化的分析基础。当前前沿研究方向包括基于该数据集对AI代理框架(如Claude Agent SDK)的传播模式与商业化成熟度进行量化评估,追踪MCP基础设施组件的采纳曲线,以及通过依赖网络分析揭示AI工具链中的关键枢纽节点。随着2026年Claude Code等终端代理工具的爆发式增长,该数据集在理解AI原生开发者工具的扩散路径、评估不同类型AI信号的关联强度(如agent信号与SDK信号的共现模式)以及预测下一代AI工具生态的演进方向中展现出独特价值,为产业界与学术界提供了从数据驱动视角解析AI开发工具革命的可信依据。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务