遇见数据集

AnonymousAuthors/SKILLMINE

收藏
Hugging Face2026-04-30 更新2026-05-03 收录
官方服务:

资源简介:

SKILLMINE是目前已知最大的AI Agent技能经验数据集,包含来自五个代表性技能市场的857,956条有效记录。该数据集为分析当前AI Agent能力、生态系统模式和跨平台技能分布提供了全面基础。数据覆盖五个主要分发渠道:ClawHub(版本化AI Agent技能注册表)、agentskills.in(通用AI Agent技能管理器)、skills.lc(用于发现、共享和安装可重用技能的Agent技能生态系统)、skills.rest(强调安全、轻量设计和高品质的AI Agent技能库)以及agent-skills.md(社区驱动的Agent技能存储库索引)。数据集通过模块化爬虫框架收集,包括API接口平台、仅Web平台和Git托管存储库的不同采集方法,并统一了数据模式和元数据字段。

SKILLMINE is the largest known empirical dataset of AI Agent Skills, comprising 857,956 valid records collected from five representative Skills marketplaces. This dataset provides a comprehensive foundation for analyzing the current landscape of AI Agent capabilities, ecosystem patterns, and cross-platform skill distribution. The data covers five major distribution channels: ClawHub (a versioned AI Agent Skills registry), agentskills.in (a universal AI Agent skills manager), skills.lc (an Agent Skills Ecosystem for discovering, sharing, and installing reusable skills), skills.rest (a curated AI Agent Skills library emphasizing security and lightweight design), and agent-skills.md (a community-driven Agent Skills repository index). The dataset was collected using a modular crawler framework accommodating different platform interfaces, with unified data schema and metadata fields.

提供机构:
AnonymousAuthors
搜集汇总
数据集介绍
AnonymousAuthors/SKILLMINE 数据集图片
构建方式
SKILLMINE数据集是迄今为止规模最大的AI Agent技能实证数据集,汇聚了来自五个代表性技能市场的857,956条有效记录。其构建依托于模块化爬虫框架,针对不同平台特性采取差异化采集策略:对提供开放API的平台,遵循速率限制规则批量获取技能元数据;对仅支持Web界面的平台,利用Headless Chrome进行动态页面渲染与结构化信息提取;对于基于Git托管的仓库,则通过浅克隆方式获取最小化快照。每个技能条目均下载完整发布包,包含SKILL.md定义文件及可选脚本、参考文档和资源文件,元数据统一存储于Redis中,以支持高效的跨平台检索与统计。
特点
该数据集最显著的特点在于其覆盖的全面性与异质性。数据来源涵盖ClawHub、agentskills.in、skills.lc、skills.rest和agent-skills.md五大主流技能市场,各自拥有独特的平台生态与技能规模,从NPM风格的版本注册表到社区驱动的索引仓库,呈现出多元化的技能分发模式。每个技能记录包含唯一标识、名称、描述、作者、原始仓库地址、本地存储路径、更新时间戳及来源平台等核心元数据字段,为分析AI Agent能力现状、生态系统模式及跨平台技能分布提供了坚实的实证基础。
使用方法
SKILLMINE数据集的使用方式灵活多样,研究者可直接利用元数据字段进行跨平台统计分析与生态模式挖掘。所有原始技能发布包以ZIP格式按平台和技能ID索引存储于本地服务器,便于深入分析技能的具体实现细节。用户可通过Redis高效查询元数据,进而按需访问存储在本地路径下的完整技能包。该数据集特别适用于AI Agent能力生态研究、技能市场对比分析、跨平台技能迁移等场景,为理解当前AI Agent技能分发的格局提供了珍贵的数据支撑。
背景与挑战
背景概述
随着大型语言模型与自主智能体技术的飞速演进,AI Agent的能力边界不断拓展,其核心驱动力之一来源于可复用、可组合的“技能”生态系统。SKILLMINE数据集于2026年发布,由研究团队从ClawHub、agentskills.in、skills.lc、skills.rest和agent-skills.md五个代表性市场中系统性地采集了857,956条有效记录,构成了迄今最大规模的AI Agent技能实证数据集。该数据集旨在揭示当前AI Agent生态的分布格局、平台特征与能力演化规律,为理解技能复用机制、平台差异化策略以及跨平台技能迁移等核心研究问题提供量化基础,对推动智能体工程化与生态系统分析具有重要学术与工业价值。
当前挑战
SKILLMINE数据集面临的挑战体现在两个层面。在领域问题层面,当前AI Agent技能市场呈现碎片化与异构性,不同平台在技能定义、元数据规范、封装格式与版本管理上缺乏统一标准,阻碍了跨平台技能的可比性、可迁移性与生态融合,亟需大规模实证数据以刻画整体图景并驱动标准化进程。在数据构建层面,挑战尤为突出:各平台技术接口差异显著,部分仅提供Web界面需依赖动态页面渲染与反爬机制;API类平台存在严格的频率限制与数据格式不一致问题;Git仓库类平台需在带宽开销与元数据完整性间权衡。此外,海量数据的实时更新、去重与质量校验也对采集与存储架构提出了高要求。
常用场景
经典使用场景
SKILLMINE数据集作为迄今为止规模最为宏大的AI智能体技能实证语料库,汇聚了来自五大主流技能市场的逾八十五万条高质量记录,为研究者深入剖析智能体能力的生态格局提供了不可或缺的数据基础。其经典应用场景涵盖跨平台技能分布的对比分析、技能流行度与开发者活跃度的趋势刻画,以及智能体能力谱系的系统构建。借助该数据集,学者能够精准识别不同平台上的技能热点与缺口,追踪AI Agent技能从萌芽到成熟的生命周期演化轨迹,进而绘制出智能体生态系统的全景图谱。
解决学术问题
该数据集直接回应了长期困扰学术界的核心困境——缺乏大规模、多源异构的AI Agent技能统一基准语料。过往研究常受限于单一平台的数据碎片化,难以开展跨平台比较与泛化性验证。SKILLMINE的发布破解了这一桎梏,使研究者得以系统性地回答诸如技能分布的不均衡性如何影响Agent性能、不同开发社区的文化差异如何在技能设计中体现、以及技能涌现与废弃的动态机制等根本性学术问题。其影响深远,不仅为智能体能力评估提供了标准化的参照系,更推动了智能体生态学这一新兴交叉领域的形成与发展。
衍生相关工作
SKILLMINE的诞生直接催生了一系列富有影响力的衍生性研究工作。基于该数据集,研究者已成功构建了首个面向AI Agent技能的跨平台分类体系,提出了技能共现网络分析框架,揭示了不同技能之间潜在的协同与互补关系。与此同时,多标签技能标签预测模型与技能流行度时间序列预测方法也应运而生,为理解智能体能力的演化提供了解析工具。在更广阔的维度上,该数据集还支撑了Agent技能推荐系统的基准测试平台建设,使得不同推荐算法能在统一、大规模的实证数据上进行公平比较,显著降低了该领域入门的实验门槛,加速了研究成果的转化与迭代。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务