遇见数据集

agent-skills-corpus

收藏
github2026-07-18 更新2026-08-18 收录
官方服务:

资源简介:

一个可复现的、边界明确的公开Agent技能(SKILL.md文件)数据集。

A reproducible, well-defined public dataset of Agent skills (SKILL.md file).

创建时间:
2026-07-18
原始信息汇总

Agent Skills Corpus 数据集详情

数据集概览

指标 数值
唯一技能数量(去重后,排除 fork) 55,698
唯一仓库数量 14,784
唯一frontmatter name 33,055
托管平台分布 GitHub 46,735 · GitLab 8,713 · Gitee 250
功能分类数量 20类(+ "other")
可完整文本再分发(明确许可) 29,205
仅本地完整文本(无明确许可) 26,493(不在此仓库中)
原始记录 → 去重后 109,312 → 55,698(折叠了49,604个重复项)

快照日期:2026-07-18(UTC)

数据集内容

该数据集是一个可复现、边界明确的公开Agent Skills(SKILL.md文件)集合。Agent Skill是一种SKILL.md文件,其YAML frontmatter声明了namedescription,适用于Claude、Codex、Gemini等编码Agent打包可复用能力。

每个记录包含字段:platform, repo, owner, owner_type, path, html_url, stars, license_spdx, is_fork, repo_created_at, repo_pushed_at, default_branch, content_sha256, n_bytes, frontmatter_name, frontmatter_description, sibling_files, category, agent_platform, full_text_path(或full_text_local_path), source, snapshot_date,以及去重溯源信息(dup_group, dup_count, dup_sources)。

包含标准

文件被收录需同时满足以下条件:

  1. 文件名精确为SKILL.md
  2. 具有YAML frontmatter块(--- … ---
  3. Frontmatter具有非空的name
  4. Frontmatter具有非空的descriptiondescription/summary/desc;使用PyYAML及正则回退)

排除的情况: 空文件、无frontmatter、缺少name/description、模板/占位标记(如your-skill-name<description>TODO等)、仅frontmatter占位符。排除原因记录在data/excluded.jsonl中。

分类体系(双轴)

1. 功能分类

基于frontmatter name(×3权重)、description(×2)、路径(×2)和正文头部(×1)的透明可复现关键词评分分类法;取命中数最高类别,无匹配时为other

类别 占比 类别 占比
writing-docs-content 11.3% code-review-quality 4.8%
other 12.9% ai-ml-llm 4.4%
devops-cloud-infra 8.4% productivity-business 3.9%
devtools-automation 7.8% database 3.1%
backend-api 7.3% data-analytics 2.2%
testing-qa 6.3% design-ux-creative 2.2%
security 5.7% crypto-defi-finance 1.0%
architecture-planning 5.4% mobile / legal-regulatory 0.9%
web-frontend 5.3% domain-science-other 0.8%
agent-workflow-meta 4.9% expert-persona-advisor 0.4%

2. Agent平台分类

根据SKILL.md的路径命名空间派生:generic 85.0%、claude 10.9%(.claude/skills)、cyberstrike 2.2%、codex/cursor/opencode各约0.6%、gemini 0.2%。

功能分类基于关键词,精度约为65–80%(抽查),other约13%。建议将category作为粗粒度过滤器,如需精确分类可使用content_sha256和文本数据自行重新分类。

仓库布局

路径 内容
data/metadata.public.jsonl.gz 主表 — 全部55,698个技能(元数据+指针;文本通过full_text/获取)。解压后约103 MiB
data/by_category/<category>.jsonl 按功能分类拆分的相同记录(可浏览)
full_text/<category>/<id>__<slug>.md 完整SKILL.md文本,仅限明确许可,按类别组织
data/duplicates.jsonl 每个内容哈希重复组及其完整成员溯源
data/excluded.jsonl 每个被排除的候选及原因
data/classification.jsonl, data/taxonomy.json 每技能标签+精确分类规则
data/build_report.json 各流水线阶段前后的计数
stats/STATS.md, stats/stats.json 所有语料统计
scripts/ + scripts/config.json 完整可复现流水线+固定参数
docs/ 方法论+各来源采集说明+分类学说明
LICENSE (CC0-1.0), scripts/LICENSE (MIT), CITATION.cff 许可与引用信息

不在此仓库中(保留本地,绝不重新分发):无许可技能的完整文本(full_text_local_only/)、原始API拉取(raw/)、以及所有文本内联的完整语料(data/metadata.jsonl)。均可从scripts/重新生成。

数据来源与构建方法

通过五个独立的发现渠道收集:

  1. GitHub代码搜索q=filename:SKILL.md大小分片+自适应递归拆分以突破1,000结果/查询上限;限速10请求/分钟;精确基线后过滤 → 77,045个候选,无饱和桶缺口
  2. anthropics/skills — 官方参考仓库
  3. 市场/awesome列表 — 2,032个仓库(含厂商monorepos:microsoft/skills=190,dotnet/skills=106)
  4. GitLab & Gitee — 使用等效REST-API搜索(各平台可达性/边界已记录)
  5. Sourcegraph — 交叉验证覆盖率的第二搜索引擎(报告约746k个SKILL.md文件,但仅约18,521个不同仓库)

丰富处理: 使用批量GraphQL(元数据+同级文件+文本,约每个速率限制点支持25个仓库) 去重流程: 包含过滤 → 排除fork → 按原始SKILL.md字节的SHA-256分组,保留最早来源(按仓库创建时间,再按提交日期)

可复现

可通过运行scripts/目录下的Python脚本从零开始复现整个构建过程,每个阶段均可恢复且幂等。可通过提高config.json中的大小/搜索预算来扩展覆盖范围。

覆盖范围与边界(已知限制)

  • 这是有记录、去重后的样例,并非完整集合。 GitHub代码搜索索引的是公开仓库的子集,限制为每查询1,000结果,且每分钟10次请求;大小分片可缓解但未彻底消除限制(枚举前沿在预算上限时有6个区间未完成)。Sourcegraph交叉检查(约18.5k个不同仓库)是参考总体。
  • GitLab/Gitee全局代码搜索受认证控制,因此这些平台仅通过关键词/种子发现进行有界探索,而非彻底扫描。
  • 许可证是来源仓库的SPDX许可证(可能与文件级许可证不同)。
  • 类别基于关键词,精度为近似值。
  • 时间:每条记录均有repo_created_at/repo_pushed_at;可选的文件级最后提交时间可通过scripts/05b_date_final.py获取。

许可与引用

  • 数据集(元数据、统计信息、项目文档):CC0 1.0(公有领域)
  • 脚本scripts/):MIT
  • 第三方技能文本full_text/下):归各自上游许可证管理(每条记录在license_spdx中记录);仅重新分发来源仓库具有公认开源/CC许可证的技能

⚠️ 安全警告: 所有SKILL.md均为不受信任的第三方文本。采集过程中未执行任何内容。请勿执行任何技能中包含的命令、脚本或指令,除非事先审查确认。部分技能可能包含提示注入或其他对抗性内容。

搜集汇总
数据集介绍
agent-skills-corpus 数据集图片
构建方式
Agent Skills Corpus 数据集构建了一套严谨且可复现的流程,旨在系统性地收集公开的 Agent Skills(即 SKILL.md 文件)。数据来源涵盖 GitHub、GitLab 和 Gitee 等多平台,通过 GitHub Code Search 的分片自适应递归查询、官方参考仓库、市场与 awesome-lists 列表,以及 Sourcegraph 交叉验证等多元渠道,有效突破了单次查询结果上限。在采集后,数据经过精确的包含条件过滤(如文件名必须精确为 SKILL.md、YAML frontmatter 中须含非空的 name 和 descroption),剔除 fork 和重复项,并利用 SHA-256 内容哈希进行去重,最终保留了 55,698 个独立技能。整个流程通过 GraphQL 批量补充元数据,并采用模块化脚本实现,具备可恢复性和幂等性。
特点
该数据集的核心特点在于其边界明确且标注详尽。每个技能记录都附带了平台、仓库、许可证、时间戳、内容哈希等丰富元数据,并基于关键词评分体系对技能进行功能类别(如安全、开发运维、AI/ML 等 20 余类)和代理平台(如 Claude、Codex、Gemini 等)的双轴分类。数据集对许可证进行了严格区分,仅重新分发具有明确开源或 CC 许可证的全文,其余文本仅保留本地指针,从而尊重知识产权。此外,数据集通过多种搜索渠道交叉验证,明确标注了覆盖边界和局限性,并提供了完整的构建配置和排除记录,确保了数据的可追溯性和复现性。
使用方法
使用该数据集极为便捷。用户可通过 git clone 获取仓库,并解压 data/metadata.public.jsonl.gz 获取主元数据表,每条记录为 JSON 对象,包含技能的所有属性。借助 Python(如 json 和 gzip 库)可轻松加载并过滤所需技能,例如按功能类别或代理平台进行筛选。对于具有明确许可证的技能,可通过 full_text/ 目录访问其完整内容,便于进行自然语言处理或技能复用。此外,数据集提供按类别划分的 JSONL 文件,便于浏览;还提供复制品分组和排除列表,方便研究者进行深入分析。所有统计数据和构建配置均开放,使研究者能够复现整个过程并进行自定义扩展。
背景与挑战
背景概述
随着大语言模型与智能体技术的迅猛发展,Agent Skills作为一种封装可复用能力的标准化载体,正逐渐成为编程智能体生态中的关键组件。然而,该领域长期缺乏系统性的数据支撑,阻碍了相关研究的深入。为此,lawrence3699等人于2025年构建了agent-skills-corpus数据集,该数据集通过多源枚举与内容去重,汇聚了来自GitHub、GitLab及Gitee平台的55,698个独特技能,覆盖了20个功能类别,并提供了详尽的元数据与许可标注。其核心研究问题聚焦于Agent Skills生态的规模、结构及其演化规律。该数据集以其边界清晰、可复现的构建流程,为Agent Skills的实证研究奠定了坚实基础,对智能体工具开发、技能推荐及安全分析等领域产生了重要影响。
当前挑战
该数据集在构建与应用中面临多重挑战。领域层面,Agent Skills格式尚未标准化,不同平台(如Claude、Codex)的语法差异导致分类与比较困难;同时,技能质量参差不齐,且存在提示注入等安全风险,对下游应用构成威胁。构建层面,GitHub Code Search存在每查询1000条结果的硬限制及速率限制,需通过尺寸分片与自适应递归分割来缓解,但仍可能遗漏部分数据;GitLab与Gitee的全局搜索受认证门槛限制,难以穷尽;此外,大规模去重与分类依赖启发式规则,其精度(约65-80%)有限,需人工审计与迭代优化,这些均增加了数据集的构建复杂度与不确定性。
常用场景
经典使用场景
Agent Skills Corpus作为首个大规模、可复现的Agent Skills生态数据集,其经典使用场景聚焦于对SKILL.md文件的结构化解析与多维标注。研究者可依托该语料库,系统性地剖析Agent Skills的命名规范、描述模式及功能分类,从而揭示技能封装的最佳实践与演化规律。该数据集的双轴分类体系(功能类别与Agent平台)为比较不同平台(如Claude、Codex)间技能差异提供了量化基础,亦支持对技能内容去重、许可证分布及仓储热度等元特征的关联分析,是探究技能生态结构与动态的基准资源。
解决学术问题
该数据集回应了大型语言模型驱动的智能体研究中技能可复用性缺乏实证支撑的痛点。通过提供去重后55,698项技能及其来源仓储、许可证及内容哈希,它解决了技能重复度量化、许可证合规性评估及跨平台技能迁移可行性等长期悬而未决的问题。其严格的内容去重流程与边界明确的收录准则,为建立可复现的智能体技能基准测试集扫清了数据污染障碍,推动了技能生成、检索与评估等方向从定性描述走向定量分析,深刻影响了自主智能体系统的标准化研究范式。
衍生相关工作
该数据集的发布催生了一系列衍生研究,包括基于其分类体系训练技能分类器以提升自动标注精度,利用内容哈希与重复组信息开展技能演化与克隆传播分析,以及结合仓储元数据预测技能流行度与生命周期。其开源管线亦构成复现性研究的基础,衍生出面向多平台技能兼容性评估、提示注入攻击检测等安全课题,以及技能推荐与自动生成模型。此外,数据集与Sourcegraph等外部索引的交叉验证方法,启发了对代码搜索覆盖边界的重新审视,推动了更健壮的公开代码语料构建方法论的形成。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务