遇见数据集

GitSkills

收藏
github2026-07-25 更新2026-08-14 收录
官方服务:

资源简介:

GitSkills是一个数据集,包含2026年7月在GitHub上公开可见的SKILL.md文件:来自282,200个仓库的3,797,117个文件,存储在一个独立的SQLite数据库中。

GitSkills is a dataset containing 3,797,117 publicly visible SKILL.md files hosted on GitHub as of July 2026. These files are sourced from 282,200 repositories, and the dataset is stored in a standalone SQLite database.

创建时间:
2026-07-25
原始信息汇总

数据集概述

GitSkills 是一个面向 MSR 2027 挖掘挑战赛提案的样本数据集,专门收录 GitHub 上公开可见的 SKILL.md 文件。该格式由 Anthropic 于 2025 年 10 月提出,作为语言模型代理的开放规范,每个 Agent Skill 是一个包含 SKILL.md 指令文件的文件夹,可附带脚本和参考文档。

数据集规模

  • 完整数据集:包含 3,797,117 个文件(来自 282,200 个仓库),存储于单个 SQLite 数据库(41 GB)
  • 样本数据集:包含 29,786 个文件(来自 11,841 个仓库),数据库大小为 277 MB
  • 样本抽取方式:确定性抽取内容哈希值最低的 13,000 个不同内容,并包含完整数据集中关于这些内容的所有关联行(跨仓库副本、仓库元数据、捆绑文件及历史记录),保证与完整数据集具有相同模式和不变量

数据模式

数据集包含四张表,所有字符串为 UTF-8 编码,时间戳采用 ISO-8601 UTC 格式:

  • artifacts:每个文件出现一行,包含文件位置、内容哈希、去重标记、YAML 前置信息、文件夹组成摘要、提交历史等字段
  • repos:每个仓库一行,包含仓库名称、所有者、星标数、语言、许可证、描述等元数据
  • artifact_siblings:代表技能文件捆绑的兄弟文件,包含文件类型、大小、内容(文本文件上限 100 KB)
  • mining_runs:每次采集运行一行,记录查询、时间戳和结果数量

数据收集方法

数据于 2026 年 7 月以只读方式采集,使用 GitHub 代码搜索 API、REST/GraphQL API 及原始内容 CDN。代码搜索将每个查询限制为 1,000 个结果且报告总数不可靠,因此按文件大小对搜索空间进行分区直到完全检索。文件按内容哈希分组,每个内容组选取一个代表进行内容(经 git blob 哈希验证)、前置信息、文件夹组成、仓库元数据及抽样提交历史的丰富化处理。从发现到内容检索期间已从 GitHub 删除的文件(占不同内容的 0.9%)被排除。

匿名化处理

  • 提交作者账户被替换为键控单向代码,同一账户在数据集中保持一致,但密钥不对外分发;Bot 类型账户保留其登录名
  • 提交消息中的电子邮件地址和个人姓名被固定标记遮蔽;AI 助手在 Co-authored-by 尾注中的姓名予以保留
  • 文件内容按 GitHub 发布时的字节级原样重现,每个内容行仍可通过 git blob 哈希验证

描述性统计(完整数据集)

  • 位置分布:9.8% 的文件位于标准路径 .claude/skills/,55.4% 位于 skills/ 目录下,34.8% 在其他位置
  • 重复率:50.5% 的文件是其他文件的逐字副本,最常被复制的内容出现在数百个仓库中
  • 前置信息:86.6% 的不同内容携带有效的 YAML 前置信息
  • 主流语言:Python(71,801 个仓库)、TypeScript(67,104)、JavaScript(23,938)、Shell(19,780)、HTML(12,187)、Rust(8,371)、Go(8,094)
  • 历史记录:最早的首次提交日期为 2014 年,早于 2025 年 10 月规范的小写 skill.md 等文件也被纳入

已知局限性

  • GitHub 代码搜索仅索引默认分支、384 KB 以下文件、少于 500,000 文件的近期活跃仓库,以及星标数超过父仓库的 fork
  • 数据集为 2026 年 7 月的时间点快照
  • 提交历史仅跟踪文件当前路径;重命名文件的首次提交日期为重命名时间
  • 文件夹组成和历史仅描述代表仓库,其他副本可能不同
  • 个别技能为符号链接,其内容为链接目标路径而非指令文本

获取方式

样本数据集以压缩文件形式提供,解压后可直接使用 SQLite 客户端查询,无需服务器或凭据。完整数据集将在提案接受后归档至 Zenodo(提供 DOI)并在 Hugging Face 上镜像。

搜集汇总
数据集介绍
GitSkills 数据集图片
构建方式
GitSkills数据集是一项针对2026年7月GitHub上公开可见的Agent技能文件(SKILL.md)的大规模采集成果,其构建过程严谨且系统。研究者利用GitHub代码搜索API、REST/GraphQL API及原始内容CDN,通过按文件大小划分搜索空间以规避代码搜索的1000条结果限制,最终获取了3,797,117个文件,覆盖282,200个仓库。文件按内容哈希分组,每组选取一个代表进行深度丰富,包括内容哈希验证、前端元数据解析、文件夹构成统计、仓库元数据及提交历史抽样。数据以自包含的SQLite数据库存储,并设计了四表结构(artifacts、repos、artifact_siblings、mining_runs),确保完整性与可复现性。样本数据采用确定性抽样策略,基于内容哈希取最低的13,000个内容及其所有关联行,保证了与完整数据集相同的模式与不变量。
特点
该数据集的核心特点在于其规模、完整性与匿名化处理。其内容覆盖了从规范路径(.claude/skills/)到其他位置的各种技能文件,并揭示了显著的重复现象(50.5%的文件为逐字副本)。数据集中86.6%的技能具有有效的YAML前端元数据,且时间跨度自2014年至今,反映了技能格式的演变。匿名化方面,提交作者被替换为密钥单向编码,个人邮箱与姓名被掩码,而文件内容则逐字节保留,确保可验证性。此外,数据集提供了丰富的元数据字段,如位置分类、前端元数据有效性、文件夹组成、提交历史等,便于研究者进行多维度分析。
使用方法
数据集以SQLite数据库形式发布,用户无需服务器或凭证,仅需通过SQL客户端即可查询。示例查询展示了如何找出最常复制的技能内容、按位置分类统计技能数量、分析捆绑文件以及按仓库语言统计技能分布。数据集的模式设计直观,四张表关联清晰,查询语句可无缝从样本迁移到完整数据集。研究者可依据自身需求,通过SQL灵活探索技能内容、仓库元数据、捆绑文件及提交历史,用于挖掘技能生态的演化规律、内容复用模式及开发者行为特征。
背景与挑战
背景概述
GitSkills数据集由伦敦大学学院的Giuseppe Destefanis、霍恩海姆大学的Daniel Graziotin与Matteo Vaccargiu以及卡利亚里大学的Marco Ortu于2026年7月联合构建,旨在系统化地采集并分析GitHub上公开可见的Agent Skill文件(即包含SKILL.md的文件夹)。Agent Skill格式由Anthropic于2025年10月提出,作为语言模型代理的指令规范,其迅速普及催生了大量开源实践。GitSkills通过GitHub代码搜索、REST及GraphQL API和原始内容CDN,以只读方式收集了3,797,117个SKILL.md文件,覆盖282,200个仓库,并存储在单一SQLite数据库中。该数据集首次为研究社区提供了大规模、结构化的Agent Skill生态快照,揭示了技能文件的分布规律、重复模式及版本演进,为挖掘代理行为、技能复用及格式标准化研究奠定了数据基础,对软件工程与人工智能交叉领域具有重要影响力。
当前挑战
GitSkills数据集在构建与领域研究中面临多重挑战。领域层面,Agent Skill作为新兴格式,其定义尚不统一,GitHub上存在大量非标准命名(如小写skill.md)或缺失有效front matter的文件,占全部内容的13.4%,且50.5%的文件为完全重复,如何准确界定“技能”并过滤噪声成为首要难题。构建层面,GitHub代码搜索API对单查询限制1,000条结果且总数估算失真(实际3.8M vs 估算349K),迫使研究者按文件大小分区枚举直至完整覆盖;同时,文件在发现与抓取间可能被删除(0.9%),需通过blob哈希校验内容完整性。此外,仓库元数据与提交历史的获取受限于API速率,历史仅覆盖当前路径,重命名文件的早期提交无法追踪,且仓库内部文件夹超过列举上限时可能丢失部分捆绑文件。这些限制意味着数据集为人口下限,时间快照属性亦限制了纵向分析,但数据集设计以确定性抽样和完整内容组保障了统计推断的可行性。
常用场景
经典使用场景
GitSkills数据集以其对GitHub上SKILL.md文件的全面收集,为软件工程和人工智能交叉领域的研究提供了独特的语料库。其最经典的使用场景在于对基于语言模型的代理技能(Agent Skill)的生态进行大规模实证分析,涵盖技能文件的分布特征、内容结构、复制与演化模式等。研究者可借助该数据集系统性地挖掘技能仓库的规模、多样性、质量差异及社区实践,从而揭示这一新兴技术范式的现状与发展趋势。
解决学术问题
该数据集解决了当前缺乏公开、系统化技能文件数据的问题,填补了代理技能研究领域的数据空白。它使得研究者能够开展可重复的量化研究,例如分析技能文件的前置元数据规范性、代码与文档的耦合关系、技能复用与分叉模式,以及仓库活跃度与技能质量之间的关联等。这些研究对于理解代理技能的开发生命周期、促进技能标准化和提升生成式代理的可靠性具有重要的理论意义和现实影响。
衍生相关工作
GitSkills数据集衍生了多个方向的经典工作。其一,基于该数据集的技能内容聚类和主题建模研究,揭示技能领域的隐含结构与热点主题。其二,利用其复制分布特性,开展对开源社区中技能传播机制的实证研究,比较不同语言和领域的复制差异。其三,结合仓库元数据,探索技能质量与项目成功指标(如stars、forks)的相关性,为指标设计和系统评估提供依据。这些衍生工作不仅丰富了代理技能的理论体系,也推动了其工具链和生态系统的持续演进。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务