遇见数据集

GitSkills

收藏
arXiv2026-08-11 更新2026-08-13 收录
官方服务:

资源简介:

GitSkills数据集由伦敦大学学院、霍恩海姆大学和卡利亚里大学的研究人员联合创建,系统收录了GitHub上公开仓库中的Agent技能文件。该数据集包含3,797,117个SKILL.md文件,源自282,200个仓库,经去重后得到1,877,981个不同内容,并附有仓库元数据、文件夹构成及部分提交历史。数据通过GitHub API分区搜索获取,按文件大小划分查询范围以突破结果限制,随后对重复内容进行哈希去重并选取代表性文件进行丰富。该数据集旨在支持对Agent技能的采纳模式、复用行为、结构演化、维护实践及安全风险的实证研究,为理解这一新型软件构件的生态特征提供基础。

The GitSkills dataset was collaboratively created by researchers from University College London, the University of Hohenheim, and the University of Cagliari. It systematically curates Agent skill files from public GitHub repositories. This dataset contains 3,797,117 SKILL.md files sourced from 282,200 repositories. After deduplication, 1,877,981 unique content items are retained, accompanied by repository metadata, folder structures, and partial commit histories. The data was collected via segmented searches using the GitHub API, where query scopes were divided by file size to circumvent the platform's result limits. Subsequently, duplicate contents were deduplicated via hashing, and representative files were selected for enrichment. This dataset aims to support empirical research on the adoption patterns, reuse behaviors, structural evolution, maintenance practices, and security risks of Agent skills, providing a foundational basis for understanding the ecological characteristics of this novel software component.

创建时间:
2026-08-11
原始信息汇总

GitSkills: A Dataset of Agent Skills on GitHub 数据集详情

该数据集记录了 GitHub 上公开仓库中的 Agent Skills 文件(即包含 SKILL.md 的文件),用于研究语言模型代理技能的分布与特征。

数据集核心信息

项目 内容
数据集名称 GitSkills: A Dataset of Agent Skills on GitHub
版本 1.0.0
发布/更新日期 2026年8月10日发布,8月12日更新
发布机构 Zenodo
DOI 10.5281/zenodo.21875637
文件大小 44.4 GB(单个SQLite文件)
许可协议 Creative Commons Attribution 4.0 International

数据集规模

  • 包含 3,797,117SKILL.md 文件
  • 来自 282,200 个公开 GitHub 仓库
  • 195,841 个账户拥有
  • 按内容哈希去重后得到 1,877,981 种不同内容
  • 每条记录均保留其所在仓库与路径,可同时研究唯一内容及其副本

数据内容与结构

数据集以单个自包含 SQLite 文件(agent_skills_release.db)形式提供,包含四个表:

表名 行数 说明
artifacts 3,797,117 每个发现的文件一行:仓库、路径、文件名、位置类别、内容哈希;代表文件还包含全文、解析的前置元数据及提交历史
artifact_siblings 7,264,865 与代表性技能文件存储在一起的脚本和参考文件
repos 282,200 仓库元数据:所有者、星标数、语言、fork状态、许可证、日期
mining_runs 7 每次采集运行的数据来源日志

数据采集与特点

  • 通过 GitHub REST、GraphQL、代码搜索 API 及 raw-content CDN 进行只读采集。
  • 按文件大小划分搜索空间,绕过代码搜索 API 的 1000 条结果上限。
  • 去重后为每组内容选择一个代表文件进行丰富(含全文、前置元数据、提交历史)。
  • 提交作者账户被替换为带密钥的不可逆代码(同一账户在整个数据集中代码一致),并隐去邮件地址和个人姓名;机器人账户保留其登录名。
  • 数据集仅覆盖公开仓库,应视为群体规模的下限。

相关资源与引用

  • 配套论文:已获 MSR 2027 Mining Challenge 接收,预印本见 arXiv:2608.10906
  • Hugging Face Parquet 镜像:https://huggingface.co/datasets/mvaccargiu/gitskills
  • 原始样本:https://github.com/giuseppedestefanis/gitskills-sample
  • 版本 DOI:10.5281/zenodo.21875636(引用所有版本用)

关键词

Mining software repositories、LLM agents、Agent skills、GitHub、Software artefacts、MSR Mining Challenge

引用格式(APA)

Destefanis, G., Graziotin, D., Vaccargiu, M. & Ortu, M. (2026). GitSkills: A Dataset of Agent Skills on GitHub (Version 1.0.0) [Dataset]. Zenodo. 24th International Conference on Mining Software Repositories (MSR 27), Dublin, Ireland. https://doi.org/10.5281/zenodo.21875637

搜集汇总
数据集介绍
GitSkills 数据集图片
构建方式
GitSkills数据集的构建依托于GitHub公共代码库的深度挖掘,采用只读管道技术,通过GitHub代码搜索与REST API进行系统化采集。针对代码搜索接口单查询最多返回1000条结果且总数估算不准确的局限,该数据集创新性地按文件大小对搜索空间进行细分,直至每个区间均能完整检索,从而捕获了2026年7月期间282,200个公共仓库中的3,797,117个SKILL.md文件。采集流程包含三个关键阶段:发现阶段保留所有文件名匹配项;去重阶段依据内容哈希将文件归类为1,877,981个唯一内容,并为每组选取一个代表文件(优先选择位于.claude/skills/目录下的);富化阶段则为代表文件补充完整文本、解析后的front matter、文件夹内容、仓库元数据,以及标准位置和分层抽样子集的提交历史。所有数据最终整合为单一自包含的SQLite文件,确保了数据的完整性与可操作性。
特点
GitSkills数据集的独特性源于其面向新型软件工件——代理技能(agent skill)的大规模实证研究支持。它突破了传统软件仓库挖掘的边界,聚焦于以自然语言为主的技能文件,这类文件由语言模型在运行时概率性选择,缺乏编译器和类型检查器的验证。数据集包含3,797,117个文件,去重后仍有近188万个唯一内容,并保留每个文件出现过的仓库与路径,从而支持对技能复制与传播模式的深入研究。其结构化设计涵盖核心工件、仓库元数据、兄弟文件(7,264,865条记录)以及匿名化的提交历史,特别适合分析技能的采纳、复用、结构、作者身份、维护与安全等议题。此外,数据集的构建方式确保了对早期格式采纳阶段的完整记录,为追踪技能格式的演变和跨工具共享基础设施的涌现提供了无与伦比的资源。
使用方法
GitSkills数据集以单一自包含SQLite文件形式发布,并附有Parquet镜像,方便不同研究环境下的加载与分析。研究者可依据研究问题灵活运用其表结构:使用artifacts表探索SKILL.md的分布与内容,结合content hash追踪技能的复制与传播;利用repos表关联仓库特征(如星标数、主要语言)以分析采纳模式;借助artifact_siblings表研究技能捆绑的脚本与参考文档;通过提交历史字段(位于artifacts中)考察技能的维护动态与作者行为。数据集保留了精确的文件名、位置类别和front matter有效性,使研究者能够自定义包含标准,进行细粒度的群体界定。此外,提交作者账户的匿名化处理(使用密钥单向编码)在保护隐私的同时确保了可追溯性,为大规模的技能质量、进化及供应链安全实证研究奠定了坚实基础。
背景与挑战
背景概述
随着大语言模型智能体在软件开发中的广泛应用,代理技能(agent skills)作为一种新兴的软件工件,于2025年10月由Anthropic提出开放规范,并在GitHub上迅速扩散。GitSkills数据集由Giuseppe Destefanis等研究者于2026年7月构建,旨在系统性地记录这一新型工件的演化与使用模式。该数据集从282,200个公共仓库中采集了3,797,117个SKILL.md文件,通过内容哈希去重后得到1,877,981个唯一文件,并丰富了仓库元数据、文件内容及提交历史。GitSkills填补了代理技能大规模实证研究的空白,为理解智能体技能在真实世界中的编写、复用与维护提供了宝贵资源,对软件工程社区研究LLM智能体行为具有重要参考价值。
当前挑战
GitSkills数据集所面临的挑战贯穿其构建与领域应用。在领域层面,代理技能主要由自然语言编写,其选择过程具有概率性,缺乏编译器或类型检查器的验证,导致技能描述不精确或指令不清晰时难以被传统软件分析方法检测。此外,技能缺乏中央注册表或包管理器,主要通过复制文件夹在仓库间传播,使得追踪其演化和安全风险十分困难。在构建过程中,GitHub代码搜索API每次查询最多返回1000条结果,且其报告的总数不准确(约349,000 vs. 实际380万),迫使研究者按文件大小划分搜索空间;同时,代码搜索仅索引默认分支、小文件和活跃仓库,导致数据集只能作为全量群体的下界,存在覆盖不完整的固有局限。
常用场景
经典使用场景
GitSkills数据集为软件工程社区提供了首个大规模、系统化的Agent技能(SKILL.md文件)语料库,其核心使用场景聚焦于挖掘软件仓库中的技能采纳、复用与演化模式。研究者可基于该数据集分析技能文件的分布特征、内容相似性及跨仓库传播路径,从而探究这一新型软件工件在GitHub生态中的扩散规律。此外,数据集支持对技能文件的结构、元数据及位置分类进行统计分析,为理解语言模型代理技能的设计范式提供了实证基础。通过该数据集,学者能够以数据驱动的方式刻画技能生态的全貌,填补了该领域缺乏大规模实证数据的空白。
衍生相关工作
围绕GitSkills数据集,衍生出一系列开创性研究工作。在技能采纳与演化方面,研究者可构建技能分类体系,追踪格式的时空传播,并分析自然语言指令的语义多样性变化。在复用模式上,借鉴定克隆分析技术,可研究技能复制的谱系与修改传播的一致性。在软件度量领域,该数据激励了针对自然语言指令的可读性、质量及维护性指标开发。此外,该数据集还催生了关于技能安全性的实证研究,例如检测被修改副本中新增的危险操作,以及技能过时与项目演化的关联分析。这些工作共同推动了对Agent技能这一新兴软件形态的深入理解,并为后续标准制定与工具开发奠定了实证基础。
数据集最近研究
最新研究方向
当前研究聚焦于GitSkills数据集所揭示的agent技能这一新兴软件工件的涌现生态。研究前沿集中在技能格式的传播动力学与采用模式,包括在各类编程语言、项目规模及活跃度下的初期扩散路径。同时,研究者关注技能的复用机制,鉴于其缺乏中心注册表,复制粘贴成为主要传播方式,进而探讨复制行为的集中度、传播途径以及基因谱系,揭示其与代码克隆模式的异同。此外,自然语言指令的度量体系成为热点,旨在建立等效于传统软件指标(如规模、变更率、克隆覆盖度及可读性)的衡量标准,并探索与技能质量相关的代理指标。在安全与信任维度,研究聚焦于技能陈旧化、供应链攻击风险及可执行文件捆绑的传播范围,为这一无正式审查生态的信任建立提供实证基础。GitSkills数据集为这些前沿问题提供了全量级的研究支撑,其意义在于开创了软件仓库挖掘的新领域,深入理解由大语言模型驱动的代理如何重塑软件开发实践。
相关研究论文
  • 1
    GitSkills: A Dataset of Agent Skills on GitHub伦敦大学学院; 霍恩海姆大学; 卡利亚里大学 · 2026年
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务