SkillCorpus
收藏官方服务:
资源简介:
为你的智能体提供96,401个经过审查、许可宽松的技能,以及一个能为每个任务挑选合适技能的检索器。
Provide your AI Agent with 96,401 curated, permissively licensed skills, alongside a retriever capable of selecting the appropriate skill for each task.
创建时间:
2026-08-11
原始信息汇总
SkillCorpus 数据集概述
SkillCorpus 是一个为 LLM Agent 提供技能(skills)的数据集与检索系统,旨在解决公开仓库中 SKILL.md 文件分布零散、冗余、质量不均和许可不明确的问题。
数据规模与构成
- 数据总量:包含 96,401 个经过审核且许可宽松(permissively-licensed)的技能,从约 821,000 个抓取的文件中筛选而来。
- 数据格式:以
skills.parquet(包含 96,401 行数据)和attachments.tar.zst(包含scripts/、references/等附件)发布。 - 数据组织:技能按 16 类分类法 组织,并从 utility(实用性)/ robustness(鲁棒性)/ safety(安全性) 三个质量维度进行评分,每个技能带有 1024 维检索嵌入向量。
- 许可策略:每个技能保留其原始上游许可证(仅包含 GREEN 类许可证,如 MIT / Apache-2.0 / BSD / ISC 等),并附带
source、source_url和license字段;发布的数据集在商业上可再分发。
数据构建流程
数据通过四阶段流水线构建:
- aggregate:从公开
SKILL.md仓库中发现并克隆技能。 - curate:解析、安全过滤、许可证门控、去重、16 类分类、3 方面质量评分。
- match:SkillRouter——微调的双编码器(bi-encoder)+ 重排序器(reranker)+ LLM 选择器,为任务挑选技能。
- evaluate:在三个真实世界 Agent 基准测试(SkillsBench、GDPVal、QwenClawBench)上评估。
检索模型
- SkillRouter:包含一个从
Qwen3-Embedding-0.6B微调的双编码器(用于候选召回)和一个从Qwen3-Reranker-0.6B微调的重排序器(用于对候选进行打分),模型权重将在 HuggingFace 发布。
评估结果
论文(arXiv:2607.15557)Table 1 显示,在相同 harness 和 backbone 下,使用 SkillCorpus 后各基准的通过率均有提升:
- SkillsBench:在 OpenClaw × Qwen3.5-27B 上从 8.8 提升至 13.0(pooled Δ +7.5±2.3);在 Raven × Qwen3.5-397B 上从 9.2 提升至 22.6。
- GDPVal:pooled Δ +1.51±0.49(z=3.1)。
- QwenClawBench:pooled Δ +2.79±0.70(z=4.0)。
访问与使用
- 在线查询:可通过托管端点 SkillHub(API)以三个层级(discover 元数据 / read
skill_md/ download zip)访问,无需安装或 API 密钥。 - 本地部署:可在自有 GPU 上通过
bash skillcorpus/match/scripts/run_server.sh启动/embed+/score端点。 - Agent 集成:Raven 提供首方可集成方案;其他 harness(OpenClaw、Hermes、Claude Code 等)可通过下载技能包并放入技能目录,或将
skill_md注入系统提示词实现集成。
代码与许可
- 代码许可:仓库主体为 Apache-2.0,
match/和evaluate/工具包为 MIT。 - 数据集许可:每个技能保留其原始上游许可证,未重新授权,下游使用需遵循各技能自身的条款。
搜集汇总
数据集介绍

构建方式
SkillCorpus数据集的构建采用了一套严谨的四阶段流程,旨在将散落于数千个公共仓库中的Agent技能(SKILL.md文件)整合为高质量、可商用的资源。首先,通过聚合阶段,从公开仓库中批量发现并克隆技能文件;其次,在策展阶段,对采集到的约82.1万个文件进行解析、安全检查、许可证审核、去重、16类分类及三维质量评分(实用性、鲁棒性、安全性),最终筛选出96,401个技能,每个技能均附带其原始上游许可证,且所有源仓库均经过许可证审计,确保发布的集合可商用再分发。
特点
SkillCorpus数据集的核心特色在于其规模、质量与实用性。数据集包含96,401个经过严格筛选的技能,覆盖16类任务分类体系,每个技能都具备三维质量评分(效用、鲁棒性、安全性)及1024维检索嵌入向量,便于高效检索。此外,数据集还配套了SkillRouter检索模型(包含双编码器与重排序器),以及三个真实世界的Agent基准测试(SkillsBench、GDPVal、QwenClawBench),实验证明引入该语料库后,Agent在各类任务上的性能均有显著提升,尤其是在需要程序性知识的场景中(SkillsBench上平均提升+7.5个百分点)。
使用方法
使用SkillCorpus极为便捷,提供了多种接入方式。用户可通过托管在SkilHub上的开放API直接查询技能,仅需一个HTTP调用即可获取元数据、技能内容或下载打包的脚本。对于需要本地部署的场景,用户可从HuggingFace下载语料库及检索模型,自行搭建编码与重排序端点。此外,SkillCorpus还支持无缝集成至主流Agent框架,如Raven、OpenClaw、Hermes等,通过配置或简单的命令即可将技能注入Agent的提示词或技能目录,实现自动化技能选择与调用,显著提升Agent的任务完成能力。
背景与挑战
背景概述
在大型语言模型驱动的智能体生态中,技能(SKILL.md)作为封装可复用程序性知识的重要载体,其分散于海量公共仓库且质量参差不齐的现状,严重制约了智能体的泛化能力与安全可控性。SkillCorpus数据集由EverMind团队于2026年提出,旨在通过系统化的聚合、净化、匹配与评估流程,构建一个规模达96,401项、具备商用再分发许可的开放技能语料库,并配套SkillRouter检索模型及三项真实世界智能体基准,以填补技能生态中缺乏高质量基准与标准化接口的空白。该工作不仅促进了技能的重用与协同进化,还为智能体在复杂任务中的技能选择提供了可靠支撑,其影响力已延伸至以Raven为代表的智能体架构的实际部署中。
当前挑战
SkillCorpus所应对的核心挑战在于多维度地破解技能生态的碎片化与不可用性。首先,技能资源普遍存在冗余、分布散乱及质量不一的问题,如何在数十万级候选技能中精确提取有效部分,同时规避安全风险与许可不明障碍,是技术层面的一大难题。其次,构建过程中需在约82.1万个抓取文件中完成解析、安全筛查、许可证审计、去重、16类分类及三维质量评分,这一流水线不仅要求高度自动化,还需在LLM端点不可用时保持规则降级的稳健性,确保端到端运行。此外,技能检索的精准度直接影响智能体任务执行效能,如何在广泛技能库中实现语义匹配与重排序的协同优化,以及如何在不同骨干模型与框架下实现显著的性能增益,均为该数据集持续探索与解决的长期挑战。
常用场景
经典使用场景
SkillCorpus 作为大规模、经许可审核的智能体技能语料库,其最经典的使用场景在于为大型语言模型(LLM)智能体提供动态、可检索的程序性知识注入。研究者与开发者可借助其配套的 SkillRouter 检索模型(双编码器与重排序器),根据任务描述从 96,401 个技能中精准召回相关技能,并将技能描述注入智能体提示,从而显著增强模型在复杂任务(如文档处理、代码生成)中的执行能力。该语料库的构建流程(聚合、筛选、分类、质量评分)为技能的组织与检索提供了标准化范式,成为技能增强智能体研究与应用的基石。
实际应用
在实际应用中,SkillCorpus 通过托管端 SkillHub 为智能体提供即时的技能检索服务,支持多种集成方式:开发者可通过简单的 HTTP 调用获取技能元数据或完整内容,亦可自托管检索模型以融入私有部署流程。其与主流智能体框架(如 Raven、OpenClaw、Claude Code)的无缝衔接,使得技能下载与注入变得极为便捷,可广泛应用于自动化文档处理(如 PDF 表格提取)、代码生成、数据分析等企业级场景。技能按 16 类分类体系组织,并携带上游许可信息,为商业应用提供了合规保障,降低了知识产权风险,促进了开源技能生态的工业化落地。
衍生相关工作
SkillCorpus 的发布催生了系列衍生工作,主要集中在技能检索优化与智能体评估方法两个方向。其 SkillRouter 模型的训练范式(合成查询、InfoNCE 损失、列表式交叉熵)启发了后续关于高效技能匹配的研究,推动了双编码器与重排序器在技能库场景中的精细调优。此外,其构建的 SkillsBench 等基准成为评估智能体程序性知识运用能力的新标准,被后续研究广泛采用或扩展,用于衡量不同骨干模型与技能库结合时的性能增益。围绕技能许可审计与质量评分机制,也衍生出关于安全技能部署与合规数据治理的探讨,对整个智能体生态的规范化发展具有深远影响。
以上内容由遇见数据集搜集并总结生成



