遇见数据集

pm-skills-instruct

收藏
Hugging Face2026-07-13 更新2026-07-14 收录
官方服务:

资源简介:

PM Skills instruct是一个指令调优数据集,通过蒸馏来自pm-claude-skills库的426个开源SKILL.md文件构建而成。这些文件编码了高级专业人士在25个专业领域(包括产品需求文档制作、事后分析、执行更新、发布计划和流失分析等)的真实工作产物中的专业判断。数据集包含三个主要部分:routing.jsonl(约1500行)提供聊天格式的三元组,用于教授技能路由(将现实任务表述映射到技能名称);sft-seeds.jsonl(约110行)包含系统提示和用户输入,作为教师模型补全生成的种子;samples.jsonl(约22行)则提供来自库中已发布、经人工评审的样本输出的完整监督微调(SFT)三元组。数据规模约1632行,格式为JSONL,语言为英语。该数据集旨在用于微调小型模型(如3B参数级别)成为本地专业副驾驶,或单独使用routing.jsonl训练和评估技能路由能力。它支持文本生成任务,适用于指令调优、专业写作、产品管理、商业分析、代理技能培养和知识蒸馏等场景。数据完全源自MIT许可的开源技能库,不包含任何网络爬取数据或用户数据。当前仅提供英语版本,且routing.jsonl中的任务措辞基于源技能触发子句机械派生,建议通过意译增强鲁棒性。

PM Skills instruct is an instruction tuning dataset constructed by distilling 426 open-source SKILL.md files from the pm-claude-skills library. These files encode professional judgment from real-world work products of senior professionals across 25 domains, such as product requirement documents (PRD), post-mortems, execution updates, launch plans, and churn analysis. The dataset consists of three main parts: routing.jsonl (approximately 1500 lines) provides chat-format triples for teaching skill routing (mapping real-world task formulations to skill names); sft-seeds.jsonl (approximately 110 lines) contains system prompts and user inputs as seeds for teacher model completion generation; samples.jsonl (approximately 22 lines) offers full supervised fine-tuning (SFT) triples from published, human-reviewed sample outputs in the library. The data scale ranges between 1K to 10K, specifically around 1632 lines, in JSONL format and in English. It is designed for fine-tuning small models (e.g., 3B parameters) to become local professional copilots, or for training and evaluating skill routing capabilities using routing.jsonl alone. It supports text generation tasks and is suitable for scenarios like instruction tuning, professional writing, product management, business analysis, agent skill cultivation, and knowledge distillation. The data is entirely derived from an open-source skill library under MIT license, with no web-scraped or user data included. Currently available only in English, and the task phrasing in routing.jsonl is mechanically derived from source skill trigger clauses, with paraphrasing recommended for robustness enhancement.

创建时间:
2026-07-02
原始信息汇总

数据集概述

数据集名称:PM Skills instruct — professional judgment as training data
许可协议:MIT
语言:英文
任务类别:文本生成
大小规模:1K < n < 10K

数据集来源

  • 从开源项目 pm-claude-skills 中蒸馏得到,该项目包含 426 个 SKILL.md 文件,编码了资深专业人员如何撰写 PRD、事后分析报告、高管更新、发布计划、流失分析等 25 种专业工作成果。
  • 每个版本均从该仓库的规范来源确定性重新生成,版本标签与仓库发布标签一致。

数据集组成

配置名称 文件 行数 内容说明
routing routing.jsonl ~1,500 聊天格式三元组,用于训练技能路由(将实际任务描述映射到技能名称),从每个技能的触发子句机械派生
sft-seeds sft-seeds.jsonl ~110 {system: 完整技能主体, user: 精心策划的评估输入, assistant: null} — 用于教师模型生成补全的种子数据(回答故意留空)
samples samples.jsonl ~22 完整的 SFT 三元组,来自仓库已发布、人工审查的样本输出(每行的 source 字段披露了产生该数据的模型)

预期用途

  • 对小型模型(3B 类)进行微调,使其成为本地专业助手。
  • 单独使用 routing.jsonl 训练/评估技能路由能力。
  • 两阶段蒸馏流程(教师模型在种子上生成补全 → 使用仓库公开评估标准过滤 → SFT)记录在仓库的数据集 README 中。
  • 同一仓库还发布了 SkillBench,一个专业工作基准,可用于评估蒸馏结果。

来源与局限性

  • 所有内容均来自 MIT 许可的技能库,无网络爬取数据或用户数据。
  • sft-seeds.jsonl不包含模型输出
  • 当前仅支持英文(上游正在推进本地化流程)。
  • routing.jsonl 中的任务表述是机械派生而来,因此继承了源技能的触发词汇,建议通过改写来增强鲁棒性。

引用

PM Skills instruct dataset, distilled from pm-claude-skills https://github.com/mohitagw15856/pm-claude-skills

搜集汇总
数据集介绍
pm-skills-instruct 数据集图片
构建方式
PM Skills Instruct数据集通过对开源技能库进行知识蒸馏构建而成,其根源可追溯至pm-claude-skills代码仓库中的426份SKILL.md文件。这些文件系统化地编码了资深专业人士在撰写产品需求文档、事后分析报告、高管更新、发布计划、客户流失分析等25种真实工作产物时所运用的专业判断与技能。数据集从该仓库的规范源中确定性生成,每个版本标签均与仓库的发布标签保持一致,确保了数据来源的透明与可复现。具体而言,数据集包含三个配置:routing配置包含约1500条聊天格式三元组,用于教授技能路由任务;sft-seeds配置包含约110条种子样本,其assistant字段故意为空,以留待教师模型生成完整回答;samples配置则包含22条完整的有监督微调三元组,且每条样本均标注了生成模型的来源。
特点
该数据集的核心特点在于其高度专业化与结构化,专注于将资深专业人士的隐性知识转化为可训练的显式数据。所有内容均源自经MIT许可的技能库,不含有任何被爬取的网络数据或用户数据,从而保障了数据来源的纯净与合规性。routing.jsonl文件中的任务表述虽基于触发子句机械推导,但忠实保留了原始技能词汇,为技能路由训练提供了清晰的基础。此外,该数据集为纯英文语料,未来有本地化的规划。值得一提的是,其配套的代码仓库还发布了SkillBench基准测试,为评估微调后的模型在专业工作场景中的表现提供了标准化的评价框架。
使用方法
该数据集主要用于将小型模型(如3B参数级别)微调为本地化的专业助手,亦可用于单独训练或评估技能路由能力。推荐的两阶段蒸馏流程在代码仓库的数据集文档中详细说明:首先利用教师模型在种子样本上生成完整回答,随后依据仓库公开的评估标准进行筛选,最后执行有监督微调。用户应留意,由于路由配置中的任务表述为机械推导,为增强模型的鲁棒性,建议在实际应用中加入同义改写来扩充多样的表述方式。该数据集直接通过HuggingFace加载,支持选择routing、sft-seeds或samples等不同配置,以适配从单一技能路由到全面的专业工作流模拟等多种微调场景。
背景与挑战
背景概述
在自然语言处理与指令微调领域,如何高效地将专业领域的人类判断转化为可复用的训练数据,一直是推动模型实用化的重要课题。PM Skills Instruct 数据集应运而生,由研究者基于 MIT 许可的开源项目 pm-claude-skills 构建,于近期发布。该数据集聚焦于产品管理、技术文档撰写、商业分析等专业写作场景,核心研究问题在于如何利用少量的、由资深专家编码的职业技能描述(SKILL.md),通过蒸馏与路由机制生成高质量的指令微调数据。其影响力体现在为小型语言模型(如 3B 参数级别)提供了成为本地专业助手的训练基础,同时配套发布了 SkillBench 职业工作基准,为评估模型的专业素养提供了标准化测试环境。
当前挑战
该数据集面对的领域核心挑战在于将隐性、高度依赖上下文的职业判断外显为可训练的指令格式,例如任务路由数据需从技能触发条款中机械推导,可能导致表述僵化、缺乏自然语言变体,从而影响模型在真实场景下的泛化能力。构建过程中,研究人员需克服从有限种子样本(约110条)中生成完整监督微调三元组的困难,并确保蒸馏出的模型输出通过人工评审标准筛选,规避质量稀释与知识丢失风险。此外,当前仅支持英语、本地化流程尚在开发,且任务路由词汇继承自源技能库,缺乏多样性与短语增强处理,均对数据集的普适性与鲁棒性构成挑战。
常用场景
经典使用场景
在自然语言处理与指令微调的前沿探索中,PM Skills Instruct数据集为小型语言模型的领域专业化开辟了崭新路径。其最经典的使用场景聚焦于将参数规模约30亿的轻量级模型,微调为能够胜任产品管理、技术复盘、高管汇报等专业写作任务的本地化智能助手。通过数据集内约1500条聊天格式的routing样本与110条SFT种子数据,研究者可高效地训练模型掌握技能路由能力,即精准地将真实场景下的任务描述映射至对应专业技能模块,从而实现从模糊需求到结构化输出的自动编排。
解决学术问题
该数据集独辟蹊径地回应了专业领域模型训练中‘蒸馏数据稀缺且质量失控’的核心困境。传统指令微调往往依赖大规模网络爬虫数据或多模型集成产生的合成样本,而PM Skills Instruct从426份经过审校的、MIT协议开源的专业技能文件出发,以确定性生成和人工审核相结合的方式,构建了高保真的训练信号。这一设计显著缓解了底层模型在专业写作任务中的事实合理性不足与逻辑断裂问题,并将‘技能路由’这一元能力从模型设计中抽离,使其成为可独立评估的学术基准组件,强化了指令微调的可解释性与模块化研究范式。
衍生相关工作
围绕PM Skills Instruct,衍生出一系列具有学术延续性的经典工作。其上游仓库pm-claude-skills系统交付了426份结构化的专业技能本体文件,直接催生了‘可复用技能原子库’的构想,即通过将专业判断编码为可组合的技能描述,支持多领域任务的无缝迁移。数据集本身沉淀的两阶段蒸馏方案(教师模型补全+评审过滤+监督微调)已成为小模型专业化训练的通用范本。此外,同源发布的SkillBench建立了首个面向产品管理综合写作的标准化评测套件,其公开的评审规则集被后续研究广泛采纳,用于评估长文本生成中的专业性与事实一致性,显著推动了专业写作自动化领域的评测体系建设。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务