遇见数据集

RESOURCE2SKILL

收藏
Hugging Face2026-07-17 更新2026-07-18 收录
官方服务:

资源简介:

RESOURCE2SKILL数据集是由微软官方发布的,旨在支持RESOURCE2SKILL系统的数据集。该系统将人类创建的多模态资源(如教程、文档等)提炼为可重用、可执行的软件代理技能。数据集包含结构化技能条目和可执行资产,覆盖Web、PowerPoint、Excel、Blender和REAPER风格的音频工作流。具体内容包括:skills_wiki/目录提供用于发现和检查的结构化技能条目;skills_library/目录包含可执行资产、辅助模块和领域资源;skills-lock.json文件锁定发布的技能集;CITATION.cff文件提供引用元数据。技能条目在可用时保留来源和出处元数据,确保可追溯性。数据集规模中等,样本数量在1,000到10,000之间,适用于构建软件代理的技能库、多模态资源处理、自动化工作流生成等任务。数据集采用MIT许可证,语言为英语,支持代理、技能库、多模态等应用场景。

The RESOURCE2SKILL dataset, officially released by Microsoft, is designed to support the RESOURCE2SKILL system. This system distills human-created multimodal resources (such as tutorials, documents, and other similar materials) into reusable and executable software agent skills. The dataset contains structured skill entries and executable assets, covering workflows for Web, PowerPoint, Excel, Blender, and REAPER-style audio editing. Its specific contents are as follows: the skills_wiki/ directory provides structured skill entries for discovery and inspection; the skills_library/ directory houses executable assets, auxiliary modules, and domain-specific resources; the skills-lock.json file locks the published skill collection; and the CITATION.cff file provides citation metadata. Skill entries retain source and provenance metadata whenever available to ensure traceability. The dataset is of medium scale, with the number of samples ranging from 1,000 to 10,000, and is applicable to tasks such as building software agent skill libraries, multimodal resource processing, and automated workflow generation. The dataset is licensed under the MIT License, uses English as its primary language, and supports application scenarios including AI agents, skill libraries, and multimodality.

提供机构:
Microsoft
创建时间:
2026-07-17
原始信息汇总

数据集概述

数据集名称:Resource2Skill: Executable Agent Skill Libraries

发布方:Microsoft(微软)

许可协议:MIT License

语言:英语(en)

数据集规模:1K < n < 10K(样本数量在1000至10000之间)

标签:agents, skill-library, multimodal, powerpoint, web, excel, blender, audio

数据集简介

Resource2Skill 是一个由微软发布的数据集,用于将人类创建的多模态资源蒸馏为软件智能体可重用的可执行技能。该数据集是 Resource2Skill 系统的官方配套数据。

  • 项目主页:https://microsoft.github.io/Resource2Skill/
  • 论文地址:https://arxiv.org/abs/2606.29538
  • 代码仓库:https://github.com/microsoft/Resource2Skill

数据集内容结构

数据集包含以下核心组成部分:

  • skills_wiki/:结构化技能条目,用于技能发现和浏览。
  • skills_library/:可执行资产、辅助模块和领域资源。
  • skills-lock.json:清单文件,用于锁定已发布的技能集合。
  • CITATION.cff:引用元数据。

覆盖领域

该数据集涵盖了以下领域的技能和工作流:

  • Web(网页相关)
  • PowerPoint(演示文稿)
  • Excel(电子表格)
  • Blender(3D建模)
  • REAPER-style audio workflows(音频处理工作流,类似REAPER软件风格)

技能条目在可用情况下保留了来源和出处元数据。

配置与数据文件

数据集包含一个默认配置:

  • 配置名称:default
  • 数据文件
    • 分割:excel_validation_examples
    • 路径模式:skills_library/excel/validation/*/skill.json

使用方式

下载数据集到 Resource2Skill 代码仓库根目录:

bash hf download microsoft/RESOURCE2SKILL --repo-type dataset --local-dir .

验证某个领域(例如 PowerPoint):

bash python cli.py domains python cli.py validate-domain --domain ppt

引用格式

如需引用该数据集,请使用以下 BibTeX 格式:

bibtex @misc{fan2026resource2skill, title = {{RESOURCE2SKILL}: Distilling Executable Agent Skills from Human-Created Multimodal Resources}, author = {Yijia Fan and Zonglin Di and Zimo Wen and Yifan Yang and Mingxi Cheng and Qi Dai and Bei Liu and Kai Qiu and Yue Dong and Ji Li and Chong Luo}, year = {2026}, eprint = {2606.29538}, archivePrefix = {arXiv}, primaryClass = {cs.SE}, url = {https://arxiv.org/abs/2606.29538} }

搜集汇总
数据集介绍
RESOURCE2SKILL 数据集图片
构建方式
Resource2Skill数据集由微软团队构建,旨在从人类创作的多模态资源中提炼出可复用的可执行智能体技能。其构建过程涵盖多个领域的结构化技能条目与可执行资产,包括Web、PowerPoint、Excel、Blender以及REAPER风格音频工作流。数据集以JSON格式组织技能条目,并附有来源与溯源元数据,以确保技能的透明性与可验证性。通过将复杂的多模态资源转化为标准化的技能模块,该数据集为智能体系统提供了高效的知识复用基础。
使用方法
使用Resource2Skill数据集时,开发者需通过HuggingFace命令行工具下载完整数据至代码仓库根目录。随后可运行Python CLI工具进行领域技能库的验证,例如通过`python cli.py validate-domain --domain ppt`检验PowerPoint领域的技能可用性。数据集中的技能条目可直接集成至Resource2Skill框架,支持智能体在真实环境中执行。详细的文档与示例代码进一步简化了从资源提取到技能部署的完整流程。
背景与挑战
背景概述
随着多模态大语言模型与智能体技术的飞速发展,如何将海量人类创作的多模态资源(如教学视频、操作指南)高效转化为可供软件智能体直接调用的可执行技能,成为人机协同领域的关键议题。2026年,微软研究院团队(Yijia Fan、Zonglin Di等)发布了Resource2Skill数据集,旨在系统性地蒸馏人类多模态资源为可复用的智能体技能库。该数据集涵盖Web、PowerPoint、Excel、Blender及音频处理等五大领域,包含超过千条技能条目,并保留了来源与溯源元数据。Resource2Skill填补了从非结构化资源到结构化可执行技能之间的鸿沟,为智能体自动化操作提供了标准化的训练与评估基准,对推动自主智能体在办公、创意等实际场景中的应用具有深远影响。
当前挑战
Resource2Skill所面临的挑战主要体现在两个方面。在领域问题层面,现有智能体系统缺乏将复杂且非结构化的多模态人类资源(如教学视频、图文教程)精准转化为泛化性强的可执行技能的有效方法,导致技能构建高度依赖手工编码,难以规模化。在数据集构建过程中,团队需解决多领域(如Web、Excel、Blender)资源异构性带来的统一表示难题,包括不同软件界面操作逻辑的差异、音频与视觉模态的融合对齐,以及技能条目在无监督条件下从原始资源中的准确抽取与验证。此外,确保技能的可复现性与跨域迁移能力,并在庞大的候选技能空间中维护元数据的完整性与一致性,亦是构建此数据集时的核心挑战。
常用场景
经典使用场景
在智能体技能库构建这一前沿研究领域,RESOURCE2SKILL数据集被广泛用于训练和评估能够从多模态资源中自动提取可执行技能的系统。该数据集涵盖了网页、PowerPoint、Excel、Blender及音频编辑等多个复杂软件环境的技能条目,每个条目均包含结构化的技能描述、可执行资产及来源元数据。研究者通常利用这些数据来验证技能蒸馏算法的有效性,即如何将人类创作的教程视频、文档等非结构化资源,转化为智能体可直接调用的模块化技能。这一过程不仅涉及对资源内容的理解与抽象,还需要确保技能在不同场景下的鲁棒性与可迁移性,因此该数据集为端到端的技能学习研究提供了标准化的基准平台。
解决学术问题
该数据集旨在解决数字智能体领域一个核心痛点:如何高效、可靠地将人类积累的多模态操作知识转化为智能体可复用的技能单元。传统方法往往依赖手工编写规则或大量领域特定样本,难以跨场景泛化。RESOURCE2SKILL通过提供涵盖多个专业软件生态的标准化技能库,使研究者能够系统性地探索从视频教程、操作手册等资源中自动提取可执行逻辑的方法。其意义在于推动智能体从“按固定指令执行”向“从人类示范中持续学习”这一范式转变,为构建通用型软件自动化助手奠定了数据基础。此外,该数据集引入的版本锁定机制与技能验证流程,也为可复现研究提供了规范化的工具支持。
实际应用
在实际应用中,基于RESOURCE2SKILL构建的技能库可大幅降低软件自动化的开发门槛。例如,在办公自动化领域,智能体可调用数据集预置的Excel宏技能,自动完成报表生成与数据清洗;在创意生产场景中,Blender与音频编辑技能使得机器人助手能根据用户指令直接执行三维建模或音效剪辑操作。企业客户服务系统也可利用网页技能库,让对话机器人突破文本回复的限制,直接操作后台界面完成如邮件发送、系统配置等复杂任务。通过将这些细致粒度的可执行技能注入到智能体工作流中,用户无需具备编程知识即可通过自然语言调度专业软件功能,从而显著提升生产效率与跨工具协作的流畅度。
数据集最近研究
最新研究方向
Resource2Skill数据集聚焦于将人类创作的多模态资源(如网页、PowerPoint、Excel、Blender及音频工作流)蒸馏为可复用的智能体技能,代表了AI代理技能库领域的前沿方向。随着大语言模型与多模态AI的融合,构建可执行的技能库成为提升软件代理自主性的关键。该数据集通过整合结构化技能条目与可执行资产,为自动化办公、创意工具及跨域工作流提供了标准化训练与验证基础。其发布不仅推动了从静态资源到动态执行技能的范式转变,更在工业4.0与低代码开发热潮中,为多模态智能体的实用化部署开辟了新路径,具有深远的行业影响力。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务