遇见数据集

MMSkills

收藏
github2026-06-01 更新2026-06-05 收录
官方服务:

资源简介:

MMSkills是一个可重用的多模态程序知识数据集,包含跨Ubuntu、macOS、VAB-Minecraft和Mario等平台的515项技能,用于增强视觉代理在桌面任务中的能力。

MMSkills is a reusable multimodal procedural knowledge dataset containing 515 skills across platforms including Ubuntu, macOS, VAB-Minecraft, and Mario, which is designed to enhance the capabilities of visual agents in desktop tasks.

创建时间:
2026-06-01
原始信息汇总

数据集概述:MMSkills

MMSkills是一个用于视觉智能体的可复用多模态程序知识框架,旨在通过技能增强的方式提升视觉智能体在桌面任务上的表现。

核心定位

  • 目标:为通用视觉智能体提供可复用的多模态程序性知识。
  • 应用场景:桌面任务(Ubuntu、macOS、VAB-Minecraft、Mario等环境)。
  • 核心价值:将复杂、多步骤的GUI操作(如合并表格、安装扩展、图像编辑)封装为标准化的技能包,供智能体调用。

技能构成

每个技能包是一个自包含的目录,包含三个核心文件:

  • SKILL.md:描述该技能的操作流程、适用条件、迁移限制及校验提示。这是技能的文本化知识核心。
  • runtime_state_cards.json:运行时状态卡片,包含在推理时使用的紧凑状态和视图元数据,用于引导智能体决策。
  • state_cards.json:审计级状态卡片,包含更详细的状态元数据,用于检查或分析。

关键特性

  • 自包含技能包:每个技能目录包含完整的文本、状态数据和视觉关键帧,易于分发和复用。
  • 多模态证据门控:运行时先判断是否需要视觉信息,再按需加载特定状态视图,效率更高。
  • 分支加载规划:创建一个临时的规划分支,咨询选定的技能,返回简洁的指导、备选建议和验证提示。
  • 与OSWorld集成:提供脚本可一键将MMSkills安装到现有的OSWorld环境中。
  • 智能体产品适配器:支持Codex、OpenClaw和Claude Code等智能体产品,通过统一的适配器接口使用MMSkills。
  • 按需技能检索:智能体可在包含515个技能的Hugging Face库中搜索,仅下载当前任务所需的技能包。
  • 社区可扩展:支持研究者提交新领域的技能包(如自动驾驶、机器人、移动端等),经过审核后纳入公共库。

数据集规模

架构与运行模式

MMSkills的架构是模型无关的,支持三种运行模式:

  1. mm_skill(推荐):多模态分支加载技能咨询模式。智能体在上下文保留轻量级技能提示,当任务状态表明可能有用时,打开一个临时分支,决定是否需要视觉证据,请求相关状态视图,并与实时截图对比,返回结构化的下一步行动指导。
  2. general_text_skill:纯文本技能咨询模式,用于消融实验或轻量级运行,只使用技能的文本描述部分。
  3. general:基线模式,不调用MMSkills,直接使用截图映射到PyAutoGUI动作。

示例演示

项目提供了四个OSWorld任务的视频对比演示(无技能 vs. 纯文本技能 vs. MMSkills),直观展示了MMSkills的效果:

  1. Calc合并表头:创建工作表,合并指定表头并写入标签。MMSkills能遵循正确的电子表格工作流。
  2. VS Code本地VSIX安装:通过GUI工作流安装本地VSIX扩展。MMSkills减少了在扩展发现和确认环节的弯路。
  3. GIMP文本图层移动:移动GIMP中的特定文本图层。MMSkills提供了图层和工具栏状态的视觉参考,使编辑路径更清晰。
  4. Calc图表创建:在LibreOffice Calc中创建聚类图表。演示了可复用的电子表格程序知识对多步骤GUI操作的影响。

安装与使用

1. 克隆仓库: bash git clone https://github.com/zkangning/MMSkills_for_Visual_Agents.git cd MMSkills_for_Visual_Agents

2. 安装Python依赖: bash python3 -m venv .venv source .venv/bin/activate pip install -r requirements.txt

3. 集成到OSWorld: 在执行以下脚本前,需要先准备好OSWorld环境。 bash python3 scripts/install_into_osworld.py /path/to/OSWorld --with-runner --with-skills

4. 配置模型端点: bash export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1" export OPENAI_API_KEY="your_api_key"

5. 运行智能体: 以下是运行MMSkills(多模态模式)的命令示例: bash python run.py --agent_type mm_skill --model gpt-4o --api_backend openai --observation_type screenshot --action_space pyautogui --max_steps 20 --skills_library_dir skills_library --task_skill_mapping_root task_skill_mappings/task_skill_mapping.json --skill_mode multimodal --task_skill_top_k 6 --save_conversation_json --test_all_meta_path evaluation_examples/test_nogdrive.json --domain chrome --result_dir results/mm_skill_multimodal

运行后,结果目录将包含轨迹、截图、skill_invocations.jsonskill_usage_summary.json等文件。

相关链接

搜集汇总
数据集介绍
MMSkills 数据集图片
构建方式
MMSkills通过将多模态程序性知识封装为自包含的技能包来构建。每个技能包的核心是结构化的SKILL.md文件,其中详细描述了操作流程、适用条件与迁移限制。伴随该文件的是运行时状态卡片与审计状态卡片,前者存储推理阶段所需的紧凑状态与视图元数据,后者用于细致的检查与验证。此外,技能包还包含可选的视觉关键帧,为视觉智能体提供任务执行过程中的关键界面快照。这些技能包按领域(如Ubuntu、macOS等)组织,形成层级化的技能库。为支持推理效率,运行时采用分支加载策略,仅在任务状态提示相关时临时打开技能分支,按需检索视觉参考,从而避免将全部信息塞入主上下文。
特点
该数据集的显著特点在于其高度的模块化与模型无关性。515个技能覆盖多领域桌面任务,每个技能包都是独立、可复用的单元,支持按需下载与即插即用。运行时采用多模态证据门控机制,智能判断是否需要加载视觉参考,显著降低计算开销。分支式规划架构允许智能体在主上下文仅保留轻量级技能提示,待需要时再深入检索,实现了上下文效率与任务性能的优雅平衡。此外,数据集支持社区扩展,研究者可提交新领域技能包,经审核后纳入公共库,形成不断生长演进的技能生态系统。
使用方法
使用MMSkills需先克隆仓库并安装依赖,随后通过安装脚本将其集成至OSWorld环境。运行时,模型无关的通用视觉智能体可通过指定`--agent_type`参数(如`mm_skill`)激活多模态技能咨询模式,配合`--skill_mode`与`--task_skill_top_k`控制技能检索策略。智能体首先接收紧凑技能提示,当判定任务适用时,运行时打开分支决策是否需要视觉证据,请求相关状态视图并与实时截图比对,返回结构化指导。对于Codex等代理产品,可通过一行命令安装适配器,调用`$mmskills`搜索并下载任务相关的技能包,实现跨产品的技能共享与按需加载。
背景与挑战
背景概述
MMSkills是由zkangning等研究者于2026年发布的开源框架,旨在为通用视觉智能体提供可复用的多模态程序性知识。该数据集隶属于OSWorld生态系统,核心研究问题在于如何让视觉智能体在桌面任务中高效利用多模态技能信息,从而摆脱对单一文本指令或零样本推理的依赖。MMSkills包含了涵盖Ubuntu、macOS、VAB-Minecraft和Mario等领域的515项技能,并通过分支加载机制实现轻量级推理。项目在Hugging Face Daily Papers上取得广泛关注,其贡献在于建立了技能封装、按需检索与跨智能体适配的统一范式,为视觉智能体的泛化能力提升开辟了新路径。
当前挑战
当前MMSkills面临的核心挑战来自两个方面。在领域问题层面,视觉智能体在执行复杂GUI操作时,既需理解界面状态,又需将程序性知识转化为精确动作,而现有单模态文本或纯视觉方法难以兼顾灵活性与稳健性,智能体频繁因缺乏情境化技能参照而陷入探索迷途。在构建层面,多领域技能的标注与对齐成本极高,不同操作系统和应用程序的界面差异性导致技能包难以实现无缝迁移,且515项技能的元数据管理与版本演进需要持续维护,社区提交的异构技能需经严格审查方能纳入统一格式,流程自动化程度仍有提升空间。
常用场景
经典使用场景
在视觉智能体研究领域,MMSkills数据集被广泛用于评估和提升多模态智能体在图形用户界面操作任务中的表现。研究者通过将数据集中515个可复用的多模态技能包注入智能体的规划与决策流程,考察其在桌面环境(如Ubuntu和macOS)中执行复杂连续操作的能力。该数据集的经典使用模式是作为技能检索与分支加载的测试平台:主智能体在推理时仅保留轻量级技能提示,当任务状态触发技能匹配条件时,运行时系统打开临时规划分支,根据需求的视觉证据级别加载相应的状态卡片和关键帧,最终返回结构化的操作指导与验证线索。这使得MMSkills成为检验多模态程序性知识能否提升视觉智能体任务完成效率与准确性的理想基准。
衍生相关工作
MMSkills数据集的发布催生了一系列富有启发性的衍生研究。在技能表示领域,研究者借鉴其自包含技能包格式和分支加载机制,提出了面向移动端和网页环境的跨平台技能迁移框架,探索如何将桌面技能适配到手机Agent和浏览器自动化任务中。在智能体评估方面,MMSkills启发了任务-技能映射关系的自动构建方法,后续工作利用技能调用日志和成功率指标,发展出基于技能覆盖率的智能体能力诊断工具,帮助研究者识别模型在多步GUI操作中的薄弱环节。此外,社区扩展机制鼓励了自动驾驶、机器人操作和科学软件等新领域的技能包贡献,推动了通用视觉智能体研究从封闭基准向开放生态的演进,使MMSkills不仅是评测数据集,更成为连接不同任务领域、不同智能体产品的重要桥梁。
数据集最近研究
最新研究方向
MMSkills作为面向通用视觉智能体的多模态技能框架,当前研究前沿聚焦于通过可重用的多模态程序性知识显著提升桌面任务中智能体的操作表现。该数据集构建了包含515项技能的跨领域知识库,覆盖Ubuntu、macOS、Minecraft和Mario等异构环境,并提出分支加载的规划架构——智能体仅在需要时动态调用轻量级技能提示,避免全量知识带来的上下文过载。这一设计直击当前视觉语言模型在复杂GUI操作中泛化能力薄弱的痛点,通过结合文本指导、状态卡片与视觉关键帧的多模态证据门控机制,使智能体在LibreOffice表格合并、GIMP图层移动等精细任务中展现出显著优于纯文本指导或无技能基线的执行效率。尤为值得关注的是,该工作与OSWorld基准的深度整合以及Codex、OpenClaw等主流智能体系统的适配器发布,标志着可复用技能库正从封闭实验环境迈向工业级视觉智能体的实用化部署,为构建具身智能体的持续学习范式提供了基础设施级支撑。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务