MMSkills
收藏资源简介:
MMSkills是一个可重用的多模态程序知识数据集,包含跨Ubuntu、macOS、VAB-Minecraft和Mario等平台的515项技能,用于增强视觉代理在桌面任务中的能力。
MMSkills is a reusable multimodal procedural knowledge dataset containing 515 skills across platforms including Ubuntu, macOS, VAB-Minecraft, and Mario, which is designed to enhance the capabilities of visual agents in desktop tasks.
数据集概述:MMSkills
MMSkills是一个用于视觉智能体的可复用多模态程序知识框架,旨在通过技能增强的方式提升视觉智能体在桌面任务上的表现。
核心定位
- 目标:为通用视觉智能体提供可复用的多模态程序性知识。
- 应用场景:桌面任务(Ubuntu、macOS、VAB-Minecraft、Mario等环境)。
- 核心价值:将复杂、多步骤的GUI操作(如合并表格、安装扩展、图像编辑)封装为标准化的技能包,供智能体调用。
技能构成
每个技能包是一个自包含的目录,包含三个核心文件:
SKILL.md:描述该技能的操作流程、适用条件、迁移限制及校验提示。这是技能的文本化知识核心。runtime_state_cards.json:运行时状态卡片,包含在推理时使用的紧凑状态和视图元数据,用于引导智能体决策。state_cards.json:审计级状态卡片,包含更详细的状态元数据,用于检查或分析。
关键特性
- 自包含技能包:每个技能目录包含完整的文本、状态数据和视觉关键帧,易于分发和复用。
- 多模态证据门控:运行时先判断是否需要视觉信息,再按需加载特定状态视图,效率更高。
- 分支加载规划:创建一个临时的规划分支,咨询选定的技能,返回简洁的指导、备选建议和验证提示。
- 与OSWorld集成:提供脚本可一键将MMSkills安装到现有的OSWorld环境中。
- 智能体产品适配器:支持Codex、OpenClaw和Claude Code等智能体产品,通过统一的适配器接口使用MMSkills。
- 按需技能检索:智能体可在包含515个技能的Hugging Face库中搜索,仅下载当前任务所需的技能包。
- 社区可扩展:支持研究者提交新领域的技能包(如自动驾驶、机器人、移动端等),经过审核后纳入公共库。
数据集规模
- 总技能数:515个。
- 覆盖领域:Ubuntu、macOS、VAB-Minecraft、Mario。
- 存储位置:Hugging Face Datasets - zhangkangning/mmskills
架构与运行模式
MMSkills的架构是模型无关的,支持三种运行模式:
mm_skill(推荐):多模态分支加载技能咨询模式。智能体在上下文保留轻量级技能提示,当任务状态表明可能有用时,打开一个临时分支,决定是否需要视觉证据,请求相关状态视图,并与实时截图对比,返回结构化的下一步行动指导。general_text_skill:纯文本技能咨询模式,用于消融实验或轻量级运行,只使用技能的文本描述部分。general:基线模式,不调用MMSkills,直接使用截图映射到PyAutoGUI动作。
示例演示
项目提供了四个OSWorld任务的视频对比演示(无技能 vs. 纯文本技能 vs. MMSkills),直观展示了MMSkills的效果:
- Calc合并表头:创建工作表,合并指定表头并写入标签。MMSkills能遵循正确的电子表格工作流。
- VS Code本地VSIX安装:通过GUI工作流安装本地VSIX扩展。MMSkills减少了在扩展发现和确认环节的弯路。
- GIMP文本图层移动:移动GIMP中的特定文本图层。MMSkills提供了图层和工具栏状态的视觉参考,使编辑路径更清晰。
- Calc图表创建:在LibreOffice Calc中创建聚类图表。演示了可复用的电子表格程序知识对多步骤GUI操作的影响。
安装与使用
1. 克隆仓库: bash git clone https://github.com/zkangning/MMSkills_for_Visual_Agents.git cd MMSkills_for_Visual_Agents
2. 安装Python依赖: bash python3 -m venv .venv source .venv/bin/activate pip install -r requirements.txt
3. 集成到OSWorld: 在执行以下脚本前,需要先准备好OSWorld环境。 bash python3 scripts/install_into_osworld.py /path/to/OSWorld --with-runner --with-skills
4. 配置模型端点: bash export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1" export OPENAI_API_KEY="your_api_key"
5. 运行智能体: 以下是运行MMSkills(多模态模式)的命令示例: bash python run.py --agent_type mm_skill --model gpt-4o --api_backend openai --observation_type screenshot --action_space pyautogui --max_steps 20 --skills_library_dir skills_library --task_skill_mapping_root task_skill_mappings/task_skill_mapping.json --skill_mode multimodal --task_skill_top_k 6 --save_conversation_json --test_all_meta_path evaluation_examples/test_nogdrive.json --domain chrome --result_dir results/mm_skill_multimodal
运行后,结果目录将包含轨迹、截图、skill_invocations.json、skill_usage_summary.json等文件。
相关链接





