Awesome-Multimodal-Intelligence
收藏官方服务:
资源简介:
这是一个精心策划的多模态智能研究资源合集,涵盖视觉语言模型、视觉语言动作模型、世界模型和具身人工智能等领域。该合集中收录了相关的研究论文、开源代码以及多个数据集和评估基准,旨在追踪从感知到决策的下一代智能体技术。
This is a carefully curated collection of multimodal intelligence research resources, encompassing fields such as Vision-Language Models (VLMs), Vision-Language-Action Models (VLAMs), World Models, and Embodied AI. The collection includes relevant research papers, open-source code, multiple datasets, and evaluation benchmarks, with the aim of tracking next-generation AI agent technologies ranging from perception to decision-making.
创建时间:
2026-04-26
原始信息汇总
🧠 仓库概览
Awesome Multimodal Intelligence 是一个专注于多模态智能研究的资料合集,覆盖视觉语言模型(VLM)、视觉语言动作模型(VLA)、世界模型及通用具身智能等前沿方向,收录论文、开源代码与数据集。仓库持续追踪从感知到决策的下一代智能体技术。
📌 最新动态
- 2026年4月全面更新:
- VLM:新增 SigLIP/SigLIP2、Qwen2.5-VL、Qwen3-VL、InternVL3、Molmo、Emu3 等模型。
- 新增专题:世界模型与具身 AI,同时补全了训练数据集与评估 Benchmark。
📂 内容索引
| 主题 | 描述 | 链接 |
|---|---|---|
| 🖼️ 视觉语言模型 (VLMs) | 感知、理解与多模态推理 | 查看 |
| 🤖 视觉语言动作模型 (VLAs) | 从感知到物理决策 | 查看 |
| 🌍 世界模型 (World Models) | 环境建模与预测性规划 | 查看 |
| 🧠 具身智能 (Embodied AI) | 感知、规划与执行的统一 | 查看 |
🗺️ 研究脉络
感知 → 理解 → 推理 → 规划 → 动作
- VLMs 桥接视觉感知与语言理解,是智能体栈的感知基础。
- VLAs 在 VLM 基础上引入动作输出,实现端到端感知-决策闭环。
- World Models 对环境动态建模,为规划提供预测性先验。
- Embodied AI 整合上述能力,面向真实世界通用智能体。
🔖 快速导航
视觉语言模型 (VLMs) 子分类
- 对比预训练:CLIP, SigLIP, SigLIP2, EVA-CLIP, MetaCLIP
- 生成式 VLM:Flamingo, BLIP-2, Emu3, Molmo
- 指令微调 VLM:LLaVA 系列, InternVL3, Qwen3-VL, Qwen2.5-VL, Idefics3
- 定位与检测:KOSMOS-2, Grounding DINO 1.5, SAM2
- 高效 VLM:PaliGemma2, Phi-4-Vision, SmolVLM
- 闭源 VLM:GPT-4o, Gemini 2.0, Claude 3.5
- 训练数据集:LAION-5B, DataComp, MMC4, PixMo
- 评估基准:MMMU-Pro, MMStar, MathVista, Video-MME
视觉语言动作模型 (VLAs) 子分类
- 基础策略:ACT, Diffusion Policy, RT-1, SayCan
- VLA 基座模型:RT-2, OpenVLA, π0, π0.5
- 通用策略:Octo, CrossFormer
- 操作、导航、灵巧控制
- 强化学习与自我提升:OpenVLA-OFT, VLARL
- 数据集与基准:Open X-Embodiment, LIBERO, CALVIN
世界模型 (World Models) 子分类
- 基于模型的强化学习:DreamerV3, TD-MPC2, MuZero, IRIS
- JEPA:I-JEPA, V-JEPA, V-JEPA2
- 视频生成:Sora, Cosmos, Genie2, DIAMOND
- 自动驾驶:GAIA-1, DriveDreamer, Vista, OccWorld
- 机器人世界模型:UniSim, GR-1, UniPi, Pandora
- 基准:VBench, EvalCrafter, nuPlan, CARLA
具身智能 (Embodied AI) 子分类
- 感知:EmbodiedScan, ConceptFusion, AnyGrasp
- 导航:NavGPT2, ViNT, NoMaD, CoW
- 操作:RVT-2, Diffusion Policy, 3D Diffusion Policy
- 任务规划:SayCan, Code-as-Policies, Voyager, ReKep
- 通用智能体:Gato, OpenVLA, π0, Octo, LEO
- 人形机器人:Figure02, HumanPlus, OmniH2O, DexVLA
- 仿真器:Isaac Lab, ManiSkill3, Habitat 3.0, Genesis
- 基准:CALVIN, MetaWorld, EmbodiedBench, BEHAVIOR-1K
🤝 贡献指南
欢迎提交 PR 补充新论文、数据集或工具。请遵循各子文档的表格格式。
- Fork 本仓库
- 在对应的
.md文件中添加条目 - 提交 Pull Request,并简要说明新增内容
📜 许可证
本项目采用 MIT 许可证 发布。



