遇见数据集

Awesome-Multimodal-Intelligence

收藏
github2026-06-03 更新2026-06-04 收录
官方服务:

资源简介:

这是一个精心策划的多模态智能研究资源合集,涵盖视觉语言模型、视觉语言动作模型、世界模型和具身人工智能等领域。该合集中收录了相关的研究论文、开源代码以及多个数据集和评估基准,旨在追踪从感知到决策的下一代智能体技术。

This is a carefully curated collection of multimodal intelligence research resources, encompassing fields such as Vision-Language Models (VLMs), Vision-Language-Action Models (VLAMs), World Models, and Embodied AI. The collection includes relevant research papers, open-source code, multiple datasets, and evaluation benchmarks, with the aim of tracking next-generation AI agent technologies ranging from perception to decision-making.

创建时间:
2026-04-26
原始信息汇总

🧠 仓库概览

Awesome Multimodal Intelligence 是一个专注于多模态智能研究的资料合集,覆盖视觉语言模型(VLM)、视觉语言动作模型(VLA)、世界模型及通用具身智能等前沿方向,收录论文、开源代码与数据集。仓库持续追踪从感知到决策的下一代智能体技术。

📌 最新动态

  • 2026年4月全面更新
    • VLM:新增 SigLIP/SigLIP2、Qwen2.5-VL、Qwen3-VL、InternVL3、Molmo、Emu3 等模型。
    • 新增专题:世界模型与具身 AI,同时补全了训练数据集与评估 Benchmark。

📂 内容索引

主题 描述 链接
🖼️ 视觉语言模型 (VLMs) 感知、理解与多模态推理 查看
🤖 视觉语言动作模型 (VLAs) 从感知到物理决策 查看
🌍 世界模型 (World Models) 环境建模与预测性规划 查看
🧠 具身智能 (Embodied AI) 感知、规划与执行的统一 查看

🗺️ 研究脉络

感知 → 理解 → 推理 → 规划 → 动作

  • VLMs 桥接视觉感知与语言理解,是智能体栈的感知基础。
  • VLAs 在 VLM 基础上引入动作输出,实现端到端感知-决策闭环。
  • World Models 对环境动态建模,为规划提供预测性先验。
  • Embodied AI 整合上述能力,面向真实世界通用智能体。

🔖 快速导航

视觉语言模型 (VLMs) 子分类

  • 对比预训练:CLIP, SigLIP, SigLIP2, EVA-CLIP, MetaCLIP
  • 生成式 VLM:Flamingo, BLIP-2, Emu3, Molmo
  • 指令微调 VLM:LLaVA 系列, InternVL3, Qwen3-VL, Qwen2.5-VL, Idefics3
  • 定位与检测:KOSMOS-2, Grounding DINO 1.5, SAM2
  • 高效 VLM:PaliGemma2, Phi-4-Vision, SmolVLM
  • 闭源 VLM:GPT-4o, Gemini 2.0, Claude 3.5
  • 训练数据集:LAION-5B, DataComp, MMC4, PixMo
  • 评估基准:MMMU-Pro, MMStar, MathVista, Video-MME

视觉语言动作模型 (VLAs) 子分类

  • 基础策略:ACT, Diffusion Policy, RT-1, SayCan
  • VLA 基座模型:RT-2, OpenVLA, π0, π0.5
  • 通用策略:Octo, CrossFormer
  • 操作、导航、灵巧控制
  • 强化学习与自我提升:OpenVLA-OFT, VLARL
  • 数据集与基准:Open X-Embodiment, LIBERO, CALVIN

世界模型 (World Models) 子分类

  • 基于模型的强化学习:DreamerV3, TD-MPC2, MuZero, IRIS
  • JEPA:I-JEPA, V-JEPA, V-JEPA2
  • 视频生成:Sora, Cosmos, Genie2, DIAMOND
  • 自动驾驶:GAIA-1, DriveDreamer, Vista, OccWorld
  • 机器人世界模型:UniSim, GR-1, UniPi, Pandora
  • 基准:VBench, EvalCrafter, nuPlan, CARLA

具身智能 (Embodied AI) 子分类

  • 感知:EmbodiedScan, ConceptFusion, AnyGrasp
  • 导航:NavGPT2, ViNT, NoMaD, CoW
  • 操作:RVT-2, Diffusion Policy, 3D Diffusion Policy
  • 任务规划:SayCan, Code-as-Policies, Voyager, ReKep
  • 通用智能体:Gato, OpenVLA, π0, Octo, LEO
  • 人形机器人:Figure02, HumanPlus, OmniH2O, DexVLA
  • 仿真器:Isaac Lab, ManiSkill3, Habitat 3.0, Genesis
  • 基准:CALVIN, MetaWorld, EmbodiedBench, BEHAVIOR-1K

🤝 贡献指南

欢迎提交 PR 补充新论文、数据集或工具。请遵循各子文档的表格格式。

  • Fork 本仓库
  • 在对应的 .md 文件中添加条目
  • 提交 Pull Request,并简要说明新增内容

📜 许可证

本项目采用 MIT 许可证 发布。

二维码
社区交流群
二维码
科研交流群
商业服务