Awesome_Multimodel_LLM
收藏资源简介:
Awesome_Multimodel_LLM 是一个精心策划的资源集合,专注于多模态大语言模型(MLLM)。它涵盖多个领域的相关数据集,包括预训练对齐数据集、多模态指令调优数据集、上下文学习数据集、多模态思维链数据集以及RLHF数据集等。该合集旨在为研究人员和开发者提供全面的数据集索引,以支持多模态大语言模型的研究和应用开发。
Awesome_Multimodel_LLM is a curated collection of resources focused on Multimodal Large Language Models (MLLMs). It covers relevant datasets across multiple domains, including pre-training alignment datasets, multimodal instruction tuning datasets, in-context learning datasets, multimodal chain-of-thought datasets, RLHF datasets, and more. This collection aims to provide researchers and developers with a comprehensive dataset index to support the research and application development of multimodal large language models.
Awesome-Multimodal-LLM 数据集详情
核心定位
这是一个精心整理的多模态大语言模型(MLLM)资源集合,涵盖数据集、多模态指令微调技术、多模态上下文学习方法、多模态思维链方法、基于大语言模型的视觉推理、基础模型等内容,并持续更新以追踪该领域前沿进展。
数据集分类
该数据集仓库将资源划分为以下几大类:
Awesome Papers(论文资源)
- Multimodal Instruction Tuning(多模态指令微调)
- Multimodal In-Context Learning(多模态上下文学习)
- Multimodal Chain-of-Thought(多模态思维链)
- LLM-Aided Visual Reasoning(大语言模型辅助视觉推理)
- Foundation Models(基础模型)
- Others(其他)
Awesome Datasets(数据集资源)
- Datasets of Pre-Training for Alignment(对齐预训练数据集)
- Datasets of Multimodal Instruction Tuning(多模态指令微调数据集)
- Datasets of In-Context Learning(上下文学习数据集)
- Datasets of Multimodal Chain-of-Thought(多模态思维链数据集)
- RLHF dataset(基于人类反馈的强化学习数据集)
评估相关资源
知识与能力评估
- Question Answering(问答)
- Knowledge Completion(知识补全)
- Reasoning(推理):含常识推理、逻辑推理、多跳推理、数学推理
- Tool Learning(工具学习)
对齐评估
- Ethics and Morality(伦理道德)
- Bias(偏见)
- Toxicity(毒性)
- Truthfulness(真实性)
- General Alignment Evaluation(通用对齐评估)
安全评估
- Robustness Evaluation(鲁棒性评估)
- Risk Evaluation(风险评估):含评估LLM行为、评估LLM作为智能体
专业领域评估
- Biology and Medicine(生物医学)
- Education(教育)
- Legislation(法律)
- Computer Science(计算机科学)
- Finance(金融)
评估组织
- Benchmarks for NLU and NLG(NLU和NLG基准)
- Benchmarks for Knowledge and Reasoning(知识与推理基准)
- Benchmark for Holistic Evaluation(全面评估基准)
- LLM Leaderboards(大语言模型排行榜)
代表性论文示例
多模态指令微调(部分)
| 论文名称 | 时间 |
|---|---|
| Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models | 2023-06 |
| MIMIC-IT: Multi-Modal In-Context Instruction Tuning | 2023-06 |
| M³IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning | 2023-06 |
| Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding | 2023-06 |
| LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day | 2023-06 |
| GPT4Tools: Teaching Large Language Model to Use Tools via Self-instruction | 2023-05 |
| PandaGPT: One Model To Instruction-Follow Them All | 2023-05 |
| InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning | 2023-05 |
| VideoChat: Chat-Centric Video Understanding | 2023-05 |
| LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model | 2023-05 |
其他特色资源
- LLM Learning MindMap:大语言模型学习思维导图
- Trending LLM Projects:热门LLM项目,如Mixtral 8x7B、Ollama、phi-2等
- Practical Guides for Prompting:提示工程实践指南
- Memory相关研究:涵盖Transformer长度限制提升、记忆压缩、记忆检索等方向的论文资源




