LLaVA代表了一种新颖的端到端训练的大规模多模式模型,该模型结合了视觉编码器和Vicuna,以实现一般的视觉和语言理解,从而实现了令人印象深刻的聊天功能,该功能以GPT-4的精神模仿了多模式,并在科学QA中设置了新的最先进的准确性。