综述2026年6月19日多模态大模型综述从单模态到多模态 人类通过视觉、听觉、触觉多个通道感知世界。多模态大模型试图让 AI 也具备这种能力。 代表性模型 GPT4V / GPT4o OpenAI 的原生多模态模型,支持图像理解、OCR、图表分析。 LLaVA 开源社区的代表作,...多模态综述视觉语言