从单模态到多模态

人类通过视觉、听觉、触觉多个通道感知世界。多模态大模型试图让 AI 也具备这种能力。

代表性模型

GPT-4V / GPT-4o

OpenAI 的原生多模态模型,支持图像理解、OCR、图表分析。

LLaVA

开源社区的代表作,通过视觉编码器 + 投影层 + LLM 的简洁架构实现多模态。

其他重要工作

Gemini、Claude 3、Qwen-VL、InternVL 等都在快速推进。

多模态是通向 AGI 的关键能力之一——语言只是智能的一个维度。