从单模态到多模态
人类通过视觉、听觉、触觉多个通道感知世界。多模态大模型试图让 AI 也具备这种能力。
代表性模型
GPT-4V / GPT-4o
OpenAI 的原生多模态模型,支持图像理解、OCR、图表分析。
LLaVA
开源社区的代表作,通过视觉编码器 + 投影层 + LLM 的简洁架构实现多模态。
其他重要工作
Gemini、Claude 3、Qwen-VL、InternVL 等都在快速推进。
多模态是通向 AGI 的关键能力之一——语言只是智能的一个维度。
人类通过视觉、听觉、触觉多个通道感知世界。多模态大模型试图让 AI 也具备这种能力。
OpenAI 的原生多模态模型,支持图像理解、OCR、图表分析。
开源社区的代表作,通过视觉编码器 + 投影层 + LLM 的简洁架构实现多模态。
Gemini、Claude 3、Qwen-VL、InternVL 等都在快速推进。
多模态是通向 AGI 的关键能力之一——语言只是智能的一个维度。