什么是多模态
多模态模型能够同时理解文本、图像、音频等多种输入。GPT-4V 的发布标志着多模态 LLM 走向成熟。
主流架构
视觉编码器 + LLM
使用 ViT 等视觉编码器提取图像特征,通过投影层对齐到 LLM 的文本空间。LLaVA 就是这种架构的代表。
graph LR
I[图像] --> V[ViT 编码器]
V --> P[投影层]
T[文本] --> LLM
P --> LLM
LLM --> O[输出]
原生多模态
Gemini 和 GPT-4o 在训练阶段就融合了多模态数据,而不是后期拼接。
当前多模态模型的文本能力仍然基于 Transformer 注意力机制详解 介绍的架构。