什么是多模态

多模态模型能够同时理解文本、图像、音频等多种输入。GPT-4V 的发布标志着多模态 LLM 走向成熟。

主流架构

视觉编码器 + LLM

使用 ViT 等视觉编码器提取图像特征,通过投影层对齐到 LLM 的文本空间。LLaVA 就是这种架构的代表。

graph LR
    I[图像] --> V[ViT 编码器]
    V --> P[投影层]
    T[文本] --> LLM
    P --> LLM
    LLM --> O[输出]

原生多模态

Gemini 和 GPT-4o 在训练阶段就融合了多模态数据,而不是后期拼接。

当前多模态模型的文本能力仍然基于 Transformer 注意力机制详解 介绍的架构。