AI2026年7月13日多模态大模型现状什么是多模态 多模态模型能够同时理解文本、图像、音频等多种输入。GPT4V 的发布标志着多模态 LLM 走向成熟。 主流架构 视觉编码器 + LLM 使用 ViT 等视觉编码器提取图像特征,通过投影层对齐到 LLM 的文本空间。LLaVA ...多模态LLM视觉语言