GPT 系列模型演进史
概述 从 2018 年到 2025 年,GPT 系列用七年时间从一篇不太被看好的论文,变成了改变世界的产品。理解它的演进过程,就是理解 LLM 技术的核心发展脉络。 mermaid timeline title GPT 系列演进 2018 ...
概述 从 2018 年到 2025 年,GPT 系列用七年时间从一篇不太被看好的论文,变成了改变世界的产品。理解它的演进过程,就是理解 LLM 技术的核心发展脉络。 mermaid timeline title GPT 系列演进 2018 ...
什么是 Prompt Engineering Prompt Engineering 是通过设计输入文本引导 LLM 产生期望输出的技术。随着模型能力增强,Prompt 技巧也在不断演进。 基础技巧 ZeroShot 直接提问,不提供示例。适...
推理为什么慢 LLM 推理是自回归的——每次生成一个 token,需要重新计算整个序列的注意力。这导致计算量随序列长度平方增长。 KV Cache 推理时将之前计算的 Key 和 Value 矩阵缓存起来,新 token 只需要计算增量部分...
什么是多模态 多模态模型能够同时理解文本、图像、音频等多种输入。GPT4V 的发布标志着多模态 LLM 走向成熟。 主流架构 视觉编码器 + LLM 使用 ViT 等视觉编码器提取图像特征,通过投影层对齐到 LLM 的文本空间。LLaVA ...
当前差距 在 MMLU、HumanEval 等标准基准上,开源模型正在快速追赶。但在复杂推理、指令遵循和安全性上,闭源模型仍有明显优势。 追赶路径 数据质量:开源模型的训练数据质量在提升,尤其是代码和数学数据 合成数据:GPT4 生成的高质...
什么是幻觉 幻觉是 LLM 生成不基于训练数据或上下文的虚构内容。这是当前 LLM 最受关注的问题之一。 幻觉的成因 训练数据的噪声和不一致性 最大似然训练目标不直接优化事实性 解码策略(如 topp sampling)引入的随机性 缓解方...