概述

从 2018 年到 2025 年,GPT 系列用七年时间从一篇不太被看好的论文,变成了改变世界的产品。理解它的演进过程,就是理解 LLM 技术的核心发展脉络。

timeline
    title GPT 系列演进
    2018 : GPT-1 : 1.17亿参数 : 预训练+微调范式
    2019 : GPT-2 : 15亿参数 : Zero-shot 能力初现
    2020 : GPT-3 : 1750亿参数 : Few-shot 学习
    2022 : InstructGPT : RLHF 对齐 : 遵循人类指令
    2023 : GPT-4 : 多模态+推理 : 图灵测试级别对话
    2024 : GPT-4o : 全模态实时交互

GPT-1 (2018):范式开创

论文全名《Improving Language Understanding by Generative Pre-Training》。当时 NLP 的主流是给每个任务标注大量数据再训练特定模型。GPT-1 的思路是:

  1. 预训练:在海量无标注文本上训练语言模型
  2. 微调:在具体任务的小数据集上适配

这个范式今天看来理所应当,但在 2018 年是全新的。1.17 亿参数,在 BooksCorpus(7000 本书)上训练。

GPT-2 (2019):Zero-Shot 的发现

OpenAI 的团队发现了一个意料之外的现象:模型大到 15 亿参数后,不需要任何微调,直接就能完成翻译、摘要、问答等任务。这就是 Zero-Shot Learning。

OpenAI 因为担心滥用,最初拒绝开源完整模型,引发了一场关于 AI 安全的公开讨论。这也奠定了 OpenAI 在 AI 安全方面的长期立场。

GPT-3 (2020):Few-Shot 时代

1750 亿参数,45TB 训练数据。GPT-3 最核心的发现是上下文学习 (In-Context Learning):在 prompt 中给几个示例,模型就能直接学会执行新任务,完全不需要梯度更新。

这催生了 Prompt Engineering 方法论 的兴起——人们开始研究如何通过巧妙的 prompt 设计来挖掘模型的能力边界。

InstructGPT (2022):让模型”听话”

GPT-3 虽然强大,但很难控制——你问它一个问题,它可能给你胡编乱造。InstructGPT 引入了 RLHF(Reinforcement Learning from Human Feedback):

  1. 收集人类标注的高质量回答,监督微调(SFT)
  2. 让标注者对比排序模型回答,训练奖励模型(RM)
  3. 用 PPO 强化学习优化策略

这个方法让模型学会了”遵循指令”。ChatGPT 就是基于 InstructGPT 打造的对话版本。

GPT-4 (2023):多模态和推理飞跃

GPT-4 被广泛认为是第一个通过”图灵测试”级别的对话模型。核心突破:

  • 多模态:能看图片,不只是文字
  • 推理能力:在律师资格考试、GRE 等标准化测试中超过 90% 人类考生
  • 128K 上下文:可以一次处理整本书

关于 GPT-4 的具体架构和参数量,OpenAI 没有公开——这是整个行业都在猜测的秘密。

GPT-4o (2024):全模态实时交互

“o” 代表 “omni”——全能。GPT-4o 的核心特性是实时多模态交互

  • 语音对话延迟降到 200-300 毫秒(接近人类对话速度)
  • 图片、视频、音频实时理解
  • 情绪感知和表达

GPT 系列每一次代际升级,底层架构始终建立在 Transformer 注意力机制详解 的基础上,推理优化也在不断进步,详见 LLM 推理优化