概述
从 2018 年到 2025 年,GPT 系列用七年时间从一篇不太被看好的论文,变成了改变世界的产品。理解它的演进过程,就是理解 LLM 技术的核心发展脉络。
timeline
title GPT 系列演进
2018 : GPT-1 : 1.17亿参数 : 预训练+微调范式
2019 : GPT-2 : 15亿参数 : Zero-shot 能力初现
2020 : GPT-3 : 1750亿参数 : Few-shot 学习
2022 : InstructGPT : RLHF 对齐 : 遵循人类指令
2023 : GPT-4 : 多模态+推理 : 图灵测试级别对话
2024 : GPT-4o : 全模态实时交互
GPT-1 (2018):范式开创
论文全名《Improving Language Understanding by Generative Pre-Training》。当时 NLP 的主流是给每个任务标注大量数据再训练特定模型。GPT-1 的思路是:
- 预训练:在海量无标注文本上训练语言模型
- 微调:在具体任务的小数据集上适配
这个范式今天看来理所应当,但在 2018 年是全新的。1.17 亿参数,在 BooksCorpus(7000 本书)上训练。
GPT-2 (2019):Zero-Shot 的发现
OpenAI 的团队发现了一个意料之外的现象:模型大到 15 亿参数后,不需要任何微调,直接就能完成翻译、摘要、问答等任务。这就是 Zero-Shot Learning。
OpenAI 因为担心滥用,最初拒绝开源完整模型,引发了一场关于 AI 安全的公开讨论。这也奠定了 OpenAI 在 AI 安全方面的长期立场。
GPT-3 (2020):Few-Shot 时代
1750 亿参数,45TB 训练数据。GPT-3 最核心的发现是上下文学习 (In-Context Learning):在 prompt 中给几个示例,模型就能直接学会执行新任务,完全不需要梯度更新。
这催生了 Prompt Engineering 方法论 的兴起——人们开始研究如何通过巧妙的 prompt 设计来挖掘模型的能力边界。
InstructGPT (2022):让模型”听话”
GPT-3 虽然强大,但很难控制——你问它一个问题,它可能给你胡编乱造。InstructGPT 引入了 RLHF(Reinforcement Learning from Human Feedback):
- 收集人类标注的高质量回答,监督微调(SFT)
- 让标注者对比排序模型回答,训练奖励模型(RM)
- 用 PPO 强化学习优化策略
这个方法让模型学会了”遵循指令”。ChatGPT 就是基于 InstructGPT 打造的对话版本。
GPT-4 (2023):多模态和推理飞跃
GPT-4 被广泛认为是第一个通过”图灵测试”级别的对话模型。核心突破:
- 多模态:能看图片,不只是文字
- 推理能力:在律师资格考试、GRE 等标准化测试中超过 90% 人类考生
- 128K 上下文:可以一次处理整本书
关于 GPT-4 的具体架构和参数量,OpenAI 没有公开——这是整个行业都在猜测的秘密。
GPT-4o (2024):全模态实时交互
“o” 代表 “omni”——全能。GPT-4o 的核心特性是实时多模态交互:
- 语音对话延迟降到 200-300 毫秒(接近人类对话速度)
- 图片、视频、音频实时理解
- 情绪感知和表达
GPT 系列每一次代际升级,底层架构始终建立在 Transformer 注意力机制详解 的基础上,推理优化也在不断进步,详见 LLM 推理优化。