GPT 谱系:Decoder-only 的加冕之路

04-代表变体 核心 约 20 分钟 #GPT#Decoder-only#涌现#ICL 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),各代参数与能力描述建议对照 GPT-1/2/3/4 论文与 OpenAI 官方发布复核。

一句话定义

GPT 谱系(2018→今)坚持 Decoder-only + 自回归预训练的"笨办法",沿 GPT-1(117M,有监督微调)→ GPT-2(1.5B,零样本多任务)→ GPT-3(175B,少样本 ICL)→ ChatGPT/GPT-4(对齐+多模态+推理)一路加码——用规模把"预测下一词"的模型推成了通用任务平台,宣告 Decoder-only 路线的胜利。

为什么重要

GPT 谱系是"缩放换能力"的完整实证链:每一代都在验证 kp-015 的定律与"涌现"的边界。GPT-3 的 ICL(kp-029)改写了 NLP 的方法论(prompt 替代微调);ChatGPT 把对齐(kp-017)变成大众体验。读懂 GPT 史,就是读懂 LLM 时代的方法论变迁史。

前置知识

kp-010(Decoder-only 架构)、kp-012(自回归目标)。

核心概念

  • GPT-1(2018):12 层 117M;"生成式预训练+判别式微调"——证明 Transformer 解码器可以做无监督预训练再微调(与 BERT 同期,路线分岔的起点 kp-010)。
  • GPT-2(2019):15 亿参数、WebText 数据、"语言模型是无监督多任务学习者"——零样本(无微调)在多任务上已有雏形;一度因"太危险"分阶段发布(生成模型的伦理讨论起点)。
  • GPT-3(2020):1750 亿参数、300B token;少样本 ICL(prompt 里给几个例子即完成新任务)——不需要梯度更新即可"学会",方法论革命(kp-029 的正文名场面)。
  • ChatGPT(2022)/GPT-4(2023):RLHF 对齐(kp-017)+ RLHF 后的对话能力 → 大众化;GPT-4 加入多模态与更强推理,技术细节保密(开放与闭源的生态分叉)。
  • 解码策略与产品化:temperature/top-p(kp-027)、系统提示、工具调用——"模型"到"产品"之间的工程层(每层都在 kp-027/030 有专论)。

原理与机制

为什么"加规模"能产生质变(GPT 谱系的核心赌注):kp-015 缩放定律保证 loss 平滑下降;而 ICL/推理等能力的"涌现"曲线显示跨阈值跃升——GPT 系的成功本质是赌对了"缩放会带来新能力"(当时并无定理保证)。这一赌注的验证,反过来定义了"大模型时代"的方法论:先堆规模,再研究为什么。

零样本→少样本→对齐的能力调用方式演进:GPT-2 零样本(prompt 直接问);GPT-3 few-shot(prompt 里放例子——上下文即程序 kp-029);ChatGPT(对话式指令+对齐行为);GPT-4+(工具/多模态/长思维链)。每一步都是"同一自回归模型"在不同使用方式下的能力释放——模型不变,"调用界面"进化。

闭源与开源的分岔:GPT-4 起不再公开参数/数据/权重——与 Llama 开源系(kp-026 工程)形成双生态;学术研究转向开源模型+推理服务 API 的混合模式(kp-031 的生态格局)。

图示

GPT-1'18: 117M 预训练+微调 (路线分岔起点)
GPT-2'19: 1.5B 零样本多任务 ("无监督多任务学习者")
GPT-3'20: 175B few-shot ICL (方法论革命 kp-029)
ChatGPT'22: RLHF对齐 → 大众化助手 (kp-017)
GPT-4'23: 多模态+推理 ; 闭源生态分叉
主线: 同一目标(自回归) × 规模与调用方式演进

直观类比

GPT 谱系像"同一个学生的成长记录":小学(GPT-1)学会了造句;中学(GPT-2)能默写百科;大学(GPT-3)看几道例题就会举一反三(ICL);毕业后(ChatGPT)学会了"好好说话"(对齐);再进修(GPT-4)带了眼镜会看图——学历(规模)与教养(对齐)叠加出完整人格。

实例或案例

  • GPT-3 论文的 ICL 实验:few-shot 性能随参数量的幂律提升曲线——"ICL 是涌现能力"的原始证据(kp-029)。
  • ChatGPT 的用户破圈:两个月一亿用户——对齐(kp-017)把技术变成产品的历史性时刻。
  • GPT-4 的考试表现:律师/医师资格考试人类前percentile——"考试型能力"的规模化(也引发考试有效性的讨论 kp-031)。

常见误区

  • 误区一:"GPT 是递归缩写"。GPT=Generative Pre-trained Transformer——"预训练的生成式 Transformer",是命名不是递归梗。
  • 误区二:"GPT-4 参数量公开为 1.8T"。官方从未公布;流出的 MoE 猜测未经证实——对闭源模型的"参数传说"保持怀疑(kp-022 MoE 背景知识辅助判断)。
  • 误区三:"GPT 系列的进步全靠架构创新"。架构自 GPT-2 以来变化保守(加 RMSNorm/RoPE/GQA 等组件级改进);进步主要来自规模、数据与对齐配方——"架构稳定+配方进化"是 GPT 系的真相。

与其他知识点的关系

  • kp-010:架构路线的胜者。
  • kp-015/029:缩放定律与 ICL 的实证载体。
  • kp-017:对齐阶段的产品化落点。

自测题

  1. GPT-3 带来的方法论变革是什么?

答:少样本 ICL——任务说明与示例写进 prompt 即可,无需梯度微调(kp-029);NLP 从"一任务一微调"转向"一个模型+prompt"。

  1. ChatGPT 的关键改进属于哪个阶段?

答:对齐阶段(RLHF,kp-017)——基座能力早已存在,对齐释放了"助手"形态。

  1. GPT-1 与 BERT 同年发布,路线分岔在哪?

答:GPT-1 选 Decoder-only+自回归(生成路线),BERT 选 Encoder-only+MLM(理解路线)——kp-010 五年战争的开幕。

延伸阅读

  • Radford 等 GPT-1/2 论文;Brown 等, "Language Models are Few-Shot Learners"(NeurIPS 2020)。
  • OpenAI GPT-4 Technical Report(2023)。
  • 《The Scaling Era》类综述(Dwarkesh/Sequoia 访谈汇编,历史视角)。