预训练目标:自回归语言建模

03-训练与微调 核心 约 20 分钟 #预训练#自回归#next-token#交叉熵 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),目标函数与 MLM 对比建议对照 GPT-2/BERT 原论文复核。

一句话定义

GPT 系的预训练目标是自回归语言建模:因果掩码下逐位置预测下一个 token,损失=全序列交叉熵的平均——"$P(x_t|x_{<t})$ 的连乘最大化"。一个目标、海量文本、每个位置都是监督信号——预训练的全部秘密浓缩在这句话里。

为什么重要

"预测下一个词"被证明是涌现通用智能的惊人有效目标:为预测准,模型被迫学会语法、事实、推理、甚至"预测人类会怎么想"(角色建模)。理解该目标的形式与副作用(只会续写、需要引导),就理解了为什么需要 SFT/RLHF(kp-017)与 ICL(kp-029)。

前置知识

kp-002(因果掩码)、kp-010(Decoder-only)、交叉熵概念。

核心概念

  • 目标函数:给定序列 x₁…xₙ,最大化 $\log P(x)=\sum_t\log P(x_t|x_{<t};\theta)$;等价最小化平均交叉熵(每 token 的 nats/bits 损失——模型报告的 "loss" 就是它)。
  • 教师强制(teacher forcing):训练时条件用真实前缀(非模型自己的生成)——并行计算全位置损失(一次前向全序列),这是 kp-001 训练并行优势的目标函数面。
  • 监督密度:n 个 token 提供 n 个预测任务(vs BERT 的 MLM 只遮 15%)——同算力下信号密度是 Decoder-only 胜出(kp-010)的要素之一。
  • 数据权重:现代预训练混合网页/代码/书籍/论文,并按质量与领域配比加权(数据配比本身就是研究主题——"数据混合学");多 epoch 与去重权衡。
  • MLM 对照(BERT kp-018):遮 15% 让模型完形填空——双向上下文但监督稀疏+预训练-微调落差([MASK] 真实世界不存在)——GPT 路线的对照说明。

原理与机制

为什么 next-token 预测能涌现通用能力:要准确预测任意文本的下一词,必须隐式掌握:语法(词形)、事实(首都是…)、风格(文体切换)、逻辑(数学题下一步)、心理(对话对象的意图)——预测是压缩,压缩需要理解(Kolmogorov 压缩视角)。"涌现"(大模型突然多出的能力)被假设为这一压缩压力在规模下的相变(kp-015/029)。

为什么自回归分解天然适配生成:链式法则 $P(x)=\prod_tP(x_t|x_{<t})$——训练与推理的目标一致(都按前缀条件);推理时模型"吃自己输出"(自回归生成),教师强制的训练与自由生成的偏差即"exposure bias"(训练-推理错配,工程上影响可控但理论未完全解决)。

损失数值的解读纪律:loss 3.0→2.5 的意义取决于词表与数据(不同 tokenizer 不可直接比较);per-token bits 或换算 perplexity 才可跨模型粗比(且数据分布必须相近)——kp-015 缩放定律的坐标语言。

图示

输入:  [BOS] 我 爱 北 京
目标:   我  爱  北  京 天安门   (右移一位)
损失:  L = (1/n)Σₜ CrossEntropy(logitsₜ, xₜ₊₁)
       = −(1/n)Σₜ log P(xₜ₊₁ | x_{≤t})
教师强制: 条件=真实前缀 → 全位置并行算损失
监督密度: n个token = n个任务 (vs MLM 15%)

直观类比

自回归预训练像"海量填空练习":每一句的每个位置都是一道填空题,答案就是原文——不用人工标注,互联网本身就是题库。模型为把全互联网"填"对,被迫学会写作的一切技巧。

实例或案例

  • GPT-2/3 的 Scaling:同一目标函数下参数×1000 → 从补全到"对话、翻译、代码"的零样本涌现——目标未变、能力相变(kp-015/029)。
  • 代码混入的收益:代码数据的预训练提升推理与结构化能力(配比实验)——"目标相同、数据配方改变能力"的证据。
  • 评测对齐:语言建模 loss 与下游 benchmark 的相关性研究——loss 是代理指标不是终极指标(评测学 kp-031 边缘)。

常见误区

  • 误区一:"预训练后模型'知道'自己在对话"。它只学过文本的续写分布;对话能力是数据形态(对话语料)+ 后训练(kp-017)塑形的。
  • 误区二:"loss 降=能力升(处处)"。不同数据分布的 loss 不可比;且记忆化(背诵)也会降 loss——需下游评测闭环(kp-033 批评)。
  • 误区三:"因果掩码损失信息"。对生成任务这是必要约束;理解类任务若需要双向,可用 Enc-only 或让 prompt 承载(kp-010)。

与其他知识点的关系

  • kp-002:因果掩码的实现处。
  • kp-018:自回归交叉熵=负对数似然(MLE 的序列版)。
  • kp-017/029:预训练之后的两级能力调用(对齐与 ICL)。

自测题

  1. 写出自回归预训练的目标函数。

答:$\max_\theta\sum_t\log P(x_{t+1}|x_{\le t};\theta)$,等价最小化平均 token 交叉熵。

  1. 教师强制是什么?带来什么并行性?

答:训练条件用真实前缀而非自身生成——全位置损失可一次并行计算(推理时才串行)。

  1. 为什么说"预测下一词是压缩,压缩需要理解"?

答:准确预测需隐式掌握生成文本的全部规律(语法/事实/逻辑)——最小化描述长度即最大化对数据结构的把握(压缩-理解等价论)。

延伸阅读

  • Radford 等, GPT-2 论文《Language Models are Unsupervised Multitask Learners》(2019)。
  • 《Chinchilla》论文(Hoffmann 2022,目标与算力的定量关系 kp-015)。
  • kp-033 历史篇(GPT 路线的确立过程)。