Transformer 全景:为什么是它

01-注意力与基础 入门 约 15 分钟 #全景#自注意力#并行#长程依赖 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),历史脉络建议对照 kp-033 与原论文(Vaswani et al. 2017)复核。

一句话定义

Transformer 是 2017 年提出的、完全依赖自注意力建模序列依赖的神经网络架构——抛弃 RNN 的顺序计算与 CNN 的局部窗口,任何两个位置都能一步直连,且整个序列可并行计算。

为什么重要

它是当代 AI 的默认架构:GPT/Claude/Llama 等大语言模型、BERT、ViT(视觉)、Whisper(语音)、AlphaFold 的模块——全部是 Transformer 或其变体。"Attention Is All You Need"的宣言在 7 年内基本兑现。理解它 = 理解大模型时代的技术底座;它胜出的三个结构性原因(长程依赖一步直达、训练全并行可扩展、缩放定律友好)将在本库反复回响。

前置知识

神经网络基本概念(矩阵乘法、softmax);RNN/CNN 的存在性认知(对比用,不需深入)。

核心概念

  • 自注意力(Self-Attention):序列中每个位置直接"查询"所有其他位置、按相关性加权取信息——一步建立任意距离的依赖(细节 kp-002)。
  • 三大架构胜因:

1. 长程依赖一步直达:RNN 需逐步传递(信息衰减),注意力 O(1) 跳数; 2. 训练全并行:RNN 必须按时间步串行,Transformer 一次算完整序列——GPU 的并行能力被吃满,"可扩展性"成为架构属性; 3. 缩放友好:结构简单均匀(堆 Block 即可),参数/数据放大即性能提升(缩放定律 kp-015)。

  • 代价:注意力计算/内存 O(n²)(序列长度平方,kp-005 的瓶颈与变体动机);无天然位置概念(需位置编码 kp-009)。
  • 整体结构预告:Token 化(kp-011)→ N 层 Block 堆叠(注意力+FFN+残差+归一化,kp-006/007/008)→ 输出头;位置信息由位置编码注入(kp-009)。

原理与机制

RNN 的两个死穴如何被 Transformer 精准解决:① 长程依赖——RNN 的信息要穿过 n 步隐状态传递,梯度消失/信息稀释(LSTM 的门控只是止血);自注意力让位置 i 直接对位置 j 做一次点积,路径长度 O(1)。② 顺序计算——RNN 的 t 步依赖 t−1 步(训练无法并行),Transformer 的注意力对全序列是矩阵乘法(一次 GEMM),推理时才因自回归退化为串行。

为什么"简单均匀"是超级力量:RNN/LSTM/门控/卷积混合着不同的归纳偏置,缩放时各组件的收益不均匀;Transformer 把序列建模简化为"同一 Block 的重复堆叠"——参数量与深度可预测地转化为能力(缩放定律 kp-015 的结构前提),工程上也只需优化一种 Block。

"Is All You Need"的真正含义:论文证明在机器翻译上,注意力+FFN 足够——不需要循环、不需要卷积。这是"减法创新":删除组件而性能不降反升,宣告了旧组件的冗余。

图示

Token 化 → [Block × N] → 输出头
Block = 注意力(混合信息) + FFN(逐位加工)
      + 残差(信息高速路) + LayerNorm(稳定)

对比:
RNN:   h₁→h₂→h₃→⋯→hₙ  串行, 长程衰减
CNN:   局部窗口×L层     感受野线性增长
Att:   任意两位置一步直连, 全序列并行

直观类比

RNN 像"传话游戏":信息沿人链逐个耳语,传到队尾早已失真;Transformer 像"圆桌会议":每个人都能直接听到其他所有人发言(注意力加权),一轮讨论(一层)就完成全局信息交换,且所有人同时发言(并行)。

实例或案例

  • 机器翻译(2017 原论文任务):以远低于当时 SOTA 的训练成本刷新 BLEU。
  • GPT 系:Decoder-only Transformer + 自回归目标 → 通用文本能力(kp-019)。
  • ViT:把图像切块当"词"喂 Transformer → 视觉任务(kp-020)——架构的跨模态通用性。

常见误区

  • 误区一:"Transformer 理解语言"。它学的是 token 序列的统计结构;"理解"是能力隐喻不是机制描述——机制层面只有矩阵乘法与 softmax。
  • 误区二:"注意力=人类注意力"。只是同名隐喻:机器注意力是可微分的加权平均,没有"选择性聚焦"的主观机制。
  • 误区三:"Transformer 是终极架构"。它在长上下文 O(n²)、串行推理(自回归)上有结构性短板——Mamba 等替代架构正在挑战(kp-031)。

与其他知识点的关系

  • kp-002/003:核心计算单元。
  • kp-006~009:架构解剖四件套。
  • kp-015/033:缩放红利与历史位置。

自测题

  1. Transformer 相对 RNN 的两大结构性优势?

答:任意位置一步直连(长程依赖 O(1))+ 训练全并行(利用 GPU 扩展)。

  1. Transformer 的两大代价?

答:注意力 O(n²) 计算/内存(长序列瓶颈 kp-005);无位置概念需位置编码(kp-009)。

  1. 为什么说"简单均匀的 Block 堆叠"是缩放定律的结构前提?

答:同构组件使参数/数据的增长可预测地转化为能力提升——异构组件的混合会破坏这种可预测性。

延伸阅读

  • Vaswani 等, "Attention Is All You Need"(NeurIPS 2017,原论文)。
  • 3Blue1Brown《Transformer 神经网络》系列视频(最佳动画讲解)。
  • Jay Alammar, "The Illustrated Transformer"(图解经典博客)。