知识地图

横轴为模块、纵轴为难度层级,虚线为前置依赖(prerequisites)。悬停节点可看标题,点击进入知识点。

入门核心进阶前沿 ⌀ 虚线 = 前置依赖
入门核心进阶前沿 Transformer 全景:为什么是它(入门) kp-001 缩放点积注意力:QKV 与加权取信息(核心) kp-002 Multi-Head 注意力:多套问法并行(核心) kp-003 Self-Attention 与 Cross-Attention:自己看自己 vs 跨序列查询(核心) kp-004 注意力复杂度与长序列瓶颈:O(n²) 的重负(进阶) kp-005 Transformer Block:残差与 LayerNorm 的骨架(核心) kp-006 Pre-LN 与 Post-LN:归一化位置之争(进阶) kp-007 FFN 前馈网络:逐位加工与专家存储(核心) kp-008 位置编码:从正弦到 RoPE(核心) kp-009 架构分化:Encoder-Decoder、Encoder-only 与 Decoder-only(核心) kp-010 Tokenization 与 BPE:模型的词汇表(入门) kp-011 预训练目标:自回归语言建模(核心) kp-012 训练稳定性:初始化、warmup 与梯度裁剪(核心) kp-013 优化器与学习率调度:AdamW 的统治(进阶) kp-014 缩放定律:Kaplan 与 Chinchilla(前沿) kp-015 微调谱系:从全参到 LoRA(核心) kp-016 对齐三阶段:SFT、奖励模型与 RLHF(前沿) kp-017 BERT:双向编码器与完形填空(核心) kp-018 GPT 谱系:Decoder-only 的加冕之路(核心) kp-019 ViT:把图像变成句子(进阶) kp-020 高效注意力:FlashAttention 与线性注意力(进阶) kp-021 MoE 混合专家:参数大、计算省(前沿) kp-022 KV Cache 与推理优化:生成快的秘密(核心) kp-023 量化与压缩:把大模型塞进小显存(进阶) kp-024 长上下文技术:突破窗口的三条路(进阶) kp-025 分布式训练:把大模型摊到千卡上(进阶) kp-026 解码策略与推测解码:模型怎么"说(进阶) kp-027 注意力的表达力:它为什么有效(前沿) kp-028 上下文学习:prompt 里的"免费学习(前沿) kp-029 幻觉与安全:架构视角的审视(前沿) kp-030 Transformer vs Mamba/SSM:架构的下一步(前沿) kp-031 从零实现 Attention:100 行代码的 Transformer 心脏(核心) kp-032 历史脉络:从 Seq2Seq 到 Attention Is All You Need(入门) kp-033

# Transformer · 知识库总览

领域边界

核心问题:Transformer 是 2017 年《Attention Is All You Need》提出的纯注意力架构——抛弃循环与卷积、完全依赖自注意力建模序列依赖。本库回答:① 注意力如何计算与为什么有效(QKV/多头/复杂度);② 架构如何组装与训练(Block/位置编码/预训练目标);③ 家族如何分化(BERT/GPT/ViT/MoE);④ 推理如何工程化(KV Cache/量化/长上下文);⑤ 理论边界在哪里(表达力/ICL/替代架构)。

学完能做到什么:

  1. 从零手写 Scaled Dot-Product Attention 与完整 Transformer Block(kp-032 的 100 行实现)。
  2. 精确说出 GPT 与 BERT 的结构差异、RoPE 的作用机制、KV Cache 省了什么。
  3. 做出正确的工程决策:微调选 LoRA 还是全参、长上下文选什么方案、量化到什么精度。
  4. 读懂 LLM 论文(GPT-3/Llama/FlashAttention/Mamba)并判断技术归属哪一层。

前置知识(不属于本库范围):

阶段划分

阶段内容对应模块
入门全景图、注意力 QKV、分词01、02
核心多头/Block/LayerNorm/FFN/位置编码/架构分化、预训练、训练稳定性、微调02–03
进阶复杂度瓶颈、缩放定律、变体家族、KV Cache/量化/长上下文/分布式/解码01、03–05
前沿与脉络表达力理论、ICL、安全视角、Mamba 挑战、从零实现、历史05–06

最小可用路径:kp-001 → kp-002 → kp-003 → kp-006 → kp-008 → kp-009 → kp-011 → kp-012 → kp-016 → kp-023 → kp-032。走完即建立"注意力→Block→位置编码→分词→预训练→微调→推理→实现"的完整骨架,足以读懂主流 LLM 论文与上手工程。

01-注意力与基础

02-架构解剖

03-训练与微调

04-代表变体

05-推理与工程

06-理论实践与脉络