知识地图
横轴为模块、纵轴为难度层级,虚线为前置依赖(prerequisites)。悬停节点可看标题,点击进入知识点。
入门核心进阶前沿
⌀ 虚线 = 前置依赖
# Transformer · 知识库总览
领域边界
核心问题:Transformer 是 2017 年《Attention Is All You Need》提出的纯注意力架构——抛弃循环与卷积、完全依赖自注意力建模序列依赖。本库回答:① 注意力如何计算与为什么有效(QKV/多头/复杂度);② 架构如何组装与训练(Block/位置编码/预训练目标);③ 家族如何分化(BERT/GPT/ViT/MoE);④ 推理如何工程化(KV Cache/量化/长上下文);⑤ 理论边界在哪里(表达力/ICL/替代架构)。
学完能做到什么:
- 从零手写 Scaled Dot-Product Attention 与完整 Transformer Block(kp-032 的 100 行实现)。
- 精确说出 GPT 与 BERT 的结构差异、RoPE 的作用机制、KV Cache 省了什么。
- 做出正确的工程决策:微调选 LoRA 还是全参、长上下文选什么方案、量化到什么精度。
- 读懂 LLM 论文(GPT-3/Llama/FlashAttention/Mamba)并判断技术归属哪一层。
前置知识(不属于本库范围):
- 深度学习基础:神经网络、反向传播、softmax、交叉熵(本库 kp-006/008 会就地复习必要部分)。
- 线性代数:矩阵乘法、点积(kp-002 自含解释)。
- Python/PyTorch 基础(仅 kp-032 需要)。
阶段划分
| 阶段 | 内容 | 对应模块 |
|---|---|---|
| 入门 | 全景图、注意力 QKV、分词 | 01、02 |
| 核心 | 多头/Block/LayerNorm/FFN/位置编码/架构分化、预训练、训练稳定性、微调 | 02–03 |
| 进阶 | 复杂度瓶颈、缩放定律、变体家族、KV Cache/量化/长上下文/分布式/解码 | 01、03–05 |
| 前沿与脉络 | 表达力理论、ICL、安全视角、Mamba 挑战、从零实现、历史 | 05–06 |
最小可用路径:kp-001 → kp-002 → kp-003 → kp-006 → kp-008 → kp-009 → kp-011 → kp-012 → kp-016 → kp-023 → kp-032。走完即建立"注意力→Block→位置编码→分词→预训练→微调→推理→实现"的完整骨架,足以读懂主流 LLM 论文与上手工程。
01-注意力与基础
02-架构解剖
03-训练与微调
04-代表变体
05-推理与工程
06-理论实践与脉络
- kp-028 注意力的表达力:它为什么有效 前置:kp-002、kp-006
- kp-029 上下文学习:prompt 里的"免费学习 前置:kp-002、kp-015
- kp-030 幻觉与安全:架构视角的审视 前置:kp-002、kp-012
- kp-031 Transformer vs Mamba/SSM:架构的下一步 前置:kp-005、kp-021
- kp-032 从零实现 Attention:100 行代码的 Transformer 心脏 前置:kp-002、kp-003、kp-006
- kp-033 历史脉络:从 Seq2Seq 到 Attention Is All You Need 前置:kp-001