- Transformer
- 2017 年提出的纯注意力架构——抛弃循环与卷积、自注意力建模序列依赖。
- 自注意力(Self-Attention)
- Q/K/V 来自同一序列的注意力——token 间信息混合。
- 缩放点积注意力
- softmax(QKᵀ/√d)V——按内容相关性加权取信息。
- Query/Key/Value
- 查询向量 / 可检索标签 / 实际内容——注意力的三投影。
- 因果掩码
- 将未来位置注意力分数置 −∞ 的掩码——自回归生成的必备件。
- Multi-Head
- Q/K/V 切分到多子空间独立注意力再融合——多套问法并行。
- Self vs Cross
- QKV 同源 / Q 与 KV 异源——序列内混合 vs 跨序列查询。
- O(n²) 瓶颈
- 注意力计算与显存随序列长度平方增长。
- Transformer Block
- 注意力+FFN+残差+LayerNorm 的堆叠单元。
- 残差连接
- x + f(x)——信息高速路与增量学习;深度可训的开关。
- LayerNorm
- 激活的均值方差归一化——稳定深层训练。
- Pre-LN / Post-LN
- LN 在子层前(鲁棒)/ 后(质量略优需warmup)。
- RMSNorm
- 去均值化的 LN 变体(Llama 系标配)。
- FFN
- 逐 token 两层 MLP(升维4倍+激活+降维)——知识存储器。
- SwiGLU
- 门控线性单元激活——现代 FFN 的标准结构。
- 位置编码
- 给无序注意力注入位置信息(正弦/可学习/RoPE)。
- RoPE(旋转位置编码)
- Q/K 按位置旋转、点积只依赖相对位置——现代主流。
- 位置插值
- 位置 m→m/L 压缩进训练范围——长上下文扩展技术。
- Encoder-only / Decoder-only / Encoder-Decoder
- 双向理解 / 因果生成 / 双塔翻译三种架构形态。
- BPE
- 字节对编码——迭代合并高频对构建子词词表的分词算法。
- 自回归语言建模
- 因果掩码下逐位置预测下一 token 的预训练目标。
- 教师强制
- 训练时条件用真实前缀——全位置并行损失的来源。
- AdamW
- 解耦权重衰减的 Adam——Transformer 训练默认优化器。
- warmup
- 学习率从零线性升至峰值的预热阶段。
- 梯度裁剪
- 梯度范数超限按比例缩回——训练稳定的保险丝。
- 缩放定律
- 损失随参数/数据/算力幂律下降;Chinchilla 最优比 D≈20N。
- 涌现
- 能力随规模跨阈值跃升的现象(真相变 vs 度量假象之辩)。
- SFT
- 监督微调——指令-回答对的监督训练(对齐第一阶段)。
- 奖励模型(RM)
- 从人类排序训练的偏好打分器(Bradley-Terry)。
- RLHF
- 以 RM 为奖励、KL 惩罚锚定 SFT 的强化学习对齐。
- DPO
- 偏好对的闭式监督优化——免 RM 与 PPO 的对齐简化。
- BERT
- Encoder-only 双向 Transformer;MLM 完形填空预训练。
- GPT
- Decoder-only 自回归 Transformer 谱系(GPT-1→4)。
- ViT
- 图像切 patch 当 token 的视觉 Transformer。
- FlashAttention
- IO 感知分块计算——精确但显存 O(n) 的注意力加速。
- 线性注意力
- 核函数消去 n×n 项的 O(n) 近似注意力。
- MoE(混合专家)
- 路由器选择 Top-k 专家 FFN——参数大计算稀疏。
- KV Cache
- 缓存历史 K/V 避免重算——自回归推理的基本优化。
- GQA/MQA
- 多 Q 头共享 KV 头——推理缓存压缩。
- PagedAttention
- KV 显存的分页管理(vLLM)——吞吐优化。
- 量化
- fp16→INT8/INT4 的权重压缩(GPTQ/AWQ/QLoRA)。
- 长上下文
- 超训练长度的上下文扩展(插值/滑窗/检索增强)。
- Lost in the Middle
- 长上下文中部信息利用率骤降的现象。
- 数据并行/张量并行/流水线并行
- 切数据 / 切层内矩阵 / 切层的分布式三件套。
- ZeRO
- 优化器状态/梯度/权重的分片存储(省显存的并行策略)。
- temperature
- softmax 前的 logits 缩放——探索与利用的旋钮。
- top-p(nucleus)
- 只在累积概率前 p 的候选中采样。
- 推测解码
- 小模型猜大模型验的并行解码加速——分布严格不变。
- 幻觉
- 流畅但事实错误/上下文矛盾的生成——训练目标的副作用。
- 提示注入
- 恶意指令藏在输入中劫持模型行为的攻击。
- ICL(上下文学习)
- prompt 中示例的无梯度学习——前向激活内的"学习"。
- induction head
- 两层注意力组合实现"模式复制"的电路——ICL 机制候选。
- Mamba/SSM
- 选择性状态空间模型——O(n) 训练、O(1) 推理的架构挑战者。
- 混合架构
- SSM 层+少量注意力层的组合(Jamba 类)。
- 注意力图
- 注意力权重矩阵的可视化——token 间的信息流图。
- 残差流
- 残差连接构成的信息主干道(可解释性视角)。
- 思维链(CoT)
- 生成中间推理步骤以动态加深计算。