术语表 (57 条)

Transformer
2017 年提出的纯注意力架构——抛弃循环与卷积、自注意力建模序列依赖。
自注意力(Self-Attention)
Q/K/V 来自同一序列的注意力——token 间信息混合。
缩放点积注意力
softmax(QKᵀ/√d)V——按内容相关性加权取信息。
Query/Key/Value
查询向量 / 可检索标签 / 实际内容——注意力的三投影。
因果掩码
将未来位置注意力分数置 −∞ 的掩码——自回归生成的必备件。
Multi-Head
Q/K/V 切分到多子空间独立注意力再融合——多套问法并行。
Self vs Cross
QKV 同源 / Q 与 KV 异源——序列内混合 vs 跨序列查询。
O(n²) 瓶颈
注意力计算与显存随序列长度平方增长。
Transformer Block
注意力+FFN+残差+LayerNorm 的堆叠单元。
残差连接
x + f(x)——信息高速路与增量学习;深度可训的开关。
LayerNorm
激活的均值方差归一化——稳定深层训练。
Pre-LN / Post-LN
LN 在子层前(鲁棒)/ 后(质量略优需warmup)。
RMSNorm
去均值化的 LN 变体(Llama 系标配)。
FFN
逐 token 两层 MLP(升维4倍+激活+降维)——知识存储器。
SwiGLU
门控线性单元激活——现代 FFN 的标准结构。
位置编码
给无序注意力注入位置信息(正弦/可学习/RoPE)。
RoPE(旋转位置编码)
Q/K 按位置旋转、点积只依赖相对位置——现代主流。
位置插值
位置 m→m/L 压缩进训练范围——长上下文扩展技术。
Encoder-only / Decoder-only / Encoder-Decoder
双向理解 / 因果生成 / 双塔翻译三种架构形态。
BPE
字节对编码——迭代合并高频对构建子词词表的分词算法。
自回归语言建模
因果掩码下逐位置预测下一 token 的预训练目标。
教师强制
训练时条件用真实前缀——全位置并行损失的来源。
AdamW
解耦权重衰减的 Adam——Transformer 训练默认优化器。
warmup
学习率从零线性升至峰值的预热阶段。
梯度裁剪
梯度范数超限按比例缩回——训练稳定的保险丝。
缩放定律
损失随参数/数据/算力幂律下降;Chinchilla 最优比 D≈20N。
涌现
能力随规模跨阈值跃升的现象(真相变 vs 度量假象之辩)。
SFT
监督微调——指令-回答对的监督训练(对齐第一阶段)。
奖励模型(RM)
从人类排序训练的偏好打分器(Bradley-Terry)。
RLHF
以 RM 为奖励、KL 惩罚锚定 SFT 的强化学习对齐。
DPO
偏好对的闭式监督优化——免 RM 与 PPO 的对齐简化。
BERT
Encoder-only 双向 Transformer;MLM 完形填空预训练。
GPT
Decoder-only 自回归 Transformer 谱系(GPT-1→4)。
ViT
图像切 patch 当 token 的视觉 Transformer。
FlashAttention
IO 感知分块计算——精确但显存 O(n) 的注意力加速。
线性注意力
核函数消去 n×n 项的 O(n) 近似注意力。
MoE(混合专家)
路由器选择 Top-k 专家 FFN——参数大计算稀疏。
KV Cache
缓存历史 K/V 避免重算——自回归推理的基本优化。
GQA/MQA
多 Q 头共享 KV 头——推理缓存压缩。
PagedAttention
KV 显存的分页管理(vLLM)——吞吐优化。
量化
fp16→INT8/INT4 的权重压缩(GPTQ/AWQ/QLoRA)。
长上下文
超训练长度的上下文扩展(插值/滑窗/检索增强)。
Lost in the Middle
长上下文中部信息利用率骤降的现象。
数据并行/张量并行/流水线并行
切数据 / 切层内矩阵 / 切层的分布式三件套。
ZeRO
优化器状态/梯度/权重的分片存储(省显存的并行策略)。
temperature
softmax 前的 logits 缩放——探索与利用的旋钮。
top-p(nucleus)
只在累积概率前 p 的候选中采样。
推测解码
小模型猜大模型验的并行解码加速——分布严格不变。
幻觉
流畅但事实错误/上下文矛盾的生成——训练目标的副作用。
提示注入
恶意指令藏在输入中劫持模型行为的攻击。
ICL(上下文学习)
prompt 中示例的无梯度学习——前向激活内的"学习"。
induction head
两层注意力组合实现"模式复制"的电路——ICL 机制候选。
Mamba/SSM
选择性状态空间模型——O(n) 训练、O(1) 推理的架构挑战者。
混合架构
SSM 层+少量注意力层的组合(Jamba 类)。
注意力图
注意力权重矩阵的可视化——token 间的信息流图。
残差流
残差连接构成的信息主干道(可解释性视角)。
思维链(CoT)
生成中间推理步骤以动态加深计算。