学习路径

# 学习路径

前置知识要求见 00-overview.md:深度学习基础(神经网络/BP/softmax)、矩阵乘法、Python(仅 kp-032 需要)。这些不属于本知识库范围。

第一阶段 · 入门(约 2 小时)

全景 + 注意力核心 + 分词。

  1. [kp-001] Transformer 全景:为什么是它(15 分钟)
  2. [kp-002] 缩放点积注意力:QKV(30 分钟)
  3. [kp-003] Multi-Head:多头的分工(20 分钟)
  4. [kp-011] Tokenization 与 BPE(20 分钟)

第二阶段 · 核心(约 5 小时)

架构解剖与训练全流程。

  1. [kp-006] Transformer Block:残差与 LayerNorm(25 分钟)
  2. [kp-008] FFN:位置-wise MLP(15 分钟)
  3. [kp-009] 位置编码:正弦到 RoPE(30 分钟)
  4. [kp-004] Self vs Cross Attention(15 分钟)
  5. [kp-010] 编码器-解码器到 Decoder-only 的分化(20 分钟)
  6. [kp-012] 预训练目标:自回归语言建模(20 分钟)
  7. [kp-013] 训练稳定性:初始化/warmup/裁剪(25 分钟)
  8. [kp-007] Pre-LN vs Post-LN(15 分钟)
  9. [kp-016] 微调谱系:全参到 LoRA(25 分钟)

第三阶段 · 进阶(约 4 小时)

  1. [kp-005] 注意力复杂度与长序列瓶颈(20 分钟)
  2. [kp-014] 优化器与学习率调度(20 分钟)
  3. [kp-015] 缩放定律:Kaplan 与 Chinchilla(25 分钟)
  4. [kp-018] BERT:双向编码器(20 分钟)→ [kp-019] GPT 谱系(20 分钟)
  5. [kp-020] ViT:视觉 Transformer(20 分钟)
  6. [kp-021] 高效注意力:稀疏/线性/FlashAttention(25 分钟)
  7. [kp-022] MoE 混合专家(20 分钟)
  8. [kp-023] KV Cache 与推理优化(25 分钟)
  9. [kp-024] 量化与压缩(20 分钟)
  10. [kp-025] 长上下文技术(20 分钟)

第四阶段 · 工程、理论与脉络(约 3 小时)

  1. [kp-026] 分布式训练并行策略(25 分钟)
  2. [kp-027] 解码策略与推测解码(20 分钟)
  3. [kp-017] 对齐三阶段:SFT/RM/RLHF(20 分钟)
  4. [kp-028] 注意力的表达能力:理论视角(20 分钟)
  5. [kp-029] 上下文学习 ICL(20 分钟)
  6. [kp-030] 幻觉与安全的架构视角(20 分钟)
  7. [kp-031] Transformer vs Mamba/SSM(20 分钟)
  8. [kp-032] 从零实现 attention(30 分钟)
  9. [kp-033] 历史脉络(15 分钟)

最小可用路径

kp-001 → kp-002 → kp-003 → kp-006 → kp-008 → kp-009 → kp-011 → kp-012 → kp-016 → kp-023 → kp-032(约 4 小时)。这条线是"注意力→Block→位置编码→分词→预训练→微调→推理→实现"的完整骨架:读懂主流 LLM 论文与上手工程的最短路线。时间紧张只走这条线。

学习进度加载中…