Transformer · 注意力即一切
2017 年一篇论文抛弃了循环与卷积。33 个知识点,从缩放点积注意力与多头机制出发, 解剖 Block、位置编码与预训练,穿越 BERT/GPT/ViT/MoE 的变体谱系,抵达 KV Cache、缩放定律与 Mamba 挑战—— 读懂大模型时代的架构底座。
学习进度加载中…
知识模块
01-注意力与基础
5 个知识点
02-架构解剖
6 个知识点
03-训练与微调
6 个知识点
04-代表变体
5 个知识点
05-推理与工程
5 个知识点
06-理论实践与脉络
6 个知识点