Transformer · 注意力即一切

2017 年一篇论文抛弃了循环与卷积。33 个知识点,从缩放点积注意力与多头机制出发, 解剖 Block、位置编码与预训练,穿越 BERT/GPT/ViT/MoE 的变体谱系,抵达 KV Cache、缩放定律与 Mamba 挑战—— 读懂大模型时代的架构底座。

学习进度加载中…

知识模块

01-注意力与基础

5 个知识点

02-架构解剖

6 个知识点

03-训练与微调

6 个知识点

04-代表变体

5 个知识点

05-推理与工程

5 个知识点

06-理论实践与脉络

6 个知识点