Transformer vs Mamba/SSM:架构的下一步
本文基于模型知识整理(生成时未联网核对),Mamba 机制建议对照 Gu & Dao 2023 原文复核。
一句话定义
Mamba(2023)代表的状态空间模型(SSM)是 Transformer 的最有力挑战者:把注意力替换为"选择性状态空间递归"——每步只维护一个固定大小的隐藏状态(O(1) 推理,O(n) 训练),但通过"选择性"机制(根据内容决定记住/遗忘什么)恢复了注意力的大部分表达力——用"遗忘的艺术"换"无限的上下文"。
为什么重要
Transformer 的 O(n²) 与 KV Cache(kp-005/023)是结构与成本的天花板;Mamba 系证明了"线性复杂度+无限上下文+常数推理"的可行性——如果 SSM 或混合架构在质量上追平 Transformer,整个 AI 基础设施(GPU/推理栈/上下文管理)都将重构。这是 kp-031 历史线上"架构战争"的最新回合。
前置知识
kp-005(O(n²) 瓶颈)、kp-021(线性注意力)、RNN 状态递归概念。
核心概念
- SSM 基本形态:连续状态空间模型 $\dot h=Ah+Bx,\ y=Ch$ 的离散化递归 $h_t=\bar Ah_{t-1}+\bar Bx_t,\ y_t=Ch_t$——一个带"可学习衰减/输入门"的线性递归。
- S4 的突破(2021):用 HiPPO 初始化(历史压缩的正交多项式基)+ 结构化 A 矩阵 → 在长序列任务(LRA)上碾压此前所有模型——SSM 首次证明"能学长程依赖"。
- Mamba 的"选择性"(2023):让 B、C、Δ(衰减率)成为输入的函数(线性投影自 x_t)——每个 token 动态决定"记多少/忘多少";等价于"内容感知的注意力门控"(与 kp-005 的注意力门控类比——但作为递归而非全局注意力)。
- 与注意力的数学关系:kp-021 线性注意力 = SSM 的特例(退化到对角 A 的无选择性版本)——"注意力与 RNN 的边界被消融",Mamba/线性注意力/RNN 是同一家族的不同成员(状态更新规则不同)。
- 混合架构的胜利:纯 Mamba 与 Transformer 各有短板(纯 SSM 精确回忆弱);Jamba/Zamba 等混合架构(SSM 层+少量注意力层)实测表现最佳——"取长补短的混血"比"纯血统"更实用。
- 训练技巧:选择性使递归不可并行(每个 h_t 依赖 x_t)→ 并行扫描(parallel scan)算法恢复 GPU 并行——工程创新与模型创新同等重要。
原理与机制
为什么"选择性"是关键一步:早期 SSM(S4 前身)的时间不变性(A/B 固定)导致"对所有 token 一视同仁"——无法过滤噪声 token(与 kp-005 的注意力门控对照:Transformer 可以选择不看);Mamba 的输入依赖 B/Δ 让模型学会"这个 token 值得记/可以忘"——选择性=信息过滤能力,是 LLM 语言建模的核心需求。
O(1) 推理的代价:固定状态 = 有限记忆——超出状态容量的信息被覆盖丢失(不像 KV Cache 可以无限累积);"无限上下文"实际是"有限状态的无限流处理"——超长依赖的精确回忆是弱点(与kp-005 精确回忆对比)。SSM 擅长"模式"不擅长"精确查找"。
混合架构为什么胜出:Transformer 擅长精确回忆(注意力=全历史索引),SSM 擅长模式与长流(状态递归);混合=用 SSM 层处理 90% 的"模式理解"、用注意力层处理 10% 的"精确回忆"——工程上最优的往往是混合而非纯种(生物学式的杂交优势)。
图示
SSM递归: h_t = Āh_{t−1} + B̄x_t ; y_t = Ch_t
Mamba选择: B,C,Δ = f(x_t) (输入依赖的记忆门控)
账本: 训练O(n) 并行scan ; 推理O(1) 状态 ; KV Cache=无
强项: 长流式/线性扩展/推理速度
弱项: 精确回忆(固定状态容量)
混合(Jamba/Zamba): SSM层 + 少量注意力层 → 实测最佳
数学: 线性注意力 = SSM特例 (kp-021的家族统一)
直观类比
Transformer 像"带着全部笔记开会"(KV Cache)——任何引用即时翻查(精确),但笔记本越来越厚(KV 增长);Mamba 像"只带一本滚动摘要"——每步快速翻新摘要(O(1)),细节可能被覆盖(有限状态),但开会永远轻装(推理快)。
实例或案例
- Mamba-2(2024):理论统一(SSD=结构化状态对偶)——与注意力关系的数学明确化。
- Jamba(AI21):Mamba+Attention+MoE 三合一——混合架构的工业级验证。
- 音频/基因组:SSM 在超长序列(基因组百万 bp)上胜 Transformer——长流场景的天然主场。
常见误区
- 误区一:"Mamba 已经取代 Transformer"。混合架构在追赶,但纯 Mamba 在语言建模上尚未全面超越同规模 Transformer——"挑战者"定位更准确。
- 误区二:"线性复杂度=无限上下文能力"。O(n) 处理长度但状态有限——超长依赖的精确信息会丢失(状态容量的天花板)。
- 误区三:"SSM 与 Transformer 是完全不同的物种"。数学上线性注意力是 SSM 特例(kp-021 的家族统一)——竞争的背后是同一谱系的分化。
与其他知识点的关系
自测题
- Mamba 的"选择性"是什么?解决了什么问题?
答:B/C/Δ 变为输入的函数——每个 token 动态决定记忆/遗忘;解决了早期 SSM"对所有输入一视同仁"的过滤能力缺失。
- SSM 的 O(1) 推理意味着什么?付出什么代价?
答:每步只维护固定状态(推理时间/显存与序列长无关);代价是精确回忆受限(状态容量有限,超长依赖被覆盖丢失)。
- 为什么混合架构(SSM+注意力)表现最好?
答:SSM 擅长模式与长流(线性高效)、注意力擅长精确回忆(全历史索引)——取长补短覆盖两种需求。
延伸阅读
- Gu & Dao, "Mamba: Linear-Time Sequence Modeling with Selective State Spaces"(2023)。
- Gu 等, "Efficiently Modeling Long Sequences with Structured State Spaces"(S4, ICLR 2022)。
- Lieber 等, "Jamba: A Hybrid Transformer-Mamba Language Model"(2024)。