注意力的表达力:它为什么有效

06-理论实践与脉络 前沿 约 20 分钟 #表达力#理论#归纳偏置#全序 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),理论结论建议对照 Weiss et al. 2021、Yun et al. 2020 及后续形式化工作复核。

一句话定义

理论视角回答"注意力为什么有效":① softmax 注意力能实现任意序列到序列的连续映射(通用近似);② Transformer(带位置编码与足够深度)能表达排序、复制等序列操作(遵循思考链的结构);③ 但也有边界——注意力的计算是"常数深度并行"风格,某些任务(如状态跟踪)存在表达下界,这解释了后续架构竞争(kp-031)的空间。

为什么重要

实践告诉我们 Transformer 有效,理论告诉我们它到底能表达什么、天然擅长什么、结构性短板在哪——这些结论直接预测了 ICL 的可行性(kp-029)、思维链的增益(推理作为"深度补偿")、以及 Mamba 类架构(kp-031)能挑战什么不能挑战什么。理论是实践的地图(哪怕这张地图还在绘制中)。

前置知识

kp-002/003/006(注意力与堆叠)。

核心概念

  • 通用近似视角:单层自注意力(带 FFN)已是序列上的通用近似器(Yun et al.:任意上下文映射的逼近)——"能表达"不等于"能学到",但至少排除了表达障碍。
  • 能做什么(构造性证明):

- 选择/复制/关联:注意力=可微分的哈希查找——"检索第 i 个 token"可由硬注意力近似( induction head 的形式化基础 kp-003); - 排序/全序推理:多层注意力可计算两两比较的传递闭包——排序网络式构造; - 思维链作为深度扩展:每步推理=一层计算;CoT 把"常数深度的局限"变成"序列化的深度"——思考链=把难问题摊成多层(kp-030 姊妹篇推理模型的理论根)。

  • 边界与下界:

- 常数深度限制:固定层数 Transformer 无法表达某些需要顺序迭代的函数(如正则语言的精确判别、强周期函数); - TC0 类的容量上界:多项式精度的固定深度 Transformer 落在 TC0 电路类内——乘法/某些计数任务有理论困难(与实证的"算术短板"呼应,kp-011 分词+表达力双重原因); - 状态跟踪的挣扎:奇偶校验/图可达性问题——Transformer 需要思维链补偿,而 RNN/SSM 天然带状态(kp-031 的理论分野)。

  • 归纳偏置的哲学:Transformer 几乎"无偏置"(不假设局部性/递归性)——万能但样本效率低(ViT 的教训 kp-020 同款);RNN 假设序列性、CNN 假设局部性——偏置越强小数据越好、越难泛化到偏置外。

原理与机制

"思维链=深度补偿"的机制:固定 L 层 Transformer 的计算图深度是 O(1)(每 token 一次前向);而某些问题(n 步算术、多跳推理)需要 O(n) 串行计算步——生成中间 token 相当于动态增加计算深度(每个生成 token 让模型"多想一步")。这解释了:为什么 CoT 提升推理、为什么"思考 token"越多答案越好(推理模型的训练动机 kp-030 姊妹)。

注意力=可微分的全连接"软电路":把每个注意力头看作"条件性的边选择"(softmax 在 token 间分配边权)、FFN 是节点计算——Transformer 是"边权与节点函数都可学习的动态电路"。理论工作(Transformer Circuits 线)把训练好的模型反向解析成这样的电路(induction head 等已解析实例)。

为什么这些理论要谨慎使用:表达能力 ≠ 可学习性 ≠ 泛化——能表达不代表 SGD 能找到、找到了不代表分布外仍对;理论结论是"可能性空间"的地图,工程结论仍需实证(kp-031 的架构之争双方都要引用理论+实验)。

图示

能力面:
 ✓ 通用近似(序列映射) | 选择/复制/关联(软检索)
 ✓ 排序等全序操作(多层构造) | CoT=动态加深
 边界:
 ✗ 常数深度: 正则语言/状态跟踪下界
 ✗ TC0类: 乘法/部分计数困难 (分词+表达双重原因)
思维链: 生成token=动态加层 → 推理作为深度补偿
哲学: 无偏置→万能但样本饥 (ViT教训 kp-020 同款)

直观类比

固定层数 Transformer 像"一位只能看一眼棋盘就走棋的棋手":一次扫视(注意力)极强,但复杂杀局需要多步推演——思维链等于允许他"在草稿纸上摆沙盘"(生成中间步骤=动态加深思考)。SSM 则像"装了记忆的棋手"——每步带着累积状态走(kp-031)。

实例或案例

  • induction head 的形式化:Elhage 等解析出"两层组合完成模式复制"的具体电路——表达力理论的已验证实例。
  • CoT 的规模效应:思维链对大模型增益显著、小模型反而下降(推不出就跑偏)——"深度补偿"需要基础能力作燃料。
  • 算术短板与分词:加法错误既源于分词(kp-011)也源于表达(TC0 论证)——双重原因的诊断样本。

常见误区

  • 误区一:"通用近似=什么都能学"。存在性证明不含样本复杂度与优化可达性——表达≠可学。
  • 误区二:"理论边界=能力上限"。思维链/工具调用/外部记忆都可突破理论边界(动态加深+外部状态)——边界描述的是"裸架构"。
  • 误区三:"理论已完整解释 Transformer"。表达力/学习动力学/泛化三个层面中,后两者理论远未成熟——地图仍在大规模绘制中。

与其他知识点的关系

  • kp-002/003/006:被理论化的对象。
  • kp-029:ICL 的机制候选(induction head)。
  • kp-030/031:推理加深与替代架构的两个延伸方向。

自测题

  1. 为什么思维链能提升 Transformer 的推理?

答:固定层数=常数计算深度;生成中间 token 动态增加串行计算步——把需要深迭代的任务摊到序列维度。

  1. Transformer 的哪个理论边界与"算术短板"呼应?

答:固定深度落在 TC0 电路类——乘法/部分计数任务有表达下界;加上分词问题(kp-011)双重叠加。

  1. "无偏置架构"的代价是什么?

答:样本效率低(需大数据学出局部性/递归性等结构);小数据下强偏置架构(CNN/RNN)更优——归纳偏置与数据的交换。

延伸阅读

  • Yun 等, "Transformers are Universally Consistent Approximators"(2020)。
  • Weiss 等, "Thinking Like Transformers"(2021,RASP 形式化语言)。
  • Elhage 等, "A Mathematical Framework for Transformer Circuits"(2021)。