状态空间模型 S4/S5:用结构化状态空间替代注意力做长序列
Transformer 的注意力是 O(N²),序列一长显存和时间都爆。状态空间模型(SSM,S4/Gu et al. 2021,S5/2022)走另一条路:把序列建模写成连续系统的离散化,用 FFT 卷积在 O(N log N) 内处理全序列,且状态天然携带长程记忆。本文用 numpy+scipy 从零实现 HiPPO 对角化、双线性离散化与 SSM-as-convolution,真实证明:卷积视角与状态递推逐点差 1.7e-15(数值精度内);FFT 卷积随序列长度的斜率 0.55(近线性)vs 注意力 1.95(近 O(N²));衰减 a=0.99 的 SSM 在「早期事件→末端读出」长程任务上 MSE≈0,而 a=0.5 短记忆与固定窗口基线都≈1.0 失败;并诚实给出 LTI-SSM 的内容选择性短板——同一核无法做「取闸门后 token」,线性读出 MSE=0.324≈随机水平,需用 Mamba 的选择性扫描才补得上。附完整 Python 与四张真实计算图。