- 状态空间模型 S4/S5:用结构化状态空间替代注意力做长序列
Transformer 的注意力是 O(N²),序列一长显存和时间都爆。状态空间模型(SSM,S4/Gu et al. 2021,S5/2022)走另一条路:把序列建模写成连续系统的离散化,用 FFT 卷积在 O(N log N) 内处理全序列,且状态天然携带长程记忆。本文用 numpy+scipy 从零实现 HiPPO 对角化、双线性离散化与 SSM-as-convolution,真实证明:卷积视角与状态递推逐点差 1.7e-15(数值精度内);FFT 卷积随序列长度的斜率 0.55(近线性)vs 注意力 1.95(近 O(N²));衰减 a=0.99 的 SSM 在「早期事件→末端读出」长程任务上 MSE≈0,而 a=0.5 短记忆与固定窗口基线都≈1.0 失败;并诚实给出 LTI-SSM 的内容选择性短板——同一核无法做「取闸门后 token」,线性读出 MSE=0.324≈随机水平,需用 Mamba 的选择性扫描才补得上。附完整 Python 与四张真实计算图。
14 min Chinese - 状态空间模型 Mamba 金融时序:把「历史」压缩成一个状态向量,选择性地记住该记的
Transformer 的注意力是 O(N²) 且训练时看不到未来、推理时还得把整段重新过一遍;RNN 虽是线性复杂度却有梯度消失、难以并行。状态空间模型(SSM,Gu et al. 2021)走中间路线:用连续系统的离散化,把历史压成一个状态向量 h_t 沿时间递推。Mamba(Gu & Dao 2023)再加一招「选择性」——让扫描步长 Δ 由输入决定,模型自己决定「记住什么、忘掉什么」。本文用纯 numpy+scipy 从零实现零阶保持离散化、递归扫描与卷积视角,在「目标被 130 步前事件驱动」的长程依赖合成序列上实测:带持久循环状态的选择性 SSM 预测 MSE=0.50,相对 120 窗口线性基线(2.93)降 82.9%、相对 AR(1)(1.34)降 62.7%——因为循环状态携带了窗口外的回声;并诚实拆穿线性读出下 SSM 不赢线性基线、Δ 选择性是演示近似、状态维度 N 受限、训练不稳、长程衰减五类真实陷阱(中阶)。
16 min Chinese
返回