- 状态空间模型 S4/S5:用结构化状态空间替代注意力做长序列
Transformer 的注意力是 O(N²),序列一长显存和时间都爆。状态空间模型(SSM,S4/Gu et al. 2021,S5/2022)走另一条路:把序列建模写成连续系统的离散化,用 FFT 卷积在 O(N log N) 内处理全序列,且状态天然携带长程记忆。本文用 numpy+scipy 从零实现 HiPPO 对角化、双线性离散化与 SSM-as-convolution,真实证明:卷积视角与状态递推逐点差 1.7e-15(数值精度内);FFT 卷积随序列长度的斜率 0.55(近线性)vs 注意力 1.95(近 O(N²));衰减 a=0.99 的 SSM 在「早期事件→末端读出」长程任务上 MSE≈0,而 a=0.5 短记忆与固定窗口基线都≈1.0 失败;并诚实给出 LTI-SSM 的内容选择性短板——同一核无法做「取闸门后 token」,线性读出 MSE=0.324≈随机水平,需用 Mamba 的选择性扫描才补得上。附完整 Python 与四张真实计算图。
14 min Chinese - 深度状态空间交易:用线性 RNN 做高效长程建模
RNN 串行训练慢、Transformer 注意力 O(L²) 贵,状态空间模型(SSM,S4/Mamba 一族的骨架)走第三条路:把隐藏状态写成对角线性递推 h_t = a⊙h_{t-1} + b⊙x_t,衰减率 a 按对数均匀铺满短记忆到长记忆,一层状态就是一组不同时间尺度的指数记忆核,推理 O(L·N) 且可并行扫描。本文用纯 numpy 从零实现多时间尺度对角线性 SSM + 统一 Ridge 读出,在两个合成任务上诚实实测:平滑多尺度记忆任务(1800 小样本)上 SSM-16 状态 R²=0.787 完胜 OLS-256 滞后的 0.664;但尖锐 lag-64 任务上被 OLS-128 滞后(0.922)打爆(SSM 只有 0.487)——指数记忆核天然抹平孤立尖锐滞后。并拆穿线性状态无损/状态越多越好/SSM 必胜滞后回归/长程=万能/金融直接落地五类真实陷阱(中阶)。
18 min Chinese
返回