- PatchTST 时序分块预测:把价格切成一块块「补丁」,Transformer 才真正用得上
Transformer 横扫 NLP 后,直接搬到时间序列预测上却常被简单线性模型吊打——问题出在「逐点建模」:把每个时间步当一个 token,注意力算力爆炸、还学不到局部形态。PatchTST(ICLR 2023)用两招破局:把序列切成一段段 patch(分块)当 token、多变量之间通道独立。本文用纯 numpy 复现「分块 vs 逐点」的核心对比,在趋势+双周期+噪声的自洽合成序列上,两者都把朴素基线的 MSE 从 51.6 压到 2.7,并诚实说明分块在这份干净数据上只领先 2.3%、它真正的价值在哪、以及六类真实陷阱(中阶)。
17 min Chinese - TimesNet 周期建模:把价格「折叠」成二维时间块,Transformer 才真正读得懂周期
Transformer 直接搬到时序常被简单线性吊打,病根是「逐点建模」——单个价格点没有语义。TimesNet(Wu et al. 2023)的破局点很巧:既然时间序列里最稳定的结构是「周期」,那就把一维序列按周期 P 折叠成二维「时间块」,让二维卷积去抓「同一相位跨周期」的相关性。本文用纯 numpy 从零实现 FFT 周期检测、1D→2D 折叠、2D 池化回 1D,在「三周期+趋势+脉冲噪声」合成序列上实测:2D 折叠把多周期结构的解释方差从 0% 抬到 31.7%,残差以噪声为主;并诚实拆穿「数据处理的不等式(线性头打不过线性基线)」、周期检测偏 bin、折叠引入伪相关、相位对齐泄漏、端点缺口五类真实陷阱(中阶)。
18 min Chinese - Temporal Fusion Transformer:把多变量时序预测做成可解释黑盒
TFT(Temporal Fusion Transformer,Lim 等 2020)是少有的「既用 Transformer 注意力、又刻意追求可解释」的时序模型。它靠三道门控——变量选择网络(VSN)、时序注意力(TIA)、门控残差——把「哪几个变量重要、过去哪段历史重要、线性还是非线性重要」全部量化出来。本文用自洽合成模型从零复现这三步,给出变量选择 265× 信噪比、多变量融合 SMAPE 比单变量低 43.7% 的实算结果,并诚实指出注意力可解释性的边界,附完整 Python 与六类真实陷阱。
13 min Chinese - Transformer模型股价预测:Attention机制在金融时序中的应用
深入探讨Transformer模型在股价预测中的应用,从Attention机制到时间序列建模,带你用PyTorch构建端到端的股价预测系统
24 min
返回