PatchTST 时序分块预测:把价格切成一块块「补丁」,Transformer 才真正用得上
Transformer 横扫 NLP 后,直接搬到时间序列预测上却常被简单线性模型吊打——问题出在「逐点建模」:把每个时间步当一个 token,注意力算力爆炸、还学不到局部形态。PatchTST(ICLR 2023)用两招破局:把序列切成一段段 patch(分块)当 token、多变量之间通道独立。本文用纯 numpy 复现「分块 vs 逐点」的核心对比,在趋势+双周期+噪声的自洽合成序列上,两者都把朴素基线的 MSE 从 51.6 压到 2.7,并诚实说明分块在这份干净数据上只领先 2.3%、它真正的价值在哪、以及六类真实陷阱(中阶)。