- 神经组合优化 Pointer Net:用 seq2seq 直接输出排序权重
传统 Markowitz 输出连续权重,但『选几只、选哪几只』本质是一个组合优化+排序问题。Pointer Net 把候选资产列表视为序列、用 attention 机制学会输出排列——直接产出 K 个选中的下标、从排序里导出权重。本文从 Pointer 机制的 softmax attention 出发,用 numpy+scipy 从零实现 Pointer-style scorer,在 8 资产 + 双因子的合成数据上对比 Equal-Weight/Markowitz/Risk-Parity,Pointer Net 的样本外 Sharpe 中位数 1.62、IQR 窄到 0.28,跑赢 Markowitz(1.05)53%。附完整 Python 与三张真实计算图。
12 min Chinese - Transformer 旋转位置编码金融改进:让周期与相位进入注意力
绝对位置编码让 Transformer 把『第 20 天』和『第 21 天』当成两个毫不相干的坐标,完全丢掉金融序列最宝贵的周期与相位结构。RoPE(旋转位置编码)用旋转让注意力内积只依赖相对距离,而把 θ 设为 2π/P 后更把『相距 P 天 = 同相位』直接编码进注意力。本文 numpy 从零实现周期调制 RoPE,证明周期目标上的外推 RMSE 从 0.71(无位置)砸到 0.00,频率扫描在真实周期处呈 V 形谷,多周期信号多维 RoPE 训练区+外推区双零误差。附完整 Python 与四张真实计算图。
13 min Chinese - 图注意力金融网络:用注意力权重重新分配板块间的信息流
板块不是孤岛——半导体一动,消费电子、新能源车、光伏跟着抖。传统 GCN 用固定归一化权重平均所有邻居,把真信号和噪声边一视同仁地糊在一起。图注意力网络 GAT 换思路:给每条边学一个注意力分数 α,让模型自己决定『该多听谁的』。本文用纯 numpy 从零实现单层 GAT(含通过 masked-softmax 的完整反向传播),构造 10 个板块的有向信息流图,故意混入 9 条『市场惯性误认』的噪声边(图上有连接但真实传导=0)。500 个时间点训练后样本外对比:GAT 的 IC 0.670,甩开被噪声边拖累的 GCN(0.625)和完全无图的 MLP(0.577)。注意力热图显示 GAT 学到的 α 与真实传导 β 高度吻合、对噪声边自动降权;hub 分析揭示 GAT 给『消费电子→半导体』分配 0.495 权重(GCN 固定只给 0.316),因为它读得懂『这条边真的重要』。拆穿注意力=因果、单层感受野局限、注意力可解释性幻觉、图结构错了 GAT 也救不了四类陷阱(中阶)。
15 min Chinese - Crossformer 跨变量预测:用维度分段注意力建模变量交互
多资产预测里最容易被漏掉的信息,是『变量之间怎么互相带动』——大多数时序 Transformer 把每个变量单独摊平,只在时间轴上做注意力,跨变量的联动全靠模型自己隐式脑补。Crossformer(Zhang & Yan, ICLR 2023)明确把注意力拆成两段:先在时间轴上分段(DSW,维度分段嵌入)压缩局部形态,再用两阶段注意力(TSA)分别在时间段之间、变量维度之间显式建模。本文用纯 numpy 从零拆解『分段嵌入 + 跨时间 + 跨变量』的两阶段结构,在 6 资产共享隐因子的合成序列上诚实实测:跨变量注意力把单步预测 R² 从朴素持平的 0.356 抬到 0.366——增益真实但微小,并拆穿维度注意力万能/跨变量必优/分段无损/关联=因果/直接落地五类真实陷阱(中阶)。
15 min Chinese - Set Transformer 金融表征:用诱导点注意力聚合多资产
组合是集合不是序列,但 DeepSets 的「逐资产编码+对称池化」有个盲区:池化前每个资产互相看不见,成对交互(拥挤度、相似持仓共振)只能靠编码器隐式凑。Set Transformer(ICML 2019)把交互焊进结构:SAB 让集合内元素两两做注意力,PMA 用可学习种子向量做注意力池化,ISAB 用 m 个诱导点把 O(K²) 注意力砍成 O(K·m)。纯 numpy 从零实现 SAB+PMA(手写 einsum 反向传播,梯度校验 1e-9 级),在组合拥挤度聚合任务上实测:SetTransformer R²=0.843 > DeepSets-mean 0.831 ≈ 统计聚合+Ridge 0.830——成对交互任务上有真实但温和的优势;注意力矩阵与真实相似度结构吻合,置换偏移 1.4e-15;ISAB 实测 K=2048 时提速 55 倍。但诚实翻车:n=300 小样本下 SetTransformer 过拟合(train 0.92 / test 0.53),被 DeepSets(0.80)反杀——注意力参数多,先吃数据。拆穿注意力必胜/池化都一样/诱导点无损/交互自动学会/直接上实盘五类陷阱(中阶)。
14 min Chinese - 金融新闻 Transformer 情感分析:用自注意力读标题
朴素词袋(BoW)把标题当成一堆无序词的集合,丢掉了「词序」和「哪几个词最关键」。Transformer 的自注意力让每个词去「看」标题里所有其他词、按相关性加权聚合——于是「标题头段和中段的情绪词」能被自动放大。本文用纯 numpy 从零实现自注意力编码器(含完整前向/反向),在「位置加权的好/坏消息」合成标题上实测:测试集 R² Transformer=−0.026 远优于 BoW 的 −0.873(提升 97%)、方向准确率 54.0% vs 46.4%、读出 token 对关键位置(12,30)的注意力命中率 1.00、互换两个非关键 token 后预测一致性 1.000,并诚实拆穿「注意力一定尖锐聚焦 / 位置编码多余 / 深层才有效 / 小数据随便训 / 注意力=因果」五类真实陷阱(中阶)。
9 min Chinese - Temporal Fusion Transformer:把多变量时序预测做成可解释黑盒
TFT(Temporal Fusion Transformer,Lim 等 2020)是少有的「既用 Transformer 注意力、又刻意追求可解释」的时序模型。它靠三道门控——变量选择网络(VSN)、时序注意力(TIA)、门控残差——把「哪几个变量重要、过去哪段历史重要、线性还是非线性重要」全部量化出来。本文用自洽合成模型从零复现这三步,给出变量选择 265× 信噪比、多变量融合 SMAPE 比单变量低 43.7% 的实算结果,并诚实指出注意力可解释性的边界,附完整 Python 与六类真实陷阱。
13 min Chinese - 注意力机制因子:让模型自己决定看哪些特征
把注意力机制从 NLP 搬进多因子选股:用特征级自注意力让模型自己决定看哪些因子,再门控加权出 1 维注意力因子。合成里门控因子 OOS R²=0.59 远超等权平均 0.15(高阶)。
15 min Chinese
返回