- 稀疏主成分因子模型:用 L1 约束逼出可解释载荷
标准 PCA 的载荷是稠密的——30 个资产、3 个因子,90 个载荷系数全是小数,你看不出「哪个因子驱动哪组股票」。本文用 numpy 从零实现 Zou-Hastie 弹性网稀疏 PCA,在 30 资产 / 3 因子的块状合成因子模型上把 90 个稠密载荷压成 52 个非零项,恢复度 0.908 与标准 PCA 的 0.918 基本持平,但每个因子只落在 1 个板块里。附完整 numpy 实现与四张真实计算图。
13 min Chinese - 小波相干性板块联动:用交叉小波看板块共振的时频结构
传统相关系数只能给一个全局数,看不出『哪段时期、哪个周期』在共振。本文用 numpy 从零实现 à trous MODWT(db4 核) 与交叉小波相干性(Wavelet Coherence),在两只合成板块(危机内相关 0.97、危机外 0.22)上把共振定位到「时-频」平面:危机窗口整条尺度亮起、相干性均值 0.50 vs 非危机 0.09。附完整 numpy 实现与四张真实计算图。
8 min Chinese - 对抗训练鲁棒因子:用 FGSM/PGD 给预测模型加噪声免疫力
金融特征里混着微观结构噪声、陈旧报价、舍入误差甚至错单 tick——一个对微小扰动极度敏感的因子模型,会给出抖动的因子值与不稳定的排名。本文用 numpy 从零实现 FGSM 与 PGD 对抗训练,在标准逻辑回归因子上做对照实验:干净准确率 96.4% vs 93.4%(牺牲约 3 个点);在 ε=0.1 的 PGD 攻击下,标准模型 28.0% 样本被翻转、鲁棒模型 24.3%;权重范数被压低 14.4%。结论很诚实——表格型低频金融特征不像图像那样对对抗扰动极度脆弱,对抗训练在这里主要扮演「隐式正则化器 + 最坏情况风险上界」的角色,而非银弹。附完整 Python 与四张真实计算图。
11 min Chinese - 因果发现 PC 算法:用条件独立性把变量间的真实因果图挖出来
相关不等于因果——这句老生常谈在量化里是血淋淋的真金白银。PC 算法(Peter-Clark)不靠专家拍脑袋,而是用条件独立性检验,从观测数据里把变量之间的因果骨架和箭头方向自动挖出来。本文用 numpy 从零实现一个线性高斯 PC,在已知的合成因果图上验证:骨架召回率 1.000、精确率 1.000;并给出最关键的反直觉事实——控制共因后相关会塌缩到 0(X1-X5 偏相关 0.390→0.007),而直接因果边不塌(X1-X4 0.648→0.562),正是这个不对称把因果图与纯相关网络区分开。附完整 Python 与四张真实计算图。
12 min Chinese - 对比学习负采样策略:金融表征里该选哪些『难负例』
对比学习用「同标的增强视图=正对、不同标的=负对」把股票压成可迁移表征。但负样本怎么选,决定模型学到的是噪声还是真信号。本文用 numpy 从零复现四类负采样:难负例(高相似、确属异板块)把 InfoNCE 损失压到 0.355、下游分类 1.000;错标签负例(没剔除同板块)损失飙到 7.28、准确率掉到 0.276;随机负例易满足却学最浅。并做难负比例消融:纯难负反而不如适度混入——倒 U 形态。附完整 Python 与四张真实计算图。
14 min Chinese - 决策树因子可解释性:用规则集替代黑盒给出合规理由
深度学习因子模型 IC 高,但每笔预测都是黑盒——监管问你'为什么选这只票',你拿不出可审计的理由。决策树把预测拆成一条条 if-then 规则,每条规则有明确的覆盖率和 IC,天然合规。本文从 numpy 实现一个简化版 CART 决策树因子模型,在合成数据上证明:深度 3 的决策树 OOS IC=0.072,虽低于 MLP 的 0.091,但全部 5 条规则可逐条审计、逐条设限、逐条关闭——合规代价为零。附完整 Python 实现与四张真实计算图,含规则提取、覆盖分析、IC 对照与合规评分。
17 min Chinese - 可微分组合优化:把 Markowitz 写进可反向传播的图
经典 Markowitz 是一个二次规划,靠数值 solver 解出来,因此没法把梯度回传到前端的收益预测模型。本文把组合权重用 softmax 参数化、把均值-方差效用当作可微损失,用梯度上升直接「解」这个优化问题——整个优化层可反向传播。我们用 200 次蒙特卡洛证明:无正则的样本 Markowitz 样本外 Sharpe 被估计误差压到 4.90,把 L2 权重收缩(为主)与熵分散(为辅)写进可微目标后,样本外 Sharpe 回升到 5.98,逼近 Oracle 的 5.94。附完整 numpy 与四张真实计算图。
14 min Chinese - 联邦学习因子共享:在不交换原始数据的前提下联合训练选股模型
券商、私募、银行理财子各自握着一批选股数据,但监管与商业壁垒让它们无法把数据池到一起。联邦学习(Federated Learning)让多方只交换模型参数、不交换原始样本,就能联合训练一个比各自单打独斗更准的选股模型。本文用 numpy 从零实现 FedAvg,在受控 non-IID 数据上证明:FedAvg 的全局测试准确率 0.891,逼近集中池化的 0.893,却把纯本地不共享的 0.778 甩开 11 个百分点;并诚实给出差分隐私的精度代价与三条实战红线。附完整 Python 与四张真实计算图。
12 min Chinese
返回