- 稳健 PCA 与异常因子剥离:用主成分把离群股票的影响压下来
标准 PCA 对极端离群点几乎零容忍——一只复牌补跌或业绩暴雷的股票,就能把整个截面因子结构拽偏。本文 numpy 从零实现稳健 PCA(主成分追踪 PCP),在 N=60/T=250、3% 离群污染的合成数据上把低秩恢复相关从 0.968 拉回 0.998,离群点 100% 召回且不误报,还给出完整 Python 与三张真实计算图。
12 min Chinese - 稀疏主成分因子模型:用 L1 约束逼出可解释载荷
标准 PCA 的载荷是稠密的——30 个资产、3 个因子,90 个载荷系数全是小数,你看不出「哪个因子驱动哪组股票」。本文用 numpy 从零实现 Zou-Hastie 弹性网稀疏 PCA,在 30 资产 / 3 因子的块状合成因子模型上把 90 个稠密载荷压成 52 个非零项,恢复度 0.908 与标准 PCA 的 0.918 基本持平,但每个因子只落在 1 个板块里。附完整 numpy 实现与四张真实计算图。
13 min Chinese - 对抗训练鲁棒因子:用 FGSM/PGD 给预测模型加噪声免疫力
金融特征里混着微观结构噪声、陈旧报价、舍入误差甚至错单 tick——一个对微小扰动极度敏感的因子模型,会给出抖动的因子值与不稳定的排名。本文用 numpy 从零实现 FGSM 与 PGD 对抗训练,在标准逻辑回归因子上做对照实验:干净准确率 96.4% vs 93.4%(牺牲约 3 个点);在 ε=0.1 的 PGD 攻击下,标准模型 28.0% 样本被翻转、鲁棒模型 24.3%;权重范数被压低 14.4%。结论很诚实——表格型低频金融特征不像图像那样对对抗扰动极度脆弱,对抗训练在这里主要扮演「隐式正则化器 + 最坏情况风险上界」的角色,而非银弹。附完整 Python 与四张真实计算图。
11 min Chinese - 决策树因子可解释性:用规则集替代黑盒给出合规理由
深度学习因子模型 IC 高,但每笔预测都是黑盒——监管问你'为什么选这只票',你拿不出可审计的理由。决策树把预测拆成一条条 if-then 规则,每条规则有明确的覆盖率和 IC,天然合规。本文从 numpy 实现一个简化版 CART 决策树因子模型,在合成数据上证明:深度 3 的决策树 OOS IC=0.072,虽低于 MLP 的 0.091,但全部 5 条规则可逐条审计、逐条设限、逐条关闭——合规代价为零。附完整 Python 实现与四张真实计算图,含规则提取、覆盖分析、IC 对照与合规评分。
17 min Chinese - 图神经网络因子扩散:用 GCN 在板块关联图上传播收益信号
原始因子信号常常「脏」:同一板块的股票本该共享行业 beta,可个股噪声把板块共性搅得七零八落。本文用 numpy 从零实现图卷积网络(GCN)的消息传递,把 120 只股票按收益相关性建成板块关联图,再让因子信号沿边「扩散」——每只股票的得分被邻居平均,板块内噪声被洗掉、共同因子被提纯。在合成数据上,扩散后整体 rank-IC 从 0.489 升到 0.656(+34.2%),共同因子 IC 冲到 0.93;但文章也诚实指出代价:个股特异 alpha 的 IC 被平滑到 −0.03,这就是过平滑(over-smoothing)。附完整 Python 与四张真实计算图。
9 min Chinese - KAN Kolmogorov-Arnold 网络:用可学习一元函数替代线性权重做因子建模
MLP 把『线性加权 + 固定激活』焊死在每一层,而 KAN 把边上的权重换成一个可学习的一元函数。本文用 numpy 从零实现一个两层 KAN,在一个带交互项与平方项的合成因子任务上,对比同规模 MLP,证明它在小样本下泛化更稳、且每条边函数可读——你可以直接把『某个因子在低位线性、高位饱和』画出来。附完整 Python 与四张真实计算图。
13 min Chinese - MoE 混合专家因子模型:用稀疏激活给不同市场状态配不同专家
单一全球因子模型默认「一套权重解释所有市场」,但牛市、危机、低波动期的因子暴露本就不同。本文用 MoE(Mixture of Experts)把组合拆成 K 个线性专家 + 一个门控网络:门控依据可观测的市场状态变量稀疏激活对应专家。在含状态切换的合成数据上,MoE 测试 MSE 为 0.042,远低于单一全局模型的 18.493(降低约 100%),且门控热图证明它确实学到了 market state。附完整 numpy 与四张真实计算图。
13 min Chinese - 多任务因子学习:用硬共享底座同时预测收益与风险
同时预测预期收益和预期波动率的因子模型为什么会比单任务模型更准?原因是梯度信号翻倍、共享表征被迫学到『干净的特征』,并且对噪声特征自动降权。本文 numpy 从零搭建硬共享硬参数化模型,用受控实验证明联合训练的 IC 高于单任务拼接。
15 min Chinese
返回