- Lasso 与弹性网络变量选择:用 L1 惩罚把几百个因子压成可交易少数
你有 500 个因子、2000 个样本,直接全量回归——回测里 R² 漂亮,样本外一塌糊涂。这不是数据问题,是自由度把噪声当成了信号。Lasso 用 L1 惩罚把系数逐个压到 0,弹性网络再补一道相关性缓冲,把「几百个因子」压成「十几个真有信息量的少数」。本文用合成的多因子面板(仅 15 个真信号 + 成组相关)从零跑出系数路径、稀疏度阶梯与 OOS R² 对比,并诚实披露:L1 解决的是过拟合,不是帮你印钞(高阶)。
13 min Chinese - Bootstrap 回测显著性:用重抽样给你的夏普率算出 p 值
回测跑出 1.5 的夏普很爽,但它真的不是运气吗?经典 t 检验在收益非正态、自相关、样本短时会严重失真。本文用 iid bootstrap 重抽样,在「零假设=无 alpha」下重建夏普的分布,直接算出 p 值:真 alpha 策略 p=0.015 当场现形、纯噪声策略 p=0.47 无所遁形。并附功效分析与四类真实陷阱(中阶)。
13 min Chinese - LASSO 与弹性网络在多因子选股中的应用:把 100 个因子收敛到真信号
当因子数量超过有效样本,OLS 会把噪声因子也装进模型。本文用一段 100 因子 / 10 真因子的合成面板,亲手走完 LASSO(ℓ1) 与弹性网络(ℓ1+ℓ2) 的系数路径、真因子恢复、样本外 IC 与多空组合,所有数字与配图由文末代码真实生成。
11 min Chinese - Purged K-Fold 交叉验证:给回测一个诚实的样本外
金融 ML 的标签常向前看,普通 KFold 打乱会把近重复样本留进训练、靠抄作业刷出虚假高分。本文用 López de Prado 的 purge+embargo 逼出诚实的样本外,并附完整 Python。
13 min Chinese - 合成数据增强与对抗训练:提升因子模型的泛化边界
量化因子模型最怕三件事:样本少、过拟合、分布漂移。本文从零实现 MLP 与逻辑回归,演示高斯噪声增强、SMOTE 式混合与 FGSM 对抗训练如何把测试准确率与对抗鲁棒性一起拉起来,并诚实列出会踩的真实陷阱。
14 min Chinese - 模型风险与回测过拟合检测:让回测结果值得信任
回测漂亮不等于能赚钱。本文系统拆解量化策略中的模型风险与回测过拟合:从样本内/样本外鸿沟、多重检验假阳性、去膨胀夏普比率(DSR)到 Walk-Forward 验证,并附完整 Python 实现,帮你识别并防御「看起来很美」的陷阱。
13 min Chinese
返回