- 序贯自助法样本权重:修正金融标签重叠带来的伪独立性
机器学习的所有教科书保证都建立在一句话上:样本独立同分布。金融标签把这句话踩得粉碎——「持有 25 天」意味着相邻样本共享 96% 的价格路径,500 个样本实测平均并发 6.66 个、平均唯一度仅 0.147,有效样本量只剩 73.7 个。后果是袋外评估彻底失灵:在完全不可预测的随机游走上,持有期 1 天时 OOB 只虚高 0.9pp,持有期 80 天时 OOB 报 0.607 而真样本外 0.492,凭空造出 11.5pp——重叠让「袋外」样本不再袋外。López de Prado 的两件解药:唯一度加权把每个样本的话语权降到它真正携带的信息量,序贯自助在抽样时优先挑不重叠的样本(实测抽样内唯一度提升 7.6%、重复抽中从 34.9 降到 27.5)。控制变量实验最能说明问题:训练段埋一个只在密集重叠簇里成立的伪信号,等权训练下它的特征重要性 0.633 碾压真信号的 0.193、样本外 t 值只有 1.33;换成唯一度加权后伪信号掉到 0.154、真信号升到 0.464、t 值 3.95——只改了样本权重,别的一行没动。三盆冷水:唯一度加权治重复计票不治前视偏差、纯噪声特征下不会凭空变出 alpha、序贯自助 O(n²) 开销在万级样本上要用近似(高阶)。
16 min Chinese - Purged K-Fold 交叉验证:给回测一个诚实的样本外
金融 ML 的标签常向前看,普通 KFold 打乱会把近重复样本留进训练、靠抄作业刷出虚假高分。本文用 López de Prado 的 purge+embargo 逼出诚实的样本外,并附完整 Python。
13 min Chinese
返回