- 嵌套聚类优化 NCO:先聚类再优化的两层组合构建
Markowitz 优化器的误差会在相关资产之间共振:40 只资产、4 个板块的块状相关结构下,T=90 天样本协方差直接优化的 OOS 波动率 9.7%、总杠杆 3.1 倍。López de Prado 的 NCO 把问题切成两层:先按相关距离聚类把 40×40 矩阵切成 4 个小块,簇内各自优化、再在 4 个簇组合之间优化——T=90 时 OOS 波动率降到 8.1%、杠杆压到 2.0 倍,Bootstrap 权重标准差从 3.07pp 砍到 1.44pp(稳定性翻倍)。代价同样实测得到:T=1008 数据充足时 NCO(7.68%)反而略输给直接优化(7.52%),两层结构禁止跨簇对冲,是用偏差换方差的又一笔交易。与 HRP 的区别:HRP 全程不求逆,NCO 只是把求逆的规模变小——簇内维度低到样本够用时,二次优化的信息还能保留(中阶)。
11 min Chinese - 高斯混合聚类资产:用软分配把股票分成潜在风格群
k-means 给每只股票发一张唯一的『风格身份证』:要么成长、要么价值,边界上的股票被硬塞进某一边。但真实资产风格是渐变的——一只『半成长半价值』的股票,硬分类会抹掉这个信息。GMM 把每个风格群建模成一个高斯分布,输出的不是标签而是责任度(responsibility):这只股票 62% 像成长、35% 像价值。合成实验:3 个真实风格群、协方差形状各异且相互重叠,GMM 分类准确率 89.0% 碾压 k-means 的 68.3%——因为 k-means 只会画球形边界,而 GMM 的满协方差能贴合拉长、倾斜的簇。更关键的是 GMM 自带『不确定度报告』:15.7% 的资产最大责任度低于 0.8,这些正是躺在风格边界上的股票,k-means 对它们的标签几乎是抛硬币。用 BIC 选簇数,K=3 处 BIC 达到最小值 1755.2,精确对上真实群数。纯 numpy 实现 EM 算法(E 步算责任度、M 步更新均值协方差权重),拆穿 GMM 总比 k-means 好/EM 保证全局最优/责任度=真实概率/K 越大似然越高所以越好/满协方差永远优于对角五类陷阱(中阶)。
12 min Chinese
返回