- 相关矩阵去噪与去调:把市场模式从相关结构里剥出来再聚类
去噪(denoise)治采样噪声,去调(detone)治市场模式——后者是聚类场景里真正的杀手。N=40 四板块模拟(λ1 占迹 56%)实测:市场模式让所有股票对的相关都抬到 0.5 上下,簇内-簇间相关间距只剩 0.048,single/average linkage 聚类 ARI 直接归零(链式合并全灭);去调把第一特征成分整个剥掉后间距不变但均值归零,single linkage ARI 从 0.002 复活到 1.000。最反直觉的实测坑:板块特征值(约 2.0)恰好骑在 MP 上界 1.96 附近,标准 MP 去噪把板块信号当噪声压平,去噪+去调后 ARI 反而从 0.99 跌到 0.31——教科书流程『先去噪再去调』在信号贴边时是自毁操作。弱板块对照(尖峰数 1.0)更极端:去噪+去调 ARI −0.03 vs 只去调 0.89。诚实边界:去调后矩阵奇异(少一个秩)不能直接进优化器求逆,只服务聚类/距离场景;市场模式个数 k 的选择在多因子市场里不显然;Tracy-Widom 涨落让贴边特征值成灰色地带。
14 min Chinese - 层次聚类配对交易:用相关性树在几百只股票里挖出可交易的对
配对交易的第一道难关不是回测,是从 N 只股票的 C(N,2) 个组合里挑对——30 只就有 435 对,全跑一遍协整检验既慢又是数据挖掘的温床。本文用纯 numpy/scipy 合成 30 只股票(内嵌市场因子+5 个板块因子+一对刻意注入的协整对),把层次聚类当成配对的漏斗:先用相关性距离 √(0.5(1-ρ)) 建 Ward 连接树,聚类纯度 90.9%,把 435 对候选压到 100 对簇内高相关组合(筛掉 77%);再在簇内用『对冲比为正 + 相关>0.5』预筛、按价差 AR(1) 半衰期排序挑出真正均值回归的对(金融2/金融5,相关 0.64、半衰期 15.7 天)。配对回测 3 年 15 次开仓、日胜率 52%、Sharpe 0.58、累计价差收益 20.5%。全文最重要一节是打穿『相关≠协整』:刻意注入的高相关对若对冲比为负、价差不回归,照样亏钱;聚类只负责缩小搜索空间,真正决定盈亏的是价差平稳性。另拆穿聚类结构随窗口漂移、树状图切割高度主观、簇内组合仍需协整二次筛、样本内挑对必然乐观四类陷阱(中高阶)。
16 min Chinese - 层级风险平价(HRP):用相关性树把马科维茨的协方差病治好
马科维茨均值-方差最优解对协方差估计极度敏感:只要资产高度共线,样本协方差的一点噪声就会让最优权重爆成几十倍杠杆。层级风险平价(HRP, López de Prado 2016)干脆不碰逆协方差,而是用相关性距离做层次聚类,把资产聚成一棵树,再自顶向下按子组合波动率二分配置。本文用 12 个合成资产(含一对近复制资产)复现:最小方差解出 2.09 倍总敞口、5 个资产做空、bootstrap 权重 std 0.025;HRP 权重有界、风险贡献接近均衡、bootstrap 权重 std 仅 0.015——它不保证更高收益,但把『估计误差』这条命门堵上了。附完整 Python 与六类真实陷阱(高阶)。
14 min Chinese - 层次风险平价(HRP):用聚类与递归二分超越传统风险平价
传统风险平价要么求逆协方差(病态)要么坍缩到单名40%+;HRP 不求逆:Ward 聚类+递归二分按逆方差切权重,样本外波动14.13%低于等权14.82%、最大单名仅19.8%远胜最小方差37.6%集中。
11 min Chinese
返回