- Gerber 统计量:用共动阈值替代皮尔逊相关构建组合
皮尔逊相关的每一项都是幅度乘积,一个 −8σ 崩盘日就能把全矩阵平均抬高 +0.122;Gerber 统计量只问『两资产是否同时越过 ±0.5σ 阈值』,数崩盘日只算 1 票——同一污染实验漂移仅 −0.007,稳健性差 17 倍。N=20 四板块 t(4) 肥尾模拟实测:GMV 组合真实波动率 Gerber(2022 定义) T=63 时 16.21% vs 样本 18.28%,与 LW 收缩打平;但最重要的发现是分母陷阱——原始定义 g=(nc−nd)/(nc+nd) 把 60% 的『安静样本』全扔掉导致相关系统性高估、矩阵非 PSD,GMV 波动率爆炸到 213%,Gerber-Markowitz-Sargen 2022 版分母改成 T−双双静止数后才能用。阈值 c 的权衡:干净数据 c 越小越好(退化成符号相关也无妨),叠加微观结构噪声后小 c 被重创 +79%、大 c 只 +10%。诚实边界:扔掉幅度信息在正态世界是纯损失;PSD 需事后投影修复;c 是新的自由参数且无解析选法。
16 min Chinese - Tyler M-估计量:对肥尾免疫的稳健散布矩阵
样本协方差在肥尾分布下不是慢慢变差,而是被极端日直接绑架——一个 ±15% 的异常日进入平方项后能扭曲整个相关结构。Tyler(1987)的 M-估计量给出一个漂亮的解法:把每天的收益向量投影到单位球面上再估计,只保留方向、扔掉幅度,得到的形状矩阵在所有椭圆分布下都有同一个渐近分布——对尾部厚度『分布自由』。本文 N=20 单因子模拟市场实测:t(3) 肥尾下样本协方差形状误差 0.266、Ledoit-Wolf 0.253,Tyler 只有 0.108,且从 t(3) 到正态误差几乎纹丝不动(0.108→0.102);注入 2% 的 ±15% 异常日,样本协方差误差从 0.147 恶化到 0.184,Tyler 稳在 0.109;但 10% 污染时 Tyler 反而崩得更惨(1.93 vs 0.52)——迭代加权会被大规模结构性污染带偏,稳健≠无敌。GMV 组合上优势收窄:t(4)、T=252 时 Tyler 10.63% vs 样本 11.03%(理论最优 10.19%),因为组合权重只依赖协方差的逆的方向结构,形状矩阵的优势部分被求逆运算稀释。诚实边界:Tyler 只估形状不估尺度,波动率目标要另配;对『集体同向的真实危机日』降权可能扔掉最有信息量的样本;N/T 比例较大时需要正则化版本。
14 min Chinese - 稳健协方差 MCD 估计:用最小协方差行列式抗住极端值污染
协方差矩阵是组合优化、风险模型、配对交易的地基,但样本协方差有个致命弱点——单点崩溃:只要几个极端值,整个相关结构就被拖歪。合成实验(真实相关 0.7,10% 样本被反向污染):经典相关系数直接崩到 −0.068(连符号都错了),MCD 稳健估计还原到 0.611。距离-距离图上 MCD 把 40 个污染点里的 27 个甩到右上方(FP 仅 1),经典马氏距离只抓到 11 个。最扎心的是组合权重:真实最小方差权重是 (1.04, −0.04),经典协方差给出 (0.62, 0.38)——把该做空的资产配成了 38% 多头,MCD 给出 (0.95, 0.05) 基本还原。核心机制:在所有样本子集里找行列式最小(最紧致)的那 h 个点估协方差,极端值天然行列式大、被排除在外。附一致性校正因子、C-step 迭代、以及『稳健≠无脑抗噪,h 选太大照样被污染拉偏』的反面教材(中高阶)。
17 min Chinese - 稳健统计在量化中的应用:用中位数与 MAD 替代均值方差抗极端值
你的回测夏普被一个乌龙指撑高了?你的协方差矩阵被一次闪崩撑爆了?经典均值-方差模型在遇到极端值时像纸糊的。本文用真实合成数据证明:中位数+MAD 把被离群值撑大的波动率从 2.08× 拉回 0.95×,稳健相关把被摧毁的 0.24 拉回真实 0.60 附近,并给出可直接落地的 Python 实现与五类真实陷阱(中阶)。
14 min Chinese
返回