- 常相关模型 CCM:把整个相关矩阵压成一个平均相关系数
Elton-Gruber(1973)的常相关模型:把 N(N-1)/2 个成对相关全部替换成一个平均相关系数 ρ̄——435 个参数压成 1 个,方差骤降换一身结构偏差。N=30 板块结构模拟实测:T=30 时 CCM 的 Frobenius 误差 2.56 vs 样本相关 4.38,交叉点在 T≈126,之后 CCM 被结构偏差下限 1.90 卡死永远追不上。GMV 组合判决更极端:T=30 样本协方差真实波动率 456%(近奇异优化器爆仓)vs CCM 17.5%;T=252 后样本反超。最有信息量的是混合曲线:最优混合权重 δ 随 T 单调爬升(T=60 时 0.35、T=252 时 0.65、T=1008 时 0.90)——这正是 Ledoit-Wolf 收缩的雏形,LW 恰以 CCM 为收缩靶心并把 δ 的选择自动化。诚实边界:ρ̄ 抹掉全部板块结构、对多板块 universe 偏差大;相关非平稳时单一 ρ̄ 追不上 regime;它是收缩靶子而非终点方案。
11 min Chinese - Corwin-Schultz 高低价价差估计:用两日高低价把价差与波动拆开
Corwin-Schultz(2012)的巧思:日最高价几乎总来自 ask、最低价几乎总来自 bid,所以高低价比里藏着价差;而波动随时间线性增长、价差不随时间变——单日高低比与两日高低比联立两个方程,恰好把价差 s 和波动 σ 同时解出。252 日模拟实测:真实价差 2% 时 CS 截零均值 2.05%,几乎无偏;但低价差区间正偏差显著(真值 0.2% 估出 0.83%),因为逐对负估计占比高达 40% 且截零只砍左尾。与 Roll 同台:信噪比低时 Roll 失效率 45% 直接弃赛,CS 至少给出有偏但可用的数字。隔夜跳空是最大污染源:隔夜波动 3% 时估计从 1% 被压到 0.69%(跳空撑大两日区间、γ 膨胀导致低估),平移修正能救回一半。60 日滚动 CS 危机温度计:平静期 0.79%、危机峰值 3.58%,形状完整还原。诚实边界:截零规则在截面比较中引入系统性正偏、非连续交易压低高低区间导致低估、加密/外汇等无隔夜市场反而是最优场景(中阶)。
14 min Chinese - DCC-GARCH 动态相关:让资产间相关系数随时间自行演化
相关性从来不是常数:危机来临时它齐刷刷跳升,而 252 天滚动相关要 248 天才承认这件事。Engle(2002)的 DCC-GARCH 把问题拆成两步:先用单变量 GARCH 各自过滤波动率,再在标准化残差上用一行递推 Q_t = (1−a−b)Q̄ + a·ε_{t−1}ε'_{t−1} + b·Q_{t−1} 驱动相关演化。本文两资产模拟实测:相关从 0.3 跳到 0.85 的危机段,DCC 86 天收敛到位(滚动窗口 248 天),全样本追踪 MAE 0.109 优于滚动(0.112)和 EWMA(0.143)。1% VaR 回测更能说明问题:危机段滚动窗口击穿率 2.33%(超标 2.3 倍),DCC 0.33%——差异全部集中在最需要风控的时段。QML 估计出 a=0.033、b=0.964,a+b=0.997 的高持续性正是金融相关的典型指纹。诚实边界:两步 QML 是一致但非有效估计、N 大时 Q̄ 本身要收缩、DCC 假设所有资产对共享同一组 a/b。
14 min Chinese - 相关矩阵去噪与去调:把市场模式从相关结构里剥出来再聚类
去噪(denoise)治采样噪声,去调(detone)治市场模式——后者是聚类场景里真正的杀手。N=40 四板块模拟(λ1 占迹 56%)实测:市场模式让所有股票对的相关都抬到 0.5 上下,簇内-簇间相关间距只剩 0.048,single/average linkage 聚类 ARI 直接归零(链式合并全灭);去调把第一特征成分整个剥掉后间距不变但均值归零,single linkage ARI 从 0.002 复活到 1.000。最反直觉的实测坑:板块特征值(约 2.0)恰好骑在 MP 上界 1.96 附近,标准 MP 去噪把板块信号当噪声压平,去噪+去调后 ARI 反而从 0.99 跌到 0.31——教科书流程『先去噪再去调』在信号贴边时是自毁操作。弱板块对照(尖峰数 1.0)更极端:去噪+去调 ARI −0.03 vs 只去调 0.89。诚实边界:去调后矩阵奇异(少一个秩)不能直接进优化器求逆,只服务聚类/距离场景;市场模式个数 k 的选择在多因子市场里不显然;Tracy-Widom 涨落让贴边特征值成灰色地带。
14 min Chinese - EWMA 协方差 RiskMetrics:用指数衰减权重让风险估计跟上市场
等权滚动窗口把 252 天前的旧数据和昨天的数据一视同仁:相关性 regime 从 0.3 跳到 0.8(危机来临)后,252 天滚动相关要 234 天才收敛到位,EWMA λ=0.94 只要 18 天。RiskMetrics(1996)的全部秘密是一行递推:σ²_t = λσ²_{t-1} + (1−λ)r²_{t-1},λ=0.94 对应 11 天半衰期、约 32 天有效样本。GARCH 市场实测 1% VaR 击穿率:EWMA 1.40% vs 滚动窗口 1.67%,且滚动窗口的击穿集中在波动率抬升年份——最需要它的时候它最迟钝。但诚实的另一面:20 资产最小方差组合 OOS 波动率,EWMA λ=0.94(16.0%)反而输给滚动 252 天(12.9%)——有效样本 32 天喂 20 维协方差矩阵是灾难,EWMA 解决的是时效性不是维度诅咒,高维要么升 λ 要么叠加收缩(中阶)。
10 min Chinese - 因子结构协方差 POET:用主成分加稀疏残差拼出高维协方差
Fan-Liao-Mincheva(2013)的 POET 把高维协方差拆成『低秩因子部分 + 稀疏残差部分』:PCA 提前 K 个主成分吃掉公共风险,残差协方差做自适应软阈值恢复块结构。N=100/T=252(c=0.4)实测最反直觉的结论:协方差本身的 Frobenius 误差各方法几乎分不出胜负(样本 0.45 vs POET 0.47),POET 的主战场在逆矩阵——精度矩阵谱范数误差样本协方差 197 vs POET 22,差 9 倍,T=126 时更是 2144 vs 24 的灾难现场;GMV 组合真实波动率 25.2% vs 13.8%。残差软阈值把非零占比从 91% 压回 13%(真实 9%),行业块结构肉眼可见地恢复。两个工程陷阱:特征值比值法选 K 会被市场因子霸屏(K̂=1),需排除首峰看次峰;纯因子模型(残差取对角)短窗口和 POET 打平但长窗口被反超——它到 T=1008 还带着 0.39 的结构偏差不收敛。诚实边界:残差稀疏性是假设不是事实;阈值常数需交叉验证;K 选错在 Frobenius 口径几乎无感但精度矩阵口径放大。
14 min Chinese - Gerber 统计量:用共动阈值替代皮尔逊相关构建组合
皮尔逊相关的每一项都是幅度乘积,一个 −8σ 崩盘日就能把全矩阵平均抬高 +0.122;Gerber 统计量只问『两资产是否同时越过 ±0.5σ 阈值』,数崩盘日只算 1 票——同一污染实验漂移仅 −0.007,稳健性差 17 倍。N=20 四板块 t(4) 肥尾模拟实测:GMV 组合真实波动率 Gerber(2022 定义) T=63 时 16.21% vs 样本 18.28%,与 LW 收缩打平;但最重要的发现是分母陷阱——原始定义 g=(nc−nd)/(nc+nd) 把 60% 的『安静样本』全扔掉导致相关系统性高估、矩阵非 PSD,GMV 波动率爆炸到 213%,Gerber-Markowitz-Sargen 2022 版分母改成 T−双双静止数后才能用。阈值 c 的权衡:干净数据 c 越小越好(退化成符号相关也无妨),叠加微观结构噪声后小 c 被重创 +79%、大 c 只 +10%。诚实边界:扔掉幅度信息在正态世界是纯损失;PSD 需事后投影修复;c 是新的自由参数且无解析选法。
16 min Chinese - Glosten-Milgrom 模型:逆向选择如何撑开买卖价差
Glosten-Milgrom(1985)用一个贝叶斯序贯交易模型回答『价差从哪来』:做市商面对的每一张单子都可能来自知情者,报价必须事前把这份逆向选择风险定进价里——ask = E[V|下一单是买],bid = E[V|下一单是卖]。V∈{98,102} 的两值模型实测:知情者占比 μ 从 0.1 升到 0.6,价差从 0.40 线性撑到 2.40;做市商损益分解完美验证零利润条件——μ=0.1 时对知情者亏 12.0、从不知情者赚 11.2,合计≈0,价差本质是不知情者向知情者交的转移税。价格发现的速度-成本对偶:μ=0.5 时中间价约 30 笔收敛到真值但每步价差宽,μ=0.15 时价差窄却 200 笔仍未收敛完;价差随成交衰减,因为信息逐渐进价、剩余信息不对称减小。工程输出:GM 是 PIN/VPIN 的理论地基,也解释为何财报前价差系统性走宽。诚实边界:两值真值、单位单量、零库存成本都是理想化;真实价差还含订单处理成本与库存风险两个 GM 不建模的成分。
12 min Chinese
返回