- 分层抽样再平衡:降低指数复制的跟踪误差
「买前 50 大市值不就等于买指数了吗?」——Top-50 覆盖 56.7% 指数权重,听起来够了,实测年化跟踪误差 10.93%。300 只成分股、5 年日频因子结构模拟给出的分解:朴素 Top-K 的误差大头不是漏掉的小票的特质波动,是行业暴露的系统性歪斜——最大行业权重偏差 10.94 个百分点,等于每天拿着一个未对冲的行业赌注。行业分层抽样只做一件事:层内配额 ∝ 层权重、层权重钉死等于指数,同样 50 只票 TE 从 10.93% 降到 7.10%;再叠加市值维度做二维分层,降到 4.66%——一只票都没多买,误差砍掉 57%。蒙特卡洛 50 次重抽特质噪音:朴素 10.94%±0.10% vs 分层 7.13%±0.05%,优势是结构性的不是运气。含成本净口径下的完整权衡也摊开了:二维分层 5 年换手 2.83 倍(朴素的 2.7 倍),年化净落后从朴素的 -507bp 收窄到 -152bp——分层多付的成本远小于它省下的误差。三盆冷水:模拟的因子结构是已知的而真实世界要先估协方差、成分股调整的换手冲击未建模、K<30 时二维分层的格子会比票还多(中阶)
15 min Chinese - 换手率衰减与 Alpha 半衰期:信号该持有多久
「信号该持有多久」不是拍脑袋的参数,而是由 alpha 半衰期和交易成本共同决定的最优化问题。用 200 只股票、2000 天、真实半衰期 8 天的受控模拟实测:IC 从 1 天滞后的 1.65% 指数衰减,日频调仓年化单边换手 145.7 倍——零成本下 Sharpe 3.05,单边 60bp 直接砍到 -5.52。最优持有期随成本单调右移:10bp 时 3 天、30bp 时 10 天、60bp 时 40 天。更重要的发现有两个:一是降换手的两条路不等价,EMA 平滑信号在每个成本水平都优于机械拉长持有期(30bp 下 1.28 vs 0.94),因为平滑保留了「每天用最新信息、只是慢慢挪仓」的自由度;二是半衰期本身很难估准——单样本点估计 11.9 天 vs 真值 8 天,20 个种子的估计散布 5.4~16.7 天,而只对正 IC 点取对数回归会把估计推到 16.2 天,这是一个不报错的选择偏差。诚实边界:模拟中信号衰减是干净的指数,真实 alpha 衰减常是快慢两段混合;成本模型只有比例费率,没有市场冲击(中阶)。
15 min Chinese - 宏观因子映射:把资产收益拆解到增长与通胀两轴
「我持有 6 类资产,够分散了吧」——这是资产配置里最贵的一句错话。25 年月频实测:一个名义上持有 6 类资产、单资产最大权重仅 35% 的组合,权重 HHI 只有 0.235 看着很分散,但因子方差分解摊开来,51.8% 的波动全部来自同一个增长因子、通胀因子只占 3.5%——它不是分散组合,是加了债券装饰的股票。真正的诊断工具是把每个资产回归到「增长意外/通胀意外」两轴:股票 (+2.96, -1.29)、黄金 (+0.04, +2.39)、大宗商品 (+2.02, +2.99)、国债 (-0.70, -1.52),这张地图立刻告诉你谁和谁其实是同一笔押注。四象限矩阵给出残酷事实:没有任何资产在四个象限都活着——股票在滞胀 -35.9%、大宗商品在通缩衰退 -37.7%、黄金在金发姑娘 -19.9%。按因子暴露而非资产名称配权后,通胀敞口从 -0.0138 压到 +0.0003、最差象限从 -24.5% 收敛到 -3.6%、四象限极差从 61.0pp 砍到 15.6pp、Sharpe 从 0.64 升到 1.00,样本外 (后 15 年持有前 10 年估的权重) Sharpe 0.82 vs 60/40 的 0.41。三盆冷水:beta 在漂(黄金增长 beta 信噪比仅 0.51)、因子平衡砍右尾也砍左尾、两因子解释力有天花板(R² 最高 0.66)(中阶)
19 min Chinese - 相关矩阵去噪与去调:把市场模式从相关结构里剥出来再聚类
去噪(denoise)治采样噪声,去调(detone)治市场模式——后者是聚类场景里真正的杀手。N=40 四板块模拟(λ1 占迹 56%)实测:市场模式让所有股票对的相关都抬到 0.5 上下,簇内-簇间相关间距只剩 0.048,single/average linkage 聚类 ARI 直接归零(链式合并全灭);去调把第一特征成分整个剥掉后间距不变但均值归零,single linkage ARI 从 0.002 复活到 1.000。最反直觉的实测坑:板块特征值(约 2.0)恰好骑在 MP 上界 1.96 附近,标准 MP 去噪把板块信号当噪声压平,去噪+去调后 ARI 反而从 0.99 跌到 0.31——教科书流程『先去噪再去调』在信号贴边时是自毁操作。弱板块对照(尖峰数 1.0)更极端:去噪+去调 ARI −0.03 vs 只去调 0.89。诚实边界:去调后矩阵奇异(少一个秩)不能直接进优化器求逆,只服务聚类/距离场景;市场模式个数 k 的选择在多因子市场里不显然;Tracy-Widom 涨落让贴边特征值成灰色地带。
14 min Chinese - 因子结构协方差 POET:用主成分加稀疏残差拼出高维协方差
Fan-Liao-Mincheva(2013)的 POET 把高维协方差拆成『低秩因子部分 + 稀疏残差部分』:PCA 提前 K 个主成分吃掉公共风险,残差协方差做自适应软阈值恢复块结构。N=100/T=252(c=0.4)实测最反直觉的结论:协方差本身的 Frobenius 误差各方法几乎分不出胜负(样本 0.45 vs POET 0.47),POET 的主战场在逆矩阵——精度矩阵谱范数误差样本协方差 197 vs POET 22,差 9 倍,T=126 时更是 2144 vs 24 的灾难现场;GMV 组合真实波动率 25.2% vs 13.8%。残差软阈值把非零占比从 91% 压回 13%(真实 9%),行业块结构肉眼可见地恢复。两个工程陷阱:特征值比值法选 K 会被市场因子霸屏(K̂=1),需排除首峰看次峰;纯因子模型(残差取对角)短窗口和 POET 打平但长窗口被反超——它到 T=1008 还带着 0.39 的结构偏差不收敛。诚实边界:残差稀疏性是假设不是事实;阈值常数需交叉验证;K 选错在 Frobenius 口径几乎无感但精度矩阵口径放大。
14 min Chinese - Gerber 统计量:用共动阈值替代皮尔逊相关构建组合
皮尔逊相关的每一项都是幅度乘积,一个 −8σ 崩盘日就能把全矩阵平均抬高 +0.122;Gerber 统计量只问『两资产是否同时越过 ±0.5σ 阈值』,数崩盘日只算 1 票——同一污染实验漂移仅 −0.007,稳健性差 17 倍。N=20 四板块 t(4) 肥尾模拟实测:GMV 组合真实波动率 Gerber(2022 定义) T=63 时 16.21% vs 样本 18.28%,与 LW 收缩打平;但最重要的发现是分母陷阱——原始定义 g=(nc−nd)/(nc+nd) 把 60% 的『安静样本』全扔掉导致相关系统性高估、矩阵非 PSD,GMV 波动率爆炸到 213%,Gerber-Markowitz-Sargen 2022 版分母改成 T−双双静止数后才能用。阈值 c 的权衡:干净数据 c 越小越好(退化成符号相关也无妨),叠加微观结构噪声后小 c 被重创 +79%、大 c 只 +10%。诚实边界:扔掉幅度信息在正态世界是纯损失;PSD 需事后投影修复;c 是新的自由参数且无解析选法。
16 min Chinese - 截面动量的衰减曲线:因子信号逐日『腐烂』的实证与对抗
动量因子不是一次性开关,而是一块每天都在融化的冰。本文用边际 IC 画出信号从 0.012 逐日腐烂到零的衰减曲线,再把它翻译成最扎心的实盘问题:调仓越勤越能吃到峰值 alpha,却被换手成本反噬——模拟里毛夏普在 2 天持有期最高,净夏普却在 10 天持有期见顶(3.0),短线高频反成净值杀手。
17 min Chinese - Smart Beta 与因子投资:用规则战胜情绪,而非预测市场
Smart Beta 站在被动指数与主动选股之间:用透明、规则化的方式把久经考验的因子溢价(价值、动量、低波、质量)装进组合。本文拆解因子动物园的来源、最小方差等组合构建方法、因子相关性与分散化前提,并复盘因子拥挤、换手成本等真实陷阱,附完整 Python 构建与回测代码。
11 min Chinese
返回