- MDI 与 MDA 特征重要性:识别真正有用的因子特征
回测好看不等于特征有用——不打开黑箱,你不知道模型赚的是 alpha 还是巧合。受控实验(3 信息特征 + 3 冗余复制品 + 6 纯噪声)暴露两套主流工具各自的说谎方式:MDI(树内不纯度减少)给纯噪声也发 0.04+ 的非零重要性且永不为负,替代效应让 I_1 与它的两个复制品 R_1/R_2 三分天下(0.179/0.179/0.167),单看排名会以为有三个独立因子;MDA(OOS 置换退化)把噪声干净归零(≤0.0006)但冗余特征互相'顶班'——置换 I_1 时 R_1/R_2 还在场,损失退化被系统性低估。修复方案是聚类 MDA:相关特征整组同排置换,G1 组重要性 0.247 一举显形,是单列置换的 5 倍。三条铁律:MDI 只可比较不可检验、MDA 必须配 Purged CV 否则泄漏伪装成重要性、特征重要性分析先于回测而非之后。A 股因子普遍多重共线(规模/流动性/波动率纠缠),聚类版几乎是必选项(中高阶)
15 min Chinese - SHAP 因子解释:用博弈论份额拆开每个特征对预测的贡献
树模型自带的 gain 重要性有两个死穴:它偏爱高基数特征、而且只给全局排名,答不了『这一只股票为什么被模型看多』。SHAP 借来博弈论里的 Shapley 值——把预测当成一场合作博弈,每个因子是玩家,公平分配它对这次预测的贡献。本文讲清 Shapley 值的可加性从哪来、为什么 base value 加上所有 SHAP 值恰好等于 f(x),用合成因子数据做单样本瀑布图、全局重要性对比、依赖图揭示交互效应,并诚实指出相关特征分摊、计算成本、因果幻觉三大陷阱,附完整 Python(中阶)。
15 min Chinese
返回