双重机器学习 Double ML 因果估计:把「被混淆的因果」剥离干净
你算出「低波动股跑赢」就敢说低波动「导致」高收益吗?两者可能都被某个隐藏变量驱动——这是因果推断的死穴:混淆。双重机器学习 Double ML (Chernozhukov et al. 2018) 用两阶段机器学习(随机森林纯 numpy 从零实现)估计「处理→结果」之外的所有混淆路径 g(X)/f(X),再用交叉拟合 cross-fitting 残差化,把处理效应 θ 从相关里撬成因果。自洽合成面板(Y=θ·D+g(X)+ε, D=f(X)+ν, g 与 f 共享非线性项)上:朴素 OLS 估到 1.88(真值 1.50,偏差 +0.38)、线性残差化 Double ML 仍 1.90(偏差 +0.40,抓不住非线性混淆)、随机森林 Double ML 压到 1.60(偏差 +0.10,蒙特卡洛 100 次 SD≈0.02);并诚实拆穿 RF 收缩偏误/无交叉拟合必过拟合/混淆变量遗漏/模型误设/PLM 线性假设五类真实陷阱(中阶)。