- 距离相关系数:用 Hilbert-Schmidt 独立性把非线性依赖从噪声里捞出来
Pearson 相关只能抓线性:r=0 时两变量可能仍强烈相关(如 Y=X²)。距离相关系数(dCor)把独立性本身变成可检验的量——dCor=0 当且仅当独立。本文用纯 numpy 从零实现 dCov/dCor 与置换检验,并在线性/二次/圆/独立四类关系上对照 Pearson,诚实拆穿「径向对称是 dCor 盲区」与「噪声稀释依赖」两条真实边界(中阶)。
13 min Chinese - 分数差分平稳化:在保留记忆与消除单位根之间取平衡
机器学习做量化最隐蔽的坑之一:直接用价格(非平稳)会引入伪相关,用收益率(一阶差分)又把记忆全丢掉。分数差分 fracdiff 用 0<d<1 的阶数,在「平稳」与「记忆」之间取折中。本文换一个应用视角——不是做特征,而是用 fracdiff 选 d 来服务「样本外预测」:在差分序列上拟合 AR(1) 外推,发现预测误差随 d 呈 U 形,最优 d≈0.65,并在多预测期上证明平稳化的优势随外推越远越明显。配 3 张真实图表与完整 Python(中阶)。
11 min Chinese - 分数阶差分 fracdiff:在平稳与记忆之间找平衡点
机器学习做量化最隐蔽的坑之一:直接用价格(非平稳)会引入伪相关,用收益率(一阶差分)又把记忆全丢掉。分数阶差分 fracdiff 用 0<d<1 的阶数,在『平稳』与『记忆』之间取折中。本文从权重公式讲到 ADF 权衡曲线,配 4 张真实图表与完整 Python。
11 min Chinese - 自编码器因子挖掘:用深度学习提取非线性 Alpha
传统因子是「人拍脑袋的线性组合」,自编码器(Autoencoder)能用无监督方式把几十维原始量价特征压缩成一小组「低相关、信息损失最小」的编码向量,当作新因子喂给选股模型。本文从数学定义、纯 numpy 手写自编码器、到「编码即新因子」的 IC 检验完整走通,并指出无监督≠可预测、容量有限、分布漂移三大真实陷阱。
9 min Chinese
返回