- 分数阶差分与平稳性:在保留记忆和通过 ADF 之间求平衡
所有教科书都教你「价格不平稳,差分一次变收益」——可这一刀下去,序列的记忆被砍得干干净净:本文合成序列里一阶差分与原对数价格的相关系数只剩 0.005,「现在贵还是便宜」这个信息彻底蒸发。López de Prado 的分数阶差分主张只差 d=0.37 这么多:刚好通过 ADF(p=0.039),同时保住 91.1% 的记忆,捕捉真实均值回归成分的相关系数 0.416(一阶差分只有 0.073)。但本文最硬的发现是反面:FFD 的固定窗口截断本身会伪造平稳性——在真实 I(1) 的纯随机游走上做同样的 d=0.37 分数阶差分,窗宽 311 时 ADF 错误拒绝率高达 73%,窗宽 1669 时飙到 93%,而名义水平只有 5%。同一个数据生成过程换 20 个种子,d* 从 0.00 摆到 0.55(标准差 0.138);τ 从 1e-2 调到 1e-5,同一个 d 的记忆保留从 99.8% 掉到 29.2%;FFD 与扩张窗口两种实现在同一 d 下相关系数仅 -0.10。四项对抗式检验全过:置换 300 次真实 Sharpe 0.68 超 95 分位 0.53(p=0.020)、随机游走上因果 z 的 Sharpe -0.02 干净归零、全样本 z 的 look-ahead 在随机游走上凭空刷出 0.40(高阶)。
20 min Chinese - 熵特征工程:用信息熵度量价格序列的『可预测性』
波动率告诉你市场动得多猛,熵告诉你市场动得多『乱』——同样 1% 的日波动,趋势机制块熵 0.956、随机游走 0.980,那 0.024 bit 的差距就是动量策略的全部生存空间。260 段随机 AR(1) 实测:样本内块熵与未来 120 天可预测性相关 -0.65,熵是少数能对『未来』说话的样本内统计量。落地成过滤器:趋势/随机游走交替市场上,35 分位熵阈值让动量 Sharpe 从 0.40 升到 0.50、最大回撤从 0.54 砍到 0.25、持仓时间只剩 35%——它赚的不是更多的钱,是躲掉的亏损。三盆冷水最值钱:符号编码丢掉幅度信息(跳空 8% 和阴跌 0.1% 同为一个 0)、窗口-块长组合的统计量噪声大到 60 天窗口只够分辨『很乱』和『不那么乱』、低熵只说明有结构不说明结构是什么——均值回复段的低熵会诱导动量满仓接刀。熵过滤器的正确定位是否决权而非指挥权:它有资格说『这段别交易』,没资格说『这段该做多』(中阶)。
13 min Chinese - 路径签名粗糙路径:用迭代积分把价格轨迹写成可学习的特征
传统特征工程把一段价格轨迹压成几个统计量——均值、波动、动量——路径怎么走的信息全部丢掉。路径签名换思路:用粗糙路径理论中的迭代积分,把整条轨迹按阶数展开成一列数,level-1 是净位移、level-2 是 Lévy 面积(转了多少圈)、level-3 编码更精细的时序几何,理论上无限阶签名唯一决定路径形状。本文用纯 numpy 通过 Chen 恒等式递推实现 2 维时间增广路径的 level-3 截断签名,在三类合成路径(趋势/均值回复往返/噪声)上做特征对决:签名 level-1~3 样本外 IC 0.737,碾压 6 维手工统计特征(0.597);消融揭示关键信息藏在三阶项——level-1~2 只有 0.434,加入 level-3 一步跳到 0.737,因为『先冲高后回落』的往返形状是三阶几何量。诚实拆穿维度爆炸陷阱:d 维路径 level-L 签名共 Σdᵏ 项,d=5 到 level-5 已是 3905 维,必须靠时间增广+低阶截断+正则化续命。拆穿签名=万能特征/平移不变性丢失绝对价位/采样频率敏感/树内核近似取舍四类陷阱(中高阶)。
14 min Chinese - 距离相关系数:用 Hilbert-Schmidt 独立性把非线性依赖从噪声里捞出来
Pearson 相关只能抓线性:r=0 时两变量可能仍强烈相关(如 Y=X²)。距离相关系数(dCor)把独立性本身变成可检验的量——dCor=0 当且仅当独立。本文用纯 numpy 从零实现 dCov/dCor 与置换检验,并在线性/二次/圆/独立四类关系上对照 Pearson,诚实拆穿「径向对称是 dCor 盲区」与「噪声稀释依赖」两条真实边界(中阶)。
13 min Chinese - 分数差分平稳化:在保留记忆与消除单位根之间取平衡
机器学习做量化最隐蔽的坑之一:直接用价格(非平稳)会引入伪相关,用收益率(一阶差分)又把记忆全丢掉。分数差分 fracdiff 用 0<d<1 的阶数,在「平稳」与「记忆」之间取折中。本文换一个应用视角——不是做特征,而是用 fracdiff 选 d 来服务「样本外预测」:在差分序列上拟合 AR(1) 外推,发现预测误差随 d 呈 U 形,最优 d≈0.65,并在多预测期上证明平稳化的优势随外推越远越明显。配 3 张真实图表与完整 Python(中阶)。
11 min Chinese - 分数阶差分 fracdiff:在平稳与记忆之间找平衡点
机器学习做量化最隐蔽的坑之一:直接用价格(非平稳)会引入伪相关,用收益率(一阶差分)又把记忆全丢掉。分数阶差分 fracdiff 用 0<d<1 的阶数,在『平稳』与『记忆』之间取折中。本文从权重公式讲到 ADF 权衡曲线,配 4 张真实图表与完整 Python。
11 min Chinese - 自编码器因子挖掘:用深度学习提取非线性 Alpha
传统因子是「人拍脑袋的线性组合」,自编码器(Autoencoder)能用无监督方式把几十维原始量价特征压缩成一小组「低相关、信息损失最小」的编码向量,当作新因子喂给选股模型。本文从数学定义、纯 numpy 手写自编码器、到「编码即新因子」的 IC 检验完整走通,并指出无监督≠可预测、容量有限、分布漂移三大真实陷阱。
9 min Chinese
返回