- 分数阶差分与平稳性:在保留记忆和通过 ADF 之间求平衡
所有教科书都教你「价格不平稳,差分一次变收益」——可这一刀下去,序列的记忆被砍得干干净净:本文合成序列里一阶差分与原对数价格的相关系数只剩 0.005,「现在贵还是便宜」这个信息彻底蒸发。López de Prado 的分数阶差分主张只差 d=0.37 这么多:刚好通过 ADF(p=0.039),同时保住 91.1% 的记忆,捕捉真实均值回归成分的相关系数 0.416(一阶差分只有 0.073)。但本文最硬的发现是反面:FFD 的固定窗口截断本身会伪造平稳性——在真实 I(1) 的纯随机游走上做同样的 d=0.37 分数阶差分,窗宽 311 时 ADF 错误拒绝率高达 73%,窗宽 1669 时飙到 93%,而名义水平只有 5%。同一个数据生成过程换 20 个种子,d* 从 0.00 摆到 0.55(标准差 0.138);τ 从 1e-2 调到 1e-5,同一个 d 的记忆保留从 99.8% 掉到 29.2%;FFD 与扩张窗口两种实现在同一 d 下相关系数仅 -0.10。四项对抗式检验全过:置换 300 次真实 Sharpe 0.68 超 95 分位 0.53(p=0.020)、随机游走上因果 z 的 Sharpe -0.02 干净归零、全样本 z 的 look-ahead 在随机游走上凭空刷出 0.40(高阶)。
20 min Chinese - CUSUM 结构突变检测:用累积和滤波器抓住行情的『变脸』时刻
「行情什么时候变脸的?」事后人人都能指出来,事中没人说得清。CUSUM(Page 1954)用一个朴素到极致的机制回答这个问题:把去均值后的收益不断累加,正累积和 S⁺ 只增不减直到触阈报警,负累积和 S⁻ 对称监控下行——单日噪声互相抵消,持续的单向漂移却会线性积累,这就是它区分『抖动』和『变脸』的全部原理。三段 regime 合成行情实测:h=5σ 时第一个突变(牛转熊)延迟 9 天检出、第二个(熊转牛)23 天;阈值扫描给出灵敏度-误报的完整权衡曲线——h 从 3σ 提到 8σ,纯随机游走上的误报从 115 次砍到 23 次,检测延迟只从 2 天涨到 10 天。AFML 把它重新包装成 ML 事件采样器:只在 CUSUM 触发处采样打标签,实测样本前瞻已实现波动比固定间隔采样高 19.5%——样本更『有戏』。三盆冷水:随机游走上照样报警(它测的是漂移显著性不是因果)、阈值以波动率计价必须动态更新、检测延迟意味着报警时行情已走了一段(中阶)。
13 min Chinese - 元标注 Meta-Labeling:让二级模型决定『信这个信号多少钱』
把『找方向』和『定仓位』拆成两层是 López de Prado 在《Advances in Financial Machine Learning》里最实用的建议之一:一级模型只负责给出多空方向(可以是 MA 金叉这种土办法),二级模型不预测市场,只预测『一级模型这一单会不会赢』,输出的概率直接映射成仓位。我们在 24 只带 regime 切换的合成资产上完整复现了这条流水线:震荡段用 OU 均值回复生成(金叉追涨必被反噬),趋势段带漂移。一级 MA20/60 金叉信号 650 个、裸胜率只有 44.9%,测试段全接单复利终值 0.226(亏掉 77%);二级逻辑回归以波动率、120 日动量与交互特征预测信号成败,AUC 仅 0.575——但就这点微弱的判别力,把 precision 从 0.465 拉到 0.585,过滤后复利终值 1.367,Sharpe 从 -0.32 翻正到 0.23。代价同样清楚:recall 从 1.00 掉到 0.31,七成信号被扔掉。文章给出全部可复现代码,并明确三条边界:元标注不能救没有正期望子集的信号、AUC<0.55 时概率仓位可能比二值过滤更差、以及二级模型特征必须与一级信号正交否则学到的只是重复信息。
14 min Chinese - 序贯自助法样本权重:修正金融标签重叠带来的伪独立性
机器学习的所有教科书保证都建立在一句话上:样本独立同分布。金融标签把这句话踩得粉碎——「持有 25 天」意味着相邻样本共享 96% 的价格路径,500 个样本实测平均并发 6.66 个、平均唯一度仅 0.147,有效样本量只剩 73.7 个。后果是袋外评估彻底失灵:在完全不可预测的随机游走上,持有期 1 天时 OOB 只虚高 0.9pp,持有期 80 天时 OOB 报 0.607 而真样本外 0.492,凭空造出 11.5pp——重叠让「袋外」样本不再袋外。López de Prado 的两件解药:唯一度加权把每个样本的话语权降到它真正携带的信息量,序贯自助在抽样时优先挑不重叠的样本(实测抽样内唯一度提升 7.6%、重复抽中从 34.9 降到 27.5)。控制变量实验最能说明问题:训练段埋一个只在密集重叠簇里成立的伪信号,等权训练下它的特征重要性 0.633 碾压真信号的 0.193、样本外 t 值只有 1.33;换成唯一度加权后伪信号掉到 0.154、真信号升到 0.464、t 值 3.95——只改了样本权重,别的一行没动。三盆冷水:唯一度加权治重复计票不治前视偏差、纯噪声特征下不会凭空变出 alpha、序贯自助 O(n²) 开销在万级样本上要用近似(高阶)。
16 min Chinese - Shapelet 形态特征:从时间序列里学出最有判别力的子形状
Shapelet(Ye-Keogh 2009)是时间序列分类里最有解释性的特征:不是人工画好的『头肩顶』模板,而是从数据里学出来的、最能区分两类序列的子形状——判别标准是信息增益,特征值是序列到该形状的最小 z-norm 距离。240 条合成价格片段实验(一半在随机位置内嵌深度随机的 V 形恐慌-回补形态、一半纯随机游走):算法在无任何先验下精确还原了植入的 V 形,学出的 28 点 shapelet 单距离特征在测试集上准确率 91.2%、F1 0.91——一维特征、一个阈值、完全可解释,而全序列距离度量在『位置随机』设定下注定失效。信噪比压力测试给出诚实边界:形态深度降到背景波动同量级时准确率坍塌到 52.5% 随机线。与 SAX/Matrix Profile 的分工:MP 找『重复出现的形状』(无监督),shapelet 找『区分类别的形状』(有监督),技术图形分析的科学化版本正是后者。三盆冷水:暴力搜索 O(n²m⁴) 必须近似加速、金融标签又弱又漂移(91% 在金融数据上几乎必然是泄漏)、判别 ≠ 预测——形态搜索空间的多重检验问题比因子挖掘还严重。
18 min Chinese - 趋势扫描标注 Trend Scanning:用滚动回归 t 值给样本贴上趋势标签
监督学习做量化最脏的活是打标签:固定视野法『20 天后涨了标 +1』把标签质量绑死在拍脑袋的 h 上,震荡段标签高频翻转(实测 0.121 次/天)。Trend Scanning 改问『哪个尺度上趋势最显著』:多窗口滚动 OLS 取 |t| 最大者,符号定方向、大小定置信度。教科书没写的坑:对价格水平跑 OLS 残差高度自相关,t 值极度膨胀——随机游走上 max-|t| 的 90 分位实测高达 21.8,照抄 |t|>2 等于不设阈值。null 分布校准后:覆盖率 17.3% 但真实趋势段准确率 98.4%、震荡段误报仅 4%。下游对照(同特征同模型只换标签):固定视野样本外 Sharpe 0.20、sign(t) 1.02、校准阈值+t 值加权 2.25。三条边界:标签窗口含未来信息仅供训练、多窗口取 max 是多重检验(null 校准顺带治好)、趋势显著不等于趋势延续。
13 min Chinese - 嵌套聚类优化 NCO:先聚类再优化的两层组合构建
Markowitz 优化器的误差会在相关资产之间共振:40 只资产、4 个板块的块状相关结构下,T=90 天样本协方差直接优化的 OOS 波动率 9.7%、总杠杆 3.1 倍。López de Prado 的 NCO 把问题切成两层:先按相关距离聚类把 40×40 矩阵切成 4 个小块,簇内各自优化、再在 4 个簇组合之间优化——T=90 时 OOS 波动率降到 8.1%、杠杆压到 2.0 倍,Bootstrap 权重标准差从 3.07pp 砍到 1.44pp(稳定性翻倍)。代价同样实测得到:T=1008 数据充足时 NCO(7.68%)反而略输给直接优化(7.52%),两层结构禁止跨簇对冲,是用偏差换方差的又一笔交易。与 HRP 的区别:HRP 全程不求逆,NCO 只是把求逆的规模变小——簇内维度低到样本够用时,二次优化的信息还能保留(中阶)。
11 min Chinese - 对抗验证:用一个分类器检测训练集与实盘的分布漂移
对抗验证与分布漂移检测 - halo的量化交易专栏
12 min Chinese
返回