- 日内动量之尾盘效应:最后半小时的可预测性
把一个交易日切成 13 个半小时,跑 12 个预测回归,只有两个区间对最后半小时收益有显著预测力:第一个半小时(含隔夜信息,t=7.4)和倒数第二个半小时(t=4.4)——这正是 Gao-Han-Li-Zhou (2018) 在 SPY 上发现的日内动量结构。2500 日受控模拟复现全套结果:sign(r1)×r13 策略 Sharpe 1.99、最大回撤 -27%,对比始终做多尾盘的 0.11——信号全部来自方向切换而非做多偏差;按 r1 分五组的条件期望从 -26.5bp 单调爬升到 +29.4bp,量效关系干净。机制上三条腿:隔夜信息消化不完(开盘半小时是信息含量最高的区间)、日内趋势交易者尾盘集中平仓、被动基金收盘前再平衡的机械流。诚实交代两盆冷水:成本敏感性扫描显示单边 5bp 时 Sharpe 砍半、10bp 归零——这是日频翻仓策略的宿命;无效应对照世界里同样策略跑出 Sharpe 0.30,提醒任何尾盘研究必须配对照组。A 股注记:14:57 集合竞价切走最后 3 分钟、T+1 使现货腿只能隔日出、尾盘打板资金让 r12→r13 传导更强但拥挤(中高阶)
12 min Chinese - 高频领先滞后估计:谁先动,谁跟随
两个高度相关的资产几乎从不同时动:期货先于现货、大盘股先于小盘股、美股 ETF 先于亚洲镜像。领先滞后估计要回答的是「谁先动、领先多少秒」。受控模拟(真实滞后 θ=2 秒、泊松异步观测)实测:1 秒网格滞后互相关函数峰值精确落在 +2 秒,同期相关只有 0.066 而峰值 0.120——同步相关严重低估了这对资产的真实耦合。HRY 估计器(Hoffmann-Rosenbaum-Yoshida 2013)按区间重叠配对无需网格,峰值 0.80 落在 2 秒,信号强度是网格法的 6.7 倍。采样频率扫描给出实操上最重要的曲线:h=5s 时不对称度 0.200 最大,h=60s 时只剩 0.020——领先滞后是尺度依赖信号,网格必须与 θ 同数量级,粗网格把先后关系压扁成同期相关。方向性 IC 检验:领先者过去 2 秒预测跟随者未来 2 秒,15 日 IC 均值 0.215(t=125),反向对照只有 0.074。诚实边界:领先滞后利润与延迟军备竞赛绑定、θ 本身随市场状态漂移、Epps 效应与领先滞后互为混杂因素。A 股注记:沪深 300 期货 vs ETF、AH 股是天然领先滞后对,但 T+1 与两融门槛限制了收割方式(高阶)
14 min Chinese - 宏观因子映射:把资产收益拆解到增长与通胀两轴
「我持有 6 类资产,够分散了吧」——这是资产配置里最贵的一句错话。25 年月频实测:一个名义上持有 6 类资产、单资产最大权重仅 35% 的组合,权重 HHI 只有 0.235 看着很分散,但因子方差分解摊开来,51.8% 的波动全部来自同一个增长因子、通胀因子只占 3.5%——它不是分散组合,是加了债券装饰的股票。真正的诊断工具是把每个资产回归到「增长意外/通胀意外」两轴:股票 (+2.96, -1.29)、黄金 (+0.04, +2.39)、大宗商品 (+2.02, +2.99)、国债 (-0.70, -1.52),这张地图立刻告诉你谁和谁其实是同一笔押注。四象限矩阵给出残酷事实:没有任何资产在四个象限都活着——股票在滞胀 -35.9%、大宗商品在通缩衰退 -37.7%、黄金在金发姑娘 -19.9%。按因子暴露而非资产名称配权后,通胀敞口从 -0.0138 压到 +0.0003、最差象限从 -24.5% 收敛到 -3.6%、四象限极差从 61.0pp 砍到 15.6pp、Sharpe 从 0.64 升到 1.00,样本外 (后 15 年持有前 10 年估的权重) Sharpe 0.82 vs 60/40 的 0.41。三盆冷水:beta 在漂(黄金增长 beta 信噪比仅 0.51)、因子平衡砍右尾也砍左尾、两因子解释力有天花板(R² 最高 0.66)(中阶)
19 min Chinese - Matrix Profile 模体发现:线性时间找出价格序列里的重复形态
Matrix Profile 是 Keogh 团队 2016 年提出的时间序列挖掘框架:对每个长度为 m 的子序列,记录它到全序列最近邻(排除自身邻域)的 z-normalized 欧氏距离。这一条曲线同时给出两样东西——低谷是模体(有孪生兄弟的重复形态),高峰是 Discord(独一无二的异常段)。3000 日合成价格实验完整复现:5 处植入的三重震荡模体被 MP 精确定位(top-1 对距离 1.06,位置 599/1899 对上植入点 600/1900),闪崩+chirp 扫频异常被 MP 最大值一击命中;MASS 算法用 FFT 把单条查询距离压到 O(n log n),全对距离矩阵热图直观展示『MP = 每行最小值』。事件研究部分把模体匹配当交易信号跑了 60 日前向路径对比随机基线,并诚实交代三个坑:z-norm 会抹掉幅度信息、平凡匹配需要排除区、以及『历史形态重复出现』与『形态有预测力』是两个完全不同的命题。
14 min Chinese - 元标注 Meta-Labeling:让二级模型决定『信这个信号多少钱』
把『找方向』和『定仓位』拆成两层是 López de Prado 在《Advances in Financial Machine Learning》里最实用的建议之一:一级模型只负责给出多空方向(可以是 MA 金叉这种土办法),二级模型不预测市场,只预测『一级模型这一单会不会赢』,输出的概率直接映射成仓位。我们在 24 只带 regime 切换的合成资产上完整复现了这条流水线:震荡段用 OU 均值回复生成(金叉追涨必被反噬),趋势段带漂移。一级 MA20/60 金叉信号 650 个、裸胜率只有 44.9%,测试段全接单复利终值 0.226(亏掉 77%);二级逻辑回归以波动率、120 日动量与交互特征预测信号成败,AUC 仅 0.575——但就这点微弱的判别力,把 precision 从 0.465 拉到 0.585,过滤后复利终值 1.367,Sharpe 从 -0.32 翻正到 0.23。代价同样清楚:recall 从 1.00 掉到 0.31,七成信号被扔掉。文章给出全部可复现代码,并明确三条边界:元标注不能救没有正期望子集的信号、AUC<0.55 时概率仓位可能比二值过滤更差、以及二级模型特征必须与一级信号正交否则学到的只是重复信息。
14 min Chinese - 失衡棒 Imbalance Bars:让信息流的不对称决定采样节奏
美元棒看得见活跃、看不见方向:买卖各一亿的缠斗日和净买两亿的扫货日成交额相同,切出同样多 bar。失衡棒改追踪累计签名流 θ:双边均衡时 θ 随机游走难触阈(bar 稀疏),知情单边流让 θ 线性狂奔(bar 密集开火)。12 万 tick 合成市场(7 段知情时段)实测:知情时段采样密度比,时间棒 1.00×(失明)、美元棒 1.28×、tick 失衡棒 5.01×、美元失衡棒 5.98×;检测延迟从 6.2 分钟压到 1.9-2.5 分钟。最诚实的发现:失衡棒超额峰度 2.7-4.6 反高于时间棒的 0.03——它是信息浓缩器而非分布美化器,与美元棒目标正交。三盆冷水:AFML 原文 EWMA 阈值有正反馈塌缩缺陷(实务用固定阈值+定期再校准)、真实市场方向靠 tick rule 推断且误差集中在知情时段、采样密集不等于可交易信号。
13 min Chinese - 在线牛顿步 ONS:用二阶信息加速在线组合选择的遗憾收敛
Hazan-Agarwal-Kale (2007) 的在线牛顿步 ONS 是在线组合选择的理论巅峰之一:利用对数财富损失的 exp-concavity(比强凸更弱、比一般凸更强的性质),把遗憾从 OGD 的 O(√T) 压到 O(m log T),每步只需秩一更新的类牛顿迭代而非 Cover 通用组合的指数级积分。Cover 经典市场(现金 vs 翻倍/减半交替)实测:T=3000 时 ONS 遗憾 0.40,OGD 1.23,EG 8.37——对数横轴下 ONS 遗憾近似直线,教科书级 O(log T) 复现。带 regime 切换的双资产市场上 ONS 终值 2.23 甚至超过事后最优 CRP 的 1.87(负遗憾),代价是日均换手 207bp 是 EG 的 2.2 倍——二阶方法的敏锐既是 alpha 也是成本。三盆冷水:η 与 A 矩阵初始化在非对抗市场里敏感、m 大时广义投影是 QP 开销、log T 优势要 T 够大才显现。
16 min Chinese - 订单流付款 PFOF:零佣金背后的执行质量博弈
PFOF 完整拆解:20 万笔散户订单模拟证明零佣金不是慈善也不是骗局——客户拿到 56.2 万美元价格改善、券商收 36.4 万 PFOF、内化商净留 84.9 万,客户所得是券商所得的 1.54 倍;但先知最优路由成本仅 76.3 万,内化路由多付 45.0 万缺口暴露『比交易所好』与『最好』的距离。逆向选择模拟给出内化商挑单的硬约束:无差别全接毛利 63.2 万、识别后挑单 92.9 万,被留下的知情单净亏 18.5 万全靠噪音单 111.4 万补贴 - halo的技术博客
21 min Chinese
返回