- Tick 失衡 Bar:用订单流失衡触发的自适应采样
tick/成交量/美元 Bar 共享一个盲区:只数活动的量,不看方向。1000 手买对轰 1000 手卖是均衡市场,2000 手连续买是知情交易——前三种 bar 一视同仁。Tick 失衡 Bar 把切分条件换成失衡量:逐笔方向 ±1 累加,失衡绝对值触阈值就切一根。12 万笔受控模拟(中段植入 p=0.68 持续买方失衡)实测:知情区段采样密度 30.2 vs 平静期 2.7 根/窗口,自动加密 11 倍;bar 长度中位数 1653→162 tick,bar 长度成了免费的知情强度指标;平方收益 ACF 从 0.335 压到 0.039,波动聚集被吸收进采样密度。代价:EWMA 阈值自举脆弱、bar 数不可预算、tick rule 误判在单边行情系统性放大。A 股:Level-2 BS 标志可跳过 tick rule,但 T+1 下 TIB 定位是特征时钟而非交易时钟(高阶)
12 min Chinese - 成交量时钟采样:用交易活动而非日历时间切分数据
「每 5 分钟切一根 K 线」是全行业的默认习惯,但日历时间是市场的旁观者:新闻爆发的 1 分钟塞进上千笔交易,午间死寂的 1 小时只有零星报价,等时间采样把这两者塞进同样大小的格子——高活动期信息被压缩、低活动期噪声被放大。Clark 1973 的 subordination 定理给出理论出口:如果价格是被『交易活动量』这个随机时钟驱动的布朗运动,那么在活动时钟下观察,收益就回到正态。合成实验(每笔收益严格 iid 正态、仅活动强度带 AR(1) 持续性 + 日内 U 型 + 新闻爆发)验证:同一段 21.6 万笔逐笔数据、相同 bar 数量,时间 Bar 收益超额峰度 3.52、JB 统计量 496、平方收益自相关 0.13 显著——肥尾与波动聚集全是采样时钟制造的伪影;换成成交量 Bar 后峰度 0.04、JB≈0、ACF 归零,收益变回教科书正态。这对 ML 管线是根本性利好:多数模型隐式假设样本同分布,成交量时钟在数据层面完成了『去异方差』。实操三坑:拆单与算法交易让 tick 计数通胀(成交量比笔数稳健)、阈值须随活动水平漂移而更新、A 股午休跨段 bar 需显式处理(中高阶)。
16 min Chinese - 元标注 Meta-Labeling:把方向和仓位拆成两个模型
让一个 ML 模型直接预测涨跌,是金融机器学习最拥挤也最失败的路线。López de Prado 的元标注换了问法:先让一级模型(哪怕是最朴素的 MA 金叉)定方向,再训练一个二级模型只回答『这次信号该不该信、信多少』——标签是一级信号经三重障碍结算的对错(1/0),特征是信号发出时的市场状态。合成双状态市场(趋势市动量延续、震荡市均值回归)实测:胜率 59% 的金叉策略,经元模型过滤后精确率从 63% 提到 74%,代价是放掉 29% 的赚钱机会——用召回率换精确率正是交易想要的不对称;样本外净值三连跳:全执行 Sharpe 0.56 / 回撤 23%,过滤后 1.37 / 16%,概率仓位(size ∝ 2P−1)1.86 / 4.9%。打开黑箱看元模型学到了什么:趋势市金叉胜率 69% vs 震荡市 57%——它学会的是『什么时候该信趋势策略』这个 regime 判断,而这正是人类交易员最难量化坚持的纪律。三个诚实警告:元模型天花板受一级信号质量约束(垃圾进垃圾出)、双层结构过拟合风险翻倍(元特征应克制在个位数)、概率校准是仓位函数的前提(先看校准图再谈 Kelly)(中高阶)。
14 min Chinese - 三重障碍标注法:给金融机器学习一个不作弊的标签
「未来 20 日收益为正就标 1」——这个看起来无害的标注方式,是大多数金融 ML 项目失败的第一块多米诺骨牌:固定时间窗忽略路径(20 日赚 1% 收尾但中途浮亏 15% 也算「成功」),固定收益阈值让标签分布随波动率状态漂移(低波动期全是 0、高波动期全是 ±1,模型学的是波动状态不是方向)。López de Prado 的三重障碍法一次修掉这两个病灶:止盈、止损、最大持有期三道障碍先触先得,障碍宽度按 EWMA 波动率自适应缩放。合成数据实测:固定 ±5% 阈值下标签分布从低波动期的『超时占 27%』漂移到高波动期的『超时占 12%』,自适应阈值在两种状态下几乎不变;同一特征集同一逻辑回归,三重障碍标签的样本外概率校准更贴对角线,配套障碍退出把单笔最差浮亏从 -21.8% 截到 -15.4%——标签定义与退出规则一致,模型学的才是你要执行的东西。第四节直面代价:区间重叠让样本非独立,标准 K-fold 会把泄漏伪装成 IC——这正是唯一性加权与 Purged CV 的动机(中高阶)。
15 min Chinese
返回