- 美元棒采样 Dollar Bars:按成交金额而非时钟切分K线
K线按『每5分钟一根』切分是历史遗留而非统计最优:市场信息不按时钟到达,开盘和收盘挤满成交、午盘空转,固定时间间隔意味着信息密集时段被欠采样、清淡时段被过采样,结果是时间棒收益呈现肥尾与波动聚集,直接违反大多数 ML 模型的 iid 近似假设。Dollar Bars 的解法:累计成交金额每达到阈值就切一根 bar,让采样节奏跟着市场活跃度自适应。我们用 Hawkes 自激强度 + 日内 U 型季节性合成 60 个交易日的分钟级市场(14400 分钟,活跃度高度成簇),在等量 bar 数(~1100-1200 根)下对比三种采样:时间棒超额峰度 1.16、Jarque-Bera 统计量 72、绝对收益一阶自相关 0.132;成交量棒分别降到 -0.13 / 2 / 0.013;美元棒做到 -0.01 / 0(正态性检验直接不拒绝)/ -0.035,波动聚集被采样方式本身消解。原理是 Ané-Geman (2000) 的时间变换:以成交活动为『市场时钟』重新计时,收益向高斯回归。文章给出完整合成与采样代码、QQ 图与 bar 时长分布证据,并交代三条实务边界:阈值需随市值漂移动态调整、bar 数量不齐导致多资产对齐成本、以及『分布更正态』不等于『更可预测』。
12 min Chinese - DTW 重心平均:对齐时间扭曲后求出K线形态的『平均脸』
『把 20 段 V 形恐慌-回补走势平均一下』听起来无害,但逐点算术平均是形态学的绞肉机:每段下跌时长 5~14 天随机、底部位置随机,逐点平均把错位的底相互抵消——实测平均后的 V 形深度只剩 -0.62,而样本真实平均深度是 -1.03,形态被抹掉 40%。DBA(Petitjean 2011)的解法:先用 DTW 把每段序列与当前重心逐点对齐(允许时间轴伸缩),把对齐到同一坐标的所有点取均值,迭代到收敛。实测 DBA 重心深度 -1.02 几乎完美还原,到样本的平均 DTW 距离从逐点平均的 0.907 降到 0.351(改善 61%),且目标函数单调下降。模板分类实验暴露完整依赖链:V 形单底 vs W 形双底(深度相同、位置时长随机,判别信息只在形状),逐点平均模板+欧氏距离准确率 53%(≈抛硬币)、逐点模板+DTW 50%、DBA 模板+DTW 88%——模板和度量必须同时懂时间扭曲,换任何一半都直接坍塌回随机线。三盆冷水:DTW 对齐自由度本身是过拟合来源(无窗口约束的 DTW 能把任何两段序列都对齐得很像)、DBA 是局部最优且对初始化敏感、『平均形态存在』不等于『形态有预测力』——DBA 只回答形态学问题,交易价值要靠时间外检验另行审判。
13 min Chinese - 久期中性国债期货套利:跨期限曲线交易实战
曲线交易的第一课不是「怎么选方向」,而是「你以为你在赌利差,其实你在赌利率水平」。六年模拟曲线实测:收益率日变动的第一主成分(水平)独占 95.3% 方差、斜率只剩 2.0%——等张数 1:1 的 2s10s 组合,盈亏有 74.8% 被水平因子解释、水平 beta 高达 454 元/bp,它根本不是曲线交易,是伪装成价差的裸多头。换成 DV01 中性(2.18 张两年对一张十年)后水平 R² 降到 0.0000、与利差变动相关性 0.999,这才叫「只赌斜率」。全文最反直觉的对照:等张数版本 Sharpe 0.42 反而高于 DV01 中性的 0.24——因为它偷偷加载了 beta,用『赌错了方向』换来的收益不该记在曲线交易账上。三个必须写进风控的坑:DV01 比例自己在漂移 16.3%(CTD 切换/久期衰减)、误设 20% 就把水平 R² 从 0.00 拉回 0.25、单边成本 0.53bp 就吃光全部 alpha(毛 Sharpe 1.01 → 0.24,成本占毛利 75.8%)。真正的收益来源是 carry+roll 而不是价差波动:陡峭化组合净 carry+roll 为 -5.8bp/季度,你在逆风持仓(中阶)
19 min Chinese - 微观结构熵特征:用信息论度量价格序列的可预测性
「这段行情有多可预测」不必是玄学:把收益二值化成涨跌符号串估计香农熵率——熵=1 bit/符号意味着彻底随机(任何模型命中率上限 50%),熵越低结构越多。受控实验三种机制对照:iid 块熵 0.9996、动量(延续概率 0.75)0.884、均值回复 0.880——熵对「有没有记忆」敏感、对方向色盲,一个特征覆盖两类可交易结构。延续概率 0.5→0.92 扫描给出单调曲线:熵与最优命中率一一对应,是模型无关的可预测性上界。300 符号滚动熵能把动量段与均值回复段从 iid 背景中挖出。两个深坑:块长过大+样本不足时纯随机也能测出 0.7 的假低熵,必须 2^w≪n;所有熵估计器绝对值均有偏差,只能同参数相对比较。AFML 定位:不做择时开关,做元标注二级模型的环境特征(高阶)
13 min Chinese - 熵特征工程:用信息熵度量价格序列的『可预测性』
波动率告诉你市场动得多猛,熵告诉你市场动得多『乱』——同样 1% 的日波动,趋势机制块熵 0.956、随机游走 0.980,那 0.024 bit 的差距就是动量策略的全部生存空间。260 段随机 AR(1) 实测:样本内块熵与未来 120 天可预测性相关 -0.65,熵是少数能对『未来』说话的样本内统计量。落地成过滤器:趋势/随机游走交替市场上,35 分位熵阈值让动量 Sharpe 从 0.40 升到 0.50、最大回撤从 0.54 砍到 0.25、持仓时间只剩 35%——它赚的不是更多的钱,是躲掉的亏损。三盆冷水最值钱:符号编码丢掉幅度信息(跳空 8% 和阴跌 0.1% 同为一个 0)、窗口-块长组合的统计量噪声大到 60 天窗口只够分辨『很乱』和『不那么乱』、低熵只说明有结构不说明结构是什么——均值回复段的低熵会诱导动量满仓接刀。熵过滤器的正确定位是否决权而非指挥权:它有资格说『这段别交易』,没资格说『这段该做多』(中阶)。
13 min Chinese - Epps 效应:高频下相关系数为何随采样频率衰减
把采样间隔从 30 分钟压到 5 秒,两个真实相关 ρ=0.7 的资产测出来的相关系数会跌到 0.08——不是市场变了,是估计器坏了。Epps 效应的主因是异步交易:清淡资产的最新价大部分时间是几秒前的旧价,previous-tick 对齐让高频收益大量配对到「新信息 vs 旧价格」,相关性被机械稀释。40 个模拟交易日的受控实验完整复现衰减曲线(5s: 0.08 → 60s: 0.49 → 600s: 0.69≈真值),机制分解实验证明同步观测对照组在所有频率下都测得 0.7——衰减 100% 是观测机制造成的伪影。组合风险端的传导:h=10s 估计的相关矩阵让等权组合年化波动被低估 3.6 个百分点,高频协方差矩阵制造系统性的分散化幻觉。Hayashi-Yoshida 估计量按「时间区间重叠」配对收益,无需网格对齐,但对微观结构噪声不设防——实测在带噪声数据上给出 0.29,比中频 previous-tick 更差。实操建议:统计套利配对用 5-15 分钟采样+HY 交叉验证;A 股注记:涨跌停与集合竞价的额外坑(高阶)
12 min Chinese - 指数梯度组合 EG:用乘性更新在线追踪最优资产权重
EG(Helmbold-Schapire-Singer-Warmuth 1998)是在线组合选择里的『轻量派』:Cover 通用组合要对整个单纯形做指数开销的积分,EG 只用一行乘性更新——每天把权重乘上 exp(η·相对收益) 再归一化,计算量 O(m),天然保持权重为正且和为一。翻倍-暴跌交替市场 3000 日实测:η=0.01 的 EG 对数财富 175.0,紧咬事后最优 CRP(b*=0.70,对数财富 107.6 的遗憾仅 6.7),而买入持有波动资产归零(2e-271)。η 敏感性扫描呈单谷形:η=0.01 遗憾 6.7 最优,η=1.0 遗憾 273——乘性更新对学习率的容忍度远比教科书想象的窄。regime 切换市场上 η=0.15 终值 85.2 vs η=0.03 的 59.1:理论最优的小 η 在结构突变市场跑输大 η,因为 O(√T) 遗憾界是对最坏情况的保险,而切换市场奖励快速适应。日均换手仅 0.39%、50bp 成本下终值只从 85.3 降到 78.9——EG 是三兄弟(Cover/EG/ONS)里最便宜的。三盆冷水:√T 遗憾比 ONS 的 log T 慢一个量级(对手够坏时差距真实存在)、乘性更新永不清零导致死资产权重衰减极慢、EG 追的是 CRP 基准而 CRP 本身在趋势市就是弱基准。
13 min Chinese - MDI 与 MDA 特征重要性:识别真正有用的因子特征
回测好看不等于特征有用——不打开黑箱,你不知道模型赚的是 alpha 还是巧合。受控实验(3 信息特征 + 3 冗余复制品 + 6 纯噪声)暴露两套主流工具各自的说谎方式:MDI(树内不纯度减少)给纯噪声也发 0.04+ 的非零重要性且永不为负,替代效应让 I_1 与它的两个复制品 R_1/R_2 三分天下(0.179/0.179/0.167),单看排名会以为有三个独立因子;MDA(OOS 置换退化)把噪声干净归零(≤0.0006)但冗余特征互相'顶班'——置换 I_1 时 R_1/R_2 还在场,损失退化被系统性低估。修复方案是聚类 MDA:相关特征整组同排置换,G1 组重要性 0.247 一举显形,是单列置换的 5 倍。三条铁律:MDI 只可比较不可检验、MDA 必须配 Purged CV 否则泄漏伪装成重要性、特征重要性分析先于回测而非之后。A 股因子普遍多重共线(规模/流动性/波动率纠缠),聚类版几乎是必选项(中高阶)
15 min Chinese
返回