- Cover 通用投资组合:不预测市场也能逼近最优常数再平衡
Thomas Cover 1991 年提出的通用投资组合(Universal Portfolio)是在线学习在金融里最漂亮的定理之一:不做任何统计假设、不预测任何收益,只靠把资金摊到所有常数再平衡组合(CRP)上做『财富加权平均』,就能保证长期增长率逼近事后最优 CRP——最坏情况下的财富比值只以多项式速度衰减,而财富本身是指数增长的。2000 日双资产合成实验完整复现:事后最优 b*=0.65 的 CRP 终值 1.98,UP 无预测拿到 1.85,权重轨迹从均匀先验 0.5 被财富加权逐渐吸向 b*;附赠 Shannon's Demon 演示——一个长期不涨的资产加不生息的现金,50/50 每日再平衡照样把组合从 1.0 做到 1.47,波动本身就是收益来源。同时诚实交代三盆冷水:网格维度灾难、交易成本会吃掉再平衡收益、以及 UP 的保证是渐近的——有限样本内它可以跑输朴素 50/50。
14 min Chinese - CPPI 组合保险:用动态乘数在保本底线上追逐风险资产
保本理财背后那个只有一行公式的引擎:风险敞口 = m ×(当前净值 − 保本底线),缓冲垫厚就敢上仓位、缓冲垫薄就自动撤退、归零则永久躺平。四年合成行情实测(m=4,底线 80%):熊市里风险资产跌 63.6% 而 CPPI 只回撤 19.1%、终值守住 0.867;代价是牛市 1.737 跑输买入持有的 1.795。600 次蒙特卡洛把这笔交易的账算清楚——CPPI 跌破 0.8 的概率 0.0%、买入持有 16.7%、恒定混合 60/40 是 6.0%,但 CPPI 中位数 1.006 反而低于买入持有的 1.145:它砍掉的左尾是真的,付出的右尾也是真的。最反直觉的是三条边界:震荡市里 CPPI 输给买入持有(0.911 vs 0.971)却仍赢在回撤减半,因为它天生高抛低吸的反面是波动侵蚀;乘数扫描显示换手先升后降(m=3 年均 2.2、m=10 降到 0)——高 m 长期顶满仓根本不需要调仓;再平衡频率的杀伤力全在尾部,每日调仓破底率 0%、季度调仓 22%,而平均终值几乎无差别(1.157 vs 1.159)。理论上 1/m 是能扛住的最大跳空,实测 m=8 在 17.5% 跳空处失守(理论 12.5%),保本承诺在缺口风险面前只是概率陈述(中阶)。
19 min Chinese - CUSUM 事件过滤器:只在市场偏离足够大时才采样
逐日开训练样本的隐性成本可精确计量:H=20 标注下相邻标签共享 95% 收益路径,1430 个名义样本的有效独立样本量只有 72.5——模型看到的是同一段行情复印 20 遍。CUSUM 过滤器(Page 1954 质量控制)只在累计偏离越过阈值时开样本:对积累到位的漂移敏感、对反复横跳的噪声免疫,触发即清零天然不重复计数。1500 日三区制模拟实测:固定阈值 h=3% 在高波动段事件密度爆炸 2.4 倍(采样节奏被波动率劫持),换 h=2.5×EWMA σ 自适应后密度回归均匀;CUSUM 用 17% 样本量保住 102% 有效独立信息,单标签唯一性 0.051→0.314 提升 6 倍。AFML 标准管线:bar→CUSUM→三重障碍→元标注四级串联。A 股:日频 CUSUM 天然适配 T+1,涨跌停需暂停累计器(中高阶)
13 min Chinese - CUSUM 结构突变检测:用累积和滤波器抓住行情的『变脸』时刻
「行情什么时候变脸的?」事后人人都能指出来,事中没人说得清。CUSUM(Page 1954)用一个朴素到极致的机制回答这个问题:把去均值后的收益不断累加,正累积和 S⁺ 只增不减直到触阈报警,负累积和 S⁻ 对称监控下行——单日噪声互相抵消,持续的单向漂移却会线性积累,这就是它区分『抖动』和『变脸』的全部原理。三段 regime 合成行情实测:h=5σ 时第一个突变(牛转熊)延迟 9 天检出、第二个(熊转牛)23 天;阈值扫描给出灵敏度-误报的完整权衡曲线——h 从 3σ 提到 8σ,纯随机游走上的误报从 115 次砍到 23 次,检测延迟只从 2 天涨到 10 天。AFML 把它重新包装成 ML 事件采样器:只在 CUSUM 触发处采样打标签,实测样本前瞻已实现波动比固定间隔采样高 19.5%——样本更『有戏』。三盆冷水:随机游走上照样报警(它测的是漂移显著性不是因果)、阈值以波动率计价必须动态更新、检测延迟意味着报警时行情已走了一段(中阶)。
13 min Chinese - Discord 异常子序列:用最不像别处的片段捕捉市场异常
Discord 是 Matrix Profile 的另一半:MP 曲线的低谷是模体(有孪生兄弟的重复形态),最高峰就是 discord——全序列里最找不到相似者的子序列,天然的无监督异常检测器,不需要定义『什么是异常』,只需要回答『哪段最不像别处』。但本文最重要的发现是一个刻意保留的失败案例:discord 的对比度完全取决于『正常段有多相似』。60 天 × 50 bar 共享日内模板的结构化本底上,三种植入异常(闪崩回补/波动冻结/锯齿振荡)全部被 top-3 discord 精确命中,对比度 2.1×;同样的异常搬到 IID 随机游走本底上,命中 0/3——因为 IID 世界里每一段都独一无二,MP 中位数 7.22 与峰值 7.83 挤在一起,异常淹没在『处处都是异常』的本底里。这解释了为什么 discord 在日内高频数据上是利器、在日线收益上近乎无用。消融实验补齐工程细节:排除区不设则模体端先失效(谷值 3.05→2.13)而 discord 端相对鲁棒;窗口长度 m<异常尺度一半时命中率归零;无异常对照世界的 MP 峰值也有 5.06——discord 分数没有天然阈值,必须用对照分布校准。最无争议的落地:数据质量监控(坏 tick/卡死/拼接错误的形状都独一无二)与流动性冻结检测。
13 min Chinese - 美元 Bar 与信息驱动采样:让每根 K 线携带等量信息
成交量时钟修好了『活动度量』,但在价格翻 3 倍的市场里,同样 100 手在 20 元和 60 元时的经济含义差 3 倍——股数是名义单位,成交额才是经济单位。美元 Bar(每累计 N 元成交额切一根)是信息驱动采样家族对『时钟单位』的最终回答:对拆单免疫(tick 计数会通胀)、对送股拆股天然中性(股数时钟一夜漂移,美元时钟无感)、对价格水平自适应。1000 日受控模拟(价格 3 倍 + 活动增长 + 中段高波动区制)实测:前 100 天校准的固定阈值到末期,tick/成交量 Bar 日均根数从 6 漂到 13.4,美元 Bar 因价格与活动双重增长漂得更凶(27.7)——美元 Bar 对价格敏感是特性也是负担,必须配 EWMA 动态阈值:日常稳定在 6 根、高波动区制自动加密,把趋势性漂移滤掉、只保留『信息爆发时多采样』。统计性质上四种 bar 同场竞技:时间 Bar 峰度 3.52/JB 496/波动聚集显著,三种信息驱动 bar 全部归零——家族内差异远小于『家族 vs 时间时钟』。终点站是 Easley-O'Hara-de Prado 的洞见:美元时钟正是 VPIN 的运行时钟,采样方式与知情交易度量共享同一个世界观。A 股落地注记:手数=100 股恒定使成交量/成交额时钟高度相关,但跨长周期与跨价格档比较时美元 Bar 仍占优(中高阶)。
12 min Chinese - 美元棒采样 Dollar Bars:按成交金额而非时钟切分K线
K线按『每5分钟一根』切分是历史遗留而非统计最优:市场信息不按时钟到达,开盘和收盘挤满成交、午盘空转,固定时间间隔意味着信息密集时段被欠采样、清淡时段被过采样,结果是时间棒收益呈现肥尾与波动聚集,直接违反大多数 ML 模型的 iid 近似假设。Dollar Bars 的解法:累计成交金额每达到阈值就切一根 bar,让采样节奏跟着市场活跃度自适应。我们用 Hawkes 自激强度 + 日内 U 型季节性合成 60 个交易日的分钟级市场(14400 分钟,活跃度高度成簇),在等量 bar 数(~1100-1200 根)下对比三种采样:时间棒超额峰度 1.16、Jarque-Bera 统计量 72、绝对收益一阶自相关 0.132;成交量棒分别降到 -0.13 / 2 / 0.013;美元棒做到 -0.01 / 0(正态性检验直接不拒绝)/ -0.035,波动聚集被采样方式本身消解。原理是 Ané-Geman (2000) 的时间变换:以成交活动为『市场时钟』重新计时,收益向高斯回归。文章给出完整合成与采样代码、QQ 图与 bar 时长分布证据,并交代三条实务边界:阈值需随市值漂移动态调整、bar 数量不齐导致多资产对齐成本、以及『分布更正态』不等于『更可预测』。
12 min Chinese - DTW 重心平均:对齐时间扭曲后求出K线形态的『平均脸』
『把 20 段 V 形恐慌-回补走势平均一下』听起来无害,但逐点算术平均是形态学的绞肉机:每段下跌时长 5~14 天随机、底部位置随机,逐点平均把错位的底相互抵消——实测平均后的 V 形深度只剩 -0.62,而样本真实平均深度是 -1.03,形态被抹掉 40%。DBA(Petitjean 2011)的解法:先用 DTW 把每段序列与当前重心逐点对齐(允许时间轴伸缩),把对齐到同一坐标的所有点取均值,迭代到收敛。实测 DBA 重心深度 -1.02 几乎完美还原,到样本的平均 DTW 距离从逐点平均的 0.907 降到 0.351(改善 61%),且目标函数单调下降。模板分类实验暴露完整依赖链:V 形单底 vs W 形双底(深度相同、位置时长随机,判别信息只在形状),逐点平均模板+欧氏距离准确率 53%(≈抛硬币)、逐点模板+DTW 50%、DBA 模板+DTW 88%——模板和度量必须同时懂时间扭曲,换任何一半都直接坍塌回随机线。三盆冷水:DTW 对齐自由度本身是过拟合来源(无窗口约束的 DTW 能把任何两段序列都对齐得很像)、DBA 是局部最优且对初始化敏感、『平均形态存在』不等于『形态有预测力』——DBA 只回答形态学问题,交易价值要靠时间外检验另行审判。
13 min Chinese
返回
博客
第 25 页 · 显示 8 / 1446 篇文章
按年份查看 →