- 向量误差修正与卡尔曼滤波融合:把协整关系写进状态空间
协整让两只价格「长期绑在一起」,但绑定的强度(协整向量 β)本身也会漂移。本文把 VECM 的误差修正项直接写进卡尔曼滤波的状态空间:把 β_t 当成随时间演化的隐状态,每来一个新价格就用序贯更新把它重新估出来。在 1000 天合成数据上,融合模型对真实 β 的跟踪 RMSE 仅 0.0117,价差残差标准差比静态 β 低 25.5%(0.0723 vs 0.0971),且 ACF 检验证实价差平稳、价格非平稳。附完整 numpy 实现与四张真实计算图。
10 min Chinese - Johansen 协整篮子:用多资产协整向量构建可交易价差
两两配对交易只能处理两只股票,但真正的均值回归常常藏在三只、五只资产的组合里——任何单对都测不出来。Johansen 协整检验用固定种子(20260801)的受控模拟给出答案:三个共享随机趋势的价格 P1/P2/P3,真实协整向量 [-0.6,-0.4,1],迹统计量在 r=0 处 34.73 远超 95% 临界值 29.80、在 r≤1 处 9.77 低于 15.49,干净地定出协整秩=1。恢复的向量方向误差中位仅 5.67°(P90 13.3°),而两两 Engle-Granger 全线漏判:A-B 只有 6% 的模拟判为协整、A-C 34%、B-C 18%——真协整是三资产的联合性质,拆成任何一对都测不出。但最硬的教训在样本外:Johansen 的特征向量是在样本内挑『最像平稳』的线性组合,哪怕喂三条独立随机游走,拟合出的伪价差在样本内照样刷出 Sharpe——全样本 z(look-ahead)1.31、连滚动 z 都有 0.83,因为 look-ahead 藏在向量本身而非 z 分数里。唯一解药是样本外验证:样本内估向量→样本外应用,真篮子 Sharpe 从 2.30 掉到 0.52、OOS 价差 ADF p=0.175 已不显著平稳。置换检验 300 次,真实 2.27 超过全部上限 1.28。四项对抗式检验全过。
19 min Chinese - Hasbrouck 信息份额:多市场交易时价格发现发生在哪里
同一只股票在纽交所、纳斯达克、暗池同时交易,同一份 ADR 在两地挂牌,同一个标的有现货有期货——当价格几乎同步跳动时,究竟是谁先动、谁在跟随?Hasbrouck (1995) 用协整与 VECM 把这个问题变成一个可度量的数字:信息份额(Information Share),衡量每个市场对共同有效价格新息的贡献占比。本文从零复现 VECM 估计、Cholesky 排序带来的上下界、与 Gonzalo-Granger 成分份额的分歧,用合成两市场 tick 流证明快市场吃下约 71% 的价格发现,并诚实指出信息份额区间在残差高度相关时会宽到无法定论(中高阶)。
17 min Chinese - 层次聚类配对交易:用相关性树在几百只股票里挖出可交易的对
配对交易的第一道难关不是回测,是从 N 只股票的 C(N,2) 个组合里挑对——30 只就有 435 对,全跑一遍协整检验既慢又是数据挖掘的温床。本文用纯 numpy/scipy 合成 30 只股票(内嵌市场因子+5 个板块因子+一对刻意注入的协整对),把层次聚类当成配对的漏斗:先用相关性距离 √(0.5(1-ρ)) 建 Ward 连接树,聚类纯度 90.9%,把 435 对候选压到 100 对簇内高相关组合(筛掉 77%);再在簇内用『对冲比为正 + 相关>0.5』预筛、按价差 AR(1) 半衰期排序挑出真正均值回归的对(金融2/金融5,相关 0.64、半衰期 15.7 天)。配对回测 3 年 15 次开仓、日胜率 52%、Sharpe 0.58、累计价差收益 20.5%。全文最重要一节是打穿『相关≠协整』:刻意注入的高相关对若对冲比为负、价差不回归,照样亏钱;聚类只负责缩小搜索空间,真正决定盈亏的是价差平稳性。另拆穿聚类结构随窗口漂移、树状图切割高度主观、簇内组合仍需协整二次筛、样本内挑对必然乐观四类陷阱(中高阶)。
16 min Chinese - Johansen 协整检验:用迹统计量与最大特征值锁定多变量长期关系
Engle-Granger 两步法只能处理两条序列、只能找一个协整关系,选谁当因变量还会改变结果。Johansen 检验把问题升级成特征值分解:对 VECM 的 Π 矩阵做约化秩回归,一次性回答『k 条序列里藏着几个协整关系』。纯 numpy 实现完整流程:三元系统(2 条共同随机趋势)迹统计量 176.1 >> 29.7 拒绝 r=0,r≤1 时 4.5 < 15.4 停下——精确识别协整秩 r=1;估出的协整向量 [1, −1.874, 1.247] vs 真值 [1, −1.875, 1.250],误差不到 0.3%。对照组:独立随机游走迹统计量 22.6 徘徊在临界值边缘,秩=2 系统两级统计量全部爆表。样本外 600 天三腿价差交易:z>2 开仓、|z|<0.5 平仓,净费后 Sharpe 3.15、最大回撤 6.6。诚实说明:合成数据协整永不破裂;迹检验对滞后阶数敏感(观测噪声的 MA 结构会让 nlag 选小时假拒绝);三腿组合的执行成本是两腿的 1.5 倍。拆穿『迹检验显著=能赚钱』『特征值大=价差好交易』等误区(中高阶)。
16 min Chinese - 向量误差修正模型 VECM:把协整关系写成向长期均衡的拉力
两条价格各自都是随机游走,差分建模却会把它们之间最值钱的信息——长期均衡关系——直接扔掉。VECM 的答案:在差分方程里加回误差修正项 α(y1−βy2),让偏离均衡的距离本身成为回归的拉力。纯 numpy 走完全流程:Engle-Granger 两步法估出协整系数 1.232(真值 1.25),残差 ADF=−7.24 确认协整;伪回归对照组 R²=0.62 但 ADF 只有 −1.60——高 R² 不等于协整。误差修正系数 α₁=−0.061 (t=−3.8)、α₂=+0.062 (t=+3.8),两腿对向修正,价差半衰期 4.8 天;Johansen 迹检验 54.9 >> 15.5 临界值交叉验证。配对交易样本外 500 天:z>2 开仓、|z|<0.5 平仓、z>4 止损,净 Sharpe 2.08、回撤 3.5%、19 次动作。诚实说明:合成数据协整关系永不破裂,真实市场协整会死(招行/平安、可乐/百事都散过伙);EG 法把 β 的估计误差全部灌进价差;z>4 止损保护不了缓慢漂移型破裂。拆穿相关性=协整、半衰期恒定等经典误区(中阶)。
15 min Chinese - OU 过程均值回复:用 Ornstein-Uhlenbeck 给配对价差做统计套利
配对交易/统计套利的本质问题只有一个——价差偏离均值后多久回去?Ornstein-Uhlenbeck(OU) 过程把均值回复写成 dx=κ(θ−x)dt+σdW,并给出可估计的回归速度 κ 与半衰期 HL=ln2/κ。本文用协整价差 + OU 建模 + z-score 信号,从零复现一套统计套利回测,并点明协整断裂、时变 β、手续费吞没、前视偏差四类真实陷阱(中阶)。
12 min Chinese - 卡尔曼滤波配对交易:用状态空间模型动态追踪对冲比例
经典协整配对交易最别扭的一步是:回归得到的对冲比例 β 是「全样本固定值」,可真实市场里 β 一直在漂移。本文用卡尔曼滤波(状态空间模型)把 β 写成随时间演化的状态变量,逐根 K 线在线更新对冲比例,让价差始终贴着真实均衡。合成协整对实跑:β 在 [0.87, 1.23] 缓慢摆动,卡尔曼 RMSE 仅 0.29、价差波动 0.76(固定回归 1.87);动态对冲策略 Sharpe 2.62、回撤 −9.8%,显著优于固定对冲的 Sharpe 1.18、回撤 −88.8%。附完整 Python 与六类真实陷阱(中阶)。
13 min Chinese
返回