- 封闭式基金折价:情绪代理与均值回归套利
同一篮子资产,装进封闭式基金就凭空打了八折——价格系统性低于净值(NAV),这个『封闭式基金折价之谜』困扰学界四十年。本文把折价率拆成两层含义:它既是市场情绪的干净代理(散户悲观时折价扩大),又是一条会均值回归的可交易信号。在 300 只基金的合成横截面上复现系统性折价分布(中位数约 −8%),用分组回测证明折价越深、未来收益越高(最深折价组年化超额 +14% vs 最浅组 +2%),并搭出一个折价均值回归的多空套利框架。诚实拆解:折价可以长期不收敛、清算催化剂才是真正的价差实现路径、A 股封基与 LOF/REITs 的制度差异让策略无法直接照搬(中阶)。
18 min Chinese - 层次聚类配对交易:用相关性树在几百只股票里挖出可交易的对
配对交易的第一道难关不是回测,是从 N 只股票的 C(N,2) 个组合里挑对——30 只就有 435 对,全跑一遍协整检验既慢又是数据挖掘的温床。本文用纯 numpy/scipy 合成 30 只股票(内嵌市场因子+5 个板块因子+一对刻意注入的协整对),把层次聚类当成配对的漏斗:先用相关性距离 √(0.5(1-ρ)) 建 Ward 连接树,聚类纯度 90.9%,把 435 对候选压到 100 对簇内高相关组合(筛掉 77%);再在簇内用『对冲比为正 + 相关>0.5』预筛、按价差 AR(1) 半衰期排序挑出真正均值回归的对(金融2/金融5,相关 0.64、半衰期 15.7 天)。配对回测 3 年 15 次开仓、日胜率 52%、Sharpe 0.58、累计价差收益 20.5%。全文最重要一节是打穿『相关≠协整』:刻意注入的高相关对若对冲比为负、价差不回归,照样亏钱;聚类只负责缩小搜索空间,真正决定盈亏的是价差平稳性。另拆穿聚类结构随窗口漂移、树状图切割高度主观、簇内组合仍需协整二次筛、样本内挑对必然乐观四类陷阱(中高阶)。
16 min Chinese - Hayashi-Yoshida 领先滞后估计:在异步 tick 里找谁先动
两只关联资产里,谁先动、谁跟随?大盘 ETF 涨了,成份股几秒后跟上;期货动了,现货滞后半秒——这个『谁领先谁』的时间差,是高频交易里最值钱的信息之一。但要从真实 tick 数据里量出这个 lag 极难:两条序列的成交时刻从不对齐,你一旦重采样到固定网格,就把秒级的领先滞后模糊进了分钟级的格子,lag 直接消失。本文把 Hayashi-Yoshida 估计量升级成领先滞后探测器:给一条序列的时间轴整体平移 L 秒再算 HY 交叉相关,扫描所有 L、峰值所在即领先滞后时间。用纯 numpy 造 leader/follower 结构(follower=leader 滞后 8 秒+噪声),完整复现交叉相关峰值精准锁定 8 秒;对比固定网格 last-tick 如何被粗粒度模糊掉 lag;量化样本量与信号强度对 lag 估计稳健性的影响(一天数据 vs 一周数据、ρ=0.2 的平峰 vs ρ=0.8 的尖峰)。附完整 Python 与四类真实陷阱。
15 min Chinese - Johansen 协整检验:用迹统计量与最大特征值锁定多变量长期关系
Engle-Granger 两步法只能处理两条序列、只能找一个协整关系,选谁当因变量还会改变结果。Johansen 检验把问题升级成特征值分解:对 VECM 的 Π 矩阵做约化秩回归,一次性回答『k 条序列里藏着几个协整关系』。纯 numpy 实现完整流程:三元系统(2 条共同随机趋势)迹统计量 176.1 >> 29.7 拒绝 r=0,r≤1 时 4.5 < 15.4 停下——精确识别协整秩 r=1;估出的协整向量 [1, −1.874, 1.247] vs 真值 [1, −1.875, 1.250],误差不到 0.3%。对照组:独立随机游走迹统计量 22.6 徘徊在临界值边缘,秩=2 系统两级统计量全部爆表。样本外 600 天三腿价差交易:z>2 开仓、|z|<0.5 平仓,净费后 Sharpe 3.15、最大回撤 6.6。诚实说明:合成数据协整永不破裂;迹检验对滞后阶数敏感(观测噪声的 MA 结构会让 nlag 选小时假拒绝);三腿组合的执行成本是两腿的 1.5 倍。拆穿『迹检验显著=能赚钱』『特征值大=价差好交易』等误区(中高阶)。
16 min Chinese - 向量误差修正模型 VECM:把协整关系写成向长期均衡的拉力
两条价格各自都是随机游走,差分建模却会把它们之间最值钱的信息——长期均衡关系——直接扔掉。VECM 的答案:在差分方程里加回误差修正项 α(y1−βy2),让偏离均衡的距离本身成为回归的拉力。纯 numpy 走完全流程:Engle-Granger 两步法估出协整系数 1.232(真值 1.25),残差 ADF=−7.24 确认协整;伪回归对照组 R²=0.62 但 ADF 只有 −1.60——高 R² 不等于协整。误差修正系数 α₁=−0.061 (t=−3.8)、α₂=+0.062 (t=+3.8),两腿对向修正,价差半衰期 4.8 天;Johansen 迹检验 54.9 >> 15.5 临界值交叉验证。配对交易样本外 500 天:z>2 开仓、|z|<0.5 平仓、z>4 止损,净 Sharpe 2.08、回撤 3.5%、19 次动作。诚实说明:合成数据协整关系永不破裂,真实市场协整会死(招行/平安、可乐/百事都散过伙);EG 法把 β 的估计误差全部灌进价差;z>4 止损保护不了缓慢漂移型破裂。拆穿相关性=协整、半衰期恒定等经典误区(中阶)。
15 min Chinese - 期现套利与基差交易:用「持有成本模型」把期货相对现货的偏离做成低风险收益
期货和现货明明是同一个标的,价格却常常不相等——中间的差就叫基差(basis)。持有成本模型告诉你它理论上该是多少,而「到期必收敛」又保证这个差最终归零。于是期现套利成了一个自带安全垫的统计套利:做空高基差、做多负基差,等它回复就平仓。本文用纯 numpy 合成沪深300ETF vs 股指期货的连续 6 张合约,把现货/期货/基差一步步造出来,再用「突破成本带开仓、回复平仓」的规则跑回测:58 次交易、胜率 91.4%、总收益 +25.1%(年化 11.0%)、单笔最大亏损仅 −0.06%;并诚实拆穿到期日效应/分红除权跳变/流动性与冲击成本/展期跳跃/单边升水陷阱五类真实风险(中阶)。
15 min Chinese - OU 过程均值回复:用 Ornstein-Uhlenbeck 给配对价差做统计套利
配对交易/统计套利的本质问题只有一个——价差偏离均值后多久回去?Ornstein-Uhlenbeck(OU) 过程把均值回复写成 dx=κ(θ−x)dt+σdW,并给出可估计的回归速度 κ 与半衰期 HL=ln2/κ。本文用协整价差 + OU 建模 + z-score 信号,从零复现一套统计套利回测,并点明协整断裂、时变 β、手续费吞没、前视偏差四类真实陷阱(中阶)。
12 min Chinese - 稀疏 PCA 统计套利:只保留少数正交共性因子
标准 PCA 把主成分载荷铺满全部股票,可解释性为零。稀疏 PCA(L1 惩罚)把载荷重新集中回板块,得到少数几个可解释、彼此正交的共性因子;把它们从收益里剥掉,剩下的残差才干净地均值回复。合成 40 股 4 板块里,稀疏 PCA 每层只点亮约 10/40 只股票、用 3 个因子换到约 57% 解释方差,残差套利净值跑赢买入持有。附完整 Python 与六类真实陷阱(高阶)。
14 min Chinese
返回