- 不平衡 Bar 信息驱动采样:让每根 K 线携带等量信息而非等量时间
固定时间间隔的 K 线(时间 Bar)有个隐藏毛病:市场安静时一根 Bar 几乎没信息,爆发时一根 Bar 挤满信息,于是『等量时间』等于『不等量信息』,还会撞出人造的自相关与波动聚集。不平衡 Bar(Imbalance Bar)反过来:用订单流不平衡 θ=Σ b·v 触达阈值就截断一根 Bar,于是每根 Bar 都携带约等量的信息。本文用 numpy 从零实现不平衡 Bar,在 6 万 tick 合成盘口上证明:750 根时间 Bar 压缩成 156 根不平衡 Bar,收益滞后1自相关从 0.528 砍到 0.048(接近 iid),每根 Bar 的信息量变异系数从 0.596 降到 0.252。附完整 Python 与四张真实计算图。
11 min Chinese - 已实现核与微观结构噪声:用子采样估计无偏积分波动率
秒级 tick 价格里混着买卖价差、错单、报价粒度带来的微观结构噪声——直接平方求和会把积分波动率(IV)估高 161%。本文用 numpy 从零实现 Parzen 已实现核(Realized Kernel),靠 lag1 自协方差把 2Nη² 噪声项精确抵消,在 h=1 全采样下就还原真实 IV=0.0016;并给出 γ_1=-η² 的噪声方差估计。附完整 numpy 实现与四张真实计算图。
7 min Chinese - Epps 效应:高频下相关系数为何随采样频率衰减
把采样间隔从 30 分钟压到 5 秒,两个真实相关 ρ=0.7 的资产测出来的相关系数会跌到 0.08——不是市场变了,是估计器坏了。Epps 效应的主因是异步交易:清淡资产的最新价大部分时间是几秒前的旧价,previous-tick 对齐让高频收益大量配对到「新信息 vs 旧价格」,相关性被机械稀释。40 个模拟交易日的受控实验完整复现衰减曲线(5s: 0.08 → 60s: 0.49 → 600s: 0.69≈真值),机制分解实验证明同步观测对照组在所有频率下都测得 0.7——衰减 100% 是观测机制造成的伪影。组合风险端的传导:h=10s 估计的相关矩阵让等权组合年化波动被低估 3.6 个百分点,高频协方差矩阵制造系统性的分散化幻觉。Hayashi-Yoshida 估计量按「时间区间重叠」配对收益,无需网格对齐,但对微观结构噪声不设防——实测在带噪声数据上给出 0.29,比中频 previous-tick 更差。实操建议:统计套利配对用 5-15 分钟采样+HY 交叉验证;A 股注记:涨跌停与集合竞价的额外坑(高阶)
12 min Chinese - 高频领先滞后估计:谁先动,谁跟随
两个高度相关的资产几乎从不同时动:期货先于现货、大盘股先于小盘股、美股 ETF 先于亚洲镜像。领先滞后估计要回答的是「谁先动、领先多少秒」。受控模拟(真实滞后 θ=2 秒、泊松异步观测)实测:1 秒网格滞后互相关函数峰值精确落在 +2 秒,同期相关只有 0.066 而峰值 0.120——同步相关严重低估了这对资产的真实耦合。HRY 估计器(Hoffmann-Rosenbaum-Yoshida 2013)按区间重叠配对无需网格,峰值 0.80 落在 2 秒,信号强度是网格法的 6.7 倍。采样频率扫描给出实操上最重要的曲线:h=5s 时不对称度 0.200 最大,h=60s 时只剩 0.020——领先滞后是尺度依赖信号,网格必须与 θ 同数量级,粗网格把先后关系压扁成同期相关。方向性 IC 检验:领先者过去 2 秒预测跟随者未来 2 秒,15 日 IC 均值 0.215(t=125),反向对照只有 0.074。诚实边界:领先滞后利润与延迟军备竞赛绑定、θ 本身随市场状态漂移、Epps 效应与领先滞后互为混杂因素。A 股注记:沪深 300 期货 vs ETF、AH 股是天然领先滞后对,但 T+1 与两融门槛限制了收割方式(高阶)
14 min Chinese - 高频已实现 Beta:用日内数据估计时变系统性暴露
「你的 Beta 不是一个数,是一条会跳的曲线。」传统 60 日滚动 OLS 估计 Beta 有一个结构性死穴:窗口内每个观测等权,Beta 真的变了要一个月才能在估计里显形。已实现 Beta 把已实现波动率的思路搬到协方差上——用 5 分钟日内收益,单日就能算出一个 Beta 估计(日内协方差 / 日内市场方差),无需任何模型假设,跳变当天就能看到。Python 模拟完整验证三层结构:事件日 Beta 从 1.0 跳到 1.9,22 日平滑已实现 Beta 约 20 个交易日贴近真值,60 日 OLS 落后一倍时间且路径被旧样本稀释;但高频不是免费午餐——Epps 效应让非同步交易在 5 分钟频率把 Beta 从 1.2 低估到 0.54,偏差随采样间隔拉长单调消失,最优频率是偏差与方差的权衡(20-40 分钟附近),盲目用最高频数据是这个领域最常见的错误;对冲误差是估计器的终极裁判:模拟中已实现 Beta 对冲的残余年化波动 10.1%,优于滚动 OLS 的 10.6% 与静态 Beta 的 11.1%——差距看似小,但对冲组合的方差改善会直接进入市场中性策略的 Sharpe 分母。落地约束诚实列出:A 股 5 分钟数据可得但 T+1 限制对冲调仓、开盘集合竞价段需剔除、真实市场的微观结构噪声比模拟更毒(中高阶)。
14 min Chinese - 日内波动率季节性 FFF:用柔性傅里叶形式剖开 U 型日内波动曲线
把一天的交易切成几十个 5 分钟 bin,你会发现波动率不是均匀的:开盘一柱擎天、午间死气沉沉、收盘再抬头,画出来是一条 U 型曲线。这条 U 型不是噪声,是每天都重演的日内季节性。不把它剥掉,你的日内波动预测、跳跃检测、VWAP 拆单全会被它系统性带偏——固定阈值会在开盘漏报一堆假信号、在午间漏掉真跳跃。Andersen-Bollerslev 的柔性傅里叶形式(FFF)用低阶多项式加少数谐波,几个参数就能把这条 U 型曲线拟合出来。本文从零推导 FFF、演示阶数如何影响拟合、如何用它去季节化,以及季节性校正如何改变跳跃检测的结论。并诚实拆解它的过拟合边界与 A 股制度差异(中阶)。
17 min Chinese - Epps 效应与高频相关性:为什么采样越细相关性越假
直觉告诉你:数据越密、频率越高,估计应该越准。但相关性在高频世界里恰恰相反——同一对资产,用日线算相关是 0.6,切到 1 分钟变 0.3,切到 1 秒几乎归零。这就是 Epps 效应:不是市场关系变了,是异步成交把相关性『稀释』掉了。两只股票的 tick 从不落在同一时刻,你为了对齐用旧价前向填充,就在每个细格点里塞进了大量人造的零收益,相关性被这些零拖向 0。本文用纯 numpy 合成两条 latent 相关 0.6 的高频价格路径,泊松稀疏成交 + last-tick 填充完整复现 Epps 塌陷曲线(1 秒 ρ≈0.03、30 分钟才恢复到 0.59);量化流动性对衰减速度的影响(成交越稀疏塌陷越狠);最后给出解药 Hayashi-Yoshida 估计量——用重叠区间累加协方差,不需要同步、不丢数据,在异步稀疏数据下几乎无偏。附完整 Python 与四类真实陷阱。
16 min Chinese - Hayashi-Yoshida 领先滞后估计:在异步 tick 里找谁先动
两只关联资产里,谁先动、谁跟随?大盘 ETF 涨了,成份股几秒后跟上;期货动了,现货滞后半秒——这个『谁领先谁』的时间差,是高频交易里最值钱的信息之一。但要从真实 tick 数据里量出这个 lag 极难:两条序列的成交时刻从不对齐,你一旦重采样到固定网格,就把秒级的领先滞后模糊进了分钟级的格子,lag 直接消失。本文把 Hayashi-Yoshida 估计量升级成领先滞后探测器:给一条序列的时间轴整体平移 L 秒再算 HY 交叉相关,扫描所有 L、峰值所在即领先滞后时间。用纯 numpy 造 leader/follower 结构(follower=leader 滞后 8 秒+噪声),完整复现交叉相关峰值精准锁定 8 秒;对比固定网格 last-tick 如何被粗粒度模糊掉 lag;量化样本量与信号强度对 lag 估计稳健性的影响(一天数据 vs 一周数据、ρ=0.2 的平峰 vs ρ=0.8 的尖峰)。附完整 Python 与四类真实陷阱。
15 min Chinese
返回