- 最小回测长度 MinTRL:多长的样本才够证明策略不是运气
你的策略回测出年化夏普 1.0,跑了 8 个月——能上实盘吗?大多数人凭感觉答『差不多了』,但这个问题有精确答案。López de Prado 和 Bailey 的最小回测长度 MinTRL 反过来问:给定夏普率、给定收益的偏度峰度,要在 95% 置信度下证明『真实夏普 > 0』(即策略不是纯运气),到底需要多少样本?公式给出的答案往往令人沮丧:正态下 SR=1.0 需要约 2.7 年、SR=0.5 需要约 10.8 年;一旦收益负偏肥尾(偏度-1、超峰5),SR=1.0 的需求涨到 2.9 年。反过来看置信度的增长:SR=1.0 跑满一年(252天)PSR 只有 0.84,连 95% 门槛都没过;要到 2 年才爬到 0.92。5000 条蒙特卡洛验证:真实 SR=1.0、强负偏肥尾时,只跑一年的样本里 PSR>95% 的通过率仅 25%,跑到四年也只有 62%。本文讲清三件事:MinTRL 公式里每一项的物理含义、为什么偏度峰度会推高样本需求、以及为什么『高夏普 + 短样本』是量化里最贵的自欺——它让你在最没把握的时候最自信(中阶)。
15 min Chinese - 订单失衡与收益:用成交方向净额预测下一段价格
把一段时间内的买单量减卖单量、除以总量,得到订单失衡 OI ∈ [-1,1]——这是订单流预测里最直白的一个数。它有预测力的机制不是玄学:价格冲击让净买压直接推高价格,而拆单和羊群行为让失衡有自相关、会延续到下一个 bar。5000 个 5 分钟 bar 的模拟实测:OI 最低十分位下一 bar 平均收益 -6.4bp、最高十分位 +4.9bp,十组单调;但预测性衰减极快——OI 与未来收益的相关性从 h=1 的 0.21 跌到 h=5 的约 0,寿命只有一两个 bar。策略实验最诚实:阈值策略毛收益 117%,扣 3bp 单边成本后只剩 12%——3476 次换手把利润基本磨光。它的正确用法是执行择时与已有信号的入场微调,不是独立策略。诚实边界:方向分类本身有错标、失衡可被大单方拆单制造、参数换个市场就要重估(中阶)。
10 min Chinese - 超阈值 POT 建模:用广义帕累托分布拟合尾部超额
区组极大值法每个月块只留一个数,剩下 20 个观测全扔——POT(Peaks Over Threshold)是数据效率更高的另一条 EVT 路线:定一个高阈值,把所有超过它的观测都拿来建模。Pickands-Balkema-de Haan 定理保证:阈值足够高时,超额分布收敛到广义帕累托分布(GPD),形状参数 ξ 与 GEV 完全同一个。GARCH-t(5) 模拟 40 年日损失、95% 分位做阈值(504 个超额)实测:GPD 估出 ξ=0.14,KS p=0.93;同样数据 GEV 区组法只有 480 个块。外推对比:99.9% VaR 正态公式报 2.89%、POT 报 4.54%(经验值 4.58%),99.99% 层级正态 3.48% vs POT 7.36%——差一倍以上。附平均超额图选阈值、阈值敏感性走廊(ξ 从 0.09 漂到 0.18 但 VaR 外推稳定在 4.4-4.6%)、ES 闭式解、以及波动聚集破坏 iid 时超额扎堆的 declustering 讨论(中阶)。
13 min Chinese - 价格冲击衰减:用成交后的价格回复曲线拆临时与永久冲击
一笔买单把价格推高 10bp,这 10bp 里有多少是市场真的学到了东西、有多少只是流动性暂时让步?答案藏在成交之后的价格路径里:永久冲击是回不来的台阶,临时冲击是会指数衰减的鼓包。本文用 κ + θ·exp(−t/τ) 的经典衰减模型模拟 2000 次买单事件,对平均回复曲线做非线性最小二乘,把三个参数几乎无偏地拿回来(κ̂≈4.0bp、θ̂≈6.0bp、τ̂≈5 bar)。核心洞见是执行含义:拆单、放慢只能省临时冲击那一层,永久冲击是信息的价格、怎么拆都省不掉——这条分界线就是所有执行算法成本模型的地基。诚实边界:事件平均要求冲击对订单流平稳、拆解对模型形式敏感、日线数据上 τ 几乎不可识别(中阶)。
12 min Chinese - 概率夏普率 PSR:给你的夏普率算出一个『真的大于零』的置信度
你回测出一个年化夏普 1.5,兴奋地准备上实盘——但这个 1.5 有多可信?如果只跑了 3 个月、收益还又左偏又肥尾,那这个漂亮数字很可能是运气。传统夏普率有三个致命盲点:不看样本长度(跑 60 天和跑 5 年的 1.5 天差地别)、不看高阶矩(负偏肥尾会让真实标准误暴涨)、不给显著性(永远只有一个点估计,没有置信度)。López de Prado 的概率夏普率 PSR 一次补齐三样:它把夏普率的估计误差用偏度峰度校正后,直接算出『真实夏普 > 基准』的概率。模拟里年化 SR=1.0、跑满一年(252天)的 PSR 只有 0.84——连 95% 门槛都没过;SR 掉到 0.5 时 500 天都难达标。配套的 MinTRL(最小回测长度)反过来回答:要证明 SR>0(95%置信),正态下 SR=1.0 至少需要约 2.7 年、强负偏肥尾下要 2.9 年。5000 条蒙特卡洛验证 PSR 判据的经验行为完全自洽。本文讲清三件事:PSR 公式里偏度峰度到底怎么侵蚀置信度、MinTRL 怎么在开发前就告诉你样本够不够、以及为什么『高夏普 + 短样本』是量化里最贵的自欺(中阶)。
17 min Chinese - 报价斜率流动性:用限价簿弹性度量瞬时深度
价差只告诉你第一股的成本,深度只告诉你第一档的数量——真正决定一笔像样规模订单成本的,是限价簿的形状。报价斜率把这个形状压缩成一个数:累计可成交量对价格偏移的回归斜率 S,越大盘口越有弹性。本文用模拟限价簿讲清定义与计算(含穿过原点的最小二乘),在 120 只股票的横截面上验证「固定订单的即时冲击 ∝ 1/S」的双对数线性关系,并演示斜率的日内 U 形与压力坍缩:负面消息瞬间撤单能让斜率蒸发 55%——流动性是被撤单速度定义的,不是被价差定义的。与 Kyle λ 的关系一句话讲清:S 是 λ 的簿本侧倒数近似。诚实边界:可见深度被冰山单低估、斜率对档位截断敏感、快照频率不够时压力坍缩根本看不见(中阶)。
12 min Chinese - 报价深度失衡:用限价簿两侧挂单量预测短期价格方向
价差一样的两个盘口可以完全不是一回事:买一挂 5000 股、卖一挂 1200 股的盘口,下一跳大概率往上走。深度失衡 I = (B−A)/(B+A) 是限价簿里最便宜也最顽固的短期方向信号——只要买一卖一两个数字,不要逐笔、不要全簿。本文从做市商队列消耗的机制推导为什么它有预测力,2 万个模拟盘口快照实测:失衡最负的十分位下一跳上涨概率 23%、最正的十分位 77%,单调性完美;但信号衰减曲线显示相关性在 10-20 个快照后见顶然后快速衰减,200 步外只剩 0.07。最扎心的实验是成本:无成本时四档阈值策略全部单调赚钱,扣掉 1 个 tick 的跨价差成本后全部转为亏损——这个信号的经济学归宿不是「做多做空」而是「决定挂单还是吃单、现在执行还是等一等」。执行算法里它值真金白银,当独立策略它付不起过路费。诚实边界:可被幌骗操纵、大 tick 股票才显著、隐藏单和冰山单让可见深度失真(中阶)。
13 min Chinese - 已实现价差分解:用成交后中间价拆临时成本
你付的价差里,有多少真的进了做市商口袋,有多少是被信息更灵的对手方赚走的?有效价差是你实付的总账单,但它同时装着两样性质完全相反的东西:做市商的补偿性利润(临时、会衰减)和你被逆向选择吃掉的信息损失(永久、不回来)。已实现价差用「成交后 τ 个 bar 的中间价」做锚点,把这两块拆开——买单成交后中间价若继续漂高,说明你踩到了信息,那部分不是做市商赚的;漂回来的部分才是做市商真实到手的利润。2000 笔事件模拟里,有效价差 8.4bp 拆成已实现价差 3.1bp + 价格冲击 5.3bp,信息损失占了 63%。横截面上小盘股信息占比从大盘的 38% 一路升到微盘的 61%。窗口 τ 的选择本身是建模决策:τ 越大临时越衰减,已实现价差越贴永久冲击。诚实边界:需要可靠的买卖方向标签、中间价的构造方式直接改分账、日线粒度下 τ 不可识别(中阶)。
20 min Chinese
返回