- 不平衡 Bar 信息驱动采样:让每根 K 线携带等量信息而非等量时间
固定时间间隔的 K 线(时间 Bar)有个隐藏毛病:市场安静时一根 Bar 几乎没信息,爆发时一根 Bar 挤满信息,于是『等量时间』等于『不等量信息』,还会撞出人造的自相关与波动聚集。不平衡 Bar(Imbalance Bar)反过来:用订单流不平衡 θ=Σ b·v 触达阈值就截断一根 Bar,于是每根 Bar 都携带约等量的信息。本文用 numpy 从零实现不平衡 Bar,在 6 万 tick 合成盘口上证明:750 根时间 Bar 压缩成 156 根不平衡 Bar,收益滞后1自相关从 0.528 砍到 0.048(接近 iid),每根 Bar 的信息量变异系数从 0.596 降到 0.252。附完整 Python 与四张真实计算图。
11 min Chinese - Hawkes 自激过程:订单到达如何自己点燃自己
泊松过程假设订单彼此独立,但真实盘口是一阵一阵来的。Hawkes 用一条自激强度把「一笔订单抬高下一笔的概率」写进模型:受控模拟 19132 笔订单(μ=0.5、n=0.7、β=2.0)量化簇发的代价——10 秒窗口均值同为 15.9 笔,Hawkes 出现 ≥30 笔的概率是泊松的 100 倍,≥50 笔时是 31 亿倍,泊松眼里的「五百年一遇」在这里平均每 7 分钟就来一次。68.98% 的订单是被前面的订单激发的,与理论分支比 0.70 吻合。但真正的杀手在估计端:把一段自激强度真值为 0 的纯泊松数据(只叠加日内 U 型节奏)喂给标准 MLE,n̂ 凭空刷到 0.909、Fano 因子 4.81——非平稳基线和自激在似然函数眼里长得一模一样。做时间重标定后 n̂ 精确塌回 0.000,而真 Hawkes 数据同样处理只从 0.693 掉到 0.691(几乎不动),证明修正没有误伤信号。七项对抗式检验全过:平坦泊松安慰剂 n̂=0.00008、打乱时间戳后 Fano 从 9.03 归位 0.98、时间重标定 KS 检验 p=0.964 对泊松模型的 p=0.000。最容易误读的是预测能力——2 秒窗口 MAE 只改善 12.1%,10 秒 2.7%,越往后越接近零,簇发结构可测但不等于可交易(高阶)
18 min Chinese - 订单流付款 PFOF:零佣金背后的执行质量博弈
PFOF 完整拆解:20 万笔散户订单模拟证明零佣金不是慈善也不是骗局——客户拿到 56.2 万美元价格改善、券商收 36.4 万 PFOF、内化商净留 84.9 万,客户所得是券商所得的 1.54 倍;但先知最优路由成本仅 76.3 万,内化路由多付 45.0 万缺口暴露『比交易所好』与『最好』的距离。逆向选择模拟给出内化商挑单的硬约束:无差别全接毛利 63.2 万、识别后挑单 92.9 万,被留下的知情单净亏 18.5 万全靠噪音单 111.4 万补贴 - halo的技术博客
21 min Chinese - 碎股交易的信息含量:odd lot 里的知情交易
不足一手(美股 100 股)的碎股交易,曾被当作散户零钱噪音直接过滤掉——直到研究者发现高价股里碎股占成交笔数一半以上,且碎股买卖失衡对未来收益的预测力显著强于整手失衡。原因反直觉:算法拆单把大机构的知情订单切成了碎股,'最小的单'反而藏着'最大的钱'。本文用受控模拟复现三层结构:碎股占比的长期抬升(高价股 >50%)、碎股失衡十分组的单调预测力(vs 整手失衡的平坦线)、以及 2014 年碎股并入公开磁带后因子 alpha 的衰减——信息优势的半衰期。附完整 Python 与四类真实陷阱(中阶)。
15 min Chinese - 批量成交分类 BVC:用成交量分布近似订单流方向
Lee-Ready 在高频碎片化市场里的死穴是逐笔:时间戳粒度不够、多场所归并乱序、报价陈旧,逐笔判方向的地基先塌。Easley-López de Prado-O'Hara (2012) 的 BVC 干脆放弃逐笔——把成交切成等成交量 bar,只看每根 bar 的价格变化,用标准化 ΔP 过一个 CDF 直接映射出这根 bar 里的买量占比:涨得越猛买单占比越高,跌得越猛卖单越多。20 万笔模拟实测:bar 级买量占比与真实值相关 0.80;把逐笔时间戳按块打乱模拟碎片化,Tick 规则相关性从 0.66 崩到 0.03,BVC 只从 0.78 缓降到 0.55——它根本不看逐笔顺序,只看 bar 端点。bar 大小是核心权衡:切太细噪声主导(100 根时 r=0.81 但误差大)、切太粗把日内反向流平均掉。诚实边界:BVC 给的是概率化的量占比不是逐笔标签、CDF 分布假设错了映射就歪、在报价干净的低频场景反而不如 Lee-Ready(中阶)。
13 min Chinese - 订单失衡与收益:用成交方向净额预测下一段价格
把一段时间内的买单量减卖单量、除以总量,得到订单失衡 OI ∈ [-1,1]——这是订单流预测里最直白的一个数。它有预测力的机制不是玄学:价格冲击让净买压直接推高价格,而拆单和羊群行为让失衡有自相关、会延续到下一个 bar。5000 个 5 分钟 bar 的模拟实测:OI 最低十分位下一 bar 平均收益 -6.4bp、最高十分位 +4.9bp,十组单调;但预测性衰减极快——OI 与未来收益的相关性从 h=1 的 0.21 跌到 h=5 的约 0,寿命只有一两个 bar。策略实验最诚实:阈值策略毛收益 117%,扣 3bp 单边成本后只剩 12%——3476 次换手把利润基本磨光。它的正确用法是执行择时与已有信号的入场微调,不是独立策略。诚实边界:方向分类本身有错标、失衡可被大单方拆单制造、参数换个市场就要重估(中阶)。
10 min Chinese - 报价深度失衡:用限价簿两侧挂单量预测短期价格方向
价差一样的两个盘口可以完全不是一回事:买一挂 5000 股、卖一挂 1200 股的盘口,下一跳大概率往上走。深度失衡 I = (B−A)/(B+A) 是限价簿里最便宜也最顽固的短期方向信号——只要买一卖一两个数字,不要逐笔、不要全簿。本文从做市商队列消耗的机制推导为什么它有预测力,2 万个模拟盘口快照实测:失衡最负的十分位下一跳上涨概率 23%、最正的十分位 77%,单调性完美;但信号衰减曲线显示相关性在 10-20 个快照后见顶然后快速衰减,200 步外只剩 0.07。最扎心的实验是成本:无成本时四档阈值策略全部单调赚钱,扣掉 1 个 tick 的跨价差成本后全部转为亏损——这个信号的经济学归宿不是「做多做空」而是「决定挂单还是吃单、现在执行还是等一等」。执行算法里它值真金白银,当独立策略它付不起过路费。诚实边界:可被幌骗操纵、大 tick 股票才显著、隐藏单和冰山单让可见深度失真(中阶)。
13 min Chinese - Lee-Ready 成交方向分类:只用价与报价推断每笔是买还是卖
微观结构里几乎所有模型——从 Roll、Glosten-Harris 到 Huang-Stoll 价差分解、订单流失衡、VPIN——都要先回答一个原始问题:这笔成交是买方主动还是卖方主动?可交易所的 tick 数据往往不标方向。Lee-Ready (1991) 给出了一套两步规则:报价规则(成交价高于中间价判为买、低于判为卖)先处理绝大多数价内成交,Tick 规则再救那些恰好打在中间价上的疑难成交。本文用 5 万笔模拟成交跑通完整算法,实测整体准确率 89.8%(价内成交 100%、价差内成交 80%),拆解误差全部来自中点成交与价格改善;再演示分类误差如何传导到下游订单流失衡信号(相关系数掉到 0.76),以及报价陈旧化如何快速侵蚀准确率——这正是 Lee-Ready 建议报价前移 5 秒的原因。诚实边界:错标率 10-15% 会污染所有下游模型、算法在不同市场结构下需重标定、高频碎片化市场中点滞后(中阶)。
12 min Chinese
返回