- 批量成交分类 BVC:用成交量分布近似订单流方向
Lee-Ready 在高频碎片化市场里的死穴是逐笔:时间戳粒度不够、多场所归并乱序、报价陈旧,逐笔判方向的地基先塌。Easley-López de Prado-O'Hara (2012) 的 BVC 干脆放弃逐笔——把成交切成等成交量 bar,只看每根 bar 的价格变化,用标准化 ΔP 过一个 CDF 直接映射出这根 bar 里的买量占比:涨得越猛买单占比越高,跌得越猛卖单越多。20 万笔模拟实测:bar 级买量占比与真实值相关 0.80;把逐笔时间戳按块打乱模拟碎片化,Tick 规则相关性从 0.66 崩到 0.03,BVC 只从 0.78 缓降到 0.55——它根本不看逐笔顺序,只看 bar 端点。bar 大小是核心权衡:切太细噪声主导(100 根时 r=0.81 但误差大)、切太粗把日内反向流平均掉。诚实边界:BVC 给的是概率化的量占比不是逐笔标签、CDF 分布假设错了映射就歪、在报价干净的低频场景反而不如 Lee-Ready(中阶)。
13 min Chinese - Lee-Ready 成交方向分类:只用价与报价推断每笔是买还是卖
微观结构里几乎所有模型——从 Roll、Glosten-Harris 到 Huang-Stoll 价差分解、订单流失衡、VPIN——都要先回答一个原始问题:这笔成交是买方主动还是卖方主动?可交易所的 tick 数据往往不标方向。Lee-Ready (1991) 给出了一套两步规则:报价规则(成交价高于中间价判为买、低于判为卖)先处理绝大多数价内成交,Tick 规则再救那些恰好打在中间价上的疑难成交。本文用 5 万笔模拟成交跑通完整算法,实测整体准确率 89.8%(价内成交 100%、价差内成交 80%),拆解误差全部来自中点成交与价格改善;再演示分类误差如何传导到下游订单流失衡信号(相关系数掉到 0.76),以及报价陈旧化如何快速侵蚀准确率——这正是 Lee-Ready 建议报价前移 5 秒的原因。诚实边界:错标率 10-15% 会污染所有下游模型、算法在不同市场结构下需重标定、高频碎片化市场中点滞后(中阶)。
12 min Chinese
返回