- 队列反应模型:限价簿排队动态的马尔可夫建模
限价簿的最优报价不是一个价格,是一条排队的队列:价格什么时候动,等价于哪边队列先被吃空。队列反应模型(Huang-Lehalle-Rosenbaum 2015)的核心洞见是三类事件强度都是队列长度的函数——小队列抢着补单、大队列吸引市价单、撤单随队列线性增长,生灭过程的平稳分布可以解析求出并被 12 万秒事件级模拟精确复现(众数 q=3,零智能常数强度模型给出错误的 q=1 单调衰减形态)。队列失衡→价格方向的 S 形概率曲线从首达时间竞赛自然涌现:I=+0.8 时上行概率 73.3%、I=−0.8 时 28.3%,无需任何外生 alpha 假设。全簿模拟 3600 秒 11890 个订单事件只产生 173 次价格变动——价格是队列动态的慢变量。做市、执行算法排队价值评估、短周期方向信号三个应用场景+A 股 Level-2 十档快照的工程适配(高阶)
14 min Chinese - Run Bars 采样:用连续同向成交的长度定义信息事件
失衡 Bar 数净额,Run Bar 数连续性:知情机构能用交替扫单把净失衡做平,但藏不住更长的同向 run——只要必须在信息失效前建完仓,它就必须持续单向交易。12 万笔受控模拟(中段植入 p_buy=0.67)实测:买方 run 均值 2.35→3.96 笔、p95 从 6 到 11;阈值版 Run Bar(run≥10 触发)知情段采样密度自动加密 4.6 倍,bar 长度中位数 237→54 tick——bar 长度本身是免费的知情强度指标,而等 tick Bar 完全无感。bar 内买单占比分布双极化(标准差 0.158 vs 0.089),样本信息密度更高。诚实交代 AFML 原版 EWMA 自举阈值的退化陷阱:实测切出 15245 根中位数 2 tick 的碎 bar,生产级应用固定分位数阈值+保险丝。A 股 Level-2 可跳过 tick rule 直接数 run,但 T+1 下它是特征时钟而非交易时钟(高阶)
12 min Chinese - 样本唯一性加权:重叠标签下的正确样本权重
上一篇 CUSUM 把采样点从 1430 砍到 236,但事件标签的区间重叠依然存在:1500 日模拟中活跃时点平均被 2.9 个标签同时覆盖,平均唯一性仅 0.339——每个样本携带的独立信息只有名义值的三分之一。AFML 第四章给出三件配套工具:concurrency 计数把重叠精确量化到每个时点;唯一性权重 + 收益归因权重让'独立且赚大钱'的样本主导训练;序列 Bootstrap 用动态更新的抽样概率替代均匀抽样,实测抽样集合唯一性 0.312→0.331。关键洞见:这不是可选的调参项,而是让 bagging 的方差缩减公式在金融数据上重新成立的前提——标准 bootstrap 在重叠标签下抽出的是'伪独立'样本,OOB 分数系统性虚高。A 股日频 + T+1 下持有期普遍更长,重叠更severe,加权更必要(中高阶)
14 min Chinese - 序贯自助法样本权重:修正金融标签重叠带来的伪独立性
机器学习的所有教科书保证都建立在一句话上:样本独立同分布。金融标签把这句话踩得粉碎——「持有 25 天」意味着相邻样本共享 96% 的价格路径,500 个样本实测平均并发 6.66 个、平均唯一度仅 0.147,有效样本量只剩 73.7 个。后果是袋外评估彻底失灵:在完全不可预测的随机游走上,持有期 1 天时 OOB 只虚高 0.9pp,持有期 80 天时 OOB 报 0.607 而真样本外 0.492,凭空造出 11.5pp——重叠让「袋外」样本不再袋外。López de Prado 的两件解药:唯一度加权把每个样本的话语权降到它真正携带的信息量,序贯自助在抽样时优先挑不重叠的样本(实测抽样内唯一度提升 7.6%、重复抽中从 34.9 降到 27.5)。控制变量实验最能说明问题:训练段埋一个只在密集重叠簇里成立的伪信号,等权训练下它的特征重要性 0.633 碾压真信号的 0.193、样本外 t 值只有 1.33;换成唯一度加权后伪信号掉到 0.154、真信号升到 0.464、t 值 3.95——只改了样本权重,别的一行没动。三盆冷水:唯一度加权治重复计票不治前视偏差、纯噪声特征下不会凭空变出 alpha、序贯自助 O(n²) 开销在万级样本上要用近似(高阶)。
16 min Chinese - Shapelet 形态特征:从时间序列里学出最有判别力的子形状
Shapelet(Ye-Keogh 2009)是时间序列分类里最有解释性的特征:不是人工画好的『头肩顶』模板,而是从数据里学出来的、最能区分两类序列的子形状——判别标准是信息增益,特征值是序列到该形状的最小 z-norm 距离。240 条合成价格片段实验(一半在随机位置内嵌深度随机的 V 形恐慌-回补形态、一半纯随机游走):算法在无任何先验下精确还原了植入的 V 形,学出的 28 点 shapelet 单距离特征在测试集上准确率 91.2%、F1 0.91——一维特征、一个阈值、完全可解释,而全序列距离度量在『位置随机』设定下注定失效。信噪比压力测试给出诚实边界:形态深度降到背景波动同量级时准确率坍塌到 52.5% 随机线。与 SAX/Matrix Profile 的分工:MP 找『重复出现的形状』(无监督),shapelet 找『区分类别的形状』(有监督),技术图形分析的科学化版本正是后者。三盆冷水:暴力搜索 O(n²m⁴) 必须近似加速、金融标签又弱又漂移(91% 在金融数据上几乎必然是泄漏)、判别 ≠ 预测——形态搜索空间的多重检验问题比因子挖掘还严重。
18 min Chinese - SADF 结构突变检验:实时监测价格序列的爆炸性泡沫
泡沫的技术定义不是'涨太多',而是价格序列从随机游走切换到爆炸性自回归(ρ>1)——SADF/BSADF 把 ADF 单位根检验改造成实时监测器:右尾检验 + 起点滑动取上确界,让统计量只对'最近一段是否爆炸'敏感。1000 日受控实验(500 日随机游走 + 230 日 ρ=1.012 温和爆炸 + 崩溃)实测:BSADF 在爆炸开始后 65 个交易日越过 95% 临界值报警,峰值 11.3 远超临界值 0.57,崩溃后迅速回落——它同时检测泡沫的生成与破灭。双泡沫实验暴露起点锚定的致命伤:第一轮泡沫崩溃后,锚定 t=0 的扩张窗 ADF 对第二轮泡沫完全失灵(峰值 0.14 不及临界值零头),BSADF 靠滑动起点甩掉旧样本稀释、峰值 2.72 正常报警——这正是 PSY 2015 从 SADF 升级到 GSADF/BSADF 的全部动机。三个诚实边界:65 日检测滞后意味着它是确认工具而非预测工具;临界值必须蒙特卡洛模拟(非标准分布)且随窗口设定变化;对'漂移强但不爆炸'的慢牛会保持沉默——它检验的是自回归系数不是涨幅。AFML 用法:BSADF 序列不做择时开关,做元标注特征喂给二级模型(高阶)
15 min Chinese - SAX 符号聚合近似:把连续价格序列离散成可检索的字符串
SAX(Lin-Keogh 2003/2007)把时间序列变成字符串的三步流水线:z-normalize → PAA 分段平均 → 高斯等概率断点离散,128 个点的窗口压成 8 个字符的词。它的杀手锏是 MINDIST 下界性质:词距离永不超过真实欧氏距离——3000 对随机游走实测违反率 0.00%,这让哈希桶预筛选保证零漏检。合成价格实验:5 处植入的 V 形反转模体,SAX 词哈希在 (w=6, a=5) 参数下 F1=1.00 完美检索,全程只有字典查找、无距离计算。参数热力图诚实展示敏感性:F1 从 0.28 到 1.00 剧烈波动,词太短撞词、太长碎片化。三盆冷水:等概率断点的高斯假设被肥尾收益率违反、z-norm 抹掉波动率量纲让盘整与崩盘同词、符号匹配≠预测力。与 Matrix Profile 对比:SAX 是倒排索引式召回,MP 是精确最近邻,实盘管线的正确姿势是 SAX 粗筛 + 欧氏/MP 精排。
16 min Chinese - Tick 失衡 Bar:用订单流失衡触发的自适应采样
tick/成交量/美元 Bar 共享一个盲区:只数活动的量,不看方向。1000 手买对轰 1000 手卖是均衡市场,2000 手连续买是知情交易——前三种 bar 一视同仁。Tick 失衡 Bar 把切分条件换成失衡量:逐笔方向 ±1 累加,失衡绝对值触阈值就切一根。12 万笔受控模拟(中段植入 p=0.68 持续买方失衡)实测:知情区段采样密度 30.2 vs 平静期 2.7 根/窗口,自动加密 11 倍;bar 长度中位数 1653→162 tick,bar 长度成了免费的知情强度指标;平方收益 ACF 从 0.335 压到 0.039,波动聚集被吸收进采样密度。代价:EWMA 阈值自举脆弱、bar 数不可预算、tick rule 误判在单边行情系统性放大。A 股:Level-2 BS 标志可跳过 tick rule,但 T+1 下 TIB 定位是特征时钟而非交易时钟(高阶)
12 min Chinese
返回