- 量化开发者技术栈全景图:从数据到实盘
量化开发者技术栈全景图:从数据到实盘 - halo的技术博客
9 min Chinese - 轧空与 Gamma 正反馈环:逼空行情的自我强化机制
一个 +12.6% 的初始冲击,在 g=0.5 的反馈增益下被放大到 +13.7%——看起来不起眼,但剥离机制后发现:Gamma 对冲贡献了 +7.20 个百分点,空头回补贡献 +3.24 点,两条腿合起来占了基准收益的 76%。最硬的对抗式检验:把 Gamma 对冲关掉,峰值从 +52.6% 塌陷到 +25.8%;把回补关掉,塌陷到 +50.4%;两者全关,只剩 +4.8%。这不是数字游戏——这是「真轧空」vs「普通上涨」的分界线。高强度路径(峰值 > 中位数)的回补量是低强度路径的 5.1 倍,但仍有 43% 的路径涨幅超 30% 却回补不足 5%——这些是误判,是任何事后归因都要面对的噪音。逼近临界点 g=1 时,收益非线性爆发:g 从 0 升到 0.95,平均收益只从 +12.6% 涨到 +14.8%,但峰值 95% 分位从 +105% 飙到 +162%,波动率从 49% 炸到 77%。这不是线性外推能预测的世界。
16 min Chinese - 分拆上市事件 Alpha:母子公司拆分后的价格漂移
把真实持续 Alpha 精确设为 0,市场调整 CAR 照样开出 +16.96%(t=+14.82)。同一批 1500 个事件四种口径:原始 +25.17%、市场调整 +16.96%、规模匹配 +13.49%、三因子 +13.11%——光换基准就摆 3.85pp,没一个是 Alpha。分解锁死来源:强制抛售反弹 +13.16%、规模 +3.10%、价值 +0.38%、beta≠1 +0.37%,残差 −0.05%。两条硬对照:零压力零 Alpha 安慰剂里市场调整仍报 +3.80% 而三因子精确归零(−0.052%,t=−0.05);规模溢价传导斜率 1.1159 与平均 SMB 载荷 1.1159 比值精确为 1.0000——那个「超额」逐字就是规模溢价乘载荷。剩下的 13.11% 是流动性报酬而非 Alpha:51.8% 在 20 天内赚完,窗口滚离资金流后从 +11.85% 塌到 +1.91%。容量是真天花板:只有 14 个并发仓,2.5 亿美元时投放率已跌到 17.5%,半衰容量约 2.69 亿。样本量红线:单事件 SD 42.65%、36.7% 为负,需 42 个事件才够 t=2
20 min Chinese - VPIN 知情交易概率:用成交量桶量化逆向选择风险
VPIN 被当作「知情交易探测器」用,但它只看订单流失衡的绝对值——而失衡有两个来源:真正的知情交易,和纯粹想快点成交的大额委托。受控三状态模拟(12 万根 bar、4995 个成交量桶,两种来源的真值都已知)给出决定性读数:VPIN 与「总不平衡流量」相关 0.996,与真实知情占比只有 0.347,与无知情大额委托反而有 0.648。构造一个零知情的世界(只有大额委托),VPIN 均值 0.152 仍是真实市场 0.153 的 99%——这个指标在完全没有信息不对称时读数几乎不变。后果直接体现在钱上:95 分位报警的假发现率 85.1%,99 分位精确率归零;同一条前 10% 警报内部,知情主导的桶做市亏 35.4bp,大额委托主导的桶反而赚 7.96bp(t=4.14),而后者占警报的 76%——高 VPIN 时段整体做市 P&L 是 −2.29bp,比安静时段的 −9.07bp 还好。八项对抗式检验含两个推翻常识的结果:BVC 分类误差几乎不损失相关性(0.354 对 0.347),公平匹配窗口后钟表时间桶反而略胜体积时钟(0.451 对 0.347)。混合比例扫描给出边界——无知情委托占比从 0 升到 22%,与知情的相关性从 0.998 塌到 0.196,而与总流量的相关性始终锁在 0.996 以上(高阶)
18 min Chinese - 自动化因子挖掘:遗传算法 vs 深度学习路线之争
自动化因子挖掘:遗传算法 vs 深度学习路线之争 - halo的技术博客
15 min Chinese - 交叉冲击:你买 A 却把 B 推高了,逐股成本模型为什么两头都错
冲击成本模型几乎都是逐股独立算的——每只股票一条平方根曲线,加总就是篮子成本。但冲击矩阵 Λ 的非对角元不是零:受控模拟 60 只股票 3 因子结构(非对角均值是对角的 0.343 倍)量化两个方向相反的错误:单边买入篮子上,逐股模型只报出真实成本的 1/19.5(低估 94.9%);市场中性篮子上反而高估 62.6%——多空腿的冲击互相抵消,逐股模型看不见这份折扣。方向性扫描给出连续图景:市场因子暴露占比从 0 到 1,真实/逐股比值从 0.61 单调升到 18.17,穿越 1.0 的那一点就是逐股模型恰好正确的位置。唯一的免费午餐是内部轧差:两个组反向重叠 0.5 时先轧差再下单省 48.9% 成本,重叠 0.9 时省 90.1%。六项对抗式检验全过:把 Λ 强制对角化后真实/逐股恰好 1.00000000、5000 个随机篮子最小成本 0.511 为正(Λ 半正定,无往返套利)、12 个矩阵方向性比值 20.53±1.30 且中性比值 0.582±0.032 符号从不翻转。两个反直觉发现被完整保留:打乱非对角元后单边比值 19.57 几乎不变(一边倒的篮子只感受 Λ 的总和),而抽掉共同因子后比值塌到 2.02——真正的元凶是共同因子而非「非对角非零」;且 19.5 这个倍数随组合宽度单调放大,N=10 时 3.57、N=250 时 86.53,不可跨组合搬运(高阶)
17 min Chinese - Hawkes 自激过程:订单到达如何自己点燃自己
泊松过程假设订单彼此独立,但真实盘口是一阵一阵来的。Hawkes 用一条自激强度把「一笔订单抬高下一笔的概率」写进模型:受控模拟 19132 笔订单(μ=0.5、n=0.7、β=2.0)量化簇发的代价——10 秒窗口均值同为 15.9 笔,Hawkes 出现 ≥30 笔的概率是泊松的 100 倍,≥50 笔时是 31 亿倍,泊松眼里的「五百年一遇」在这里平均每 7 分钟就来一次。68.98% 的订单是被前面的订单激发的,与理论分支比 0.70 吻合。但真正的杀手在估计端:把一段自激强度真值为 0 的纯泊松数据(只叠加日内 U 型节奏)喂给标准 MLE,n̂ 凭空刷到 0.909、Fano 因子 4.81——非平稳基线和自激在似然函数眼里长得一模一样。做时间重标定后 n̂ 精确塌回 0.000,而真 Hawkes 数据同样处理只从 0.693 掉到 0.691(几乎不动),证明修正没有误伤信号。七项对抗式检验全过:平坦泊松安慰剂 n̂=0.00008、打乱时间戳后 Fano 从 9.03 归位 0.98、时间重标定 KS 检验 p=0.964 对泊松模型的 p=0.000。最容易误读的是预测能力——2 秒窗口 MAE 只改善 12.1%,10 秒 2.7%,越往后越接近零,簇发结构可测但不等于可交易(高阶)
18 min Chinese - 执行落差归因:把 Implementation Shortfall 拆成延迟、冲击与择时
TCA 报表把执行落差拆成「延迟成本」和「交易成本」两个桶,然后拿后者考核交易台。4000 笔母单的受控模拟(每一个 bp 的真实成因都已知)给出决定性读数:报告的 15.57 bp 交易成本里,真实市场脚印只有 7.09 bp,54.5% 是本来就会发生的 alpha 漂移。零冲击安慰剂最硬--把自身冲击彻底关掉(真值精确为 0),报表照样开出 9.51 bp 账单,一个毫无市场足迹的交易台被凭空罚款。反过来关掉 alpha,交易桶立刻诚实(误差 1.67 bp),证明污染源就是 alpha 而非模型缺陷。三个基准在同一批成交上给出 23.48 / 15.57 / 7.09 bp 三个故事,跨度 16.39 bp;只把「到达时间戳」往后挪 12 根 bar、不改任何一笔成交,交易台成本从 15.6 bp 降到 -1.4 bp,17.0 bp 的纯文书改善。最刺眼的是考核后果:三个交易台按报告成本排名是 A<B<C,按真实脚印排名精确反转成 C<B<A,被表扬的正是footprint最大的那个。八项对抗式检验全过,含分解恒等式残差 0.00e+00、零延迟对照精确 0.00 bp、12 个宇宙 CV 0.106。样本量红线:单笔标准差 63.98 bp、35.9% 的单子成本为负,要 30 笔才够 t=2(高阶)
18 min Chinese
返回
博客
第 17 页 · 显示 8 / 1446 篇文章
按年份查看 →