- Hill 估计量与尾部指数:量化收益分布到底有多肥
『肥尾』被说滥了,但到底多肥?尾部指数 α 给出一个数:P(X>x) ~ x^(-α),α 越小尾越肥,且 α 直接判决矩的生死——α<4 峰度不存在、α<2 方差都没了。Hill 估计量用前 k 个顺序统计量的对数间距把 α 从数据里榨出来,本文从公式到陷阱走全程:三个已知真值的分布验证(Pareto α=2 估出 2.02 近乎完美,但 t(5) 只估出 3.87——慢收敛尾部的负偏差实锤);GARCH+t(4) 合成收益的左右尾 Hill Plot(左尾 α̂=2.65,波动聚集把无条件尾部拖得比创新项 t(4) 更肥,这是特征不是 bug);log-log 生存函数图上幂律直线与正态跳水的视觉对决;Weissman 外推算『百年一遇』:幂律给 16.5% 单日损失、正态给 3.0%,样本内最差实际 7.16% 已两倍于正态的百年一遇。最狠的是 300 次蒙特卡洛的小样本实验:n=250(一年日线)时 α̂=2.52±0.47(真值 3),系统性负偏 + 巨大方差——一年数据测尾部指数等于用体温计量海深。拆穿 k 选择的 Hill horror plot、样本依赖性、外推杠杆三类陷阱(中高阶)。
9 min Chinese - 日内动量最后一小时效应:收盘前的方向延续从哪来
开盘半小时的涨跌方向,会在收盘前一小时被部分复刻——这是 Gao-Han-Li-Zhou (2018) 在 SPY 上记录的日内动量效应,来源不是玄学而是三股结构性资金:对冲 Gamma 的做市商、盯收盘价的被动基金、日内趋势跟随者都在尾盘同向交易。本文在自洽合成数据上植入传导系数 β=0.10 并完整复现检验流程:开盘-尾盘收益相关性 0.108(t=3.8)、五分组尾盘收益单调递增、策略年化 8.3%(Sharpe 0.73)显著跑赢被动持有尾盘(0.37);同时用无效应对照组证明——β=0 时同一策略被 2bp 成本磨到年化 -7.9%。β×成本 Sharpe 热力图画出这类高频率低赔率策略的生死线,附完整 Python 与四类真实陷阱(中阶)。
14 min Chinese - Hayashi-Yoshida 领先滞后估计:在异步 tick 里找谁先动
两只关联资产里,谁先动、谁跟随?大盘 ETF 涨了,成份股几秒后跟上;期货动了,现货滞后半秒——这个『谁领先谁』的时间差,是高频交易里最值钱的信息之一。但要从真实 tick 数据里量出这个 lag 极难:两条序列的成交时刻从不对齐,你一旦重采样到固定网格,就把秒级的领先滞后模糊进了分钟级的格子,lag 直接消失。本文把 Hayashi-Yoshida 估计量升级成领先滞后探测器:给一条序列的时间轴整体平移 L 秒再算 HY 交叉相关,扫描所有 L、峰值所在即领先滞后时间。用纯 numpy 造 leader/follower 结构(follower=leader 滞后 8 秒+噪声),完整复现交叉相关峰值精准锁定 8 秒;对比固定网格 last-tick 如何被粗粒度模糊掉 lag;量化样本量与信号强度对 lag 估计稳健性的影响(一天数据 vs 一周数据、ρ=0.2 的平峰 vs ρ=0.8 的尖峰)。附完整 Python 与四类真实陷阱。
15 min Chinese - 从RAG到Agent:大模型量化投研助手的实战构建指南
从RAG到Agent:大模型量化投研助手的实战构建指南 - halo的技术博客
13 min Chinese - 元学习量化策略:用 MAML 让模型在少样本上快速适应新市场
普通模型换个市场、换个 regime 就得从头训,可新环境往往只有几十个样本,根本喂不饱。元学习换个目标:不学『某个市场的最优参数』,而学一个『最容易被少量样本快速微调』的元初始化。本文用纯 numpy 从零实现一阶 MAML(FOMAML),把每个市场建模成因子→收益的线性任务,任务间共享中心 w0、各自偏移 τ=1.1。200 个训练市场上元训练 300 轮,外层 query 损失从 3.65 压到 1.67 逼近 Oracle 下界 1.00。在 100 个全新市场上只用 K=10 个样本适应:MAML 的 MSE 2.85,碾压忽略任务差异的 Pooled 全局模型(7.75,降 63%)和从零学的 Scratch(3.17)。few-shot 曲线显示 MAML 起点就低、一两步就到位;样本量敏感性揭示真相——K 越小 MAML 优势越大(K=3 时 4.73 vs Scratch 5.75),样本足够时三者收敛。拆穿元学习=预训练、任务同分布假设、内外循环学习率耦合、少样本≠零样本四类陷阱(中阶)。
14 min Chinese - 多重分形 DFA:用多重分形谱刻画不同尺度下的记忆结构
单一 Hurst 指数假设市场只有一种记忆——大波动和小波动遵循同一个标度律。但真实收益序列的大涨大跌聚集成串、小波动却近似随机游走,一个 H 根本装不下。MF-DFA(多重分形去趋势波动分析)把波动函数升级成 q 阶矩:q>0 放大大波动的标度行为、q<0 放大小波动,得到广义 Hurst 曲线 h(q),再经 Legendre 变换画出多重分形谱 f(α),谱宽 Δα 一个数度量『记忆结构的丰富度』。本文用纯 numpy 从零实现 MF-DFA(profile 累积、双向切段、多项式去趋势、q 阶波动函数、谱变换),三类合成序列对照:白噪声 h(q) 水平线且 Δα≈0.006、长记忆 fGn(H=0.7) 整体抬高但仍是单分形(Δα=0.024)、二项级联序列 h(q) 从 0.76 弯到 0.43、Δα=0.61——多重分形性一眼可辨。滚动窗口应用:谱宽在白噪声段均值 0.11,切入波动级联段跳到 0.35,可做 regime 检测的补充仪表。诚实拆穿关键陷阱:打乱检验显示级联序列打乱后 Δα 仍有 0.55——谱宽大部分来自收益分布厚尾而非时序相关,不做打乱对照就把厚尾当记忆是 MF-DFA 文献里最泛滥的错误。另拆穿谱宽=可预测性/小样本负 q 发散/去趋势阶数选择三类坑(中高阶)。
12 min Chinese - 命名实体识别金融事件:从新闻里自动抽出公司-事件-时间
关键词正则抽事件有个死穴:它认得『回购』这个词,却认不出『拟以自有资金实施股份回购』里被拆开的实体,更分不清『茅台回购、格力增持』同一句里两家公司各自的动作。命名实体识别(NER)用 BIO 序列标注 + CRF 转移约束,把一条新闻切成『公司-事件-时间』三元组。本文从零讲清 BIO 标注、CRF 为什么能压掉非法标签路径,用合成金融语料对比正则法与序列标注的分类型 F1(公司 0.61 vs 0.90、事件 0.42 vs 0.83),并诚实指出中文分词、嵌套实体、事件归属三大真实陷阱,附完整 Python(中阶)。
17 min Chinese - Omega 比率优化:用整条收益分布替代均值方差
Sharpe 比率把整条收益分布压缩成两个数:均值和标准差——第三阶矩以上的信息全被扔掉。本文构造了两个均值、波动率几乎完全相同的策略:一个偏度 -0.05 的正态型,一个偏度 -3.37 的卖期权型,Sharpe 说它们一样好,但后者藏着单日 -5% 级别的崩盘尾巴。Omega 比率的修复思路是不做任何压缩:给定阈值 θ,把分布切成两半,上半部分的概率加权面积除以下半部分——Omega(θ) 曲线本身就携带全部分布信息,两个矩相同的策略在曲线上一眼分开。用 SLSQP 做 Omega 最优组合权重扫描,揭示一个教科书很少讲的相变:θ=0 时优化器抱紧高 Sharpe 但偏度 -9.3 的卖波动策略,θ 抬到 3.5bp/日后权重瞬间 100% 切换到低 Sharpe 但正偏 +2.7 的趋势策略——阈值就是你对『什么算亏』的定义,定义变了最优组合跟着突变。打穿 Omega 优化的三个死穴:非凸性带来的局部最优陷阱、θ 选择的隐蔽自由度(本质是另一个可过拟合参数)、样本内 Omega 对尾部事件计数的极端敏感(进阶)。
14 min Chinese
返回
博客
第 51 页 · 显示 8 / 1446 篇文章
按年份查看 →