- 波动率的波动率因子:一个测不准的风险溢价
vol-of-vol 在论文里是漂亮因子,拆到估计层却发现你测的东西 95.5% 是噪声。400 只股票、10 年、真实 ξ 已知的受控模拟:常规做法(21 日 RV + 63 日滚动标准差)与真实 vov 相关仅 0.212、水平高估 92.0%、回归斜率 0.027。噪声有解析形式:log(RV_w) 估计误差方差约 1/(2w),21 日窗口下比信号大 72 倍。两个改动把相关提到 0.676:换无重叠窗口(0.212→0.449)、RV 窗口拉到 63 日。溢价是真的——上帝视角按真实 ξ 排序价差 3.22%(t=1.99)与理论 3.00% 吻合,但最优可观测估计量只抓到 40.8%(t=0.77)。窗口敏感性是警告:t 值在 0.05–1.97 间漂移,且估计质量最好的配置不是 t 值最高的配置——这就是过拟合的具体形态。15 个种子里 6 次符号翻转。持续性对比最有诊断价值:vov 排名前后半期相关仅 0.115、高组留存 27.5%,普通波动率则是 0.958 和 73.8%。
23 min Chinese - 碎股交易的信息含量:odd lot 里的知情交易
不足一手(美股 100 股)的碎股交易,曾被当作散户零钱噪音直接过滤掉——直到研究者发现高价股里碎股占成交笔数一半以上,且碎股买卖失衡对未来收益的预测力显著强于整手失衡。原因反直觉:算法拆单把大机构的知情订单切成了碎股,'最小的单'反而藏着'最大的钱'。本文用受控模拟复现三层结构:碎股占比的长期抬升(高价股 >50%)、碎股失衡十分组的单调预测力(vs 整手失衡的平坦线)、以及 2014 年碎股并入公开磁带后因子 alpha 的衰减——信息优势的半衰期。附完整 Python 与四类真实陷阱(中阶)。
15 min Chinese - 融券费率信号:借券成本里的负面信息
做空得先借券:绝大多数股票便宜如白菜(GC <1%),少数 Special 贵到离谱——因为集中的做空需求里藏着最激进的负面信息。400 股×1000 日模拟:费率五分组未来 20 日收益从 +0.84% 单调塌到 -0.16%,Rank IC -4.1%、IR 5.2(Jones-Lamont 2002 模拟版)。但做空高费率组是悖论:费前年化 +3.3%,借券费恰好 5.9%/年,费后 -2.5%——均衡把负面信息的价值精确定价进租金,alpha 转手交给出借人。免费午餐在多头侧:回避 Special 组让年化从 5.0% 提到 7.1%,零成本排雷。530 个费率跳升事件:进入 Special 后 40 日仍超额 -2.7%,是下跌中继不是利空出尽。诚实边界:实时费率数据难得、A 股 2024 年融券收缩后信号近乎失效、Special 名单是逼空燃料(GME)、供给噪声稀释单调性(中阶)。
12 min Chinese - 累积局部效应 ALE:用条件期望修正相关因子下的边际效应
PDP 有个绕不过的死穴:因子彼此相关时,它会把某个因子强行设成某值、其余保留原值,从而外推到根本不存在的样本组合,把相关因子借来的效应算成自己的。ALE(Accumulated Local Effects)换个算法——把因子取值切成窄箱,在每个箱内只用真实存在的样本算『局部差分』(同一批样本换到箱边界两侧的预测之差),再沿因子方向累加。这样它永远不外推、只在数据支撑的邻域里说话。本文用相关系数 0.92 的两个因子做对照:一个是真驱动、一个纯冗余,看 PDP 如何被冗余因子骗、ALE 如何把它的伪效应修正回近零,附纯 numpy 从零实现的 ALE(中阶)。
14 min Chinese - 局部依赖图 PDP:把单个因子与收益的边际关系画成曲线
机器学习因子模型跑出了收益,你却说不清『动量到底怎么影响预测』——因为模型是黑箱,特征重要性只给排名不给形状。PDP(Partial Dependence Plot)把某个因子在其取值范围上扫一遍、其余特征原样保留后对全样本预测求平均,画出这个因子与预测收益的边际曲线:是单调、倒U 还是阶梯,一眼看穿。本文用合成因子数据训练梯度提升树,画动量的倒 U 型甜区、四因子 PDP 面板、动量×规模的二维交互热图,并诚实拆穿 PDP 最致命的陷阱——相关因子下它会强行外推到根本不存在的样本组合、把借来的效应算成自己的(附完整 Python,中阶)。
15 min Chinese - SHAP 因子解释:用博弈论份额拆开每个特征对预测的贡献
树模型自带的 gain 重要性有两个死穴:它偏爱高基数特征、而且只给全局排名,答不了『这一只股票为什么被模型看多』。SHAP 借来博弈论里的 Shapley 值——把预测当成一场合作博弈,每个因子是玩家,公平分配它对这次预测的贡献。本文讲清 Shapley 值的可加性从哪来、为什么 base value 加上所有 SHAP 值恰好等于 f(x),用合成因子数据做单样本瀑布图、全局重要性对比、依赖图揭示交互效应,并诚实指出相关特征分摊、计算成本、因果幻觉三大陷阱,附完整 Python(中阶)。
15 min Chinese - 词嵌入金融文本:用向量空间把公告语义变成可计算因子
情感词典(利好词 +1、利空词 −1)有个致命短板:它只认得你手工列进去的词。市场天天造新词——『超预期』你收录了,明天出现『扩产』『中标』你没收录,词典对它们视而不见,直接算 0。词嵌入用 skip-gram 从公告语料里学出每个词的向量,语义相近的词自动挨在一起,于是词典外的新词也能被『情绪轴』投影出方向。合成实验:4000 条公告、三类语义(利好/利空/中性),纯 numpy 负采样 skip-gram 训练后同类词余弦 0.981 vs 异类 0.896;构造情绪因子做 IC 检验——在含词典内词的公告上嵌入因子 IC 0.607 与词典计数 0.574 基本打平,但在『全是词典外新词』的留出集上,词典计数 IC 直接归零(0.000),嵌入因子仍有 0.602。附向量可视化、维度敏感性与五类真实陷阱(中阶)。
15 min Chinese - 现金转化周期因子:把「钱躺在账上多久」做成可交易 alpha
现金转化周期(CCC)因子:用 DIO + DSO − DPO 把「一家公司把现金锁在营运资本里多久」量化成横截面信号——短 CCC 公司资本效率高、长期跑赢。本文从零实现三项周转天数、构造「清洁 CCC」月度再平衡因子,验证十分组收益严格单调、长短因子年化约 17%,并诚实拆穿渠道压货/应付账款透支/幸存者偏差/做空约束/行业中性化五类真实陷阱(中阶)。
13 min Chinese
返回