- 合成数据:金融大模型训练的新燃料
合成数据:金融大模型训练的新燃料 - halo的技术博客
11 min Chinese - Abdi-Ranaldo 价差估计:用收盘价与中间价的关系改良 Roll 估计
Roll 估计量的命门是虚数价差——自协方差为正时直接失效,蓝筹股失效率可达 40%。Abdi & Ranaldo (2017) 的解法优雅得过分:日高低价中点 η 几乎不带买卖弹跳,而收盘价带满 ±s/2 的弹跳,于是 (c−η_t)(c−η_{t+1}) 的期望恰好等于 s²/4。本文用日内路径级模拟验证 AR 估计的无偏性(价差 0.2%~4% 全区间贴 45° 线),与 Roll 同台对比失效率与精度(σ=5% 时 Roll 失效近半、AR 的 RMSE 只有 Roll 的一半),并用 60 日滚动窗口复现危机温度计。诚实拆穿隔夜跳空、离散报价、负 s² 处理三类真实陷阱(中阶)。
12 min Chinese - 吸收比率与市场脆弱性:用主成分集中度预警系统性风险
Kritzman et al.(2011)的吸收比率:滚动协方差特征分解后看前 K 个主成分吸收多少总方差——AR 高意味着资产被公共因子『焊死』,冲击沿传导链放大。它度量脆弱性而非危机:AR 高不预测下跌,只预测『一旦跌会又急又齐』。30 资产两 regime 模拟(15 年)实测:脆弱期 AR 0.78 vs 平静期 0.61,AUC 0.863;ΔAR>1 组未来 10 日波动 17.1% vs 8.4%(翻倍)、左尾 5% 分位 −6.1% vs −2.2%,但收益均值反而最高——预测波动不预测方向。风险开关(ΔAR>1→仓位 30%):波动 16.1%→10.9%、Sharpe 0.91→1.01、最大回撤 −43.8%→−39.1%,年化 14.7%→11.0%——买保险要付保费。诚实边界:模拟 regime 由因子强度驱动、AR 天生占便宜;减仓日占比 28% 摩擦不可忽略;超参数未调优;AR 与波动率高度相关,增量信息需控制波动率后再检验。
13 min Chinese - Bayes-Stein 收缩期望收益:把各资产均值往全局大盘拉
期望收益是组合优化里估计误差最恶劣的输入:20 只资产、真实年化期望收益都在 1%~11% 之间,一年日频数据估出来的样本均值却在 18%~120% 之间狂舞——截面标准差 27.6%,是真实值(2.2%)的 12 倍。Jorion (1986) 的 Bayes-Stein 估计量把每只资产的均值往全局最小方差组合收益收缩,收缩强度由数据里的信噪比自动决定。实测切点组合 OOS Sharpe:样本均值 T=252 时 -0.21(比扔硬币还差),Bayes-Stein 提到 -0.09,而干脆不用均值的全局最小方差组合 0.53、理论最优 0.57。最诚实的结论:收缩把灾难缓解成失望,但均值估计本身可能就不该做——这正是 Stein 悖论在金融里最疼的一课(中阶)。
13 min Chinese - 常相关模型 CCM:把整个相关矩阵压成一个平均相关系数
Elton-Gruber(1973)的常相关模型:把 N(N-1)/2 个成对相关全部替换成一个平均相关系数 ρ̄——435 个参数压成 1 个,方差骤降换一身结构偏差。N=30 板块结构模拟实测:T=30 时 CCM 的 Frobenius 误差 2.56 vs 样本相关 4.38,交叉点在 T≈126,之后 CCM 被结构偏差下限 1.90 卡死永远追不上。GMV 组合判决更极端:T=30 样本协方差真实波动率 456%(近奇异优化器爆仓)vs CCM 17.5%;T=252 后样本反超。最有信息量的是混合曲线:最优混合权重 δ 随 T 单调爬升(T=60 时 0.35、T=252 时 0.65、T=1008 时 0.90)——这正是 Ledoit-Wolf 收缩的雏形,LW 恰以 CCM 为收缩靶心并把 δ 的选择自动化。诚实边界:ρ̄ 抹掉全部板块结构、对多板块 universe 偏差大;相关非平稳时单一 ρ̄ 追不上 regime;它是收缩靶子而非终点方案。
11 min Chinese - Corwin-Schultz 高低价价差估计:用两日高低价把价差与波动拆开
Corwin-Schultz(2012)的巧思:日最高价几乎总来自 ask、最低价几乎总来自 bid,所以高低价比里藏着价差;而波动随时间线性增长、价差不随时间变——单日高低比与两日高低比联立两个方程,恰好把价差 s 和波动 σ 同时解出。252 日模拟实测:真实价差 2% 时 CS 截零均值 2.05%,几乎无偏;但低价差区间正偏差显著(真值 0.2% 估出 0.83%),因为逐对负估计占比高达 40% 且截零只砍左尾。与 Roll 同台:信噪比低时 Roll 失效率 45% 直接弃赛,CS 至少给出有偏但可用的数字。隔夜跳空是最大污染源:隔夜波动 3% 时估计从 1% 被压到 0.69%(跳空撑大两日区间、γ 膨胀导致低估),平移修正能救回一半。60 日滚动 CS 危机温度计:平静期 0.79%、危机峰值 3.58%,形状完整还原。诚实边界:截零规则在截面比较中引入系统性正偏、非连续交易压低高低区间导致低估、加密/外汇等无隔夜市场反而是最优场景(中阶)。
14 min Chinese - DCC-GARCH 动态相关:让资产间相关系数随时间自行演化
相关性从来不是常数:危机来临时它齐刷刷跳升,而 252 天滚动相关要 248 天才承认这件事。Engle(2002)的 DCC-GARCH 把问题拆成两步:先用单变量 GARCH 各自过滤波动率,再在标准化残差上用一行递推 Q_t = (1−a−b)Q̄ + a·ε_{t−1}ε'_{t−1} + b·Q_{t−1} 驱动相关演化。本文两资产模拟实测:相关从 0.3 跳到 0.85 的危机段,DCC 86 天收敛到位(滚动窗口 248 天),全样本追踪 MAE 0.109 优于滚动(0.112)和 EWMA(0.143)。1% VaR 回测更能说明问题:危机段滚动窗口击穿率 2.33%(超标 2.3 倍),DCC 0.33%——差异全部集中在最需要风控的时段。QML 估计出 a=0.033、b=0.964,a+b=0.997 的高持续性正是金融相关的典型指纹。诚实边界:两步 QML 是一致但非有效估计、N 大时 Q̄ 本身要收缩、DCC 假设所有资产对共享同一组 a/b。
14 min Chinese - 相关矩阵去噪与去调:把市场模式从相关结构里剥出来再聚类
去噪(denoise)治采样噪声,去调(detone)治市场模式——后者是聚类场景里真正的杀手。N=40 四板块模拟(λ1 占迹 56%)实测:市场模式让所有股票对的相关都抬到 0.5 上下,簇内-簇间相关间距只剩 0.048,single/average linkage 聚类 ARI 直接归零(链式合并全灭);去调把第一特征成分整个剥掉后间距不变但均值归零,single linkage ARI 从 0.002 复活到 1.000。最反直觉的实测坑:板块特征值(约 2.0)恰好骑在 MP 上界 1.96 附近,标准 MP 去噪把板块信号当噪声压平,去噪+去调后 ARI 反而从 0.99 跌到 0.31——教科书流程『先去噪再去调』在信号贴边时是自毁操作。弱板块对照(尖峰数 1.0)更极端:去噪+去调 ARI −0.03 vs 只去调 0.89。诚实边界:去调后矩阵奇异(少一个秩)不能直接进优化器求逆,只服务聚类/距离场景;市场模式个数 k 的选择在多因子市场里不显然;Tracy-Widom 涨落让贴边特征值成灰色地带。
14 min Chinese
返回
博客
第 34 页 · 显示 8 / 1446 篇文章
按年份查看 →