- 双重机器学习 Double ML 因果估计:把「被混淆的因果」剥离干净
你算出「低波动股跑赢」就敢说低波动「导致」高收益吗?两者可能都被某个隐藏变量驱动——这是因果推断的死穴:混淆。双重机器学习 Double ML (Chernozhukov et al. 2018) 用两阶段机器学习(随机森林纯 numpy 从零实现)估计「处理→结果」之外的所有混淆路径 g(X)/f(X),再用交叉拟合 cross-fitting 残差化,把处理效应 θ 从相关里撬成因果。自洽合成面板(Y=θ·D+g(X)+ε, D=f(X)+ν, g 与 f 共享非线性项)上:朴素 OLS 估到 1.88(真值 1.50,偏差 +0.38)、线性残差化 Double ML 仍 1.90(偏差 +0.40,抓不住非线性混淆)、随机森林 Double ML 压到 1.60(偏差 +0.10,蒙特卡洛 100 次 SD≈0.02);并诚实拆穿 RF 收缩偏误/无交叉拟合必过拟合/混淆变量遗漏/模型误设/PLM 线性假设五类真实陷阱(中阶)。
16 min Chinese - 基本面指数加权 vs 市值加权:为什么「不按价格配」反而赚更多
市值加权被动指数有个隐藏缺陷:它自动超配被高估、近期上涨的股票。基本面指数(RAFI,Arnott 2005)改用销售额、现金流、账面值、股息等「真实经济规模」而非价格来定权重,等于每年自动「低买高卖」。本文从零合成 50 只股票(真实基本面增长 + 均值回复的错误定价),对比两种加权:基本面加权终值 43.31x(年化 13.38%)跑赢市值加权 26.80x(年化 11.58%),且换手率更低、更抗集中度。附完整 Python 与五类真实陷阱(中阶)。
13 min Chinese - GAN 生成金融序列与数据增强:用造假的数据喂饱你的模型
深度学习模型永远缺数据——尤其小市值、新上市、危机段,样本少得可怜。GAN(Goodfellow 2014)的卖点是"从噪声生成和真实分布几乎一样的合成序列",于是有人想:能不能用 GAN 造一批假 K 线,喂给下游模型做数据增强?本文用纯 numpy 实现(协方差匹配的 WGAN 等价解),在"牛熊 regime + 时变波动"的合成价格上把生成序列的协方差 Frobenius 误差从 199 压到 1.94,边缘分布和逐位移自相关都与真实肉眼难分;并诚实实测"数据增强的红利":小样本(仅 30 真实窗口)+ 高容量下游模型下,7x 增强把最差切分 AUC 从 0.934 拉到 0.963、方差砍半——增强的真正价值是稳住最差情况,不是凭空抬均值。附完整代码与五类真实陷阱(中阶)。
12 min Chinese - 高斯过程回归在金融预测中的应用:不仅给点预测,还给你一张可信度地图
线性回归只给一个点估计,深度学习连不确定性都给不清。高斯过程(GP)回归的卖点是「均值 + 协方差」一体输出:预测的同时,直接吐出每个点的预测方差。本文用纯 numpy 实现(RBF 核 + 边缘似然超参优化 + Cholesky 求解),在「滞后波动率→次日波动率、且藏了一段概念漂移」的合成数据上,给它画出分布内/分布外的可信带,并诚实拆穿它最核心也最危险的陷阱:平稳核在分布外会过度自信。附完整代码与五类真实陷阱(中阶)。
14 min Chinese - 图神经网络 GNN 资产关系建模:把「谁和谁像」直接写进模型的结构里
传统因子模型把每只股票当成孤立样本,可现实里资产从来不是孤岛——同行业、供应链上下游、共同持仓,处处是关系。图神经网络(GNN)把资产建成一张图:节点是股票、边是关系,图卷积让每个节点在预测时「借用邻居的信息」。本文用纯 numpy 从零实现一层 GCN,在「3 行业 × 60 股、同行业由共同因子驱动」的自洽合成数据上,证明加了图结构的半监督分类准确率从 MLP 的 0.75 直接拉到 1.00,并诚实拆穿邻接矩阵怎么建、过平滑、图泄漏等五类真实陷阱(中阶)。
16 min Chinese - 黄金作为尾部对冲资产:用「危机逆势上涨」给组合买一份保险
组合最怕的不是跌,是崩盘时所有资产一起跌。黄金的特殊之处在于:平静期它和股票几乎不相关,一到危机反而逆势上涨(相关转负),于是它能在别人亏钱时补位。本文用纯 numpy 合成股票/国债/黄金三类资产,逐类对比 100%股票、60/40、40/40/20(股/债/金)三组合,证明加入 20% 黄金把危机段内部最大回撤从 −21.6% 压到 −10.3%、全样本 Sharpe 从 0.56 抬到 0.77,并诚实拆穿四类真实陷阱(中阶)。
10 min Chinese - 随机指标 KDJ 实战:金叉死叉背后的 RSV/K/D/J 是怎么算出来的
KDJ 是国内交易者最熟悉的指标之一,但九成的人只记得「金叉买、死叉卖」,却说不清 K、D、J 三个数到底怎么来的。它本质是「9 日 RSV(未成熟随机值)的两次平滑 + 一个乖离放大项 J」。本文用纯 numpy 从零实现 KDJ 全公式,并把「金叉(超卖区)买入、死叉/超买平仓」的规则在一段「温和上行 + 中段急跌」的合成行情上跑回测:KDJ 多头总收益 +15.5%(年化 6.2%、Sharpe 1.30、最大回撤仅 −3.3%),同期买入持有仅 +5.2% 却吃下 −30.8% 的回撤。并诚实拆穿滞后性/钝化/单边市失效/参数脆弱/超买超卖伪信号五类真实陷阱(中阶)。
13 min Chinese - 大模型在金融量化领域的应用全景:从研报到因子的范式转变
大模型在金融量化领域的应用全景:从研报到因子的范式转变 - halo的技术博客
11 min Chinese
返回
博客
第 3 页 · 显示 8 / 976 篇文章
按年份查看 →