- 逆强化学习策略偏好推断:从一段「赚钱轨迹」反推出它到底在优化什么
我们知道某择时策略『很能赚钱』,但不知道它凭什么赚——它在奖励什么?逆强化学习(IRL)把这个问题反过来:给一段专家实际走过的轨迹,反推它背后的奖励函数。本文用纯 numpy 从零实现 MaxEnt IRL(Ziebart 2008):特征期望 + 梯度上升学奖励权重 + softmax 访问频率求解。在「专家其实在奖励『动量 + 低波动 + 周期 − 噪声』」的合成市场里,IRL 把奖励权重还原得与真值余弦相似度 0.94,学到的奖励重放出的状态分布与专家 KL=0.06(随机基线 0.23);并诚实拆穿「专家样本不足→奖励不可辨识 / 特征冗余→权重被错分 / 折扣因子误设 / 最大熵温度 / IRL 给的是偏好不是收益」五类真实陷阱(中阶)。
12 min Chinese - Stacking 集成因子模型:把四个「各瞎一块」的预测器拼成全能选手
单一模型永远有盲区——线性回归不懂非线性、核方法抓不住交互、周期项被当作噪声。Stacking 集成的妙处是用一个元学习器,把多个互补基学习器的预测「加权拼」成最终预测:谁准就听谁的。本文用纯 numpy 从零实现(含 proper Out-of-Fold 防泄漏),合成一支「线性+tanh非线性+交互+周期」混合结构的收益宇宙,训练四个各只看得见一块的专科专家,最终 Stacking 把测试集 IC 从单模型 0.10–0.40 拉到 0.61、多空收益差从 0.23–0.84 抬到 1.24,并诚实拆穿「基学习器同质化时集成几乎无效/元学习器小样本过拟合/权重天花板/OOF 不做必泄漏/线性读出下不赢线性基线」五类真实陷阱(中阶)。
13 min Chinese - 概念漂移检测:当因子失效,用漂移预警救回你的组合
因子不会永远有效。β 悄悄衰减、IC 逐月下台阶时,你的组合正在被一个看不见的概念漂移(concept drift)蚕食。本文用一个可控合成实验,把概念漂移和协变量漂移拆开讲清:性能监控(IC 类)才能抓概念漂移,分布监控(PSI/KL)只能抓协变量漂移;并对比 Shewhart / CUSUM / EWMA 四类检测器的真实延迟与误报率,给出一套能早几周救回组合的双轨预警方案(高阶)。
13 min Chinese - 共形预测在量化中的应用:给预测区间一个可验证的覆盖率保证
你的模型说明天涨 3%,但你心里没底:这 3% 的置信区间到底多宽?传统误差带要么假设高斯、要么靠经验拍脑袋,一旦分布漂移就崩。共形预测(Conformal Prediction)换了一条路:不假设分布,只用「校准集上的残差分位」构造区间,并且能**在数学上保证**测试集里 (1−α) 比例的点落在区间内。本文用异方差 + 分布漂移的合成数据,从零跑出区间覆盖、有限样本有效性、漂移下朴素法漏覆盖,以及区间宽度 vs 确定性的代价曲线(中阶)。
13 min Chinese - 稀疏组 Lasso 变量选择:把几百个因子压成少数可解释分组
你有 600 个因子、30 个经济含义分组,但只有 6 个组真有信号——普通 Lasso 会把整组零碎系数逐个挑出来,破坏分组结构、也难解释。稀疏组 Lasso(SGL) 用「先组级、再组内」的复合 L1 惩罚,把变量选择变成「整组进/整组出」+「组内精炼」两步。本文用高维(N<P)合成面板从零实现 SGL 的 FISTA 近端梯度求解,5 折交叉验证选 λ,对照 OLS/Lasso/GroupLasso:OLS 样本外 R² 崩到 −3.58(过度记忆),SGL 拉回 +0.18,并找回 86% 真信号组的系数,附完整 Python 与四类真实陷阱(高阶)。
12 min Chinese - 深度对冲:用神经网络取代 BS 公式做期权动态对冲
Black-Scholes 给期权对冲的是解析 delta,但它有三个隐藏假设:零交易成本、连续对冲、波动率已知。真实市场里这三条全破,于是 delta 对冲会在每次调仓时白白交手续费、在跳空时露风险。深度对冲(Buehler et al. 2019)换了个思路:不套公式,而是用神经网络直接学「每一步该持多少标的」,目标函数就定成对冲误差的方差;交易成本作为惩罚项写进目标,网络自己学会「该偷懒时偷懒」。本文用 GBM 下的欧式看涨、纯 numpy 手写一个 MLP 对冲器(不依赖任何深度学习框架),在无成本时退化到 BS delta,在单边成本 2% 时把对冲误差方差比 BS 压窄约 16%。附完整可复现 Python 与六类真实陷阱(高阶)。
13 min Chinese - 集成模型平均:把多个弱预测融成稳健 Alpha
集成模型平均不是玄学而是有解析保证:Var(S_M−μ*)=(σ²/M)·(1+(M−1)ρ),只有模型误差独立(ρ小)才持续降噪。合成里单模型 IC 0.134、40 模型集成升到 0.229,Sharpe 从 1.60 拉到 3.12,附完整 Python 与六类真实陷阱(高阶)。
12 min Chinese - 元学习(MAML)跨市场快速适应:让策略学会『学会』
MAML 学的不是模型而是『能快速适应的起点』:每个市场当一个 task,元训练出 θ_meta,新任务只用 K=10 样本一步梯度就贴近最优。合成实验 10-shot MSE 2.07 跑赢 Pooled(2.31)与从零(3.32),10 种子全胜。附完整 Python(高阶)。
16 min Chinese
返回