- 最大熵投资组合:在「什么都不确定」时给出最不偏见的权重
最大熵组合用 w_i ∝ exp(λ·μ_i) 把「观点强度」编码成一个温度参数:观点越空、权重越接近等权(熵最大、最不偏见);观点越强、权重越集中。本文 numpy 从零实现最大熵组合 + 收益约束,量化「倾斜中档 λ=51 时归一化熵从 1.00 降到 0.84、年化 Sharpe 3.80→3.47」;300 次 OOS 蒙特卡洛诚实显示熵倾斜并不比等权更赚,但它把组合方差从 2.37% 拉到 3.4%、把权重集中度和尾部风险压在可控区间——它卖的是「可解释的不确定性量化」而非超额收益。附完整 Python 与四张真实计算图。
14 min Chinese - 神经过程 Neural Process:用元学习给出带置信区间的点预测
普通神经网络只给一个点预测,但交易里最该知道的是『我有多确定』。神经过程(Neural Process, Garnelo et al. 2018)把函数视为可学习分布,用一组 context 观测点编码成全局表示,对目标点输出高斯均值+方差——天然带置信区间。本文用纯 numpy 从零训练一个条件神经过程(含手写前向/反向),在 GP 元学习任务上证明:95% 区间经验覆盖 0.93(贴近标称)、OOD 未覆盖区 σ 从 0.64 抬升到 0.77(自动承认不确定),而确定性 MLP 永远只有一条过窄的常数带。附完整 Python 与四张真实计算图。
12 min Chinese - 分位数回归森林:给出收益分布而非单点预测
传统模型只给「明天涨 3%」一个点预测,却答不出「这个数我有多不确定、最坏会跌多少」。分位数回归森林(QRF, Meinshausen 2006)把随机森林的每个叶节点存成样本集合,预测时直接对落点叶的样本求经验分位——于是一次预测吐出整条条件收益分布,而非一个点。本文用纯 numpy 从零实现回归树 + 随机森林 + QRF,在「异方差 + 左偏」的合成收益上实测:90% 区间经验覆盖 QRF=0.874、OLS-正态=0.902、CRPS QRF=0.531 优于 OLS 正态的 0.563 与线性 QR 的 5.326,并诚实拆穿「森林=平滑均值 / 分位单调 / 样本量免费 / OOB 替代 / 分布外可信」五类真实陷阱(中阶)。
12 min Chinese - 变分自编码器 VAE 因子挖掘:把不确定性也一起学出来
普通自编码器能把 20+ 维量价特征压成 5 维新因子,但它只给你一个"点估计"编码,不知道哪个样本编码得靠谱。变分自编码器 VAE(Kingma & Welling 2014)把编码器变成"一个分布",每个样本得到一个 (μ, σ²) 的编码高斯——于是除了新因子,你还免费拿到"这个因子值有多可信"。本文用纯 numpy 从零实现 VAE(重参数化技巧 + ELBO),在"3 潜因子驱动收益 + 大量噪声特征"的合成数据上,VAE 组合因子与未来收益 |IC|=0.695,并诚实演示"不确定性到底能不能当信号过滤器"这个反直觉结果,附完整代码与五类真实陷阱(中阶)。
14 min Chinese - 共形预测在量化中的应用:给预测区间一个可验证的覆盖率保证
你的模型说明天涨 3%,但你心里没底:这 3% 的置信区间到底多宽?传统误差带要么假设高斯、要么靠经验拍脑袋,一旦分布漂移就崩。共形预测(Conformal Prediction)换了一条路:不假设分布,只用「校准集上的残差分位」构造区间,并且能**在数学上保证**测试集里 (1−α) 比例的点落在区间内。本文用异方差 + 分布漂移的合成数据,从零跑出区间覆盖、有限样本有效性、漂移下朴素法漏覆盖,以及区间宽度 vs 确定性的代价曲线(中阶)。
13 min Chinese
返回