- 对比学习负采样策略:金融表征里该选哪些『难负例』
对比学习用「同标的增强视图=正对、不同标的=负对」把股票压成可迁移表征。但负样本怎么选,决定模型学到的是噪声还是真信号。本文用 numpy 从零复现四类负采样:难负例(高相似、确属异板块)把 InfoNCE 损失压到 0.355、下游分类 1.000;错标签负例(没剔除同板块)损失飙到 7.28、准确率掉到 0.276;随机负例易满足却学最浅。并做难负比例消融:纯难负反而不如适度混入——倒 U 形态。附完整 Python 与四张真实计算图。
14 min Chinese - 市场状态连续表征:用 VAE 隐变量把牛熊震荡编码成一条曲线
牛/熊/震荡这种市场状态,硬切成几类是丢了信息的——真实市场是在连续光谱上滑动的。变分自编码器(VAE)能把一个高维市场微观状态向量压缩进低维隐空间,训练后从中挑一个维度,就得到一条平滑、可解释的『连续市场状态曲线』。本文用纯 numpy 从零实现 VAE(含手写重参数化反向),在受控数据上证明:隐变量与真值 regime 的 1-NN 验证相关达 -0.82、与趋势/波动率原始维度的相关分别 -0.78/-0.75,重建 MSE 仅 0.52,且 β 权衡可调节隐空间的规整度。附完整 Python 与四张真实计算图。
12 min Chinese - 对比学习金融表征:不用标签,也能把「同行业」和「跨行业」拉开
监督学习要标签,金融标签又贵又滞后。对比学习(Contrastive Learning)走另一条路:不预测「是什么」,只学「什么和什么像」——把同行业股票拉近、跨行业股票推远。本文用纯 numpy 从零实现 SimCLR 风格的 InfoNCE 预训练(两层 MLP 投影头,端到端训练),在 42 支股票 / 3 行业的合成数据上,把它和「直接用原始特征」做下游少标注探针对比:每行业只给 1~3 个标注时,对比表征把分类精度从 0.50/0.54/0.58 抬到 0.57/0.61/0.61,且增益随标注变多而收敛——正是「标签越稀缺越值得预训练」的教科书结论。附完整代码与五类真实陷阱(中阶)。
12 min Chinese - 变分自编码器 VAE 因子挖掘:把不确定性也一起学出来
普通自编码器能把 20+ 维量价特征压成 5 维新因子,但它只给你一个"点估计"编码,不知道哪个样本编码得靠谱。变分自编码器 VAE(Kingma & Welling 2014)把编码器变成"一个分布",每个样本得到一个 (μ, σ²) 的编码高斯——于是除了新因子,你还免费拿到"这个因子值有多可信"。本文用纯 numpy 从零实现 VAE(重参数化技巧 + ELBO),在"3 潜因子驱动收益 + 大量噪声特征"的合成数据上,VAE 组合因子与未来收益 |IC|=0.695,并诚实演示"不确定性到底能不能当信号过滤器"这个反直觉结果,附完整代码与五类真实陷阱(中阶)。
14 min Chinese
返回