- 对比学习负采样策略:金融表征里该选哪些『难负例』
对比学习用「同标的增强视图=正对、不同标的=负对」把股票压成可迁移表征。但负样本怎么选,决定模型学到的是噪声还是真信号。本文用 numpy 从零复现四类负采样:难负例(高相似、确属异板块)把 InfoNCE 损失压到 0.355、下游分类 1.000;错标签负例(没剔除同板块)损失飙到 7.28、准确率掉到 0.276;随机负例易满足却学最浅。并做难负比例消融:纯难负反而不如适度混入——倒 U 形态。附完整 Python 与四张真实计算图。
14 min Chinese - 图对比学习板块表征:用子图扰动学出行业嵌入向量
股票之间的行业关系不该只靠 GICS 分类表写死——真实的行业联动是随宏观 regime 漂移的。图对比学习(GCL)把'股票=节点、收益相关=边'建成图,用子图扰动(删边/加噪/特征掩码)造正负样本,让同一个行业在表征空间里自然聚拢、不同行业推开。本文numpy从零实现GraphSAGE编码器+InfoNCE损失,受控实验证明学到的行业嵌入与真实相关的Spearman ρ从0.30提升到0.85,并诚实标注'它学的是相关性结构不是收益方向'。
15 min Chinese - 对比学习金融表征:不用标签,也能把「同行业」和「跨行业」拉开
监督学习要标签,金融标签又贵又滞后。对比学习(Contrastive Learning)走另一条路:不预测「是什么」,只学「什么和什么像」——把同行业股票拉近、跨行业股票推远。本文用纯 numpy 从零实现 SimCLR 风格的 InfoNCE 预训练(两层 MLP 投影头,端到端训练),在 42 支股票 / 3 行业的合成数据上,把它和「直接用原始特征」做下游少标注探针对比:每行业只给 1~3 个标注时,对比表征把分类精度从 0.50/0.54/0.58 抬到 0.57/0.61/0.61,且增益随标注变多而收敛——正是「标签越稀缺越值得预训练」的教科书结论。附完整代码与五类真实陷阱(中阶)。
12 min Chinese
返回