对比学习金融表征:不用标签,也能把「同行业」和「跨行业」拉开
监督学习要标签,金融标签又贵又滞后。对比学习(Contrastive Learning)走另一条路:不预测「是什么」,只学「什么和什么像」——把同行业股票拉近、跨行业股票推远。本文用纯 numpy 从零实现 SimCLR 风格的 InfoNCE 预训练(两层 MLP 投影头,端到端训练),在 42 支股票 / 3 行业的合成数据上,把它和「直接用原始特征」做下游少标注探针对比:每行业只给 1~3 个标注时,对比表征把分类精度从 0.50/0.54/0.58 抬到 0.57/0.61/0.61,且增益随标注变多而收敛——正是「标签越稀缺越值得预训练」的教科书结论。附完整代码与五类真实陷阱(中阶)。