- 大语言模型作为因子矿工:用 prompt 工程把文本变成可交易信号
量化投资的信息优势从来不只是数字,新闻、财报电话会、社交媒体里埋着大量尚未被价格消化的文本信息。本文把大语言模型(LLM)当成一个『因子矿工』——不做端到端预测,而是用精心设计的 prompt 从非结构化文本中提取结构化情感信号,再与传统因子正交组合。受控实验证明:链式思考(CoT)prompt 的信息系数(IC)达 0.061,显著高于零样本基线(0.032);prompt 优化后的情感因子与价值因子组合,年化信息比从 1.2 提升到 1.7。附完整 Python 实现与三张真实实验图。
16 min Chinese - 量化回测系统设计:12 个你一定会踩的坑
深度拆解量化回测系统的设计决策:从存活偏差到滑点建模,从多资产同步到因子时序对齐,每一个决策都决定回测结果是否可信。
10 min Chinese - 遗传编程因子挖掘:让表达式树自己进化出可交易 alpha
手工构造因子是『人想公式、数据验证』,遗传编程反过来:把因子表达式编码成树(叶子是特征、内部节点是算子),用交叉互换子树、变异随机替换、锦标赛选择淘汰弱者,让公式在 IC 适应度的驱动下自己进化。本文纯 Python 实现极简 GP 引擎:600×100 合成面板埋入非线性真结构 mom*exp(-|vol|)-0.5*rev,进化 25 代后找到 (mom - rev),验证集 IC 0.098——超过最强单因子(0.078)、逼近真实结构上限(0.105),而且简约压力把树从平均 6.1 节点压到 3.8,没有膨胀成垃圾。但要害在最后一图:500 个随机公式在纯噪声特征上搜索,训练 IC 被『迄今最优』推着单调上涨到 0.018——数据挖掘偏差意味着 GP 天生是过拟合机器,防御靠简约压力+验证集早停+多种子重跑看表达式是否稳定(中阶)。
16 min Chinese - 金融新闻 Transformer 情感分析:用自注意力读标题
朴素词袋(BoW)把标题当成一堆无序词的集合,丢掉了「词序」和「哪几个词最关键」。Transformer 的自注意力让每个词去「看」标题里所有其他词、按相关性加权聚合——于是「标题头段和中段的情绪词」能被自动放大。本文用纯 numpy 从零实现自注意力编码器(含完整前向/反向),在「位置加权的好/坏消息」合成标题上实测:测试集 R² Transformer=−0.026 远优于 BoW 的 −0.873(提升 97%)、方向准确率 54.0% vs 46.4%、读出 token 对关键位置(12,30)的注意力命中率 1.00、互换两个非关键 token 后预测一致性 1.000,并诚实拆穿「注意力一定尖锐聚焦 / 位置编码多余 / 深层才有效 / 小数据随便训 / 注意力=因果」五类真实陷阱(中阶)。
9 min Chinese - 变分自编码器 VAE 因子挖掘:把不确定性也一起学出来
普通自编码器能把 20+ 维量价特征压成 5 维新因子,但它只给你一个"点估计"编码,不知道哪个样本编码得靠谱。变分自编码器 VAE(Kingma & Welling 2014)把编码器变成"一个分布",每个样本得到一个 (μ, σ²) 的编码高斯——于是除了新因子,你还免费拿到"这个因子值有多可信"。本文用纯 numpy 从零实现 VAE(重参数化技巧 + ELBO),在"3 潜因子驱动收益 + 大量噪声特征"的合成数据上,VAE 组合因子与未来收益 |IC|=0.695,并诚实演示"不确定性到底能不能当信号过滤器"这个反直觉结果,附完整代码与五类真实陷阱(中阶)。
14 min Chinese - 注意力机制因子:让模型自己决定看哪些特征
把注意力机制从 NLP 搬进多因子选股:用特征级自注意力让模型自己决定看哪些因子,再门控加权出 1 维注意力因子。合成里门控因子 OOS R²=0.59 远超等权平均 0.15(高阶)。
15 min Chinese - 自编码器因子挖掘:用深度学习提取非线性 Alpha
传统因子是「人拍脑袋的线性组合」,自编码器(Autoencoder)能用无监督方式把几十维原始量价特征压缩成一小组「低相关、信息损失最小」的编码向量,当作新因子喂给选股模型。本文从数学定义、纯 numpy 手写自编码器、到「编码即新因子」的 IC 检验完整走通,并指出无监督≠可预测、容量有限、分布漂移三大真实陷阱。
9 min Chinese
返回