量化因子挖掘是量化投资的核心环节。传统的因子挖掘依赖金融学理论和人工构造——研究员根据市场逻辑或学术论文,手工设计因子公式,然后回测验证。这个过程高度依赖人的洞察力和经验积累,效率有限,且容易陷入”已知因子”的重复改良。
2023年以来,大语言模型(LLM)的能力边界的快速拓展,正在从根本上改变因子挖掘的范式。本文探讨大模型在因子挖掘中的三个关键应用方向:自然语言因子生成、多模态数据融合和因子间关系发现。

一、从公式到语义:自然语言驱动因子生成#
传统因子是一个数学公式,如 F = (Close - MA(Close, 20)) / Std(Close, 20)。研究员需要在脑海中构思”价格突破均线”这种逻辑,再翻译成公式。
大模型带来了一个全新的路径:用自然语言描述投资逻辑,由模型自动生成因子代码并回测。
工作流程#
-
逻辑输入:研究员用自然语言描述想法,例如:“找出那些营收增速连续三个季度保持20%以上,但股价在过去一个月下跌超过10%的股票——基本面在改善,但市场情绪在恶化,可能存在错杀机会。”
-
语义理解:LLM 解析这段描述,识别出核心要素:
- 营收增速(财务指标,季度数据)
- 时间窗口(连续三个季度、过去一个月)
- 阈值(20%、10%)
- 方向判断(增速为正、股价为负)
- 逻辑关系(基本面改善 AND 情绪恶化)
-
代码生成与验证:LLM 将语义结构转化为可执行的 Python/Pandas 代码,直接对接数据接口,输出因子值序列。
-
批量拓展:一个投资逻辑可以衍生出多个变体——调整时间窗口、替换财务指标(净利润增速替代营收增速)、改变阈值组合。LLM 可以系统性生成整个”因子家族”。
实例:从一句话到2000个因子的挖掘流水线#
假设研究员输入这样一句话:“寻找技术面与基本面背离的股票”。
- LLM 首先列举所有可能的”技术面指标”(MA交叉、RSI背离、MACD、布林带突破等)和所有可能的”基本面指标”(PE、PB、ROE、营收增速、毛利率等)
- 生成笛卡尔积组合,例如 RSI 超卖 + ROE 上升、MACD 死叉 + 毛利率扩张等
- 对每个组合自动生成因子代码、回测并排名
- 研究员只负责最后的”精选”工作
这个流程将因子挖掘的”创作效率”提升了两个数量级。
二、多模态因子:让模型”看”新闻、“读”财报#
传统量化因子几乎都来自结构化数据——价格、成交量、财务数值。但市场中有海量的非结构化信息:新闻、社交舆情、财报文本、分析师报告、监管公告、专利数据、卫星图像……
大模型的多模态能力,使这些”另类数据”第一次可以系统性地转化为量化因子。
NLP因子:从文本中提取α#
LLM 在文本理解上的飞跃,让 NLP 因子真正走向实用:
- 管理层语调分析:分析财报电话会议管理层发言的感情色彩和确定性程度。研究表明,CEO 使用的”乐观词汇”比例与管理层减持行为之间存在系统性相关。
- 新闻事件分类与冲击评估:实时解析财经新闻,自动归类为”政策利好""行业恶性事件""公司基本面变化”等标签,并评估对股价的预期冲击方向和幅度。
- 社交媒体情绪聚合:对雪球、微博等平台的讨论文本做实体级情绪评分,构建个股级别的情绪因子。
与传统情感分析(基于词袋模型或 LSTM)相比,LLM 的语义理解能力远超前代。它能分辨”这个财报其实很糟糕但如果去掉一次性减值数据来说还不错”这种复杂的语义结构——这是传统 NLP 方法无法做到的。
视觉因子:从图像中提取α#
多模态大模型还能处理非文本的另类数据:
- 卫星图像:分析炼油厂储油罐的阴影变化推测库存量;监测工厂停车场车辆密度推断开工率
- 图表数据:从 PDF 研报中自动提取图表数据,解决”有图无数据”的信息提取问题
- 商品图像:在跨境电商平台上通过商品图片识别品类趋势
三、因子间关系发现:当LLM成为”量化研究员”#
传统的因子研究是”纵向”的——挖掘单个因子的预测能力。但市场是复杂系统,因子之间存在耦合、对冲、失效和再生效的动态关系。理解这种”横向关系”是构建稳健多因子策略的关键。
LLM 能做的新事#
因子交互项发现: LLM 可以从因子数据库中发现”单因子无效但组合有效”的交互效应。例如,低波动因子单独使用时信号一般,但叠加高股息条件后,选股精度显著提升。这种发现在传统框架中需要大量的人工探索。
因子失效预警: LLM 能分析因子收益的时间序列模式,发现”因子拥挤”的早期信号。当一个因子的机构持仓集中度快速上升、因子估值溢价扩大、媒体报道频率激增时,LLM 可以从多个维度综合判断因子是否正在走向失效。
跨资产因子迁移: 一个在期货市场有效的动量因子,能否迁移到股票市场?LLM 能理解不同资产类别的微观结构差异,为”因子迁移”提供调整方案,而不是简单照搬。

四、实践中的挑战与边界#
尽管前景广阔,LLM 在因子挖掘中的应用仍面临几个硬约束:
1. 幻觉问题#
LLM 有时会生成”看起来合理但数学上荒谬”的因子公式。必须有代码执行和数值验证环节作为安全层。
2. 算力成本#
用大模型做大规模因子搜索,API 调用成本不可忽视。实践中需要做”分层筛选”:先用传统方法快速筛掉大概率无效的因子,再对幸存者使用 LLM 深度分析。
3. 可解释性悖论#
LLM 生成的因子有时”有效但说不清楚为什么有效”。在资管行业,不可解释的策略难以通过投资委员会的审批。在提升预测能力和保持可解释性之间需要权衡。
4. 数据泄漏风险#
LLM 的训练数据中可能包含了测试期的市场信息。直接在预训练模型上做因子生成,存在”模型级前视偏差”的风险。实践中应当使用纯开源基础模型,并验证模型的训练数据截止日期。
五、展望:从辅助工具到自主研究员#
当下的 LLM 更多是”因子研究员的高级助理”——加速试错、拓展搜索空间、整合多模态信息。但演进方向是清晰的:
- 自主因子发现:LLM 自己从海量数据中发现统计规律,提出因子假设,生成代码,回测验证,形成闭环
- 动态因子组合:根据市场环境实时调整因子权重,让多因子策略实现”自适应性”
- 因果推断因子:从相关性走向因果性,利用因果推断方法让因子更稳定、更难失效
量化的护城河曾经是”模型”——谁的公式更巧妙。但在大模型时代,护城河正在向”数据”和”算力”转移。拥有独特另类数据源和充沛算力的团队,将是这场范式转换中的赢家。
对个人量化投资者来说,拥抱大模型工具,学会用自然语言高效地”指挥”模型挖掘因子,是当下最具性价比的能力升级路径。