量化交易的核心驱动力是什么?是因子。
过去二十年,量化研究员们花费大量时间在Bloomberg终端前翻阅财务报表、在Wind里跑数据、在Excel里推导公式——这一切都是为了找到能预测股票收益的因子。从Fama-French三因子到Barra风险模型,每一个经典因子背后都是无数研究员的深夜劳动。
但现在,局面正在被大模型改变。

传统因子挖掘的困局#
传统因子挖掘有三个核心痛点:
第一,搜索空间巨大但探索效率低。 一个研究员一年可能测试几百到上千个因子,而理论上可能的因子组合是指数级的。这就像在大海里捞针,而且你不知道针长什么样。
第二,过度依赖先验知识。 一个好的因子往往来自研究员的”直觉”,而这种直觉建立在多年的行业经验和学术训练之上。问题是,这种先验知识既是武器也是枷锁——它会让你忽略那些不符合传统认知但实际有效的因子。
第三,因子衰减越来越快。 一个有效的因子被发现、发表、被同行模仿后,超额收益会迅速衰减。传统人工挖掘的速度跟不上因子衰减的速度。
大模型介入的三种范式#
当前,大模型参与因子挖掘主要有三种技术路线:
范式一:LLM as Hypothesis Generator(假设生成器)#
这是最直接的应用方式。研究员把任务描述给大模型,让它提出候选因子。
“请根据动量效应和均值回归理论,生成10个适用于A股市场的技术类因子。”
GPT-4或Claude可以在一分钟内生成几十个可验证的因子假设。研究员只需要验证这些假设,而不需要从头构思。

一个2025年的研究显示,让大模型基于学术文献中的因子描述生成Python代码实现,在标准数据集上的IC均值比人工实现的同类因子高出约12%。原因是大模型在代码实现时使用了更精确的异常值处理和中性化方法。
范式二:LLM as Feature Engineer(特征工程师)#
这种范式的核心思路是:用大模型自动从原始数据中提取特征。
具体做法是:将财务报表、公告文本、新闻、分析师报告等非结构化数据输入大模型,让它提取量化特征。
比如:
- 输入某公司近三年的年报,让LLM输出”管理层信心指数”(基于措辞的乐观程度)
- 输入供应链公告,让LLM输出”供应链风险评分”
- 输入财报电话会议转录文本,让LLM输出”CEO前瞻性陈述占比”
这些从文本中提取的特征,传统NLP工具也能做,但大模型的理解深度和准确性远超前代技术。而且最重要的是——这些特征不容易被竞争对手复制,因为它们基于专有的文本处理逻辑。
范式三:LLM as Alpha Combiner(Alpha组合器)#
这是最前沿但也最容易被滥用的方向。
思路是:让大模型直接预测股票的涨跌或排名,而不是先构建因子再组合。本质上是用大模型的能力替代传统的因子组合和权重优化过程。
问题也很明显:幻觉。大模型可能把相关性当因果,可能被近期记忆偏差误导,可能输出无法解释的”黑箱预测”。
目前更务实的做法是半自动Alpha组合:研究员把一批已验证有效的因子交给大模型,让它提出新的组合方式——比如非线性组合、动态权重调整、条件激活等。这些组合方式研究员自己也能做,但大模型能更快地探索组合空间。
实际落地:一个端到端的例子#
以”利用大模型从财务报表中提取管理层信心因子”为例,完整流程如下:
Step 1:数据准备 将目标公司过去5年的年报”管理层讨论与分析”(MD&A)部分提取为纯文本。
Step 2:Prompt设计 设计一个精细的Prompt,要求大模型对每份年报的管理层措辞打分:
- 积极词汇频率(“增长”、“扩大”、“领先”)
- 模糊词汇频率(“可能”、“或许”、“取决于”)
- 风险披露详细程度
- 与上一年措辞的变化
Step 3:批量处理 用API批量处理所有目标公司的文本,返回结构化JSON评分。
Step 4:因子回测 将LLM输出的评分作为因子,进行标准的因子回测流程:计算IC、构建分层组合、计算多空收益。
Step 5:因子评估 与传统的基本面因子(如ROE、毛利率变化、营收增速)进行相关性分析和超额收益归因。
一个A股全市场的实测案例显示,这个”LLM管理层信心”因子的月度Rank IC约为0.03~0.05,信息比率约为0.8,与传统基本面因子相关性低于0.3,提供了显著的增量Alpha。
避坑指南:LLM因子挖掘的常见错误#
坑1:数据泄漏。 在用大模型处理文本时,如果文本发布时间晚于回测时间点,就会导致前视偏差。必须严格对齐文本发布时间和回测时间窗口。
坑2:过度复杂的Prompt。 有些研究员把Prompt写得像学术论文的附录,几百行。结果是模型不稳定、输出不一致。好的Prompt应该简洁、可复现、输出结构化。
坑3:跳过因果验证。 LLM输出的因子可能只是数据挖掘的噪声。必须做经济逻辑验证:这个因子为什么能预测收益?如果找不到合理的经济解释,大概率是过拟合。
坑4:低估API成本。 调用GPT-4 API处理全市场数据是很贵的。以处理3000只A股的年报为例,每份年报约3000 token,仅一次调用就需要约900万token,按当前GPT-4定价约50。如果是月度或季度更新,成本会更高。本地部署的开源模型(如DeepSeek、Qwen)是更经济的选择。
未来展望#
我认为接下来两年会有三个重要变化:
-
开源量化LLM的出现。 从BloombergGPT到FinGPT,金融专用大模型正在从闭源走向开源。当模型可以本地部署并针对特定市场微调时,因子挖掘的效率会再上一个台阶。
-
LLM因子的可解释性框架。 监管机构和投资者天然不信任”黑箱”模型。必须有一套方法论,能解释LLM产生的因子背后的经济逻辑,否则这些因子很难进入实盘。
-
因子生命周期管理。 大模型不仅能挖掘因子,还能监控因子的失效信号——当某个因子的IC开始下滑时,主动建议退役或修改。形成”挖掘→部署→监控→退役→再挖掘”的闭环。
量化因子挖掘的终极目标不是找到最多的因子,而是找到那些独特、稳健、可解释的因子。大模型是一个强大的工具,但它不是魔法——它不能替你思考,不能替你验证,不能替你承担风险。
最好的量化研究员,是那个知道什么时候该相信模型、什么时候该质疑模型的人。
而大模型,只是让我们能更高效地找到那些值得质疑的点。