halo 的技术博客

返回

量化因子挖掘是量化投资的核心环节。传统的因子挖掘依赖金融学理论和人工构造——研究员根据市场逻辑或学术论文,手工设计因子公式,然后回测验证。这个过程高度依赖人的洞察力和经验积累,效率有限,且容易陷入”已知因子”的重复改良。

2023年以来,大语言模型(LLM)的能力边界的快速拓展,正在从根本上改变因子挖掘的范式。本文探讨大模型在因子挖掘中的三个关键应用方向:自然语言因子生成多模态数据融合因子间关系发现

LLM因子挖掘架构图

一、从公式到语义:自然语言驱动因子生成#

传统因子是一个数学公式,如 F = (Close - MA(Close, 20)) / Std(Close, 20)。研究员需要在脑海中构思”价格突破均线”这种逻辑,再翻译成公式。

大模型带来了一个全新的路径:用自然语言描述投资逻辑,由模型自动生成因子代码并回测

工作流程#

  1. 逻辑输入:研究员用自然语言描述想法,例如:“找出那些营收增速连续三个季度保持20%以上,但股价在过去一个月下跌超过10%的股票——基本面在改善,但市场情绪在恶化,可能存在错杀机会。”

  2. 语义理解:LLM 解析这段描述,识别出核心要素:

    • 营收增速(财务指标,季度数据)
    • 时间窗口(连续三个季度、过去一个月)
    • 阈值(20%、10%)
    • 方向判断(增速为正、股价为负)
    • 逻辑关系(基本面改善 AND 情绪恶化)
  3. 代码生成与验证:LLM 将语义结构转化为可执行的 Python/Pandas 代码,直接对接数据接口,输出因子值序列。

  4. 批量拓展:一个投资逻辑可以衍生出多个变体——调整时间窗口、替换财务指标(净利润增速替代营收增速)、改变阈值组合。LLM 可以系统性生成整个”因子家族”。

实例:从一句话到2000个因子的挖掘流水线#

假设研究员输入这样一句话:“寻找技术面与基本面背离的股票”。

  • LLM 首先列举所有可能的”技术面指标”(MA交叉、RSI背离、MACD、布林带突破等)和所有可能的”基本面指标”(PE、PB、ROE、营收增速、毛利率等)
  • 生成笛卡尔积组合,例如 RSI 超卖 + ROE 上升、MACD 死叉 + 毛利率扩张等
  • 对每个组合自动生成因子代码、回测并排名
  • 研究员只负责最后的”精选”工作

这个流程将因子挖掘的”创作效率”提升了两个数量级。

二、多模态因子:让模型”看”新闻、“读”财报#

传统量化因子几乎都来自结构化数据——价格、成交量、财务数值。但市场中有海量的非结构化信息:新闻、社交舆情、财报文本、分析师报告、监管公告、专利数据、卫星图像……

大模型的多模态能力,使这些”另类数据”第一次可以系统性地转化为量化因子。

NLP因子:从文本中提取α#

LLM 在文本理解上的飞跃,让 NLP 因子真正走向实用:

  • 管理层语调分析:分析财报电话会议管理层发言的感情色彩和确定性程度。研究表明,CEO 使用的”乐观词汇”比例与管理层减持行为之间存在系统性相关。
  • 新闻事件分类与冲击评估:实时解析财经新闻,自动归类为”政策利好""行业恶性事件""公司基本面变化”等标签,并评估对股价的预期冲击方向和幅度。
  • 社交媒体情绪聚合:对雪球、微博等平台的讨论文本做实体级情绪评分,构建个股级别的情绪因子。

与传统情感分析(基于词袋模型或 LSTM)相比,LLM 的语义理解能力远超前代。它能分辨”这个财报其实很糟糕但如果去掉一次性减值数据来说还不错”这种复杂的语义结构——这是传统 NLP 方法无法做到的。

视觉因子:从图像中提取α#

多模态大模型还能处理非文本的另类数据:

  • 卫星图像:分析炼油厂储油罐的阴影变化推测库存量;监测工厂停车场车辆密度推断开工率
  • 图表数据:从 PDF 研报中自动提取图表数据,解决”有图无数据”的信息提取问题
  • 商品图像:在跨境电商平台上通过商品图片识别品类趋势

三、因子间关系发现:当LLM成为”量化研究员”#

传统的因子研究是”纵向”的——挖掘单个因子的预测能力。但市场是复杂系统,因子之间存在耦合、对冲、失效和再生效的动态关系。理解这种”横向关系”是构建稳健多因子策略的关键。

LLM 能做的新事#

因子交互项发现: LLM 可以从因子数据库中发现”单因子无效但组合有效”的交互效应。例如,低波动因子单独使用时信号一般,但叠加高股息条件后,选股精度显著提升。这种发现在传统框架中需要大量的人工探索。

因子失效预警: LLM 能分析因子收益的时间序列模式,发现”因子拥挤”的早期信号。当一个因子的机构持仓集中度快速上升、因子估值溢价扩大、媒体报道频率激增时,LLM 可以从多个维度综合判断因子是否正在走向失效。

跨资产因子迁移: 一个在期货市场有效的动量因子,能否迁移到股票市场?LLM 能理解不同资产类别的微观结构差异,为”因子迁移”提供调整方案,而不是简单照搬。

多因子交互关系图

四、实践中的挑战与边界#

尽管前景广阔,LLM 在因子挖掘中的应用仍面临几个硬约束:

1. 幻觉问题#

LLM 有时会生成”看起来合理但数学上荒谬”的因子公式。必须有代码执行和数值验证环节作为安全层。

2. 算力成本#

用大模型做大规模因子搜索,API 调用成本不可忽视。实践中需要做”分层筛选”:先用传统方法快速筛掉大概率无效的因子,再对幸存者使用 LLM 深度分析。

3. 可解释性悖论#

LLM 生成的因子有时”有效但说不清楚为什么有效”。在资管行业,不可解释的策略难以通过投资委员会的审批。在提升预测能力和保持可解释性之间需要权衡。

4. 数据泄漏风险#

LLM 的训练数据中可能包含了测试期的市场信息。直接在预训练模型上做因子生成,存在”模型级前视偏差”的风险。实践中应当使用纯开源基础模型,并验证模型的训练数据截止日期。

五、展望:从辅助工具到自主研究员#

当下的 LLM 更多是”因子研究员的高级助理”——加速试错、拓展搜索空间、整合多模态信息。但演进方向是清晰的:

  1. 自主因子发现:LLM 自己从海量数据中发现统计规律,提出因子假设,生成代码,回测验证,形成闭环
  2. 动态因子组合:根据市场环境实时调整因子权重,让多因子策略实现”自适应性”
  3. 因果推断因子:从相关性走向因果性,利用因果推断方法让因子更稳定、更难失效

量化的护城河曾经是”模型”——谁的公式更巧妙。但在大模型时代,护城河正在向”数据”和”算力”转移。拥有独特另类数据源和充沛算力的团队,将是这场范式转换中的赢家。

对个人量化投资者来说,拥抱大模型工具,学会用自然语言高效地”指挥”模型挖掘因子,是当下最具性价比的能力升级路径。

大模型如何重塑量化因子挖掘:从人工构造到智能发现
https://blog.halo26812.eu.org/blog/llm-factor-mining-revolution
Author halo
Published at 2026年6月17日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨