halo 的技术博客

返回

量化投资的圣杯是什么?如果有人问这个问题,大部分量化研究员会给出同一个答案:找到稳定且独特的Alpha因子

传统因子挖掘的路径已经非常成熟:翻阅学术论文→提出假设→回测验证→优化迭代。这条路走了几十年,拼的是人的洞察力和数学功底。Renaissance Technologies把这条路走到了极致,但大多数团队做不到Simons团队那种人才密度。

2024年之后,情况变了。大语言模型(LLM)的推理能力跃迁式提升,让”用AI挖因子”从概念验证变成了可落地的工程实践。今天聊一聊这个正在重塑量化研究范式的技术路径。

LLM与量化因子挖掘概念图

传统因子挖掘的瓶颈在哪?#

先定义一下问题。因子挖掘的本质是:从海量数据中发现可稳定预测资产未来收益率的信号。传统方法大概分三类:

学术驱动型:Fama-French三因子、动量因子、质量因子、低波动因子,这些都是学术界先提出、业界验证、最后变成拥挤交易的路子。

经验驱动型:老交易员说”周五下午别做多""财报前IV必涨”,把这些经验写成规则,回测看看能不能过。

数据挖掘型:拿一堆基本面、技术面数据,做IC分析、分组回测、单调性检验,像淘金一样筛信号。

这三种方法的共同问题是:受限于人的认知边界。人只能想到自己见过的东西。一个看了十年A股的量化研究员,他的因子假说池基本绑定在A股的几类数据上。你很难期待他自己”发明”出一个完全超乎经验的因子逻辑。

LLM改变了什么#

LLM不是帮你跑回测的工具,那是传统量化平台的活。LLM的核心价值在于因子逻辑的生成与组合能力

具体来说有四个层次:

第一层:因子脑暴(Factor Brainstorming)#

这个层次的用法最直观。给LLM一段prompt:

“我有一套A股基本面数据,字段包括ROE、毛利率同比、经营现金流/净利润、PEG。请给出20个可能有效的多因子组合逻辑,要求每个因子都有经济学解释。”

模型会给出各种各样的思路。它读过几乎所有金融论文、财经报道、投资心法。它的”因子知识库”远超任何一个人类研究员。

我在实际测试中发现,Claude 4.5和GPT-5在这个任务上表现惊人。它们不仅能生成标准因子,还会主动做跨领域类比。比如把医学研究中”生物标志物组合诊断”的思想迁移到多因子选股上——这就是人很难凭空想到的东西。

第二层:因子逻辑的文本化表达(Textual Alpha)#

这是最被低估的一层。

传统量化因子几乎都是数值信号:PE_TTM < 行业20分位 → 信号为1。财务造假怎么办?数据延迟怎么办?极端值怎么办?纯数值因子非常脆弱。

LLM让文本直接变成因子输入成为可能。财报管理层讨论(MD&A)、业绩会纪要、研报摘要、新闻情绪——这些非结构化文本中藏着大量定价信息,传统方法很难系统化提取。

举个例子:你可以用一个prompt让LLM阅读某公司过去8个季度的管理层电话会纪要,然后打分”管理层对未来的信心程度(1-10)“。这个文本派生因子,在绝大多数回测中都展现出显著的IC值。它捕捉的是”管理层语气的边际变化”——这个东西存在于人类直觉中,但从未被精确量化过。

文本Alpha与传统因子对比

第三层:因子自动编码与搜索#

这层更技术化,但方向非常有意思。

思路是这样的:把因子公式”编码”成一串token序列(可以是一种DSL,也可以是自然语言描述),然后用LLM在这个编码空间中做因子变异和搜索

比如你有一个经典的动量因子:过去12个月剔除最近1个月的收益率。LLM可以自动生成100个变体:

  • 过去6个月剔除最近1周
  • 过去24个月剔除最近3个月,加权衰减
  • 过去12个月正收益天数占比
  • 过去12个月收益率的夏普比率(自身波动调整后的动量)

然后批量回测,保留IC最高的变体。这本质上是用LLM做因子公式空间的beam search,人类研究员做策略迭代,LLM做批量探索。

第四层:因子逻辑的解释与因果推理#

量化最被人诟病的问题之一就是”黑箱”:一个深度学习模型给出的信号,没法跟基金经理解释为什么。

LLM的出现改变了这个局面。你把因子权重和回测结果喂给它,它能生成人可读的因果叙事

“这个因子的核心驱动是:在利率下行周期,PB低于1但现金流持续改善的公司存在系统性定价偏差。市场过度关注利润表(PE视角),忽视了资产负债表修复的信号。”

这种解释能力不仅是合规需要,更能帮研究员发现逻辑漏洞——如果LLM解释说”因子有效是因为煤炭板块整体抬升”,那你马上就知道这因子是行业暴露而不是真正的Alpha。

实践中的坑#

当然不是一帆风顺。几个关键问题:

过拟合:LLM能力越强,越容易生成看起来非常合理实际上毫无意义的因子。你用100条prompt让LLM生成了1000个因子,回测选前10——这在统计上就是p-hacking。必须做样本外测试和时间序列稳定性检验。

数据泄露:LLM在预训练时可能已经见过你回测期间的数据。如果让它基于”知识”而不是”你提供的输入数据”生成因子,就是严重的look-ahead bias。

幻觉:LLM可能编造不存在的学术论文、捏造因子逻辑、混淆因果方向。必须做严格的逻辑审查和稳健性检验。

成本:如果你对5000只股票×10年财报数据做逐篇文本分析,API费用会非常可观。本地部署开源的Qwen3或DeepSeek-V3是更经济的方案。

一些工程建议#

如果你想把LLM集成到自己的因子挖掘流程里,这里有几个实操建议:

1. 从文本因子开始。数值因子的LLM改造是高阶玩法,文本因子(Sentiment/NLP-based)是立竿见影的切入点。把管理层语调、新闻情绪、研报摘要这些非结构化数据变成量化信号,IC提升通常很显著。

2. 用LLM做因子生成的”第一英里”。人负责定义因子逻辑框架和经济学直觉,LLM负责在框架内生成变体和组合。最后回测仍然由人来把控。这不是替代人类研究员,是放大人类研究员。

3. 建立因子知识库。把你已有的因子池写成结构化文档,喂给LLM做RAG。这样它生成的因子变体更符合你的实际框架,而不是飘在天上的学术幻想。

4. 样本外验证是绝对不能妥协的底线。LLM生成的因子,无论逻辑多完美,都要像对待任何其他因子一样做严格的样本外测试。

长远看#

我自己的判断是:3年内,LLM在因子挖掘中的角色会从”辅助脑暴”演进到”自动化研究流水线”的半自主阶段。

到那时,量化研究员的核心能力不再是自己能想出多少因子,而是:能否设计出好的因子搜索空间、能否定义好的评价标准、能否对LLM的输出做高质量的判断

这个转变有点像编程从汇编到高级语言再到AI辅助编程的演进——工具在变,但你对问题本质的理解始终是最稀缺的东西。

不管你相不相信LLM会改变量化,有一件事确定不了:如果你不用,你的竞争对手已经在用了。

LLM驱动的量化因子挖掘:大模型如何重新发现Alpha
https://blog.halo26812.eu.org/blog/llm-quantitative-factor-mining
Author halo
Published at 2026年6月9日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨