halo 的技术博客

返回

引言:当华尔街遇上大模型#

2023 年以前,量化投资中的 NLP 应用还停留在”情感分析”阶段——用朴素贝叶斯或 LSTM 判别财经新闻是利好还是利空,然后打包成一条简单的因子。2024 年开始,以 GPT-4、Claude 和 Llama 为代表的大语言模型(LLM)彻底改变了这个游戏。

不仅是技术本身在变,思维方式也在变。传统量化研究员需要花数周手动设计特征,而 LLM 让研究员可以用自然语言描述想法,系统自动生成对应的处理流程。这种”LLM as Analyst”的范式转移,正在重新定义 quant 的工作内容。

本文系统梳理 LLM 在量化投资中的三条核心应用路径:NLP 因子构建、另类数据处理、以及端到端策略生成,并探讨其中的方法论细节。

一、从文本到因子:LLM 驱动的新型特征工程#

1.1 传统 NLP 因子的局限性#

传统量化中的 NLP 因子通常依赖预定义词典(如 Loughran-McDonald 词典)或简单模型。研究员手动筛选关键词列表,对新闻和财报文本打分,然后合成一条因子。这种方法有三个致命缺陷:

  • 覆盖范围窄:词典是静态的,无法捕捉新出现的概念(如 2021 年的”meme stock”、2023 年的”AI 概念股”)
  • 上下文丢失:单词级别的统计忽略了语义关系,“苹果减产”和”苹果增产”可能被错误地赋予相同的情感方向
  • 更新成本高:每次词汇表需要扩展,都需要人工重新校准,响应速度慢

1.2 LLM 重构情感因子#

LLM 最大的优势在于对上下文的深度理解能力。以财报电话会(earnings call transcript)为例,传统方法可能只看”revenue”、“profit”等词汇的出现频率,而 LLM 能够:

  • 理解管理层措辞的微妙变化,例如”we are cautiously optimistic”实际上暗示对前景的不确定性
  • 捕捉多句话之间的逻辑关系,包括因果、转折和让步
  • 跨语言处理,同时分析中文财报和英文研报

实践中,研究员通常采用 Few-shot Prompting 的方式,让 LLM 直接对一段文本输出结构化的情感打分:

你是一名专业的金融分析师。请分析以下财报电话会记录,
从以下五个维度各给出-1到1的打分(保留两位小数):

1. 管理层信心指数
2. 业绩指引倾向(正向=上调指引)
3. 风险暴露程度
4. 竞争格局评价
5. 宏观敏感性

输出格式:
{"维度1": 0.XX, "维度2": -0.XX, ...}
plaintext

这种结构化输出的设计非常关键——它确保每次调用输出格式一致,方便后续批量处理成时间序列因子。

1.3 另类数据的 LLM 提取#

LLM 在量化领域真正爆发的场景,是处理此前无法量化的另类数据(Alternative Data)。典型例子包括:

卫星图像解读:量化基金早已采购卫星图,但传统方法只能识别预设目标(如停车场的汽车数量)。LLM 现在可以理解更复杂的视觉模式:“识别图中建筑工地的新建进度,判断该区域未来 6 个月的建材需求变化”。

电话会音频分析:Beyond Verbal 等公司曾尝试用传统方法从语音中提取情感,但 LLM 结合 Whisper 等语音识别模型,可以直接从音频转录文本中分析管理层语速变化、犹豫停顿等非语言信号。

供应链关系图谱:通过分析上市公司的 10-K、10-Q 披露文件,LLM 自动提取供应商和客户关系,构建供应链依赖图谱。这个图谱在供应链危机事件(如2021年的全球芯片短缺)来临时极具价值。

LLM 架构图,Transformer 在处理金融文本中的核心地位

二、方法论:LLM 因子构建的工程实践#

2.1 批量化推理的工程挑战#

在生产环境中用 LLM 生成因子,最大的挑战不是模型效果,而是吞吐量和成本。一条因子需要覆盖数千只股票、数年的历史数据,如果每次 API 调用耗时 2 秒,成本 $0.01,光是历史回测就要烧掉数千美元。

主流解决方案有三条路:

其一,蒸馏压缩。用大模型(如 GPT-4)为小模型(如 Llama-7B)生成训练数据,进行知识蒸馏。这种方法在情感分析任务上已经被验证有效——蒸馏后的模型在金融文本分类上的准确率与 GPT-4 差距小于 5%,但推理成本下降 90%。

其二,向量数据库索引。将历史文本预处理为向量存储,查询时用语义相似度检索,而非每次都调用 LLM 推理。典型方案是用 Pinecone 或 Weaviate 存储文本向量,每次查询先做向量检索,再用 LLM 做最终判断。

其三,结构化蒸馏。不直接蒸馏整个模型,而是提取 LLM 在特定任务上的判断规则,以 if-then 规则或小型决策树的形式固化。这种方法适合因子解释性要求高的场景(如监管审查),但会牺牲部分泛化能力。

2.2 因子正交化与组合#

LLM 生成的因子与传统因子(如 PB、PE、动量)之间往往存在相关性。实践中需要做施密特正交化(Gram-Schmidt Orthogonalization),把 LLM 因子中与传统因子共线的部分剔除,剩下的才是”纯增量信息”。

组合时需要考虑因子之间的非线性叠加效应。简单的等权线性组合在因子相关性较高时效果不佳,业界更倾向于用遗传规划(Genetic Programming)或贝叶斯优化搜索最优非线性组合权重。

金融数据处理流程,从原始数据到量化因子

三、端到端 LLM 策略:研究员的新工具还是替代者?#

3.1 LLM 作为策略 idea 生成器#

最直接的应用是让 LLM 扮演”策略头脑风暴助手”。研究员用自然语言描述宏观环境和市场观察,LLM 输出潜在的策略方向:

背景:2026年二季度,美联储维持高利率环境,
科技股估值承压,但AI算力需求持续增长。

请提出3个量化策略方向,要求:
1. 有明确的逻辑支撑
2. 可用公开数据验证
3. 避免已知过拟合陷阱
plaintext

这类交互的价值不在于 LLM 能直接给出可行策略,而在于帮研究员拓展思路盲区——人类研究员往往受限于自己的投资风格和历史经验,LLM 能带来跨风格、跨资产类别的思维跳跃。

3.2 端到端策略生成的现实与局限#

更进一步的问题是:LLM 能否直接生成可执行的交易策略?

目前最前沿的探索来自两方向。一是”LLM + 代码生成”模式:研究员描述策略思路,LLM 生成 Python/NumPy 代码,包括数据获取、因子计算、信号生成和回测框架,然后研究员审查修改后运行。DeepMind 的 AlphaCodium 论文展示的 Code-contest 工作流与此类似。

二是完全端到端的多 agent 系统。不同 agent 分别负责数据收集、因子设计、回测评估和风险管理,通过结构化通信协议协作。这个方向目前更多停留在学术研究阶段,实际效果良莠不齐。

核心的局限在于:LLM 缺乏真正的金融直觉和对尾部风险的感知。它可以学会”动量因子在趋势市中有效”这个统计规律,但很难真正理解”当流动性突然枯竭时,动量因子可能发生踩踏式崩塌”这种需要真实市场经验积累的认知。

神经网络与量化策略的融合

四、未来展望:从工具到生态#

LLM 在量化领域的下一个爆发点,我认为在金融知识图谱的自动化构建

当前的知识图谱依赖人工定义实体(公司、产品、人物)和关系(供应、竞争、投资)。LLM 可以从非结构化文本中自动抽取实体关系,将这个过程的成本降低一个数量级。一旦金融知识图谱的构建成本大幅下降,以图神经网络(GNN)为基础的因子挖掘方法将迎来新的黄金期。

此外,多模态金融分析是另一个值得关注的赛道。整合文本、图像(财报图表、K线形态)、音频(电话会)等多种模态的信息,用统一的 LLM backbone 做联合推理,是一条尚未被充分探索的方法论路径。Anthropic 的 Claude 3 已经展示了强大的多模态能力,将其应用于金融分析只是时间问题。

但有一点需要清醒认识:LLM 是 quant 研究员的放大器,而不是替代者。它让优秀研究员的生产力翻倍,但也可能让低质量研究的数量翻倍。最终,市场的超额收益来源不会因为 LLM 的出现而消失,只会被重新定价。真正稀缺的,永远是对市场本质的深刻理解。


本文不构成任何投资建议。

大语言模型如何重塑量化投资:从 NLP 因子到端到端策略
https://blog.halo26812.eu.org/blog/llm-in-quantitative-finance
Author halo
Published at 2026年7月29日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨