过去两年,量化投资圈里最热的话题从”深度学习能不能打败线性因子”悄然转向了”大模型到底能在哪些环节创造 alpha”。这个转变很微妙——因为大模型(LLM)本身并不擅长直接预测明天涨跌,它真正的价值藏在数据处理链条的上游和研究流程的效率里。今天我想聊聊我观察到的几个真正落地的方向,以及那些被过度炒作的幻觉。

大模型不是预测机,而是理解机#
先泼一盆冷水:任何声称”用 GPT 直接预测股价、年化 80%“的说法,基本可以直接划入骗局区。原因很简单——股价的短期走势接近随机游走,信噪比极低,而大模型的强项是语言理解与知识推理,不是从噪声里挖出微弱信号。
那大模型的位置在哪?答案是把非结构化信息转化为结构化信号。金融世界里有海量文本:财报电话会议记录、新闻、分析师报告、监管公告、社交媒体讨论、招聘信息、专利文件。传统量化只能用简单的情感词典或关键词计数处理这些数据,粗糙得像拿菜刀做显微手术。而大模型可以真正”读懂”一段话的语气、逻辑、隐含风险。
举个具体例子:一份财报电话会议里 CEO 说”我们对下半年保持谨慎乐观”。词典模型会把”乐观”记为正面。但大模型能理解”谨慎乐观”配合前文”面临宏观逆风”时,实际隐含的是管理层信心的下滑。这种细微语义差异,正是超额收益的来源之一。
三个真正落地的应用方向#
第一是另类数据的信号提取。 这是目前最成熟的方向。把公司公告、新闻流、电话会议逐条喂给大模型,让它输出结构化的情感分、事件标签、风险等级。相比传统 NLP,大模型对反讽、条件句、长距离依赖的处理能力强太多。国内外不少中大型私募已经把这套流程工业化,作为传统量价因子的补充。
第二是研究流程的加速。 一个因子从想法到验证,传统上要研究员写数据查询、跑回测、画图、写报告,一天能测三五个想法就不错了。现在大模型可以辅助写数据处理代码、生成回测脚本、自动总结回测结果。研究效率的提升是实打实的,一个熟练研究员配合大模型,想法验证的吞吐量能翻两三倍。

第三是因子的自动生成与筛选。 这个方向更前沿也更有争议。有团队让大模型基于金融逻辑”提出”新的因子表达式,再用回测系统批量验证。好处是能探索人类想不到的组合,坏处是极容易过拟合——大模型生成一万个因子,总有几百个在历史上表现惊艳,但样本外全部失效。所以这条路的关键不在生成,而在严格的样本外验证和多重检验校正。
那些被夸大的部分#
市面上有太多”AI 量化”的营销话术,需要拆穿几个:
一是**“端到端预测”的幻想**。指望把行情数据丢进大模型直接输出买卖信号,几乎必然失败。金融数据的时序结构、非平稳性、极低信噪比,都不是为语言模型设计的。
二是回测过拟合的隐蔽性。大模型让生成策略变得极其廉价,而廉价意味着更容易在历史数据上”碰运气”。测试一万个策略挑出最好的那个,本质上和买彩票挑中奖号码没区别。真正的护城河永远是严谨的统计检验和对逻辑的理解,而不是算力堆出来的策略数量。
三是数据泄露风险。用预训练大模型处理历史数据时,模型的知识可能”看到过未来”。比如让 2024 年训练的模型判断 2022 年某公司的风险,它可能已经知道后来发生了什么。这种前视偏差在学术论文里屡见不鲜,实盘中却是致命的。
写在最后#
我的判断是:大模型不会取代量化研究员,但会重新定义他们的工作方式。未来的量化研究员,一半时间在思考金融逻辑和验证框架,另一半时间在指挥大模型完成数据处理和代码生成。真正的竞争力,从”谁的模型更复杂”,回归到”谁对市场理解更深、谁的验证更严谨”。
工具越强大,反而越考验使用者的判断力。这大概是这波 AI 浪潮里,最反直觉也最真实的一课。