大模型能预测股市吗?AI在金融领域的现实与幻觉#
每隔一段时间,就会有一条让人心动的新闻刷屏:「某 AI 模型在回测中跑赢了标普 500」「用大模型预测第二天涨跌,准确率高达 70%」。这种标题天然诱人——如果一台机器真的能看穿市场,那它值多少钱都不为过。但作为长期关注 AI 与量化的人,我想泼一点冷水:大模型在金融里能做的事远比「预测股价」丰富,而它真正做不到的事,恰恰是被大众最期待的那一件。

一、先厘清:大模型在金融里到底在做什么#
很多人把「大模型」和「预测股价」画上等号,这是一个根本性的误解。今天主流的 LLM(大语言模型)本质上是对序列文本的建模机器,它的核心能力是理解、生成和推理自然语言,而不是回归一串数字。让它直接吐出一个明天的收盘价,既不符合它的训练范式,也没有任何理论支撑。
真正有价值的金融大模型应用,几乎全部集中在非结构化文本的处理上:
- 新闻、社媒、研报的情绪提取
- 财报(10-K、10-Q)与招股书(S-1)的自动摘要与风险因子抽取
- 财报电话会议(earnings call)中管理层措辞的细微变化
- 监管文件、法律文档的合规审查
换句话说,大模型在金融里的角色,更像是一个不知疲倦、读得极快的研究员,而不是一个能未卜先知的交易员。
二、FinBERT 与情感分析:最有落地感的一块#
在金融 NLP 领域,最经典的里程碑之一是 FinBERT——基于 BERT 在金融语料上继续预训练得到的模型。它的任务很朴素:判断一段新闻或推文是「正面、负面还是中性」。
这听起来简单,但价值巨大。市场短期由情绪驱动,一条利空新闻能在几分钟内引发抛售。传统规则词典(如 Loughran-McDonald 金融情感词典)能捕捉「miss」「downgrade」这类显性词,却很难理解反讽、语境和复合型表述。FinBERT 这类模型能把「营收超预期,但指引大幅下调」准确判为偏负,这种语义层次是词典法做不到的。
现实中的用法通常是:把海量新闻流实时打标,构建情绪因子,再把它作为一种输入特征喂给下游的量化模型。它很少单独决定买卖,而是和价格、成交量、宏观指标等一起参与决策。这里的边界很清楚——情绪是信号,不是圣旨。
三、BloombergGPT 与垂直大模型的想象#
2023 年彭博发布的 BloombergGPT 引起了不小轰动:一个在金融专属语料(新闻、财报、市场数据)上训练的 500 亿参数大模型。它的意义不在于「预测涨跌」,而在于证明了一件事——通用大模型(如 GPT 系列)在金融任务上的专业度,确实可以通过领域预训练被显著拉开。
这类垂直模型的典型任务包括:金融问答、实体抽取(把「苹果」正确判别为公司而非水果)、合同解析、异常披露识别。它们解决的是「专业性」问题:通用模型容易在金融术语、监管语境上犯外行错误,而领域模型更稳。
但必须诚实地说:即便是 BloombergGPT,官方论文也从未声称它能预测市场方向。它的定位是金融领域的语言助手与信息处理器,不是点石成金的预言机。
四、SEC 文件与财报电话会议:文本挖掘的金矿#
如果说有一个场景最能体现 LLM 在金融里的真实价值,那一定是监管文件与电话会议的分析。
美国上市公司的 10-K(年报)、10-Q(季报)里有一节叫「Risk Factors」(风险因素),管理层每年会用近乎相同的模板重写它。但聪明的分析师会逐字比对:今年多出来的那一句话、被弱化的某个措辞、从「可能」变成「很可能」的语气转变——这些往往比财报数字本身更早释放风险信号。LLM 擅长做的,正是这种跨年份、跨文档的细粒度差异比对,人力几乎无法规模化完成。
财报电话会议同理。管理层在回答分析师提问时的停顿、回避、措辞转变,都被学术界证明与后续股价表现有关。已经有研究用语音语调 + 文本转录做联合建模,发现「看似积极的言辞 + 不安的语调」组合,是强烈的负面前瞻信号。这类工作不神奇,但它扎实、可复现、能持续产生 alpha。
五、为什么大模型「预测不了」股市:四个硬约束#
讲了能做的,更要讲清楚为什么直接预测价格是一场幻觉。
1. 市场的非平稳性(non-stationarity)。 金融序列的统计分布在不断变化,过去的相关性随时断裂。一个在 2023 年管用的模式,2024 年可能彻底失效。LLM 的归纳偏置来自训练语料的统计规律,而市场恰恰最不遵守稳定规律。
2. 有效市场假说与套利者的绞杀。 如果某个信号真的稳定有效,它会被无数资金迅速套利殆尽,直到信号消失。能被大模型轻易学到的「公开文本规律」,往往也已被半有效市场部分定价。
3. 幻觉(hallucination)。 大模型会自信地编造事实——一只不存在的并购、一个错误的财报数字。在金融场景里,一句幻觉足以酿成真金白银的损失。这也是为什么金融部署必须配合严格的检索增强(RAG)和可追溯引用,绝不能直接信任模型的「自由发挥」。
4. 相关不等于因果。 LLM 擅长发现文本与价格的统计关联,但这些关联常常是第三变量驱动的伪相关。把它当因果,就会在样本外惨败。
六、现实中最有效的用法:让 AI 做「放大器」而非「决策者」#
抛开不切实际的幻想,大模型在金融里的正当角色其实非常清晰:
- 研究自动化:几分钟读完 100 份同行财报,输出可比摘要与异常清单;
- 信息降噪:从海量新闻中筛出真正影响基本面的少数事件;
- 假设生成:基于文献和数据提出可检验的投资论点,再由人类与统计模型验证;
- 风险提示:监控持仓公司的监管动态、管理层异动、舆情拐点。
一句话——AI 是分析师的杠杆,不是基金经理的替代品。它能把一个人的研究效率放大十倍,但最终的判断、仓位与风险承担,仍必须由人来完成。在 2026 年的今天,真正成熟的机构不是「让 AI 下单」,而是「用 AI 让人类决策更聪明」。

七、结语:在幻觉与现实之间#
大模型确实正在重塑金融,但它重塑的是信息的处理方式,而不是市场的不确定性本质。那些声称「AI 精准预测股市」的故事,要么是回测过拟合的幻象,要么把相关性包装成了因果。
对技术人来说,更值得投入的方向,是把 FinBERT、BloombergGPT 这类工具用在文本理解的纵深处——SEC 文件的字里行间、电话会议的语气缝隙、研报之间的逻辑张力。那里有真实的、可被严谨方法捕获的价值。
股市不会因为你用了更大的模型就变得可预测。但你会因为用对了模型,而成为一个读得更快、想得更深、犯错更少的研究者。这,才是 AI 在金融领域给诚实者准备的回报。
本文为个人技术观察,不构成任何投资建议。市场有风险,决策需独立。