halo 的技术博客

返回

大模型 + 股市预测,是科学还是玄学?#

如果有人告诉你,一个 AI 模型能准确预测明天的股价,你大概率会觉得他在忽悠。但如果说,AI 能帮你分析海量非结构化数据、提炼市场情绪、甚至自动生成交易因子——这就开始靠谱了。

2024 年以来,越来越多的量化基金开始将大语言模型(LLM)纳入研究管线。这不是为了”预测涨跌”,而是为了做那些传统量化模型做不好的事情:理解新闻、拆解财报电话会议的语气、从社交媒体中提取市场信号。

LLM 在量化中的三个实际应用场景#

1. 金融文本的情绪量化#

传统的情绪分析依赖词典匹配——给正面词打 1 分,负面词打 -1 分。问题是,“这家公司’不’存在财务造假风险”——词典法会把”造假”标记为负面,完全忽略否定词。

GPT-4 级别的模型可以准确捕捉这类语义。一篇 2025 年的研究显示,用 LLM 对美联储 FOMC 会议纪要做情绪评分,相比传统 BERT 模型,对次日标普 500 波动的解释力提升了 18%。

量化团队现在做的是:将新闻、研报、财报电话会文字记录喂给 LLM,输出结构化的情绪分数,再作为特征输入因子模型。

大模型情绪分析流程

2. 另类数据的结构化提取#

卫星图像、供应链数据、招聘信息——这些”另类数据”的共同点是:非结构化,量大,人工处理成本极高。

LLM 可以批量处理这些数据。比如从招聘网站上提取某公司”取消了所有 AI 相关岗位”的信号,或从供应链新闻中推断库存积压。这些信息过去需要分析师手动标注,现在可以自动化。

一个典型应用是:用多模态模型分析零售店停车场的卫星图像,估算客流量变化,再关联到季度营收预测。这不是科幻,对冲基金已经在做了。

3. 因子挖掘的加速器#

传统因子挖掘的思路是:研究员提出假设 → 写代码验证 → 看回测结果。一个研究员一周可能产出 5-10 个因子。

而 LLM 可以在几分钟内生成几十个因子假设。虽然大部分是垃圾,但其中 5%-10% 的高质量假设,已经足以改变研究效率。

更重要的是,LLM 可以做”因子解释”——当回测出现异常收益时,让模型分析可能的数据泄露或过拟合风险,这比人工 review 快得多。

因子生成与筛选流程

真正的瓶颈不在模型#

老实说,目前 LLM 在股票预测上最大的价值不是预测精度,而是效率提升。把研究员从大量重复的文本处理中解放出来,让他们专注于策略设计。

真正的瓶颈有三个:

数据版权:金融数据的合规成本远高于模型成本。很多高质量数据根本不能公开使用。

过拟合陷阱:LLM 生成的因子更容易过拟合,因为它们能从海量组合中找到”看起来有效”的模式,但这不等于真实规律。

时效性:模型推理需要几秒到几十秒,对高频交易毫无意义。但对日频策略,这个速度足够了。

未来方向:从辅助到决策#

目前的状态是”AI 辅助人类研究员”。但趋势明确指向”AI 驱动决策”——前提是解决可解释性问题。

一个有意思的方向是让多个 LLM 扮演不同角色:一个负责宏观经济判断,一个做技术面分析,一个做基本面估值,最后由另一个模型做综合判断。这种”多智能体”架构在模拟交易中已经展现出超越单一模型的稳定性。

当然,如果有人告诉你他有一个百发百中的 AI 预测模型——快跑。

股市没有圣杯,但 AI 可以帮你把铲子磨得更锋利。

大模型能否预测股市?从情绪分析到多因子建模的探索
https://blog.halo26812.eu.org/blog/2026-06-06-llm-stock-prediction
Author halo
Published at 2026年6月6日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨