halo 的技术博客

返回

大语言模型(LLM)在自然语言处理上展现出了惊人的能力,但让它理解股市、预测股价,远不是把 K 线图丢给它就能完成的事。这篇文章聊一聊,如何系统性地把一个大模型训练成一个可用的股市预测专家。

为什么直接 Fine-tune 效果很差#

很多人第一反应是把股票历史数据(OHLCV)当作文本喂给 LLM,然后做 next-token prediction。结果往往惨不忍睹——模型要么成为随机数生成器,要么死记硬背训练集中的几只股票。

根本原因有四个:

信噪比极低。金融时间序列的预测信噪比通常在 5% 以下。在这么低的信号强度下,LLM 几乎必然学会”平均预测”,也就是永远输出接近 0 的收益率。

数据分布非平稳。2018 年的牛市中有效的信号,在 2022 年熊市中可能完全失效。LLM 的预训练假设数据分布相对稳定,而金融市场连这个基本假设都满足不了。

反馈循环。预测本身会改变市场行为。如果大量资金用同一个模型交易,策略就会失效。这种反身性在训练数据中不存在。

缺乏因果结构。LLM 擅长关联性学习,但股市更需要因果关系。股价和新闻标题的关联性很强,但谁是因谁是果常常是反过来的。

LLM股票预测架构图

第一步:构建多模态金融数据管线#

要让 LLM 真正理解市场,数据不能只有 OHLCV。你需要构建一个多模态数据输入体系。

结构化数据层:价格序列、成交量、波动率、换手率。这部分用数值编码而非文本,否则精度损失严重。

文本数据层:财报电话会议转录、SEC 文件、券商研报、新闻、社交媒体情绪。这部分 LLM 天然擅长处理。

替代数据层:卫星图像(停车场饱和度)、信用卡交易数据、供应链订单、招聘信息。这些数据往往有真实 alpha,但获取门槛高。

关键是这些数据必须时间对齐。你 2024 年 Q3 用的研报预测,绝对不能用到 2024 年 Q2 的训练样本里。时间穿越(look-ahead bias)是量化领域最常见的致命错误。

第二步:设计预测任务而非生成任务#

不要问 LLM “明天股价涨多少”,这个问题太难。要把问题分解成可评估的子任务:

方向预测:涨/跌/横盘。三元分类问题,可以用 Accuracy 和 F1 评估。

排序预测:在 100 只股票中选出前 10 只。这是量化选股的标准范式——信息系数(IC)和 Rank IC 是核心指标。

事件影响量化:财报发布后,模型预估超额收益的方向和幅度。这需要事件研究(event study)框架。

风险场景识别:给定当前市场状态,识别最相似的 5 个历史时期及其结果分布。

把这个子任务的预测结果组合起来,比让一个单一模型做端到端预测靠谱得多。

第三步:指令微调——教 LLM 用量化语言思考#

这一步是整个流程的核心。你需要构建高质量的指令微调数据集。

每一条训练样本应该长这样:

[输入]
日期:2024-06-15
当前状态:沪深300 处于 20 日均线上方,成交额放量 30%,VIX 低位震荡
最新事件:央行降准 25bp,MLF 利率维持不变
待选股票池:50 只成分股

[输出]
选股逻辑分析:降准利好的银行、地产板块短期有超额收益...
排序结果及置信度:(列出 Top 10,附带置信度评分)
风险提示:注意降准利好已部分 price-in...
plaintext

关键设计原则:

要求模型展示推理过程(Chain-of-Thought)。这样你可以审查逻辑是否正确,而不是只看输出数字。金融领域的可解释性比准确率更重要——一个错了但你知道为什么错的模型,比一个对了但你不知道为什么对的模型有价值得多。

引入约束条件。不要只让模型选股,要加上约束:行业集中度上限 20%、单只最大权重 10%、周度调仓频率等。没有约束的选股组合在现实中无法执行。

包含反面案例。训练集中要包含模型犯错的样本,以及正确的纠正过程。这能让模型学会”我知道什么是我不知道的”。

指令微调数据构建流程

第四步:用 RLHF 注入风险意识#

监督微调后的模型能选出看起来不错的股票,但可能完全忽视风险。这时候需要 RLHF。

构建偏好数据的方法:

风险调整收益排序。用夏普比率、最大回撤、Calmar 比率对两组选股结果排序。让奖励模型学会偏好”高夏普”而非”高收益”的组合。

尾部风险标注。人工标注哪些选股决策承担了过度的尾部风险(比如在财报前夕重仓个股)。让模型学会规避黑天鹅。

一致性奖励。同一市场状态下,模型给出的建议是否前后一致?不一致意味着模型不可靠。一致性本身就是一种奖励信号。

第五步:实时推理与在线学习#

离线训练只是开始。真正的挑战在于将模型部署到生产环境。

推理架构:T+1 日开盘前完成所有推理。你需要一个低延迟的推理 Pipeline,包含数据获取、特征计算、模型推理、组合优化、订单生成。整个过程要在 30 分钟内完成。

在线学习:每天用最新的市场数据更新模型。不是全量重新训练(代价太大),而是用 LoRA 等参数高效微调方法做增量更新。模型需要持续适应市场变化。

校准监控:部署后持续监控预测的校准度。如果模型说”有 80% 概率上涨”但实际上涨的概率只有 50%,说明模型需要重新校准。

现实检验#

讲完技术路线,必须泼一盆冷水。目前没有任何公开证据表明纯 LLM 能稳定跑赢市场基准。本文讨论的方法更多是学术探索和机构内部的实验方向。

真正让 LLM 在量化中产生价值的,不是端到端的股价预测,而是这些更务实的方向:辅助因子挖掘(用 LLM 生成因子描述并自动化回测)、财报文本分析(比人类分析师快 100 倍地提取关键信息)、投研知识管理(用 RAG 构建企业内部的研究知识库)。

对于个人投资者来说,训练一个盈利的股票预测 LLM 的门槛极高——算力、数据、专业知识的每一环都有巨大挑战。但理解这个技术路线本身,就是理解未来金融科技演化的关键窗口。

如何训练大模型成为股市预测专家
https://blog.halo26812.eu.org/blog/training-llm-stock-prediction
Author halo
Published at 2026年7月25日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨