大语言模型(LLM)在自然语言处理上展现出了惊人的能力,但让它理解股市、预测股价,远不是把 K 线图丢给它就能完成的事。这篇文章聊一聊,如何系统性地把一个大模型训练成一个可用的股市预测专家。
为什么直接 Fine-tune 效果很差#
很多人第一反应是把股票历史数据(OHLCV)当作文本喂给 LLM,然后做 next-token prediction。结果往往惨不忍睹——模型要么成为随机数生成器,要么死记硬背训练集中的几只股票。
根本原因有四个:
信噪比极低。金融时间序列的预测信噪比通常在 5% 以下。在这么低的信号强度下,LLM 几乎必然学会”平均预测”,也就是永远输出接近 0 的收益率。
数据分布非平稳。2018 年的牛市中有效的信号,在 2022 年熊市中可能完全失效。LLM 的预训练假设数据分布相对稳定,而金融市场连这个基本假设都满足不了。
反馈循环。预测本身会改变市场行为。如果大量资金用同一个模型交易,策略就会失效。这种反身性在训练数据中不存在。
缺乏因果结构。LLM 擅长关联性学习,但股市更需要因果关系。股价和新闻标题的关联性很强,但谁是因谁是果常常是反过来的。

第一步:构建多模态金融数据管线#
要让 LLM 真正理解市场,数据不能只有 OHLCV。你需要构建一个多模态数据输入体系。
结构化数据层:价格序列、成交量、波动率、换手率。这部分用数值编码而非文本,否则精度损失严重。
文本数据层:财报电话会议转录、SEC 文件、券商研报、新闻、社交媒体情绪。这部分 LLM 天然擅长处理。
替代数据层:卫星图像(停车场饱和度)、信用卡交易数据、供应链订单、招聘信息。这些数据往往有真实 alpha,但获取门槛高。
关键是这些数据必须时间对齐。你 2024 年 Q3 用的研报预测,绝对不能用到 2024 年 Q2 的训练样本里。时间穿越(look-ahead bias)是量化领域最常见的致命错误。
第二步:设计预测任务而非生成任务#
不要问 LLM “明天股价涨多少”,这个问题太难。要把问题分解成可评估的子任务:
方向预测:涨/跌/横盘。三元分类问题,可以用 Accuracy 和 F1 评估。
排序预测:在 100 只股票中选出前 10 只。这是量化选股的标准范式——信息系数(IC)和 Rank IC 是核心指标。
事件影响量化:财报发布后,模型预估超额收益的方向和幅度。这需要事件研究(event study)框架。
风险场景识别:给定当前市场状态,识别最相似的 5 个历史时期及其结果分布。
把这个子任务的预测结果组合起来,比让一个单一模型做端到端预测靠谱得多。
第三步:指令微调——教 LLM 用量化语言思考#
这一步是整个流程的核心。你需要构建高质量的指令微调数据集。
每一条训练样本应该长这样:
[输入]
日期:2024-06-15
当前状态:沪深300 处于 20 日均线上方,成交额放量 30%,VIX 低位震荡
最新事件:央行降准 25bp,MLF 利率维持不变
待选股票池:50 只成分股
[输出]
选股逻辑分析:降准利好的银行、地产板块短期有超额收益...
排序结果及置信度:(列出 Top 10,附带置信度评分)
风险提示:注意降准利好已部分 price-in...plaintext关键设计原则:
要求模型展示推理过程(Chain-of-Thought)。这样你可以审查逻辑是否正确,而不是只看输出数字。金融领域的可解释性比准确率更重要——一个错了但你知道为什么错的模型,比一个对了但你不知道为什么对的模型有价值得多。
引入约束条件。不要只让模型选股,要加上约束:行业集中度上限 20%、单只最大权重 10%、周度调仓频率等。没有约束的选股组合在现实中无法执行。
包含反面案例。训练集中要包含模型犯错的样本,以及正确的纠正过程。这能让模型学会”我知道什么是我不知道的”。

第四步:用 RLHF 注入风险意识#
监督微调后的模型能选出看起来不错的股票,但可能完全忽视风险。这时候需要 RLHF。
构建偏好数据的方法:
风险调整收益排序。用夏普比率、最大回撤、Calmar 比率对两组选股结果排序。让奖励模型学会偏好”高夏普”而非”高收益”的组合。
尾部风险标注。人工标注哪些选股决策承担了过度的尾部风险(比如在财报前夕重仓个股)。让模型学会规避黑天鹅。
一致性奖励。同一市场状态下,模型给出的建议是否前后一致?不一致意味着模型不可靠。一致性本身就是一种奖励信号。
第五步:实时推理与在线学习#
离线训练只是开始。真正的挑战在于将模型部署到生产环境。
推理架构:T+1 日开盘前完成所有推理。你需要一个低延迟的推理 Pipeline,包含数据获取、特征计算、模型推理、组合优化、订单生成。整个过程要在 30 分钟内完成。
在线学习:每天用最新的市场数据更新模型。不是全量重新训练(代价太大),而是用 LoRA 等参数高效微调方法做增量更新。模型需要持续适应市场变化。
校准监控:部署后持续监控预测的校准度。如果模型说”有 80% 概率上涨”但实际上涨的概率只有 50%,说明模型需要重新校准。
现实检验#
讲完技术路线,必须泼一盆冷水。目前没有任何公开证据表明纯 LLM 能稳定跑赢市场基准。本文讨论的方法更多是学术探索和机构内部的实验方向。
真正让 LLM 在量化中产生价值的,不是端到端的股价预测,而是这些更务实的方向:辅助因子挖掘(用 LLM 生成因子描述并自动化回测)、财报文本分析(比人类分析师快 100 倍地提取关键信息)、投研知识管理(用 RAG 构建企业内部的研究知识库)。
对于个人投资者来说,训练一个盈利的股票预测 LLM 的门槛极高——算力、数据、专业知识的每一环都有巨大挑战。但理解这个技术路线本身,就是理解未来金融科技演化的关键窗口。