halo 的技术博客

返回

量化投资的世界正在经历一场由大语言模型(LLM)引发的深层变革。过去十年,量化行业依赖的经典范式——数据清洗、因子挖掘、回测优化——正在被一种全新的能力所补充:大模型不仅能理解海量非结构化文本,还能在因子空间中自主探索、甚至预测市场情绪的走向。这不是科幻,而是2024年以来已经逐步落地的现实。

传统量化的瓶颈与大模型的出现#

量化投资的核心在于寻找”Alpha”——即能够持续产生超额收益的预测信号。传统的因子挖掘方法主要依赖结构化数据:价格、成交量、财务报表、宏观经济指标。研究员们通过数学变换(移动平均、波动率计算、财务比率)手动构造因子,再用遗传编程或强化学习进行自动化搜索。然而,这些方法存在几个根本性局限。

首先是信息维度的局限。传统方法几乎完全依赖结构化数据,而金融市场的信息来源远不止于此——新闻公告、研究报告、社交媒体、卫星图像、供应链数据,这些文本和图像信息在传统框架中难以系统性纳入。即使能处理,也需要大量人工特征工程。

其次是Alpha衰减问题。当一个因子被市场广泛发现和使用,其超额收益会迅速衰减。遗传编程生成的因子容易趋同,因为它们都在同一个有限的搜索空间内探索。多智能体LLM系统通过抽象语法树(AST)的原创性限制,能够生成更具差异化、更难被复制的新因子。

第三是可解释性的缺失。深度学习模型虽然预测能力强,但决策过程如同黑箱。量化研究员需要理解因子为什么有效,以便判断其在未来市场条件下的适用性。LLM生成的因子天然具有语义可解释性——每一个数学表达式背后都可以被语言描述其金融逻辑。

AlphaAgent:大模型因子挖掘的新范式#

2025年的一篇论文提出的AlphaAgent框架,代表了LLM驱动因子挖掘的重要突破。该框架的核心思路是将LLM Agent与金融领域的正则化机制结合,解决传统方法的三大痛点。

AlphaAgent采用三种机制来实现抗衰减的因子挖掘。首先是AST原创性限制:因子以抽象语法树的形式表示,LLM在生成新因子时必须偏离已有因子的结构,防止趋同。其次是假设-因子对齐:LLM首先解析市场假设(例如”动量效应在短期反转后更显著”),然后生成与该假设逻辑一致的因子,确保因子的金融含义清晰。第三是复杂性控制:通过AST的结构约束限制因子的数学复杂度,避免过拟合训练数据。

实验结果令人印象深刻。AlphaAgent在中美市场的回测中,持续产生显著Alpha,且对Alpha衰减有很强的抵抗力。这说明大模型不仅仅是”更快的遗传算法”,而是真正在理解和推理金融市场。

MarketSenseAI:从单点分析到多智能体协作#

如果说AlphaAgent解决的是因子生成问题,MarketSenseAI则代表了一种更宏大的愿景:用多智能体LLM系统重构整个股票分析流程。

MarketSenseAI 2.0的综合能力令人关注。它整合了金融新闻、历史股价、公司基本面和宏观经济数据,通过RAG(检索增强生成)技术解析SEC文件和财报。在2023至2024年针对S&P 100成分股的测试中,累计回报率达到125.9%,远超同期市场指数73.5%的表现。更重要的是,在2024年扩展到S&P 500的验证中,Sortino比率较市场平均水平高出33.8%,表明该系统在风险调整后的收益表现同样出色。

这套系统的关键在于其多智能体架构。不同的Agent分别负责新闻解读、财务分析、技术信号和宏观研判,最后通过一个协调层整合各Agent的判断,输出综合投资建议。这种”群体协作”的范式,突破了传统单模型预测的瓶颈。

多模态数据:大模型带来的信息革命#

大模型在量化投资中最重要的贡献,或许在于它第一次真正实现了对海量非结构化数据的系统性利用。

新闻与公告的情绪挖掘是最直接的应用。传统的NLP方法(如LDA主题模型、情感词典)只能做粗粒度分析,而LLM能够理解新闻的具体含义,判断其对特定公司的影响方向和程度。更重要的是,LLM可以跨语言处理——同时分析中文财经媒体和英文研报,这在全球化投资中具有独特价值。

财报深度解读是另一个重要场景。SEC文件和A股年报包含大量非结构化文本——管理层讨论、风险提示、行业展望。传统方法只能提取结构化数字,而LLM能够理解文字背后的含义,识别管理层语调的变化,甚至发现”文字叙述”与”财务数字”之间的不一致。

研报复现与拓展则是机构的刚性需求。券商研报往往逻辑严密但数据分散,LLM可以快速提取关键假设、重新计算盈利预测、并将结论推广到同类公司。

技术路径:从预训练到RLHF对齐#

将通用LLM转化为金融领域专家,需要经历几个关键阶段。

领域预训练(Domain Pretraining)是最耗算力的一步。需要收集海量金融语料——年报、研报、新闻、公告、财经论坛帖子——在通用预训练的基础上继续训练。这一阶段的目的是让模型习得金融领域的专业词汇、概念和推理模式。DeepSeek在金融领域的尝试已经证明,领域预训练能够显著提升金融任务的准确率。

指令微调(Instruction Tuning)让模型学会”按要求执行任务”。例如,给定一份年报,模型能够按照指令输出”核心风险”、“盈利能力分析”、“现金流评估”等结构化内容。指令微调需要高质量的领域问答对,通常由金融专家标注。

RLHF对齐(基于人类反馈的强化学习)是最后也是最关键的一步。金融市场的”正确答案”往往是模糊的——同一个信息,不同投资者可能有截然相反的解读。RLHF通过让标注者对多个输出进行偏好排序,训练出一个符合专业判断标准的奖励模型。这使得LLM能够学习到”什么样的分析是专业且有用的”,而不只是”什么样的回答在字面上更流畅”。

挑战与局限:模型也会”幻觉”#

尽管大模型为量化投资带来了前所未有的能力,但我们必须清醒认识到其局限性。

幻觉问题是首要风险。LLM有时会自信地生成看似合理但实际错误的信息——捏造数据引用、误读财务数字、张冠李戴公司名称。在金融场景中,一个错误的数字可能导致整个分析框架的崩塌。因此,在生产环境中使用LLM输出时,必须建立严格的事实验证机制。

时效性问题同样突出。大模型的训练数据有截止日期,且更新成本高昂。金融市场的环境和规则不断变化——监管政策调整、行业周期轮动、黑天鹅事件——这些都需要模型能够及时响应。RAG(检索增强生成)是在一定程度上缓解这一问题的方案,但检索质量本身也是一个挑战。

计算成本与延迟也是实盘中的现实约束。实时分析海量新闻并生成投资信号,对延迟有严格要求。大模型的推理延迟远高于传统特征计算,如何在精度和速度之间取得平衡,是工程层面的重要课题。

未来展望:LLM将成为量化团队的标准配置#

展望未来,大模型在量化投资中的应用将沿着几个方向发展。首先是端到端Agent化:从数据获取、分析、因子生成、组合优化到风险管理,整个流程将由多智能体系统自动完成,人类研究员退居监督和策略设计的角色。其次是多模态融合深化:文本、图像(财报图表、K线形态)、音频(电话会议转录)的联合建模将带来更丰富的信息维度。第三是个性化与可解释性增强:针对不同风险偏好和投资风格的机构,定制化微调专属的投资Agent将成为可能。

大模型不会取代量化研究员,而是会成为他们最强大的工具。那些率先掌握”如何训练和调优金融领域LLM”的团队,将在未来的市场竞争中占据显著优势。这场革命才刚刚开始。

LLM量化分析系统架构

AI驱动的因子挖掘流程

大模型如何重塑量化投资:从Alpha因子挖掘到多智能体投资系统
https://blog.halo26812.eu.org/blog/llm-quantitative-investment-paradigm-shift
Author halo
Published at 2026年7月27日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨