halo 的技术博客

返回

2026年的大模型领域,有一个概念正在重新定义我们对”智能”的理解:Test-time Scaling(推理时扩展)。它不再是简单地把模型参数堆到万亿级别,而是让模型在推理时投入更多计算资源去”思考”,用时间换智能。这个范式的转变,不仅影响通用AI的进化方向,也在悄然改变量化投资、金融分析等专业领域的技术路线。

从训练时Scaling到推理时Scaling#

过去三年,大模型的进步主要靠训练时Scaling:堆更多数据、更大参数、更强算力。GPT-4到GPT-5的演进,本质上就是预训练阶段的参数和数据规模的指数增长。

但2025年OpenAI o1的发布让行业看到了新路径。o1没有公布具体参数量,它的核心创新在于推理时的强化学习:模型在回答问题前,会生成内部思维链,尝试多种推理路径,评估结果后再输出最终答案。简单说,给模型更多”思考时间”,它就能表现得更好。

这一范式的关键在于test-time compute scaling。研究发现,当推理时投入的计算量从1倍增加到10倍时,模型在数学推理、代码生成等任务上的准确率可以提升20%-40%。而且这种提升曲线目前还看不到明显的天花板。

test-time scaling 示意图

DeepSeek R1的横空出世进一步验证了这条路。R1通过强化学习驱动的思维链,在数学奥赛级别的题目上接近甚至超越了闭源模型。更重要的是,R1完全开源了训练流程和模型权重,让研究者能够深入分析RL在推理阶段的具体运作机制。

强化学习如何让模型”学会思考”#

Test-time scaling的背后是强化学习的精巧应用。以DeepSeek R1为例,其训练流程分为几个关键阶段:

冷启动阶段:先用少量高质量思维链数据进行监督微调(SFT),让模型学会”展示思考过程”。这一步很关键——如果直接上RL,模型可能会学会作弊而非真正推理。

推理导向的RL阶段:使用GRPO(Group Relative Policy Optimization)算法,让模型对同一问题生成多个答案,然后根据答案质量给予奖励。奖励信号不仅看最终答案对不对,还看推理过程是否符合逻辑、是否完整。这种奖励机制鼓励模型形成严谨的思考习惯。

自我进化阶段:当RL训练收敛后,模型使用自身生成的数据进行迭代优化,形成正反馈循环——更好的推理能力产生更好的自我训练数据,进而进一步提升推理能力。

RL training process

中金公司2026年初的研究报告指出,强化学习在模型后训练中的占比正在快速提升,预计2026年海内外主要模型厂商的RL训练算力将占据总训练算力的30%以上。这一趋势的核心在于:RL让模型能够突破静态训练数据的上限,通过自我博弈和自我修正来持续提升智能水平。

推理时扩展对量化投资的启示#

这个范式转变对量化投资领域有着深远影响:

第一,复杂推理替代直觉判断。 传统量化模型(包括大多数机器学习模型)的输出是”一次性”的——输入历史数据,直接输出预测。这类似人类的”快思考”。Test-time scaling则让模型执行”慢思考”:分析市场背景、评估多种可能性、考虑罕见情景、最终形成带置信度的综合判断。

想象一个场景:模型分析某只股票的走势时,不是直接输出”涨”或”跌”,而是先检索相关新闻、查询行业轮动规律、比对历史相似形态、计算不同情景下的概率分布,最后给出”有72%概率上涨2%-5%,但若跌破支撑位则有15%概率急跌8%“这样的结构化判断。这就是从预测到头寸管理的完整链路升级。

第二,推理成本与交易频率的平衡。 Test-time scaling需要额外计算资源。对于日线级别或周线级别的策略,推理延迟(几秒到几分钟)完全可接受——而这种级别的策略恰好是大多数机构投资者的主战场。对于高频交易,目前的test-time scaling方案还不适用,但可以用在信号生成的上游环节。

第三,可解释性的天然提升。 强化学习生成的思维链本身就是天然的决策解释。这对量化投资至关重要——基金经理需要对客户解释为什么做了一笔交易,监管机构也需要理解模型决策的逻辑。

当前的局限与挑战#

Test-time scaling虽然前景广阔,但落地到金融场景还面临几个实际问题:

推理稳定性问题。 同一问题多次推理可能产生不同结论,这在金融决策中是不可接受的。目前行业正在探索通过多轮采样+投票机制来提升稳定性,但这又进一步增加了推理成本。

幻觉与虚假推理。 模型可能在思维链中”编造”不存在的新闻或数据来支撑其结论。这需要严格的工具调用约束——模型必须标注信息来源,做到每一步推理可追溯。

算力成本。 在量化交易的日常流程中,如果每一次策略信号生成都需要数十秒的高强度推理,月度算力成本可能达到数万美元。对于中小量化团队来说,ROI的账要认真算。

2026下半年的展望#

2026年下半年,我们可以期待三个方向的发展:

  1. 轻量化推理时扩展:通过模型蒸馏和推理优化,让小模型也能享受test-time scaling的红利,降低落地门槛。
  2. 金融专用RL奖励函数:针对量化投资场景设计专门的奖励机制(如夏普比率加权、最大回撤惩罚、信息比率优化等),让RL训练的模型更贴合实际交易需求。
  3. 思维链与多模态融合:将K线图、新闻文本、财务表格、市场情绪等多模态信息整合到推理思维链中,实现真正的”全能型”量化分析。

Test-time scaling正在成为大模型领域的”第二增长曲线”。对于金融和量化领域来说,这或许不是一个需要立刻All-in的技术,但它代表的方向——让AI真正理解而非仅仅拟合——值得每一个从业者关注和持续跟进。

推理时Scaling法则:大模型后训练的新范式与金融应用展望
https://blog.halo26812.eu.org/blog/2026-07-26-test-time-scaling
Author halo
Published at 2026年7月26日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨