过去两年,AI领域最激动人心的叙事不是”更大”,而是”更深”——推理能力的跃升。从GPT-4到o1,再到o3和Gemini 2.5,模型在复杂推理任务上的表现已经超越了大多数人类的直觉判断。但最近一系列新测试让人们开始认真思考一个问题:AI的推理能力有没有上限?如果有,它在哪里?
从”涌现”到”刻意推理”#
理解这个问题,先要区分两种不同的能力提升模式。
传统的语言模型升级走的是”涌现”路线——参数多了、训练数据多了,模型突然就能做之前做不到的事。这种模式的特点是:能力提升是平滑的、渐进的,你很难说清某个能力是在哪个具体版本突然出现的。
o系列模型代表了一种全新的范式转变:刻意推理(Deliberate Reasoning)。不再是让模型”直觉反应”,而是让模型在回答前进行大量的内部思考,把复杂问题拆解成一步步的子问题。
OpenAI发布o1时展示的数据令人震撼:在国际数学奥林匹克(IMO)题目上,o1的得分率达到了83%,而GPT-4o只有13%。这个差距不是靠更多的训练数据能弥合的——它来自于思维方式本身的重构。
当难度推向极限#
真正让我感兴趣的不是AI在现有测试上的表现,而是当难度被推到极限时会发生什么。
FrontierMath是这波讨论的起点。这是一个由全球顶尖数学家参与设计的数学基准测试,题目专门设计来防止模式匹配和记忆,要求真正的数学洞察力和创造性思维。最初,模型的得分率不到2%。很多人据此认为AI的数学推理还远远不行。
但到了2025年底,o3在FrontierMath上的得分率已经突破了25%。对于一个”考试”来说,这个数字可能还不够高;但对于需要原创数学思维的测试来说,这是令人难以置信的跃升。
然后研究者开始设计更难的东西。Epoch AI推出了FrontierMath 2.0,题目难度进一步提升,同时加入了”动态难度”机制——系统会根据模型的答题情况自动调整下一题的难度,确保模型始终在极限边缘工作。o3在这个版本上的表现如何?目前最新的数据显示得分率降回了大约8%左右。
这个数字本身就很有趣。它说明:即使是最先进的模型,在真正极限难度的数学推理上,仍然有超过90%的题目无法正确解答。但这90%不是均匀分布的——模型在某些数学分支上表现出色,在另一些需要长期结构和深层次数学直觉的领域则明显薄弱。
推理能力的三道墙#
分析目前的数据和实验结果,我认为AI推理能力至少面临三道不同的墙:
第一道墙:计算资源的非线性成本
o3这类模型的推理能力提升,很大程度上来自于在推理阶段投入更多计算资源。模型可以”思考”更长时间,使用更多token来探索不同的解题路径。但这个过程的成本是惊人的——有报道称o3 high版本的单次查询成本高达数千美元。
这意味着:在物理上存在一个”太贵了而不实用”的边界。即使模型有能力解决某道题,如果需要消耗相当于一个人类数学家一个月工资的计算资源,它在实践中也是不可用的。
第二道墙:长期结构的捕捉
目前AI在需要长期上下文追踪的任务上仍然存在明显弱点。让模型在一个长篇小说中保持角色设定的一致性、理解一个复杂软件系统的层层依赖关系、在哲学论证中保持论点的连贯性——这些任务对模型的要求不是计算速度,而是对复杂结构的记忆和理解。
Gemini 2.5在这类任务上有所突破,但距离真正可靠的长期结构推理仍有差距。
第三道墙:真正的”元认知”
最深层的问题是:AI目前的学习方式本质上是在大量人类已有知识上进行模式识别和组合。它可以在已有知识的基础上进行令人惊叹的重组,但它不太可能产生完全独立于人类知识体系的新概念框架。
爱因斯坦的相对论不是从牛顿力学的线性扩展中产生的——它需要的是对”同时性”这个概念的重新定义,这一步跳跃目前AI很难自主完成。
为什么这个问题比我们想象的更重要#
讨论AI的推理上限,不只是在问”机器能有多聪明”,它触及的是一个更根本的问题:我们究竟在用AI做什么?
如果我们的目标是让AI替代人类做重复性的知识工作——写代码、分析数据、写报告——那目前的推理能力已经远远够用了。真正的瓶颈不在于模型有多聪明,而在于如何把它整合到真实的工作流程中。
但如果我们期望AI能够真正推动人类知识的边界,在科学研究、数学证明、复杂系统设计这些领域做出原创性贡献,那目前的天花板可能比表面上看起来更低。
这两条路的战略意义完全不同。前者意味着AI是效率工具的革命性升级,后者意味着AI开始具备”创造性伙伴”的可能性。目前来看,前者的实现路径清晰可见,后者的实现路径仍然布满迷雾。
写在最后#
我个人的判断是:AI的推理能力会有上限,但它不在我们目前能看到的地方。当模型在FrontierMath上能做到60%的时候,我们会发现还有FrontierMath 3.0在等着;当o4在某个基准上超越人类的时候,研究者会设计出更难的测试来继续探索边界。
真正的问题不是AI能不能达到某个具体的能力指标,而是:在这个过程中,AI和人类的关系会如何演变?
当AI能够在越来越多领域做到”足够好”,人类在这些领域中的角色就会发生变化——不是被替代,而是被重新定义。这是比任何具体技术突破都更值得思考的问题。

