halo 的技术博客

返回

2026年的AI行业,有一个军备竞赛正在悄然降温——不是模型的参数规模,不是推理速度,而是上下文窗口长度

从2023年的ChatGPT 4K上下文,到2024年的100K,再到如今某些模型宣称的1M甚至2M tokens上下文,这场竞赛看起来很热闹。但作为一个深度使用AI一年多的用户,我想泼一盆冷水:**更长的上下文,不等于更好的AI。

竞赛的起点:为什么大家都在卷上下文#

上下文窗口的本质,是AI的”工作记忆”。你可以把它理解成AI在一次对话中能同时记住多少内容。传统的Transformer架构中,上下文越长,计算量越大(通常是O(n²)),成本也越高。所以扩大上下文窗口,本质上是在和物理定律掰手腕。

早期各家模型上下文都很短,导致了著名的”中间丢失”问题——当你要AI总结一篇10万字的文章时,开头和结尾的内容往往被记住,中间部分容易被”遗忘”或忽略。这催生了RAG(检索增强生成)等技术来弥补。

但更长的上下文,解决的是表面问题,不是根本问题。

长上下文的真实体验:期望 vs 现实#

我做过一个实验:给同一个模型投入同样100K的上下文,一半是高度相关的信息,一半是噪声。模型在噪声中检索关键信息的能力,远没有达到宣传的那样精准。

这涉及到AI的一个根本限制:上下文越长,模型越容易”分心”。虽然技术上它能”看到”所有token,但在实际推理时,不同位置的token对最终输出的影响是不均匀的。心理学上有个词叫” primacy effect”和”recency effect”——人类倾向于记住最先和最后看到的内容。AI模型也有类似的倾向,而且这个倾向在超长上下文中更加明显。

换句话说:1M上下文听起来很美,但当你真正在里面塞入大量内容时,模型对中间部分的感知能力是在下降的,不是线性的。

为什么我在实际工作中反而缩短了上下文#

这个发现让我改变了使用习惯。

以前我总是恨不得把所有相关文档都丢给AI,让它自己去找重点。现在我更倾向于:

  • 先人工提炼关键段落
  • 分多次对话,每次聚焦一个具体问题
  • 用结构化的方式组织输入,而不是一股脑塞进去

这种”少即是多”的用法,往往比一次性投入超长上下文效果更好。原因很简单:**AI的理解能力是有限的,你给它的东西越多,它越需要”猜测”你想让它关注什么。

这场竞赛的真正受益者#

如果长上下文不等于更好,那为什么各家还在拼命卷?

答案是:差异化营销的需求,大于实际用户需求。

对于普通用户来说,“支持100万字上下文”是一个极具冲击力的数字,能让人直观感受到”这个模型很强大”。但对于真正专业的用户,这种宣传反而会造成误导——以为买了个更强大的工具,实际上只是买了个更贵的噱头。

真正从这场竞赛中获益的,是那些需要处理大量结构化文档的企业用户——法律文档审核、代码库分析、长篇报告总结。在这些场景下,长上下文确实有价值。但对于个人用户日常使用,4K-32K的有效上下文,往往就足够了。

给普通用户的一句话建议#

不要被”超长上下文”这个数字绑架。AI工具的核心能力是理解推理,不是记忆。与其花更多钱买更长上下文,不如花时间学会更高效地和AI协作——学会提问、学会分解问题、学会验证输出。

上下文长度的竞赛,终将回归理性。

AI模型上下文示意

长上下文的挑战

AI上下文长度竞赛:更长不等于更好
https://blog.halo26812.eu.org/blog/2026-05-27-ai-context-length-trap
Author halo
Published at 2026年5月27日
版权声明 CC BY-NC-SA 4.0
Comment seems to stuck. Try to refresh?✨