为什么最强的推理系统,先学会把“记忆”变短

Kevin Di

Hatched by Kevin Di

Jul 25, 2026

1 min read

84%

0

如果算力继续变强,瓶颈为什么还会在“记不住”

很多人以为,模型推理提速的关键是把算力堆高,把 GPU 再加几倍,把网络再拉快一点。但真正决定大模型系统能否规模化的,往往不是“算得够不够快”,而是数据在系统里走得有多慢,记忆在系统里长得有多臃肿

这听起来有点反直觉。模型越强,似乎应该记得越多,连接越丰富,通信越频繁,才更接近“智能”。可在真实系统里,过长的上下文、过大的缓存、过密的跨层依赖,最后都变成了拖慢推理的负担。于是,一个更深层的问题浮现出来:高性能推理的本质,到底是增强记忆,还是重构记忆的组织方式?

当你把这一问法放到大模型推理和智算网络里,会发现两者其实讲的是同一件事。模型内部的 KV Cache,和机房里的网络流量,本质上都是“状态”的流动。谁能更高效地保存状态、共享状态、复用状态,谁就能把延迟和成本压到更低。


真正昂贵的,不是计算,而是状态

在传统想象里,推理的开销主要来自矩阵乘法。可一旦进入长上下文、多人对话、多轮生成、超大集群,这个直觉就会失真。因为推理系统最贵的部分,往往不是“做一次计算”,而是为了做下一次计算,必须搬运多少状态

可以把大模型推理想象成一座图书馆。每次回答问题,不只是要写新内容,还要回头查很多旧书页。若每一页都重新翻、重新搬、重新抄,那答案当然会慢。于是所有优化都在围绕一个核心目标展开:让系统少搬运、多复用、尽量把状态留在最合适的位置

这就解释了为什么几种看似很技术的手段,其实都在服务同一个原则。

  • MQA 让所有 head 共享 K 和 V,减少缓存体积。
  • 局部注意力 让大部分层只看最近的窗口,不必处理全部历史。
  • 跨层 KV 共享 进一步减少相邻层之间重复保存的信息。
  • 有状态缓存 把跨轮对话的中间结果保存在主机内存里,避免每轮都从头构建。

这些方法共同指向一个判断:推理系统不是在“更努力地记忆”,而是在“更聪明地遗忘”。这里的遗忘并不等于丢失,而是把不必要的精细化表示降维,把“够用的状态”保留下来。

最好的推理优化,不是让模型记住一切,而是让系统只为真正有价值的记忆付费。


从注意力到网络,延迟的本质都是“复制过多”

如果只看模型内部,KV Cache 的膨胀似乎只是一个张量管理问题。但把视角拉到整座智算中心,你会发现同样的逻辑在网络层被重复了一遍:一切延迟,最终都和复制有关

在单机内,模型需要复制和访问历史 KV。跨机器时,数据还要经过网络复制。复制越多,路径越长,缓存越大,延迟越高。于是 RDMA 的价值就凸显出来了。它绕过内核协议栈,让主机可以直接访问另一台主机的内存,本质上是把“数据搬运”从层层中转变成更直接的内存交换。

这和 MQA、局部注意力、跨层共享,有一种惊人的同构性。它们都在做一件事:去除中间层的重复保存和重复转发

可以把它理解为“信息路径压缩”。

  1. 在模型内部,通过共享 K 和 V,减少每个头都复制一份的浪费。
  2. 在层与层之间,通过跨层共享,减少相邻层重复存储同类状态。
  3. 在多轮对话之间,通过状态缓存,避免每一轮都重新构建历史。
  4. 在集群之间,通过 RDMA,减少操作系统参与和协议栈转发。

这四层看起来不同,实则都是在缩短状态流转链路。每多一层“中转站”,系统就多一点延迟,多一点抖动,多一点规模化成本。

一个有用的类比是城市交通。MHA 像每辆车都要在每个路口走完整的绕行路径,GQA 和 MQA 像给车辆共用车道,局部注意力像只开放附近街区通行,RDMA 则像一条直达高架。它们的目标不是让每辆车跑得更用力,而是让整个城市少建红绿灯,少设收费站,少把车流堵在中转节点上。


规模化的真正分水岭,是“状态的局部性”

如果说传统系统设计关注的是吞吐和算力,那么大模型推理系统真正的分水岭,是状态的局部性

局部性意味着什么?意味着信息不需要时时刻刻处在全局可见的高成本状态里,而是应该按使用频率、时间跨度、访问范围,分层存放。短期最常用的信息,留在最靠近计算的位置。长期但不频繁使用的信息,放到更便宜的存储里。很少需要同步的部分,尽量不要同步。

这也是为什么 Character.AI 这类面向长对话的场景,会特别重视轮次间缓存。因为一个聊天不是一次性推理,而是一个不断累积状态的过程。平均 180 条对话记录,意味着每一轮都从头扩展上下文,会让成本像滚雪球一样上涨。把 KV Cache 缓存在主机内存中,再通过哈希和树结构找到最长匹配前缀,本质上是在做一种语义层面的增量编译

这带来一个重要洞察:

不是所有上下文都应该被平等对待,真正应该被保留的,是那些能最大幅度降低未来计算成本的状态。

这句话听上去像工程优化,但它其实是一种系统哲学。因为“保留什么”比“计算什么”更重要。所有大系统都会面对这个问题,只不过大模型把它放大到了极致。

例如,局部注意力并不等于模型变笨。它的关键在于,大多数 token 的影响其实是局部的,真正需要全局视野的层数可以很少。换句话说,模型不必每一层都拥有同样宽的视野。就像写作时不必每一句都回看整本书,系统只要在关键节点上全局对齐,平时用局部上下文推进,就能显著降低成本。

这里的核心不是“少看”,而是把全局视野变成稀缺资源。稀缺资源应该只在最值得的时候使用。


从“更大”到“更像互联网”的架构思维

大模型系统的演进,正在从“堆大单体”转向“分层网络化”。这是一种非常像互联网的发展路径。

早期互联网也不是一开始就高效。它的进化过程,就是不断减少不必要的同步,增加局部自治,提升缓存能力,依靠更聪明的路由来避免全局阻塞。今天的大模型推理系统正在重复这个过程:

  • 注意力机制 逐渐从完全密集,变成分层稀疏。
  • 缓存机制 从单轮临时变量,变成跨轮状态池。
  • 网络架构 从通用 TCP/IP,变成更偏低延迟的 RDMA。
  • 集群调度 从“把一切放在一起”,变成“把状态放在最该在的地方”。

这意味着未来的竞争,不仅是模型参数规模的竞争,更是状态管理系统的竞争。谁能更好地回答三个问题,谁就能获得优势:

  1. 哪些状态必须驻留在最快的介质上?
  2. 哪些状态可以共享,而不必重复保存?
  3. 哪些状态可以被压缩、延后或局部化,而不损害效果?

这三个问题看起来像工程问题,实际上是产品问题,甚至是商业问题。因为对话产品、搜索产品、代码助手、企业知识系统的成本结构,最后都取决于状态如何流动。推理成本一旦被压住,产品才有资格做真正长时长、高频交互的体验。

一个很实用的判断标准是:如果某个系统里,新增一个用户、一次对话、一次长上下文,都会带来近似线性的状态膨胀,那么它迟早会撞上经济边界。相反,如果系统能通过共享、稀疏化和缓存,把新增成本压成次线性,规模化才会真正成立。


Key Takeaways

  1. 先问状态在哪里,而不是先问算力够不够。 在大模型系统里,很多瓶颈都不是计算本身,而是 KV Cache、跨层传递和网络搬运造成的状态成本。

  2. 把“复用”当作第一设计原则。 无论是 MQA、局部注意力,还是跨轮缓存,本质都是减少重复保存和重复计算。

  3. 不要让全局视野成为默认配置。 全局注意力和全局同步都很贵,应该只留给真正需要它们的关键节点。

  4. 把系统看成分层记忆,而不是单一记忆。 最近的、高频的、关键的状态应该更靠近计算;低频状态应该沉到更便宜的层级。

  5. 评估优化时,别只看单点指标,要看状态流动链路。 一个看似小的缓存优化,可能通过减少跨层、跨轮、跨机的数据搬运,带来数量级的系统收益。


结语:最强的系统,不是记得最多,而是忘得最有策略

我们总把智能想象成记忆力的胜利,好像记得越多、上下文越长、连接越密,系统就越强。但真正能走向规模化的系统,恰恰相反。它们并不执着于保留所有细节,而是学会了区分:什么该保留,什么该共享,什么该压缩,什么该下放到更慢但更便宜的层级。

这是一种更成熟的智能观。智能不是无限扩张记忆,而是以最小的状态成本,维持最大的有效连续性。

从模型内部的注意力结构,到机房里的 RDMA 网络,所有高性能系统都在回答同一个问题:怎样让重要的信息尽可能靠近决策点,而让不那么重要的信息尽可能少占资源。懂得这一点,你就会发现,推理优化从来不只是“提速”,它是在重新定义什么值得被记住。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣