算力系统真正的分水岭,不在更快,而在更像“忘记”

Kevin Di

Hatched by Kevin Di

Jun 10, 2026

1 min read

87%

0

你真的需要把一切都留住吗?

大多数 AI 系统的直觉都是同一个方向:更多缓存、更多带宽、更多互联、更多保留。只要把信息尽可能完整地堆在一起,模型就会更快、更稳、更强。这种思路看上去理所当然,直到你发现真正决定系统上限的,往往不是“能记住多少”,而是知道该忘掉什么

这件事在今天尤其反常识。无论是在芯片互联上追求单层满带宽,还是在大模型推理里压缩 KV Cache,本质上都在回答同一个问题:一个复杂系统,究竟应该把“完整性”放在第一位,还是把“可计算性”放在第一位?

如果把这个问题想透,你会发现,AI 基础设施的竞争,表面上是性能竞赛,深处却是一次关于信息组织方式的重构。最强的系统,不一定是记得最多的系统,而是最懂得把信息分层、筛选、合并、丢弃的系统。


第一性问题:到底是在建“网络”,还是在建“记忆”

做 AI Scale Up 时,最容易掉进一个幻觉:把所有互联都当成“网络工程”问题。只要带宽够高,延迟够低,拓扑够优雅,系统就能跑得漂亮。于是出现了极致的单平面高密互联设计,任意节点之间都像点对点直连,程序员几乎感受不到拓扑存在,仿佛世界被压成了一张无摩擦的平面。

这种方案的魅力在于,它把复杂性从软件里拿走了。开发者不用去理解层次,不用为通信路径做太多适配,不用在算法里不断迁就硬件结构。硬件把自己变成了“透明的”,就像一辆把悬挂调到极致的车,路面的细碎震动几乎消失了。

但现实世界不是一张平面,而是一个由距离组织起来的层次宇宙。封装内部、板上互联、机架内互联、机架间互联,每一层的带宽、密度、成本和时延都不同。真正可持续的系统,不会强行把一切压成同一种连接,而是承认:距离本身就是一种资源约束

你越想让系统“无感”,越是在把复杂性藏到别的地方。不是复杂性消失了,而是被转移到了更隐蔽、更昂贵的层次。

这就引出一个更深的类比:AI 基础设施不是单纯的网络问题,它更像记忆系统设计问题。 因为无论是互联还是缓存,目标都不是保存所有东西,而是让关键的信息在关键时刻可达。系统的价值,不在于存储容量的绝对大小,而在于它能否以正确的方式组织信息流。


KV Cache 不是“缓存”,而是模型的短期记忆结构

如果说 Scale Up 互联关注的是“信息如何流动”,那么 KV Cache 关注的就是“信息如何被保留”。在长上下文推理里,KV Cache 常被默认看成一种必需品,好像模型必须为每个 token 付出完整记忆成本,才能维持理解能力。但新的优化工作不断提醒我们:并不是每一个 token 都值得被同等对待

这背后有一个非常重要的事实。对注意力机制而言,真正重要的不是“所有历史 token 的总量”,而是与当前生成目标相关的那部分历史。也就是说,模型需要的不是一份完整档案,而是一份经过筛选的工作记忆。像 SnapKV 这类方法在 Prefill 阶段就开始筛选,把 Prompt 分成 Prefix 和 Window,再根据注意力分数决定 Prefix 中哪些 token 值得保留。它不是简单削减,而是在模拟人类记忆中的一种自然机制:远处的信息只有在与当前任务有连接时,才会被重新唤醒

MiniCache 则更进一步,提示我们深层层之间的 KV Cache 可能存在高度相似性。换句话说,模型并不是每一层都在从零生成全新的记忆,而是在不断重复、修饰、继承同一组结构。既然相邻层之间有大量冗余,那么合并和压缩就不是一种粗暴的节省,而是一次对模型内部信息流的校准。

这很像整理书桌。你不会把所有纸张都摆在桌面中央,而是会区分:

  1. 现在手头正在处理的文件,必须放在最顺手的位置;
  2. 仍可能用到的参考资料,放在抽屉里但不离开;
  3. 重复打印的草稿,直接回收;
  4. 低频但重要的档案,放入归档系统。

KV Cache 的优化本质上就是这种整理。它不是在破坏记忆,而是在建立记忆的层级制度


真正的上限,不是绝对容量,而是“分层忘记”的能力

这时,芯片互联和 KV Cache 压缩之间突然出现了深刻的同构关系。

在互联设计里,最优解往往不是“所有地方都一样快”,而是根据距离和用途分层。封装内追求高密,板级追求稳定,机架内强调高吞吐,机架外则接受更高延迟但更大规模的光互联。系统要接受一个现实:越靠近计算核心的部分,越应该像短期记忆,越外围的部分,越应该像长期存档

KV Cache 的优化也遵循同样的逻辑。Prefill 阶段保留所有信息,看似最完整,但实际上只是第一步;真正高效的系统,会在后续阶段做选择、合并、保留、恢复。SnapKV 是选择,MiniCache 是合并,量化和 retention recovery 是恢复。它们不是独立技巧,而是一个共同原则的不同实现:在误差可控的前提下,主动遗忘冗余。

这就是今天 AI 系统设计里最值得重视的概念,有损但可逆的记忆管理

这个概念很重要,因为它突破了“压缩等于牺牲精度”的老思维。现实中的优秀系统从来不是无损系统,而是误差可预算系统。它允许局部丢失,但要求整体任务不崩;它接受某些 token、某些层、某些链路不必全量保留,但要求关键信息能以足够低的代价被恢复出来。

最强的系统不是没有损失,而是知道损失发生在哪里、为什么发生、以及如何把损失限制在可控范围内。

这也解释了为什么某些看起来更“高级”的全连接或网格拓扑,在普适场景里并不总能胜出。因为它们通常要求软件也跟着重写,要求集合通信算法、调度策略、并行语义全面适配。换句话说,硬件如果不能把复杂性真正消掉,只是把复杂性搬到了编译器和框架里。KV Cache 压缩也一样,如果压缩带来的恢复和管理成本过高,系统只是换了个地方变慢。

所以问题不是“能不能压缩”,而是压缩后是否还能保持系统的组织能力


一个新的统一框架:从“保留最大化”走向“信息经济学”

如果把这两类问题放在一起看,会得到一个更有用的框架:AI 系统的核心竞争力,正在从硬件峰值转向信息经济学。

什么叫信息经济学?就是把每一份信息都当成一种有成本、有收益、有折旧速度的资产。短期里最有价值的信息,不该被放在远处;长期里仍有价值的信息,不该被过度复制;重复的信息,应该被合并;低相关的信息,应该被尽早淘汰。系统设计的关键,变成了对信息做投资组合管理,而不是无差别囤积。

你可以把它理解成三条规则:

1. 近处高频,远处低频

在互联上,近处使用更高密度、更低延迟的连接,远处使用更经济的方式。不要试图让所有通信都享受同等级的待遇。

2. 关键保真,非关键压缩

在 KV Cache 里,真正影响当前生成的 token 要优先保留。剩下的可以借助稀疏化、合并、量化来减少开销。

3. 允许恢复,不要求绝对无损

只要误差抑制机制足够好,就可以用 rescaling、retention recovery 这类方法把系统从压缩引入的偏差里拉回来。重要的不是“从未损坏”,而是“损坏后能快速回到可用状态”。

这三条规则的共同点是:把“完整”重新定义为“对任务完整”。不是把所有东西都留下,而是留下那些对目标最有贡献的东西。

这也是为什么很多看起来很强的方案,在实际铺开时会遇到门槛。因为它们优化的不是信息组织,而是单点指标。真正的规模化,需要同时优化硬件结构、算法适配和内存语义。缺任何一环,系统都可能在某个维度上美得惊人,却在另一个维度上难以部署。


可以立刻使用的判断框架

如果你正在设计、选型或者评估一个 AI 系统,不妨问自己四个问题:

  1. 哪些信息必须始终近在咫尺? 这决定了你的高带宽区域应该有多大,以及该服务哪些任务。

  2. 哪些信息看似重要,实则只是重复? 这决定了哪些 KV Cache、哪些中间状态、哪些同步消息可以合并或压缩。

  3. 哪些误差可以被恢复? 这决定了你能否接受有损优化,以及需要多强的恢复机制。

  4. 复杂性是被消灭了,还是被转移了? 如果一项硬件创新让软件适配成本暴增,那它可能只是把账单从一边挪到另一边。

当你用这四个问题看系统时,很多表面争论会瞬间变清楚。比如某种拓扑为何适合特定场景,却不适合普适部署。再比如某种缓存压缩为何能显著提高吞吐,却依然保持精度。答案通常不是“某个技巧神奇”,而是它是否真的理解了信息的层级和任务的边界。


Key Takeaways

  1. 不要把 AI 系统理解成单纯的性能机器,要把它理解成信息组织机器。 真正重要的不是绝对带宽或绝对容量,而是信息能否按任务需求被正确组织。

  2. 最优设计往往来自分层,而不是一刀切。 近距离互联、高频记忆和核心状态应当高保真,远距离通信和低频状态可以更经济。

  3. KV Cache 优化的本质不是“删减”,而是“筛选后保留”。 通过注意力、层间相似性和误差恢复机制,系统可以用更少的存储完成近似同等的推理。

  4. 接受可控误差,比追求绝对无损更接近现实。 只要恢复机制足够强,压缩和合并就不是妥协,而是工程成熟度的体现。

  5. 评估一项技术时,永远问它是否在减少复杂性,还是仅仅在转移复杂性。 真正优秀的方案会让硬件、算法和部署三者同时受益。


结语:未来的竞争,不是谁记得更多,而是谁忘得更聪明

AI 基础设施的下一个阶段,可能不再由“更大”或“更快”来定义,而是由更会分层、更会筛选、更会遗忘来定义。无论是互联拓扑,还是 KV Cache 管理,真正决定系统命运的,都不是把一切拉平,而是承认世界本来就有层次。

这意味着一种观念上的转向:我们过去总觉得高性能系统应该像全知全能的记忆体,什么都不漏,什么都不错。可现实正在告诉我们,真正优秀的系统更像一个成熟的思考者,它不会执着于保存每一粒沙,而是知道哪一块岩石值得搬运,哪一阵风只是路过。

未来最强的 AI 系统,不一定拥有最满的缓存,也不一定拥有最夸张的互联,而是拥有最聪明的遗忘能力。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣