算力不是瓶颈,真正的瓶颈是“带宽与缓存的政治学”

Kevin Di

Hatched by Kevin Di

May 03, 2026

1 min read

86%

0

当 2P Flops 时代来临,为什么模型仍然会“饿死”在显存边缘?

一个看似矛盾的事实正在重塑 AI 工业的竞争逻辑:最强的模型,不一定死于算力不够,而是死于数据搬运不够快

这句话听上去有些反直觉。过去我们谈性能,习惯盯着 FLOPs,仿佛算力就是一切,芯片越大,模型越强。但当单芯片已经逼近 2P Flops,当堆更多 GPU 不再是难事,真正卡住系统的,往往不是“能不能算”,而是“来不来得及喂”。模型像一台超级跑车,可如果油管太细,车依旧跑不起来。

这正是当下 AI 产业最值得重新理解的地方。表面上看,硬件厂商在拼晶体管,开源模型在拼参数,工程团队在拼优化技巧;深层里,所有人其实都在围绕同一个问题展开战争:谁能更低成本地把更多信息,持续、稳定、低延迟地送到计算单元手里


真正的稀缺品不是芯片本身,而是“让芯片不空转的能力”

我们常常把高端 AI 芯片想象成一种昂贵且不可替代的神物。但如果把一块顶级 GPU 拆开看,会发现它的价值并不只在“算”,而在整套系统协同:封装、供电、显存、互联、PCB、散热、软件栈,缺一不可。高端芯片更像一座机场,不是单块跑道,而是跑道、塔台、航油系统、导航系统、货运系统的总和。

这里最有意思的一点是,算力已经越来越像一种“可采购的标准件”。真正难以复制的,是让算力持续产生有效吞吐的系统设计。例如,显存容量决定你能塞下多大的模型和上下文,带宽决定每一步推理能不能顺滑完成,互联决定多卡扩展时是不是会把集群变成彼此等待的交通堵塞。

于是,AI 竞赛的焦点发生了位移。过去像是“谁的发动机马力更大”,现在越来越像“谁的整车热管理、变速箱和供油系统更好”。一个 900T 到 2P Flops 的飞跃,当然令人震撼,但如果没有同步把显存、互联、缓存复用、并行策略一起升级,理论上的峰值就会被现实中的等待时间吞掉。

算力的极限,常常不是芯片内部的极限,而是系统级数据流动的极限。

这也是为什么高端芯片看起来贵,实际上却并不总是“贵在那颗最核心的 Die”。当封装、HBM、互联和供电都被拆解后,很多人会惊讶地发现,性能的高成本并不总是来自最显眼的部分,而是来自把各部分拧成一体的工程复杂度。真正值钱的,不只是那颗芯片,而是让它在极限条件下不掉链子的整套架构。


你以为在比“参数”,其实是在比“记忆管理”

如果说高端 GPU 代表的是硬件层面的带宽战争,那么大模型推理最直观的痛点,则是缓存战争

一个模型生成文本时,并不是每吐一个字都从头计算一遍,而是要保存中间状态,尤其是 KV Cache。这个缓存越大,越能支撑长上下文;但它也越吃显存。于是,模型的可用性并不只取决于参数规模,还取决于它是否足够会“记忆”。

这里有一个非常重要但常被忽视的洞见:语言模型的效率,本质上是记忆结构的效率。Multi Query Attention 降低 KV Cache 占用,连续对话中复用前文缓存,都是在解决同一件事,如何少搬运、少重复、少浪费。一个 6GB 显存的设备,之所以能从“只能勉强对话”变成“能稳定长聊”,不是因为它突然变得更强,而是因为它学会了更好的记忆组织方式。

这件事和高速芯片的世界其实是同构的。芯片内部拼的是数据路径的精简,模型内部拼的是状态复用的精简。前者关心从 HBM 到计算单元的每一次搬运,后者关心从历史上下文到当前 token 的每一次读取。二者都是在减少“必须重新付费的计算”

我们经常把工程优化看成小修小补,像是“省一点显存”“快一点推理”“少一点延迟”。但当你把这些优化放在系统层面看,会发现它们不是边角料,而是决定模型能否真正进入产品形态的分水岭。

可以把它想成一家图书馆。参数规模像书架数量,KV Cache 像桌面上摊开的书页。你当然可以把书架建得更大,但如果读者每翻一页都要把整个图书馆搬一遍,那再大的馆也会乱套。真正的高手,不是拥有最多书,而是知道如何让书留在最该留的位置。


从芯片到模型,竞争正在从“堆规模”转向“扩张可协调性”

如果只看表面趋势,今天的 AI 产业像是在疯狂做大:更大的芯片,更大的集群,更大的上下文,更大的模型。然而,真正决定胜负的,并不是谁能堆得更大,而是谁能在更大规模下仍然保持协调。

这是一种从规模竞赛转向协调竞赛的变化。

在硬件侧,协调意味着更强的互联、更大的带宽、更低的封装延迟、更稳的供电和热设计。单芯片 IO 能力上去之后,600GB 不够就 1TB,8P 不够就 16P、32P,甚至更大的大互联,本质上不是炫技,而是在回答一个现实问题:当一个计算任务超出单机边界时,系统如何避免变成互相拉扯的碎片。

在模型侧,协调意味着更聪明的状态管理、更低的显存占用、更高效的注意力机制、更少重复读取。模型越大,越不能靠蛮力硬堆,因为你每增加一层复杂度,就会同时增加协调成本。很多时候,性能不是被“计算”吃掉,而是被“同步”吃掉。

这也是为什么未来真正有价值的,不只是更大的模型或更快的芯片,而是把大规模复杂系统变得可控的能力。谁能把算力、带宽、缓存、并行和调度整合成一个更少摩擦的整体,谁就能在实际部署中拥有压倒性优势。

大规模系统的核心竞争力,不是能扩到多大,而是扩到多大之后还不碎。

这里有一个值得警惕的误区:很多人认为开源或国产追赶的路径是“做出同样的硬件”或“训练出同样大的模型”。但更现实的突破路径,往往不是复制结果,而是复制一种可扩展的方法论。只要能在受限资源下把带宽利用率、缓存复用率、并行协调率做高,就已经接近了真正的护城河。


低成本突破的秘密,不是更便宜,而是更少浪费

如果把 AI 产业想成一场战争,那么真正的胜利并不是谁拥有更多弹药,而是谁能把每一发弹药都打中。

这就是为什么“成本拆解”如此重要。表面上,高端 GPU 昂贵得令人望而生畏,但拆开看,很多成本其实由几个关键部分构成:封装、显存、逻辑芯片、互联、供电。真正值得关注的,不是总价标签,而是哪些部分是“必须为性能付费的”,哪些部分其实是“可以通过架构优化减少消耗的”。

同样地,在模型工程里,最有效的优化往往不是把某个指标极限压榨,而是减少不必要的重复。比如:

  1. 减少状态重复计算,通过缓存复用降低每轮推理的边际成本。
  2. 减少显存占用,让同样的硬件支持更长上下文和更大 batch。
  3. 减少跨设备通信摩擦,让多卡并行不至于被同步拖慢。
  4. 减少低价值精度浪费,用量化、稀疏化、混合精度把资源留给真正重要的部分。

这些做法的共同点,不是“更抠门”,而是把资源花在最有信息增量的地方。这是一种极其重要的工程哲学。因为当系统进入高密度竞争阶段,真正稀缺的不是绝对资源,而是每单位资源能转换出的有效结果。

可以把它理解成一座城市的交通治理。你当然可以扩建更多车道,但如果红绿灯设计糟糕,换乘不顺,出入口混乱,城市依旧堵。AI 系统的扩容也是一样。更大的芯片、更大的模型、更大的集群,只有在“流动效率”足够高时,才会转化为真实生产力。


Key Takeaways

  • 别只看算力峰值,要看数据流动效率。 芯片快不等于系统快,带宽、缓存和互联同样决定体验。
  • 把“记忆管理”当作模型能力的核心。 KV Cache、上下文复用、注意力设计,决定了模型是否适合真实场景。
  • 规模竞争正在变成协调竞争。 未来的胜负手不是谁更大,而是谁更能让大系统保持稳定、低摩擦运转。
  • 优化的目标不是省资源,而是提高资源转化率。 任何减少重复搬运、重复计算、重复同步的设计,都会在规模化后被放大。
  • 寻找护城河时,要从单点性能转向系统方法论。 真正难复制的,是把硬件、软件和工作负载协同起来的能力。

结语:未来的 AI 竞争,不是造更强的脑,而是造更顺畅的神经系统

我们习惯把 AI 想象成“更聪明的脑”,于是自然会把注意力放在参数、算力和模型规模上。但如果把真实系统看清楚,就会发现,决定上限的往往不是脑本身,而是神经系统是否足够高效地传递信号、缓存经验、协调动作

这就是今天最重要的重新理解:AI 的下一阶段,不再只是把模型做大,而是把整个计算系统做得更像一个高效生物体。 它要有更快的信号传输,更聪明的短期记忆,更少的重复劳动,更稳的协同机制。谁先理解这一点,谁就不会被“单纯堆算力”的幻觉迷惑。

所以,真正的问题也许不是“还能把芯片做多快”,而是“我们能把信息流组织得多优雅”。因为最终,所有的性能,都会回到同一个朴素但深刻的真相:不是算得更多,才叫更强,而是让每一次计算都更值得。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣