算力的秘密不在芯片中心,而在芯片之间的流动
Hatched by Kevin Di
Jun 15, 2026
1 min read
3 views
91%
你以为 AI 加速器的竞争在算力核心,其实真正的战场在“搬运”
如果一块芯片已经够快,为什么还要花大价钱在板子、互连、布线、层数、材料上继续堆料?更尖锐一点说,为什么今天一台 AI 服务器里,真正吞掉大量成本的,往往不是那个最耀眼的计算核心,而是让这些核心彼此说话、共享数据、同步节拍的“周边系统”?
这看起来反直觉,但却是理解 AI 硬件进化最关键的一把钥匙。过去我们习惯把计算看成一个中心问题,谁的 Tensor Core 更强,谁的矩阵乘法更猛,谁就赢。但当模型规模和并行度持续上升之后,瓶颈开始从“算得够不够快”转向“数据能不能准时到达”。于是,真正决定系统性能和成本结构的,不再只是芯片内部的峰值算力,而是芯片如何被组织、广播、连接,以及如何让数据在不同计算单元之间形成稳定流动。
换句话说,AI 硬件的竞争已经从“造一颗更强的脑子”,转变成“设计一个更高效的神经系统”。
从 Tensor Core 到广播缓冲区:算力正在变成一种“组织能力”
在很多人的想象里,AI 芯片的先进性,最重要的标志是专用矩阵单元是否更强、更密、更快。但另一个更深的方向正在出现:通过Broadcast Buffer和多级广播,把流水线组织成脉动阵列或者 SIMD 向量计算,很多时候甚至可以不再依赖额外的专用 Tensor Core。
这件事的意义不只是“又省了一块硬件”。它揭示了一个更重要的趋势:计算能力正在被架构化,而不是被单元化。过去我们总在追问“这颗芯片里有什么单元”,现在更值得追问的是“这些单元如何协同工作”。如果广播机制足够高效,数据不必被反复复制,不必在局部缓存和专用单元之间来回折返,那么原本需要专门硬件承担的任务,就可以通过更灵活的组织方式完成。
可以把它想象成一支交响乐团。传统思路是给每个乐手都配一个独立的节拍器,甚至给低音区专门定制一个更豪华的节拍器。但更高效的方式,是建立一个精准的指挥系统,让节拍在整个乐团中被统一传播。Broadcast Buffer 的价值,正像那个指挥台。它不直接演奏,却决定每一个音符是否能在正确的时间进入正确的位置。
这也是为什么今天看 AI 芯片,不能只看峰值 TOPS。峰值指标像发动机马力,当然重要,但如果变速箱、传动轴和整车调度不过关,马力根本传不到轮子上。真正的竞争,早已延伸到数据路径设计、广播层级设计和流水线节拍设计。
未来的 AI 芯片,赢家不一定是“算得最多”的那颗,而是“让每一次计算都少走冤枉路”的那颗。
为什么一台 AI 服务器里,PCB 也能成为主角
如果说芯片内部的广播机制体现的是“计算组织”,那么整机层面的 PCB 成本则告诉我们另一件更现实的事:高性能 AI 不是一颗芯片的胜利,而是一整套物理系统的胜利。
一台高端 AI 服务器里,GPU 载板、NVSwitch、GPU 加速卡、GPU 模组板共同构成了一个复杂的板级系统。它们占据了可观的 PCB 面积,也带来了非常可观的成本。这里最值得注意的,不只是“贵”,而是贵得有结构。部分板级部件单机价值量很高,甚至在整机中占到接近一半的成本份额。也就是说,越是极致的 AI 机器,越不像一颗孤立的芯片,更像一个高度精密的交通枢纽。
为什么板子会这么重要?因为当多个 GPU 要协同训练一个大模型时,最怕的不是某一颗 GPU 算慢一点,而是彼此之间的通信慢一点。算力的扩张,最后总会撞上互连和供电的物理边界。于是,PCB 不再只是“承载芯片的底座”,而是系统级性能的一部分。它决定信号完整性、阻抗控制、散热路径、供电稳定性,甚至决定多芯片协同是否能真正跑到预期速度。
这就像修高铁。大家只盯着动车组有多快,但真正决定通车能力的,往往是轨道、信号、站场和供电系统。动车组再强,如果轨道不稳、信号延迟、站场拥堵,也只能空转。AI 服务器也是如此。GPU 是车头,PCB 和互连则是轨道与调度。高性能计算,表面上是芯片竞赛,本质上是系统工程。
这里还有一个更深的经济学含义。过去,芯片价值往往更集中,产业链关注点也更集中在晶圆和封装。但当板级复杂度上升后,价值开始向更广阔的物理层扩散。更高层数、更低损耗的 CCL 材料、更复杂的通孔工艺、更严格的高速信号设计,这些曾经不那么显眼的环节,开始从“配角”变成“利润池”。
真正的矛盾:AI 正在把“算力”变成“流量”问题
把芯片架构和板级成本放在一起看,会发现一个非常深的共同点:无论是在芯片内部,还是在服务器内部,AI 的核心问题都不是“有没有足够多的计算单元”,而是“数据能不能持续、低损耗地流过这些单元”。
这可以概括为一个新框架:AI 系统的三层流动。
- 单元流动:单个计算单元内部,如何完成乘加、向量化和局部数据复用。
- 芯片流动:同一芯片内,不同阵列、缓存、广播路径之间如何同步。
- 机箱流动:多颗 GPU、交换芯片和板级互连之间如何分发带宽。
在这三层里,越往上,流动越难控制,越容易成为瓶颈。也正因为如此,现代 AI 硬件看上去越来越复杂,其实是在做一件很朴素的事:尽可能减少数据在错误位置等待的时间。
这也是为什么广播机制和高端 PCB 会在同一个故事里相遇。前者解决的是“芯片内部如何少搬运”,后者解决的是“芯片之间如何少绕路”。它们看似处在不同层级,实则在回答同一个问题:谁来承担数据的组织成本?
一旦理解这一点,很多现象就顺了。比如为什么某些架构不再强调传统意义上的专用加速单元,而强调可重构的广播和流水线组织。因为当数据流被设计得足够优雅时,硬件功能不一定要做得更“专”,而可以做得更“通”。又比如为什么整机级 PCB 价值越来越高。因为当计算密度不断上升,板级系统要替芯片承受更多的同步压力和信号压力,系统复杂度自然从芯片里“外溢”出来。
AI 硬件真正稀缺的,不是晶体管,而是让晶体管协同起来的秩序。
一个更准确的类比:AI 不是一台更大的计算器,而是一座更聪明的城市
如果把一颗 GPU 想成一台计算器,那么今天的 AI 服务器已经更像一座城市。计算单元是工厂,缓存是仓库,广播机制是广播系统,NVSwitch 是高速环路,PCB 是道路和地下管网,供电与散热则是水电与排污。
城市的效率,不取决于单个工厂有多强,而取决于交通、通信和能源是否足够顺畅。一个产能很大的工厂,如果原材料迟到,产品出不去,城市总效率依然低。AI 服务器也是同理。一个 GPU 的峰值算力再漂亮,如果训练过程中通信拥塞、信号衰减、同步等待过长,最后得到的只是一堆纸面指标。
这个类比能帮助我们理解一个常被低估的事实:AI 性能不是线性堆出来的,而是网络效应堆出来的。多个计算单元彼此连接后,价值不只是相加,而取决于连接质量。连接越多,系统越强,但前提是连接足够便宜、足够快、足够稳定。否则,连接本身会吞掉收益。
这就是为什么高端 AI 硬件的设计逻辑,越来越接近“城市规划”而不是“零件堆砌”。优秀的城市不是楼越多越好,而是功能区布局合理,通勤效率高,能源与信息分发顺畅。同样,优秀的 AI 平台不是每个模块都堆到极致,而是让数据在最短路径上完成最多工作。
从这个角度看,Broadcast Buffer 的意义就不再局限于某个架构创新,PCB 的高价值也不再只是成本现象。它们共同说明了一件事:未来的硬件竞争,胜负手在系统协调,而不是单点极限。
Key Takeaways
-
别只盯峰值算力,先看数据路径。 在 AI 硬件里,算力越来越像结果,数据组织才越来越像原因。
-
广播能力是一种“去重复搬运”的能力。 如果一个架构能把数据高效广播到多个计算单元,就能减少专用单元的依赖,也能降低局部瓶颈。
-
PCB 和互连不是附属成本,而是性能的一部分。 在多 GPU 系统里,板级设计直接影响通信、供电、散热和最终可用算力。
-
把 AI 系统看成三层流动。 单元流动、芯片流动、机箱流动,任何一层卡住,整体效率都会下降。
-
从“堆硬件”转向“设计秩序”。 真正高水平的 AI 硬件,不是单点最强,而是让每一层都少做无谓搬运,少做无效等待。
结尾:未来的算力战争,拼的不是谁的芯片更像大脑,而是谁更像神经系统
我们之所以容易被最亮眼的芯片参数吸引,是因为“更快的核心”最容易被讲述,也最容易被量化。但 AI 硬件的真实进化方向,恰恰是把竞争从核心转移到连接,从单点性能转移到系统秩序,从计算单元转移到数据流。
这意味着一个很重要的认知转变:未来的算力优势,不只属于最强的芯片设计者,也属于最懂广播、互连、板级工程和系统协同的人。真正拉开差距的,不是“能不能算”,而是“算之前、算之中、算之后,数据有没有被最少代价地组织起来”。
所以下一次当你听到某个 AI 芯片峰值又刷新了,或者某台服务器的板级成本又攀升了,不妨换个问题问:它究竟是在提升计算,还是在重写流动?如果答案是后者,那你看到的就不仅是一项工程改进,而是一种新的计算文明正在成形。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣