算力战争真正的战场,不在芯片上,而在内存与互联的主权
Hatched by Kevin Di
Jul 31, 2026
2 min read
0 views
87%
一块 GPU 板值一万二,真正贵的却不是“算力”本身
如果一台 AI 服务器里,单机 PCB 价值量能到 1.225 万元,你会不会下意识以为,贵的是那颗 GPU 芯片?事实恰恰相反。很多时候,决定系统价值和性能上限的,并不是“算力有多强”,而是算力如何被连接、如何被喂养、如何被调度。
这才是今天数据中心里最容易被误判的一件事。人们习惯把 GPU 看成一块更快的芯片,把 AI 服务器看成“堆更多芯片”的机器,但真正让整机复杂化、昂贵化、甚至形成护城河的,是板级设计、互联协议、内存一致性和数据流路径。换句话说,AI 时代的竞争,不是单颗芯片的赛跑,而是整个计算版图的主权争夺。
从这个角度看,一块 UBB、NVSwitch、GPU 载板、26 层通孔 PCB、Ultra Low Loss CCL,这些听起来像制造业细节的名词,实际上都在讲同一件事:当算力密度足够高时,真正稀缺的不再只是晶体管,而是把晶体管组织成一个可用系统的能力。
算力不是问题,问题是算力能不能不被“喂死”。
为什么 PCIe、NVLink、CXL 不是接口之争,而是权力之争
很多人以为互联协议只是工程选择,像挑交通工具一样,快一点慢一点而已。但在数据中心里,互联协议决定的不是“传得多快”,而是谁拥有系统的中心地位。
PCIe 的历史,本质上是 CPU 主权的延伸。它把一切设备都组织在主机之下:设备是外设,主机是中心。这个结构非常稳定,适合传统服务器,也非常符合 CPU 时代的控制逻辑。可一旦 GPU、SSD、RDMA、DPU、DSA 这些设备开始承担原本由 CPU 负责的任务,这套架构就开始显得笨重。
这时候,问题就不是“带宽够不够”这么简单了,而是:
- 数据必须先回 CPU 再转发吗?
- 设备之间能不能直接说话?
- 内存到底属于谁?
- 谁是系统的调度中心?
NVLink 的意义,就在于它试图绕开这种中心化瓶颈,让 GPU 之间、甚至 CPU 和 GPU 之间建立更紧密的链接。它不是单纯为了更快,而是为了让 GPU 从“外设”变成“协同计算节点”。这类设计一旦成形,就会催生一种新的系统观:不是所有东西都必须经过 CPU。
而 CXL 的路线更微妙。它看起来像是在缓解 PCIe 生态的问题,让设备能更容易接入一致性内存体系。但它的核心气质仍然是 host CPU centric。它的聪明之处在于兼容、渐进、低门槛,可它的边界也很清晰:设备可以被扩展,但主权不出让。
这就是数据中心互联战的本质分歧:
- NVLink 更像联邦制,试图让多个计算实体共享更高程度的自治与协作;
- PCIe 和 CXL 更像帝国制,通过协议把所有设备统一纳入主机秩序。
这不是抽象比喻,而是决定性能路径、软件模型、硬件布局的深层政治结构。
最昂贵的不是“连接”,而是“被谁连接”
真正值得警惕的地方在于,互联协议的争论经常被误解成速度竞争,仿佛只要把 PCIe 变快,就能解决一切。可现实里,带宽只是表层,路径才是根本。
想象一下两种仓库:
- 第一种仓库里,所有货物都要先经过总调度台,再分发到各个货架;
- 第二种仓库里,货架之间可以直接搬运,调度台只负责制定规则。
如果你的货物只有少量,那第一种没问题,秩序甚至更清晰。但如果货物流量暴涨,第一种仓库会被调度台堵死。数据中心也是一样。GPU 之间交换参数、SSD 直达 GPU、RDMA 绕开 CPU 传输数据,这些需求出现后,路径设计就开始决定系统的上限。
这也解释了为什么 GPU 会越来越像一个“独立王国”。CUDA 的意义不只在于让程序跑在 GPU 上,而在于它重写了计算任务的组织方式。GPU 有自己的内存,有自己的调度,有自己的执行节奏。CPU 不再是唯一的计算中心,而更像一个统筹者,或者说一个必须被绕开的瓶颈点。
于是,系统设计开始分化为两种哲学:
- 中心化哲学:所有设备的数据交互都以 host memory 为枢纽,方便管理,便于生态统一,但可能牺牲设备间直通效率;
- 去中心化哲学:允许设备之间更直接地交换数据和状态,性能更高,架构更复杂,但能释放异构系统潜力。
这两种哲学没有绝对对错。关键在于,当你的系统目标从“稳定运行”变成“极致吞吐”,当你的负载从“单机业务”变成“多卡训练”,当你的数据从“少量请求”变成“海量张量流”,中心化就会越来越像瓶颈,而不是秩序。
在 AI 数据中心里,协议不是路由器上的规则,而是权力分配图。
从 Summit 到 DGX:真正的突破,是把内存边界拆掉
如果说 PCIe、NVLink、CXL 之争是在争“谁来当中心”,那么 Summit 这样的系统则展示了一个更激进的答案:中心不是 CPU 也不是 GPU,而是共享语义下的统一地址空间。
这件事的震撼之处在于,它不是简单地把 GPU 变快,而是让 CPU 和 GPU 的协作方式发生了质变。CPU 可以缓存 GPU 内存,GPU 也可以访问 CPU 的地址空间,kernel 的执行位置不再是预设的,而是可以根据任务动态选择。更关键的是,内存分配和地址访问的边界被大幅软化,程序员不用再被固定的 pin、复制、搬运、回传流程绑住。
这让人意识到一个更深层的事实:计算加速的终局,不是单点加速,而是消灭不必要的边界。
边界有三种:
- 计算边界,谁负责算;
- 内存边界,数据属于谁;
- 组织边界,谁决定任务怎么分配。
传统服务器的优化,大多只解决第一种边界。GPU 加速把算力拉高,却往往把后两种边界保留下来,甚至加剧。结果就是,芯片越来越快,系统却越来越像一个被协议和内存墙困住的巨兽。
Summit 之所以重要,是因为它证明了另一条路是可行的:当系统愿意重写内存语义,异构计算才能从“拼装”变成“融合”。这不是简单的硬件升级,而是计算范式的更换。
从这个意义上说,DGX A100 这样的系统价值,不只是它用了多少高端 PCB,或者板上有多少价值昂贵的互联器件,而是它反映了一个时代的共识:为了让 GPU 真正成为主角,必须把系统设计的重心从芯片性能转向板级协同、内存路径和互联拓扑。
一个新的理解框架:算力系统的三层主权
如果想真正理解今天的数据中心,不妨用一个简单的框架:三层主权模型。
1. 芯片主权
这一层回答的是:单颗芯片有多强。它关注 FLOPS、核心数、频率、张量吞吐。这是最容易被宣传的层面,也是最容易被误以为等同于“性能”的层面。
2. 互联主权
这一层回答的是:芯片之间如何合作。它关注 PCIe、NVLink、NVSwitch、RDMA、peer to peer。这里决定的是数据能不能少绕路,设备能不能互通,瓶颈会不会出现在交换层。
3. 内存主权
这一层回答的是:谁能看到什么数据,谁可以在什么地址空间里行动。它关注一致性、缓存可见性、虚拟地址共享、pinning 代价,以及程序模型是否自然。
很多团队只盯着第一层,所以总觉得“再换更强的 GPU 就好了”。但实际系统优化往往卡在第二层,而真正形成代际差异的,经常是第三层。因为当内存语义改变时,软件模型、编程习惯、性能调优方法都会一起变。
这也是为什么某些架构会显得“难推广”。不是因为它不够快,而是因为它要求整个系统重新组织。反过来,某些看起来平庸的协议,反而更容易普及,因为它们维护了既有秩序。于是,性能极限和生态扩张之间,总存在张力。
最先进的架构,不一定最先赢。因为真正贵的不是做出来,而是让整个生态愿意为它改写自己。
产业链真正的护城河,藏在“无聊”的地方
从板级 PCB 价值量看,很多人容易把注意力放在 GPU 芯片上,但一旦你进入系统层,就会发现最难复制的恰恰是那些“无聊”的部分:
- 26 层通孔 PCB 的信号完整性设计;
- Ultra Low Loss CCL 的材料选择;
- NVSwitch 带来的拓扑约束;
- UBB 面积、散热、布局、供电的协同;
- 设备直通、peer to peer、缓存一致性的系统级验证。
这些东西看起来不像“创新”,却决定了一个平台能否从实验室走向大规模部署。硬件行业最残酷的地方就在这里:真正形成壁垒的,往往不是某个炫目的参数,而是把几十个看似普通的约束同时满足的能力。
这也解释了为什么 AI 服务器越来越像一门系统工程,而不是单纯的芯片采购。你买到的不是一块 GPU,而是一整套关于电、热、信号、协议、软件栈和供应链的协同结构。越往高端走,越不是“单件商品”,而是“关系网络”。
如果说芯片是发动机,那么板级设计和互联协议就是传动系统。你可以把发动机做得很强,但如果传动系统有损耗、有延迟、有卡顿,整车的体验依然差。AI 数据中心也是如此,算力的价值只有在系统路径顺畅时才真正兑现。
Key Takeaways
- 别把 AI 服务器理解成“更强的芯片集合”。它本质上是一个关于数据路径、内存语义和互联拓扑的系统。
- 看协议时要先问权力结构,而不是带宽数字。PCIe、NVLink、CXL 的差异,首先是系统中心由谁掌控。
- 性能瓶颈常常不在算力,而在喂数和搬数。设备直通、peer to peer、RDMA、缓存一致性,往往决定实际吞吐。
- 真正难复制的是系统协同能力,不是单点器件。高层数 PCB、低损耗材料、NVSwitch 拓扑、软件栈适配,都是护城河的一部分。
- 评估一套 AI 平台时,优先看内存边界是否被打通。如果数据必须频繁经过 CPU,很多“高性能”只是纸面性能。
结语:数据中心的未来,不属于最快的芯片,而属于最少边界的系统
我们经常把技术进步理解为“越来越快”,但在 AI 时代,更准确的描述其实是“越来越少的摩擦”。摩擦来自哪里?来自协议的绕路,来自内存的复制,来自设备之间不能直说话,来自 CPU 必须当所有事的中介。
因此,真正的赢家未必是那颗最强的 GPU,而是那套最能让 GPU、CPU、存储和网络像一个整体那样行动的系统。未来的数据中心竞争,本质上不是谁的芯片更快,而是谁更有能力重新定义计算的边界。
当你下一次看到某块 PCB、某个互联标准、某个一致性协议,不妨换个问题:它是在增加一条路径,还是在重写谁拥有系统的主权?答案往往比峰值带宽更能决定未来。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣