算力不是算力,真正昂贵的是让数据像内存一样流动

Kevin Di

Hatched by Kevin Di

Jun 07, 2026

1 min read

88%

0

当一块板子比一颗芯片更值钱,问题就变了

如果一台 AI 服务器里,最贵的部分不是 GPU 芯片本身,而是那些让 GPU 彼此、让 GPU 与主机、让数据在系统里“像内存一样流动”的板卡和互连,你会怎么理解算力产业?很多人习惯把 AI 基础设施想成“买更多芯片就行”,但现实越来越像另一种生意:买来的是峰值算力,卖出去的是数据可达性

一台 GPU 服务器的价值,已经不再由单个芯片决定。板组、载板、GPU 模组板、NVSwitch、超低损耗 CCL、多层通孔 PCB,这些看上去像配角的东西,正在吞下越来越大的成本份额。原因并不神秘:当算力密度升高,真正稀缺的不是“有多少个计算单元”,而是“计算单元之间和计算单元周围的通信是否足够像内存访问那样顺滑”。

这就把一个工程问题变成了一个架构问题,甚至是一个经济问题。谁能把数据移动的摩擦降到最低,谁就能把昂贵的芯片时间变成真正的有效算力。


计算的瓶颈,早已从“算”转向“搬”

在直觉里,CPU、GPU、FPGA、网卡、内存,各司其职,彼此通过总线连接,像一群分工明确的工人。但从系统效率看,最大的浪费往往不是某个工人动作太慢,而是工人之间传话太慢。传统 PCIe 架构下,设备访问设备内存,很多时候等价于绕远路,数据要经过更多软件和协议层,结果就是高延迟和低效率。

一个很有冲击力的例子是,把一块内存挂在 PCIe BAR 空间上,理论上“都能跑 Linux 了”,现实却可能把原本几秒钟的启动拖到几十分钟。差距不是几个百分点,而是数百倍。根本原因并不是 CPU 不够快,而是这块内存对 CPU 来说不可缓存,每次访问都像穿着防护服去仓库搬货,动作都要走一遍笨重流程。

真正昂贵的不是计算本身,而是让计算能连续发生的那段“看不见的路径”。

这也是为什么 RDMA 会被广泛使用。它把发送一个数据包的过程拆成 WQE、doorbell、DMA、报文发送、完成回写、CQE 轮询等多个步骤,本质上是一套高度工程化的“异步搬运系统”。它很强,但它强在远程数据搬运,而不是把访问体验变得像普通读写那样自然。

问题在于,当系统规模继续增长,异步搬运本身也开始成为负担。于是,架构演进的方向就从“更聪明地搬运”变成了“尽量别让应用感知搬运”。这时,CXL 和 NVLink 所代表的思路就显得格外关键:把远程访问做成 Load/Store 语义,让数据像本地内存一样被读取和写入。


为什么 Cache Coherency 不是锦上添花,而是系统级的分水岭

很多人第一次听到 cache coherency,会觉得这像是处理器内部的细节,离业务很远。但一旦把 CPU、GPU、FPGA、网卡这些设备放进同一个系统里,coherency 就不再是“优化项”,而是决定架构形态的基础设施。

想象一下两种世界。

第一种世界里,CPU 看到的是普通内存,设备看到的是另一套内存,二者之间要靠显式拷贝、同步、轮询、完成队列来维持一致性。这个世界的特点是:每一次交互都需要额外的协议意识。程序员要知道数据在哪里,谁拥有它,什么时候更新,什么时候失效,什么时候再拉一次。

第二种世界里,CPU core 和 device 之间具备一致性,至少在主机内部,访问远程内存或设备内存的方式更像本地访问。这个世界的特点是:软件不必时时刻刻记住硬件边界。边界仍然存在,但边界不再污染应用逻辑。

这就是 cache coherency 的真正价值。它不是让硬件更“高级”这么简单,而是把系统从“显式搬运时代”带向“隐式访问时代”。而一旦访问语义变了,编程模型、性能上限、芯片周边生态,都会跟着变。

可以把它理解成两个城市之间的交通差异。没有一致性时,城市之间靠货运站,中转仓,报关点,流程完整但效率低。具备一致性后,很多访问像地铁一样直达,甚至可以在同一个站台换乘。从货运网络到城市轨道,差的不是路线,而是文明层级。


板子为什么越来越贵:因为它在替“系统一致性”付账

如果只看芯片,很多人会低估一台 AI 服务器真正的成本结构。可当系统开始追求更大带宽、更低时延、更高互联密度时,板卡和材料成本会迅速抬头。原因很直接:互连不是附属品,它正在成为算力本体的一部分。

一块 UBB,作为整个 GPU 平台的承载板,需要容纳复杂的走线、供电、信号完整性设计和高层数 PCB 工艺。再加上 GPU 载板、加速卡、NVSwitch 等部分,单机 PCB 面积和价值量都不再是边角料,而是可观的整机成本。

这里有一个容易被忽略的事实:当你买一台高性能 AI 服务器时,你买的其实不是“几颗芯片”,而是一个数据路由器加计算引擎的组合体。芯片越快,互连越贵,因为芯片的性能提升会立刻暴露周边互连的短板。于是,系统会把钱花在更高层数的 PCB、更低损耗的 CCL、更复杂的封装与板级协同上。

这不是浪费,而是被迫支付的对价。因为一旦互连不够好,最贵的 GPU 会像在堵车的高架上空转,账面峰值很高,实际有效吞吐却很低。于是你会看到一种很反直觉的现象:算力越先进,越依赖“把数据送到该去的地方”的基础工程。

换句话说,板子贵,不是因为板子变成了主角,而是因为系统正在把“协调成本”实体化。以前这些成本藏在软件栈里,藏在等待里,藏在轮询里,藏在不可见的延迟里。现在它们被转移到了材料、工艺和互连设计中。


真正的竞争,不是谁算得快,而是谁更像“内存”

把这些线索放在一起,会得到一个更深的判断:未来高性能系统的核心竞争,不是单点峰值,而是访问语义的亲和度

什么叫亲和度?就是系统中的各个资源,能不能像同一台机器里的不同地址空间那样被访问。CPU 访问内存是天然的,GPU 访问共享数据越来越接近天然的,设备之间也在尝试朝这个方向演化。CXL 的价值,NVLink 的价值,甚至高端 GPU 板组和 NVSwitch 的价值,最终都可以用一个共同问题来衡量:它们能否把“远”变成“像近一样”

这会重塑很多设计选择。

例如,过去选择网络方案时,常问的是吞吐量、带宽、端到端时延。今天还必须问:这个网络能不能支持像 Load/Store 一样的访问?能不能减少协议状态?能不能让 CPU core 和 device 在缓存一致性上有更自然的协作?因为这些答案决定了软件是否需要显式管理一切。

再例如,过去 GPU 集群的重点是堆更多卡、更大的交换网络。现在还要看板级和系统级的互连是否足够优雅。因为如果访问语义差,哪怕互联带宽高,软件仍然会被迫围着数据跳舞。反之,如果语义够好,应用就会更像在操作一个统一的大内存池,而不是在给一堆孤岛下发指令。

下一代基础设施的分界线,不是“算力强不强”,而是“数据能不能像内存一样自然地流动”。

这也解释了为什么很多性能竞赛最后都会转向架构竞赛。芯片可以通过制程进步变快,但系统效率只有在互连、缓存一致性、板级材料、软件模型一起进化时,才会真正提升。


一个更实用的框架:把系统分成三层摩擦

如果想判断一套 AI 或异构计算系统到底值不值得,别先问峰值算力,先问它的摩擦属于哪一层。

1. 计算摩擦

这是最容易理解的一层,指芯片本身的算力、吞吐和延迟。大家都在看 TOPS、TFLOPS、GPU 数量。

2. 访问摩擦

这是更关键的一层,指数据是否需要经过多次拷贝、显式同步、轮询和协议转换。RDMA 已经在降低这层摩擦,但它仍然是一种“搬运语义”。而 CXL、NVLink 这类 Load/Store 语义,目标是把访问摩擦压缩到接近本地内存。

3. 一致性摩擦

这是最隐蔽但最值钱的一层,指不同计算单元看到的数据是否保持足够一致,软件是否需要手动维护状态。没有一致性,程序员要为每次边界穿越付认知成本;有了一致性,系统复杂度可以大幅下降。

当你这样分层之后,就会发现很多“贵”的地方其实是合理的。高层数 PCB、超低损耗材料、NVSwitch、支持更紧密一致性的互连协议,它们不是零件贵,而是在替你减少三层摩擦中的后两层。

这也是为什么未来硬件架构的胜负,不只看芯片厂商,更看系统工程能力。谁能把计算、访问、一致性三层同时打通,谁就能把单颗芯片的潜力转化为整机的有效生产力。


Key Takeaways

  1. 不要只看算力参数,要看访问语义。 真正决定系统效率的,不是芯片峰值,而是数据能否像本地内存一样被自然访问。

  2. 把“搬数据”当成核心成本,而不是附带成本。 很多性能损失并不发生在计算上,而发生在 WQE、doorbell、CQE、DMA 这些中间路径上。

  3. 优先判断系统是否具备足够的 cache coherency。 一致性越强,软件需要显式管理的边界越少,系统越容易扩展。

  4. 评估硬件时,连同板级和材料一起看。 高层数 PCB、低损耗 CCL、NVSwitch 等成本上升,往往意味着系统在为更低摩擦付费。

  5. 设计架构时,用“三层摩擦”框架做决策。 分别检查计算摩擦、访问摩擦和一致性摩擦,能更快找到真正的瓶颈。


结语:未来最贵的,不是芯片,而是“让芯片像同一台机器一样工作”的能力

很多人把 AI 基础设施理解为一种规模竞赛,谁有更多 GPU,谁就更强。但更深一层看,真正的竞赛是让异构资源共享同一种现实。现实不是算力峰值,而是访问体验,不是芯片数量,而是数据流动的自然程度。

当一个系统足够先进时,最重要的不是某个单元多快,而是它们之间是否还需要你不断提醒它们“数据在哪里”“谁写过”“谁该等谁”。一旦系统足够接近内存语义,复杂性就会从软件栈中消失,转而被封装进板卡、材料、互连和一致性协议里。

所以,下次当你看到一台服务器里最贵的不是芯片,而是那些看似沉默的板子和互连时,不妨换个思路:**这不是成本膨胀,而是算力文明在升级。**未来的赢家,不是单纯把计算做得更快的人,而是把远处的数据,变得像近处内存一样容易的人。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣