AI 服务器真正的瓶颈,不是算力,而是数据能不能像神经一样流动

Kevin Di

Hatched by Kevin Di

Jul 15, 2026

2 min read

89%

0

你以为一台 AI 服务器最贵的是 GPU 吗?未必。真正决定系统价值的,可能是一块你几乎看不见的东西:把算力连成整体的板子、互连、以及让数据像被“直接想起”一样访问的机制

当我们谈大模型训练时,常常把注意力放在 FLOPS、显存容量、芯片工艺上,仿佛只要算力足够强,智能就会自然涌现。但更接近现实的真相是,现代 AI 系统的竞争,越来越像一场通信架构之战。谁能更快、更少步骤、更低代价地把数据送到正确的位置,谁就更接近真正可扩展的智能。

这就引出一个更深的问题:算力到底是在芯片里诞生的,还是在互连中被释放出来的?

一、为什么“最贵的不是芯片”这个直觉正在失效

如果把一台高端 AI 服务器拆开看,会发现它并不是“几颗 GPU 插上去就完事”。支撑整机的,是一整套复杂的 PCB 体系:GPU 载板、NVSwitch、GPU 加速卡、GPU 模组板,也就是用于搭载整个平台的 UBB。单机 PCB 面积可以达到 0.624 平方米,单机 PCB 价值量可到 12250 元,几乎不是一个可以忽略的数字。

这件事之所以重要,不只是因为它“贵”,而是因为它揭示了一个行业层面的结构变化:算力的边际价值,正在从单颗芯片转移到系统级连接。一块 UBB 面积约 0.30 平方米,可能需要 26 层通孔 PCB、Ultra Low Loss 材料,还要和整机结构、电源、散热、信号完整性协同设计。换句话说,AI 服务器不再是“组件的堆叠”,而是“高速信息流的建筑”。

这像什么?像修一座城市。以前大家只看摩天大楼有多高,现在更关键的是地铁、道路、供电和调度系统。楼再高,如果交通堵塞,整座城市的效率都会崩塌。AI 服务器也是如此,GPU 再强,如果数据在板级、卡间、主机与设备之间传不动,算力就只是昂贵的空转。

在 AI 系统里,最值钱的往往不是“能算”,而是“算之前和算之后的数据不堵”。

这也是为什么 PCB 和互连不再是配角。它们正在从“承载芯片的物理底座”,升级为“决定算力可用性的神经网络”。


二、真正的瓶颈不是带宽,而是访问模型

很多人谈互连,第一反应是带宽:每秒能传多少数据。但更深的问题其实是,数据访问到底要经过多少层协议和控制路径

举个极端例子。曾经有人把一块通过 PCIe BAR 暴露出来的 FPGA 内存当作系统内存来跑 Linux,结果原本只要 3 秒的启动过程,变成了 30 分钟,慢了 600 倍。这里最刺眼的不是“慢”,而是慢得如此离谱,说明问题并不是单纯的吞吐不够,而是访问语义错了

PCIe 本质上并不支持 cache coherency。CPU 直接访问 device memory 时,必须把它当成 uncacheable 的区域,每次访问都像是去一个远房仓库取件,不能先记在脑子里,不能预测,不能合并,不能像访问本地内存一样自然。于是原本应该是“读一下,立刻继续执行”的操作,变成了“每次都要跨过一整套慢路径”。

这就是为什么 RDMA、CXL、NVLink 的区别不能只看“快不快”,而要看它们提供的究竟是什么模型。

1. RDMA 的强项,是把搬运变成网络事务

RDMA 非常强,但它的强在于高效搬运,而不是像本地加载那样自然。一个发送流程可能要经历 WQE、doorbell、DMA、报文、远端写回、完成事件、轮询 CQE。它非常适合大块数据、批量传输、网络通信和异步卸载。

它像物流系统:你下单,仓库拣货,打包,运输,签收,回执。整个体系高效,但你不会把它当成“伸手拿杯子”。

2. CXL 和 NVLink 的野心,是把远端访问伪装成本地访问

相比之下,Load/Store 模型更像直接把远程内存变成地址空间的一部分。应用发出一个 Load 或 Store,硬件网络单元直接发起访问,对方 DMA 取数,再回传结果,指令继续执行。对程序员来说,这几乎就是“像访问寄存器一样访问远端资源”。

这种模型的巨大价值,不在于少了几个步骤这么简单,而在于它让系统的思维方式发生变化。你不必显式地编排那么多中间动作,不必为每次通信设计完整消息协议,不必把每个数据交互都写成物流流程。数据被访问的方式,更接近“地址”而不是“任务”。

3. 关键不只是跨主机,而是主机内部的 coherency

这里最容易被忽略的一点是,Load/Store 并不一定需要跨主机的 cache coherency。更关键的是主机内部 CPU core 和 device 之间的 CC。只要这个局部一致性做好,很多设备就能像系统的一部分那样工作,而不是像外部附属品那样被反复“叫醒”。

这背后的深意是:计算系统真正需要的不是把一切都做成网络,而是把必要的对象变成“可直接思考的对象”。对于 CPU 来说,某些 device memory 不再是外物,而是地址空间中的自然延伸。对于 GPU 来说,某些远端资源不再是远端,而是参与同一计算图的可访问节点。

性能的跃迁,常常不是把旧流程做得更快,而是让系统根本不需要那个旧流程。


三、从“搬数据”到“让数据参与计算”,架构的核心正在迁移

把这两件事放在一起看,你会发现它们其实指向同一个趋势:AI 基础设施正在从“算力堆叠”走向“语义级互连”

过去我们定义一台机器,往往看 CPU 多强,内存多大,硬盘多快。后来进入 GPU 时代,我们开始看显存、NVLink、PCIe 代际、拓扑结构。现在,事情又往前走了一步。关键不是“有多少卡”,而是“这些卡是否像一个整体大脑那样协作”,以及“数据能不能像神经信号那样迅速、无歧义地流动”。

这也是为什么板级价值会越来越高。因为板子不再只是承载器件,而是实现这种协作语义的物理介质。更高速、更低损耗、更高层数、更复杂的布线,本质上是在为一种新的“数据可达性”买单。

可以用一个简单比喻来理解:

  • PCIe 世界像邮局,每次通信都是发件、运输、签收、回执。
  • RDMA 世界像专业物流网络,适合批量配送,但仍然是物流。
  • CXL 或 NVLink 世界更像把某些仓库直接挂进你家房间,让你伸手就能拿。

这三种模型的差异,不只是快慢,而是系统哲学不同。邮局适合事务,物流适合搬运,房间适合思考。AI 服务器真正需要的,是把尽可能多的关键路径从“事务”升级为“思考”。

一个更深的观察:现代 AI 的瓶颈不是“计算密度”,而是“认知摩擦”

所谓认知摩擦,就是系统为了拿到数据、确认状态、完成同步、维护一致性所付出的额外步骤。步骤越多,摩擦越大。摩擦大了,算力就像在沙地上奔跑,越强越累。

而 cache coherency 的意义,恰恰是减少这种摩擦。它让硬件和软件对“谁持有最新数据”“这段数据能否直接访问”“访问后要不要再确认”达成统一语义。没有这个语义,系统只能靠人为编排补洞,像一支没有统一战术的队伍,人数再多也难以形成战斗力。

所以,CXL、NVLink、甚至更广义的板级设计,并不是孤立的工程细节,它们共同回答的是同一个问题:如何让一个庞大系统中的不同部件,像一个真正协同的认知体那样工作?


四、一个新的判断框架:衡量系统,不看“算力峰值”,先看“数据是否原生可达”

如果你在做硬件选型、系统设计,甚至投资判断,有一个新的框架值得采用:先看数据可达性,再看计算能力

这个框架可以拆成四个问题:

  1. 数据离计算有多远? 是本地寄存器、本地内存、卡间共享,还是跨主机远端访问?距离越远,语义越复杂。

  2. 访问是否原生? 是需要 WQE、doorbell、CQE 这样的显式协议,还是一个 Load/Store 就能完成?越原生,软件越简单,延迟越低。

  3. 一致性边界在哪里? 是仅主机内部 CPU 与 device 的 coherency,还是要求跨节点共享可见性?边界越明确,系统越容易设计。

  4. 物理层是否匹配语义层? 高速互连如果被低等级 PCB、损耗过大的材料、过长的路径拖累,再先进的协议也会被现实打回原形。

这个框架的价值在于,它会迫使我们把注意力从“参数”转向“路径”。很多系统之所以贵,不是因为芯片本身,而是因为要把数据沿着一条足够短、足够一致、足够可预期的路径送到它该去的地方。

例子:训练和推理为什么会越来越依赖互连

训练任务中,参数同步、梯度聚合、激活交换都高度依赖网络和互连。推理任务里,KV cache、专家路由、分层存储、显存溢出,也越来越像一个数据调度问题。看似是算法问题,落到工程上,往往是互连问题。

当模型变大到一定程度,性能不再由某颗芯片单独决定,而由系统里最慢、最乱、最不自然的那条数据路径决定。于是,一块 PCB 的材料、一个互连协议的语义、一个 coherency 边界的定义,都可能比一张芯片参数表更关键。


Key Takeaways

  1. 不要只看算力峰值,要先看数据路径。 计算能力只有在数据能够被低摩擦访问时才真正兑现。

  2. 区分“搬运模型”和“访问模型”。 RDMA 解决的是高效搬运,CXL 和 NVLink 试图把远端访问变成原生 Load/Store,这两者的系统哲学不同。

  3. cache coherency 不是细节,而是语义基础。 没有 coherency,CPU 和 device 之间就会充满额外同步成本,性能会被协议开销吞掉。

  4. 板级设计已经是系统竞争力的一部分。 高速 PCB、低损耗材料、层数和布线不是“配套工程”,而是在定义数据能否流动得足够顺畅。

  5. 用“认知摩擦”评估系统。 问问自己:完成一次数据访问,需要多少显式步骤,多少协议动作,多少同步成本。步骤越少,系统越接近自然。


结语:未来最强的机器,不是最能算的机器,而是最像一个整体的机器

我们习惯把 AI 的进步想成芯片越来越强,模型越来越大,参数越来越多。但更本质的变化,也许是另一个方向:机器正在从一堆会算的零件,变成一个会流动的整体

当数据可以像本地变量一样被访问,当 device 不再像外部附件而像认知的一部分,当板级、电气、协议和软件语义开始对齐,算力才真正变成系统能力。

所以,未来的竞争不只是“谁造出更强的 GPU”,而是谁更早理解一个简单却深刻的事实:智能不是把更多算力塞进机器,而是让信息在机器内部以更自然的方式发生。

而一旦你这样看待 AI 服务器,你会发现真正昂贵的,从来不是那颗发光的芯片,而是让它们彼此理解、彼此可达、彼此协同的整套神经系统。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣