真正稀缺的不是 GPU,而是可持续的有效算力

Kevin Di

Hatched by Kevin Di

Aug 07, 2026

2 min read

94%

0

一台人工智能服务器最昂贵的部分,未必是你以为的 GPU。更反常的是,决定数千张 GPU 能否真正持续工作的,也未必是单张 GPU 的峰值算力,而是那些负责承载、连接、供电、传输和故障隔离的部件。

这揭示了人工智能基础设施中的一个关键转变:算力正在从一种芯片属性,变成一种系统属性。 GPU 负责计算,但只有当数据能够准时抵达、结果能够快速交换、故障能够迅速被隔离时,计算才真正发生。

因此,理解 AI 集群,不能只问“用了多少块 GPU”,还要问三个更底层的问题:这些 GPU 如何被组织在一起?它们之间如何交换信息?当某一部分出错时,整个系统要停多久?

一块电路板,为什么值得几千元

在一台高端 AI 服务器中,PCB 并不是简单的“连接线集合”。它更像一座城市的交通、供电和通信基础设施。芯片是工厂,数据是原材料,而 PCB 则决定了原材料能否以足够高的速度,在足够短的距离内,被送到正确的工厂。

以一台采用 A100 GPU 的服务器为例,GPU 载板、NVSwitch、GPU 加速卡和 GPU 模组板合计使用约 0.624 平方米的 PCB,对应单机 PCB 价值量约为 12250 元。其中,载板价值约 6370 元,占比超过一半,其他 PCB 产品价值约 5880 元。

单独看,这些数字似乎只是产业链报价。但如果把它们放回系统结构中,意义就完全不同了。高性能 AI 服务器对电路板提出了多重要求:层数更高,信号完整性更严格,材料损耗更低,电源分配更稳定,布局还必须容纳高密度器件与复杂互联。

GPU 模组板,也就是承载整个 GPU 平台的 UBB,就是一个典型例子。一台服务器通常对应一块 UBB,面积约为 0.30 平方米,需要使用 26 层通孔 PCB,并采用 Ultra Low Loss 材料,单机价值量约为 3000 元。

这里最值得注意的不是“26 层”这个数字本身,而是它背后的逻辑:当计算密度提高到一定程度,物理连接就不再是被动配件,而会成为系统性能的一部分。

如果信号在高速传输过程中衰减过大,数据就需要重传。如果供电路径不稳定,GPU 就不能长期维持高负载。如果板上的布线无法支持足够多的并行通道,芯片的理论带宽就只能停留在规格表上。

这和修建高速公路很相似。城市拥有再多工厂,如果道路狭窄、交叉口拥堵、桥梁经常维修,工业产出仍然上不去。AI 集群中的 PCB、交换芯片和互联网络,承担的正是这套道路系统的功能。

芯片决定一辆车能跑多快,互联基础设施决定一座城市能否让所有车同时抵达。

训练大型模型,为什么通信会变成计算问题

大型模型训练不是让一块 GPU 独自完成一项任务,而是把一个巨大任务切分给大量 GPU。每块 GPU 计算一部分参数或样本,然后周期性地交换中间结果,更新彼此的状态。

这类交换通常通过集合通信完成。例如,在数据并行训练中,不同 GPU 可能需要执行全规约,把各自计算出的梯度汇总,再将结果同步给所有参与者。GPU 数量越多,单次计算越快,但同步的复杂度和压力也会随之上升。

于是出现一个容易被忽视的悖论:增加 GPU 可能提高峰值算力,却不一定提高有效训练速度。

假设一台机器拥有 8 张 GPU。每张 GPU 计算一个批次只需要很短时间,但如果 GPU 必须等待其他 GPU 的结果,整个训练步骤的完成时间就取决于最慢的那一张卡、最拥堵的链路,或者最迟到达的一组数据。

在大规模训练中,这种等待会反复出现。单次等待或许只有几毫秒,但训练可能包含数百万甚至更多次迭代。最终,系统损失的不是某个局部操作的速度,而是大量昂贵 GPU 的空闲时间。

对于 decoder only 类型的大语言模型,训练所需资源可以根据参数量和 token 数量进行估算。每个 token 的前向计算量大约是参数量的两倍。这个公式说明,模型规模和数据规模会直接推动计算需求增长,但它也隐含了另一个事实:计算规模越大,通信、同步和故障恢复带来的系统性损耗越不能被忽略。

如果把训练看成一条生产线,GPU 是加工机器,集合通信就是机器之间交换半成品的环节。生产线上的机器越多,产能未必越高,因为物料调度、质量检查和异常处理也会变得更加复杂。

这正是硬件设计与通信软件发生深度交汇的地方。高价值 PCB 让高速信号能够稳定到达,网络调度则决定这些信号何时通过、以何种路径通过,以及出现异常时如何处理。前者解决“能不能传”,后者解决“怎样更好地传”。

真正昂贵的不是故障,而是故障后的沉默

传统服务器运维往往把故障看成一个离散事件:某块网卡坏了,某台机器掉线,某个任务失败。大规模 AI 训练中的问题更复杂,因为一个局部故障可能让整个分布式任务陷入等待。

集合通信具有两个非常特殊的特征。第一,它具有周期性。训练步骤不断重复,每一轮都可能按照相似的顺序交换数据。第二,它具有同质性。参与通信的 GPU 通常执行高度相似的操作,流量模式相对稳定。

这两个特征带来了一个重要推论:在一个高度规律的通信系统中,异常本身就携带诊断信息。

如果某个通信步骤本应由所有 GPU 同时完成,但某一条链路反复延迟,或者某个设备始终没有按时回应,那么问题很可能不是随机的软件波动,而是某个硬件组件、连接路径或网络状态发生了异常。

基于这种规律,可以设计由通信驱动的故障检测与流量管理机制。其核心不是等待传统监控系统慢慢报告,而是直接观察集合通信的节奏:谁没有按时到达,哪一段路径出现反常,异常是否在多个训练周期中重复出现。

这样的系统可以快速定位故障组件,隔离异常,并重新启动受影响的任务。它还可以利用集合通信中“少量大流量”的可预测模式进行流量规划,从而减少拥塞。

这是一种思维上的变化:通信不再只是被监控的对象,而成为监控系统本身。

可以把它类比为人体的神经系统。身体不需要等到器官完全停止工作,才知道某处出现问题。神经信号的延迟、反射节奏和左右对称性,本身就能帮助系统识别异常。大规模 AI 集群也可以通过通信的周期性和一致性,建立自己的“反射弧”。

实践结果说明,这种方法不是理论上的优化。通过快速识别和隔离异常,错误造成的开销可以减少约 30%,在一些通信成本适中的运行场景中,运行时性能可以提升约 15%。这两个数字的价值,不只是节省了几分钟训练时间,而是说明了一个关键事实:可靠性机制本身能够转化为算力。

从“买 GPU”转向“设计有效算力”

许多企业仍然用 GPU 数量来衡量 AI 基础设施规模。这种指标简单、直观,却越来越不够用。更有意义的指标应该是有效算力,也就是在真实训练任务中,GPU 有多少时间处于有用计算状态。

可以用一个简化公式来理解:

有效算力 = 理论算力 × 通信效率 × 系统可用率 × 任务利用率。

理论算力由 GPU 决定,但后三项分别受到互联设计、故障处理和软件调度影响。哪怕 GPU 的理论性能不变,只要通信效率提升,故障恢复时间缩短,任务等待减少,最终完成训练所需的时间就会下降。

这个公式还解释了为什么 PCB 的价值会随着 AI 集群发展而提高。PCB 不是孤立地增加成本,而是在支撑后三个乘数。更低损耗的材料帮助提高通信效率,更高层数的板件支持更密集的互联,更稳定的供电设计降低系统在长时间高负载下的不确定性。

同样,通信优化也不是简单地把网络变快。它更像是在提高系统的确定性。对于一个需要运行数周的训练任务来说,能够提前发现异常、准确定位故障并缩小重启范围,往往比单条链路增加几个百分点的峰值带宽更有价值。

这里可以提出一个“瓶颈迁移”模型:

  1. 在早期阶段,瓶颈通常是计算能力不足。
  2. 当 GPU 数量增加后,瓶颈迁移到内存和互联带宽。
  3. 当集群规模继续扩大,瓶颈又迁移到同步、拥塞和故障恢复。
  4. 当系统高度复杂时,最大的损失可能来自不可预测性,而不是单点性能不足。

因此,AI 基础设施的竞争并不只是芯片竞争,而是对瓶颈迁移速度的竞争。谁能更早识别下一个瓶颈,谁就能避免把大量资本投入到已经不再是主要限制因素的地方。

真正稀缺的不是算力,而是可持续、可预测、可恢复的算力。

把系统当作一个闭环,而不是零件清单

如果把 AI 服务器拆成 GPU、PCB、交换芯片、网络和软件,容易得到一份采购清单,却很难理解性能从何而来。更准确的方式,是把它看成一个闭环系统。

第一层是物理承载。载板和 UBB 决定器件如何连接,信号和电力如何在高密度环境中传输。第二层是数据交换。NVSwitch 和网络负责让大量 GPU 以尽可能低的延迟交换信息。第三层是运行时控制。调度和通信软件负责安排流量、识别异常、恢复任务。第四层是经济结果。前三层共同决定每块 GPU 每小时能够产出多少有效训练进度。

这四层之间不是简单的串联关系,而是相互放大的关系。硬件互联越稳定,软件越容易建立可预测的通信模型。通信模型越稳定,故障检测越准确。故障处理越及时,集群越敢于扩大规模。规模扩大后,对板材、连接和调度的要求又进一步提高。

这也是为什么看似分属不同产业环节的两个问题,实际上属于同一个问题:如何让大规模计算保持秩序。

对企业而言,这种视角可以转化为几个非常具体的决策。采购服务器时,不应只比较 GPU 型号和数量,还要比较板级互联、交换结构、材料等级、网络拓扑和故障恢复能力。评估训练平台时,不应只看峰值吞吐,还要看任务失败后的平均恢复时间、通信等待比例和长期运行的利用率。

对工程团队而言,最重要的改进也许不是再增加一层监控,而是让通信本身暴露更多可诊断信号。一个越规律的训练系统,越应该被设计成可观测的系统。周期、延迟、流量、响应顺序和重传行为,都可以成为故障判断的依据。

Key Takeaways

  1. 用有效算力替代 GPU 数量。 评估 AI 集群时,同时测量通信效率、GPU 空闲时间、任务利用率和故障恢复时间。
  2. 把 PCB 和互联视为性能部件。 高层数、低损耗材料和稳定供电并非单纯增加成本,它们直接影响高速通信的可靠性与持续性。
  3. 让通信成为故障检测器。 利用集合通信的周期性和同质性,建立基于延迟、响应顺序和流量模式的异常识别机制。
  4. 优先减少全局等待。 在大规模训练中,降低一次任务失败后的重启范围,往往比追求局部峰值带宽更能改善整体效率。
  5. 提前寻找下一个瓶颈。 GPU、内存、互联、拥塞和恢复机制会依次成为限制因素,基础设施规划必须随着规模变化不断迁移重点。

AI 时代最容易产生的误判,是把计算能力想象成芯片的个人能力。事实上,当模型规模和集群规模不断扩大,算力越来越像一种集体行为。它依赖无数信号在电路板上准时通过,依赖网络中的数据按照节奏汇聚,也依赖系统在某个部件失灵时迅速做出判断。

一块价值几千元的多层 PCB,和一套能够减少故障开销的通信机制,表面上一个属于硬件,一个属于软件。它们真正共同解决的,却是同一个难题:让成千上万次局部动作协调成一次稳定的全局计算。

所以,下一次有人问一座 AI 数据中心拥有多少算力时,更好的追问也许是:这些算力有多少能够持续工作,有多少能够彼此协同,又有多少能够在故障发生后被及时找回?

未来最强的 AI 系统,不一定是拥有最多 GPU 的系统,而是最能把物理连接、通信秩序和故障恢复组织成一个整体的系统。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣