为什么 AI 集群的胜负,不再只取决于算力,而取决于它如何传递“下一跳”

Kevin Di

Hatched by Kevin Di

May 31, 2026

1 min read

82%

0

一台机器再快,也可能被“通信”拖成普通电脑

如果一台 GPU 的峰值算力翻了十倍,但训练速度只快了两倍,问题通常不在算力,而在数据怎么流动。这听起来反直觉,因为我们习惯把 AI 进步理解成更大的模型、更强的卡、更猛的芯片。可在多机多卡时代,真正决定系统上限的,往往不是单点算力,而是通信路径的设计

这就是为什么 RDMA 会成为 AI 基础设施里最关键却最容易被低估的技术之一。它绕过操作系统内核,让一台主机可以直接访问另一台主机的内存。这个动作看起来像是“少走几层软件”,但本质上是把网络从“搬运工”变成了“血管”。当数据不再需要经过冗长的协议栈、上下文切换和内核调度,端到端时延就可能从 50 微秒降到 5 微秒,甚至 2 微秒。

这不是小优化,而是系统级改写。因为在分布式训练中,每一次梯度同步、参数交换、KV 传递、AllReduce,都在和通信时延较劲。你看到的是训练曲线,背后其实是网络架构在替模型“争呼吸时间”。

在 AI 集群里,算力不是唯一的速度,通信才是决定“群体智能”能否真正形成的隐形门槛。


真正的分水岭,不是“快不快”,而是“谁来决定路怎么走”

RDMA 让延迟变小,但不同实现方式体现的其实是两种完全不同的网络哲学。一个是 InfiniBand,另一个是 RoCEv2。前者更像一套自成体系的专用高速铁路,后者更像在现有以太网之上改造出一条高铁专线。

如果只从“能不能跑 RDMA”来理解它们,就太浅了。更深层的区别在于:谁负责控制复杂性

InfiniBand 的关键特征之一,是交换机上不运行传统路由协议。整张网络的转发表由集中式的 Subnet Manager 统一计算和下发,它还负责 Partition、QoS 等全局配置。也就是说,网络不是让每台交换机各自“临场发挥”,而是由一个全局控制面先算好路径,再把规则发下去。再加上其 Adaptive Routing 具备逐包动态路由能力,在大规模组网里可以更好地利用带宽,减少拥塞与热点。

RoCEv2 则不同。它建立在以太网生态上,兼容性更强,成本也更低,适合更多通用环境。但它要在交换机上精细处理 Headroom、PFC、ECN 等参数,配置复杂度高得多。你可以把它理解为:你继承了一座成熟城市的道路系统,但要在繁忙交通中临时开通极速车道。能用,但对调度、路权和拥塞控制的要求更高。

这就引出一个核心判断:

AI 网络竞争的真正焦点,不是谁的端口更大,而是谁更擅长把“复杂性”集中管理,或者把“复杂性”分布化。

InfiniBand 倾向于集中式的系统化控制,换来更强的确定性和更高的极限性能。RoCEv2 倾向于借力通用以太网生态,换来更低的部署门槛和更广的适用面。两者的分歧,本质上是性能极限与生态弹性之间的取舍。


这场竞争的本质,是“专用高速公路”还是“城市道路改造”

很多人把 InfiniBand 和 RoCEv2 看成两种网卡或交换机方案,其实它们代表的是两种基础设施逻辑。

1. 专用高速公路模型

InfiniBand 像一条为 AI 和 HPC 量身打造的高速公路。车道规则、收费站、调度中心、应急机制,全都围绕一个目标优化:把集群内部通信做得极快且稳定。它的代价也很明确,需要专用线缆、光模块、交换设备,以及相对封闭的生态。

这解释了为什么在万卡级 GPU 集群里,InfiniBand 会频繁出现在头部案例中。规模越大,越容易遭遇拥塞放大、尾延迟抖动和热点集中。此时,网络已经不是配角,而是训练效率的主角之一。此时需要的不是“能跑”,而是“在极限状态下也能保持可预期”。

2. 城市道路改造模型

RoCEv2 则像在既有城市路网中开辟一条高性能走廊。它的优势是更容易接入现有以太网环境,设备选择更多,价格也更友好。对很多企业来说,这意味着更低的起步成本,更少的组织摩擦,以及更强的和现有 IT 体系融合的能力。

但代价是,城市道路不是为高速交通生长出来的。你必须处理车流冲突、路口优先级、拥塞回压和参数配平。Headroom、PFC、ECN 这些词听起来像工程细节,实际上是系统边界条件。它们决定了这条“改造过的高速路”会不会在高峰期变成堵车现场。

这正是 AI 网络里最容易被误解的一点:真正困难的不是把一条链路跑通,而是在极端规模下仍然维持链路的集体行为。单卡性能是局部问题,多卡协同才是系统问题。


为什么“下一跳”比“更快的芯片”更值得关注

Hot Chips 上那句看似轻描淡写的话,其实点中了整个行业的一个方向:事情早就想明白了,这才是正路。

所谓“正路”,并不是某个厂商赢了,也不是某种协议天然高贵,而是 AI 处理器互联正在发生一次思想转向:从片上互联思维,转向集群互联思维。过去,芯片设计强调怎么在一颗芯片内部把数据搬得更快。现在,随着模型和数据规模膨胀,真正决定体验的常常是:下一块芯片、下一台服务器、下一层交换机之间,能不能以足够低的摩擦传递信息。

这就是“下一跳”的意义。

在一个 GPU 集群里,很多性能损失并不来自绝对距离,而来自“每多跨一步,就多一点不确定性”。内核协议栈是一步,复杂拥塞控制是一步,路由收敛是一步,缓存和队列里的排队又是一步。每一步单看似乎不大,但叠加起来,就会把一个本来可以在微秒级完成的动作拖成训练瓶颈。

因此,优秀的 AI 网络架构不是一味追求“更大的带宽数字”,而是追求更少的协议摩擦、更短的排队链、更可预测的路径。如果说芯片是发动机,那么 RDMA 网络就是变速箱。发动机马力再大,变速箱效率差,车也快不起来。


一个新的判断框架:AI 基础设施的三层速度

要真正看懂 AI 集群网络,不妨用一个更有用的框架来替代“谁更快”的粗糙比较。我建议把速度分成三层:

1. 计算速度

这是芯片 FLOPS、Tensor Core、矩阵乘法效率。它决定理论上限,但通常不是系统上限。

2. 传输速度

这是 RDMA、交换机带宽、链路速率、网络拓扑。它决定数据能不能快速到位。

3. 协调速度

这是最被忽视的一层。它包括路由控制、拥塞抑制、Qos 策略、集群调度,以及各类参数之间是否一致。一个网络即使带宽很高,如果协调速度差,仍然会在大规模场景里表现出随机抖动和性能塌缩。

很多组织在采购时只盯着第一层和第二层,却忽略第三层。结果是,纸面性能很漂亮,真实训练时却发现 GPU 利用率上不去,尾延迟拖慢整个 step,甚至集群越大越不稳定。

AI 集群的核心竞争力,不只是“快”,而是“快得可控”。

这也是为什么 InfiniBand 和 RoCEv2 的差异不能只看协议名词。前者把协调速度更多地内建进系统,后者把协调速度更多地留给部署者自己设计。前者像统一装修好的高性能剧场,后者像一套可以灵活改造的空壳厂房。不同组织的能力、预算和规模,决定了它们更适合哪一种。


你真正该问的问题,不是买哪种网,而是你准备承担哪种复杂性

如果把这个问题说透,会发现大多数争论都问错了。

很多人会问:InfiniBand 是否一定优于 RoCEv2?答案当然不是绝对的。更合理的问题是:在我的规模、预算、团队能力和增长路径下,哪一种复杂性更值得承担?

如果你正处于超大规模训练、极高通信密度、对尾延迟极其敏感的场景,专用、高确定性、全局控制的架构往往更有优势。因为一旦系统规模上去,最贵的不是设备单价,而是性能不稳定带来的时间损失和机会成本。

如果你处于多业务并行、预算受限、需要与现有以太网体系共存的场景,RoCEv2 可能更现实。它不一定在极限场景里最强,但它允许你以更低的组织成本切入高性能网络。

这里有一个非常实用的判断标准:

  1. 如果失败的代价是训练延误和资源浪费,优先考虑确定性。
  2. 如果失败的代价是初期投入过高和系统割裂,优先考虑兼容性。
  3. 如果规模会快速增长,优先考虑能否在未来扩展时仍保持稳定。

从这个角度看,网络不是一个“配件采购问题”,而是一个组织能力映射问题。你选择什么网络,其实是在选择你愿意把多少复杂性留给厂商,多少复杂性留给自己。


Key Takeaways

  1. AI 集群的性能瓶颈常常不在算力,而在通信。 多机多卡时代,微秒级时延差异会被训练步骤放大成显著的效率差距。

  2. InfiniBand 和 RoCEv2 的核心差异,是复杂性如何被管理。 前者更集中控制,后者更依赖以太网生态和部署调优。

  3. 不要只看带宽数字,要看协调速度。 路由、拥塞控制、Qos、PFC、ECN 这些机制决定了系统在大规模下是否稳定。

  4. 选择网络架构,本质上是在选择组织能力边界。 你是在买一套系统,还是买一套自己必须维护的复杂性。

  5. 真正值得优化的是“快得可控”。 低延迟只是起点,稳定、可预测、可扩展,才是 AI 基础设施的终局指标。


结语:AI 时代最贵的,不是算力,而是每一次不必要的“绕路”

我们过去总以为技术进步意味着更快的芯片、更大的模型、更高的峰值。可在真正的大规模 AI 系统里,决定胜负的往往不是单点性能,而是信息能否以最少的摩擦在系统中穿行。

从这个意义上说,RDMA 的价值不仅是“快”,而是它让我们重新理解了基础设施的本质:系统不是由最强的节点定义的,而是由最短、最稳定、最少绕行的路径定义的。当一台机器能直接访问另一台机器的内存时,改变的不只是延迟数字,而是整个集群对时间的使用方式。

所以,未来 AI 基础设施的竞争,不会只是“谁的卡更强”。它会越来越像一场关于下一跳的竞赛。谁能让数据更少等待,谁能让路径更少摇摆,谁能把复杂性收束得更优雅,谁就更接近真正的系统优势。

换句话说,AI 时代最稀缺的能力,也许不是制造算力,而是消灭绕路。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣
为什么 AI 集群的胜负,不再只取决于算力,而取决于它如何传递“下一跳” | Glasp