AI集群真正的瓶颈,不是带宽,而是你选择了哪种“空间组织方式”
Hatched by Kevin Di
May 27, 2026
1 min read
6 views
84%
当 5 微秒和 2 微秒的差距,决定的不只是性能
很多人谈 AI 集群,第一反应是带宽:400G 够不够,800G 会不会更好,交换机是不是越快越强。可真正值得追问的,也许不是“每条链路有多快”,而是一个更尖锐的问题:你的计算系统到底是按什么空间逻辑组织起来的?
这件事听起来有点抽象,但它会直接决定你是把几十万张 GPU 组成一台“协同机器”,还是把它们堆成一片“互相等待的高速停车场”。当端到端时延从 50 微秒降到 5 微秒,甚至 2 微秒,变化的不是一个数字,而是整个系统的可设计边界。因为一旦通信足够快,系统架构的核心矛盾就从“能不能连上”转向“应该怎么连”。
这正是 AI 基础设施最容易被误判的地方。很多争论表面上在讨论网络协议,实质上是在讨论一种更深层的秩序:集群是中心化管理更重要,还是拓扑本身更重要;是追求通用性,还是追求空间约束下的最优协同。RDMA、InfiniBand、RoCEv2、FatTree、Torus、Mesh、DragonFly,这些名字背后,其实是不同的世界观。
AI 集群的竞争,表面上是网卡和交换机的竞争,深层上是“如何把算力摆放在空间里”的竞争。
一、RDMA 解决的不是“更快的网络”,而是“更少的系统摩擦”
如果把传统 TCP/IP 网络想成一个快递系统,那么每一次数据交换,都要先经过“仓库管理中心”盖章,再经过分拣,再装车,再发货。这个过程非常稳妥,也非常通用,但它的代价是多次中转、多次检查、多次协议处理。对于大多数业务,这点摩擦可以接受;但对多机多卡训练来说,摩擦本身就可能成为主成本。
RDMA 的关键价值,不只是快,而是绕过内核协议栈,直接访问对方主机内存。这意味着通信不再是一个层层搬运的物流链条,而更像是两个仓库之间建立了一条直通传送带。于是,应用层端到端时延可以从几十微秒压缩到个位数微秒。对人类来说,这些数字都很小;对大规模训练系统来说,它们决定的是 GPU 是否在等数据,而不是在算数据。
这里有一个常被忽略的事实:当通信足够快,拓扑就变成了计算的一部分。过去,网络只是计算的附属设施,负责“把包送到”;而在训练集群里,网络实际上参与了“决定谁先算、谁后等、谁和谁协同”的过程。换句话说,网络不再只是管道,它已经是机器的一部分。
这就是为什么同样叫 RDMA,InfiniBand 和 RoCEv2 的意义并不止于“都快”。它们代表的是两种不同的集群治理方式。一种更像专用高速公路,一种更像在通用道路上做极限优化。前者强调极致一致性和可预测性,后者强调兼容性与成本效率。你选择哪一种,实际上是在选择未来整个集群的运营哲学。
二、真正的分水岭,不在协议,而在“谁来决定网络如何流动”
如果只看协议名字,很容易误以为网络架构之争主要是技术指标之争。实际上,差异更深的地方在于:网络的转发逻辑是分布式自治,还是集中式编排。
InfiniBand 的一个核心特征,是交换机上不运行传统路由协议,转发表由集中式的 Subnet Manager 统一计算和下发,同时还负责 Partition、QoS 等配置。这个设计带来的好处是,网络像一个被统一编排的乐队,所有交换机都按照同一乐谱演奏。结果就是可预测、低抖动、适合超大规模 GPU 集群。它的 Adaptive Routing 还是逐包动态路由,说明它并不是死板的静态连线,而是在统一规则下追求最优利用率。
RoCEv2 则更像把高速 RDMA 能力嵌入到更通用的以太网世界里。它的优势是便宜、通用、兼容性强,但要靠 PFC、ECN、Headroom 等一系列参数维持秩序。这里的难点不是“能不能跑”,而是“能不能长期稳定地跑”。当规模上升到万卡级别,参数调优的复杂度会急剧放大,网络也更容易出现局部拥塞、尾延迟波动和吞吐损失。
这背后其实是一个经典的系统问题:中心化控制降低了局部自由度,但提高了全局协调能力;分布式通用性提升了弹性,但也增加了协调成本。在小规模时,这种差异不明显,因为任何一种方案都能用。可一旦系统进入极端规模,架构风格本身就开始决定上限。
可以把它想成交通系统。RoCEv2 像在城市普通道路上推行智能交通信号灯,理论上很好,成本也低,但一旦车流量暴涨,就必须依赖大量局部调参。InfiniBand 更像专门为超大车流设计的立体快速路,建设成本更高,但它从一开始就是按“高密度协同”来设计的。问题不是哪个绝对更先进,而是你愿意为哪种秩序付费。
三、ScaleUp 拓扑之争,本质上是在回答:算力应该如何占据空间
如果说 RDMA 解决的是“通信为什么能快”,那么拓扑解决的就是“通信该怎么组织”。这里的真正分野,不是某个品牌,而是几种非常不同的空间几何学。
1:1 收敛的 FatTree,像是一座严格分层、对称均衡的城市,每个节点都尽量拥有等价的上行能力。它的优点很直观,路径清晰,整体易于管理,适合大规模训练中较强的全局均衡需求。NVIDIA、Intel Gaudi3、AMD MI300X、华为 910B 等都倾向于这种模式,说明在当前高性能训练生态里,均衡性仍然是最稳妥的默认答案。
Torus Ring、2D Mesh、DragonFly 则是另一类思路。它们不再追求每个点都像在一个完美对称的金字塔里,而是通过空间邻近性和局部连接,把通信成本压缩在更符合物理现实的布局里。Torus Ring 更像环形城市,邻居之间高度紧密;2D Mesh 更像棋盘,局部协同强,但远距离通信需要更精细的路径规划;DragonFly 则像一个由多个高密度社区组成的超大交通网,强调组团之间的高效互联。
这说明一个很重要的事实:拓扑不是工程细节,而是工作负载的空间隐喻。如果你的工作负载更依赖全局同步,例如大规模 all reduce,FatTree 的均衡结构会显得更自然。如果你的系统更强调局部通信、分组协作或分层调度,那么更贴近“局部优先”的拓扑可能更有生命力。
NVIDIA 目前仍以 1:1 收敛的 FatTree 为主,而后续会演进到 DragonFly,这个信号很值得重视。它意味着行业正在从“如何把所有节点尽量平等地连起来”,转向“如何在更复杂的空间组织中实现更高效的协同”。这不是简单的升级,而是一种范式迁移:从平面均衡,走向结构分层;从连通性优先,走向流量形态优先。
四、真正的竞争力,不是买更贵的设备,而是找到系统与拓扑的匹配点
很多基础设施选型失败,不是因为产品不够先进,而是因为把“性能指标”当成了“系统答案”。高带宽、低时延、强一致性,这些当然重要,但它们只是在回答局部问题。真正决定成败的,是你的负载形态、规模阶段、运维能力和组织目标,是否和拓扑风格匹配。
一个简单的判断框架是:先看负载,再看规模,最后看治理成本。
- 如果你的瓶颈主要在短消息同步,训练任务极度依赖稳定低时延,且规模已经上到很大,那么专用网络和强编排拓扑更有吸引力。
- 如果你需要更强的生态兼容性,预算更敏感,同时团队具备较强的网络调优能力,RoCEv2 可能更现实。
- 如果你做的是超大规模训练平台,未来还要面对更复杂的分层并行策略,那么拓扑扩展性和全局调度能力,可能比单点链路速度更重要。
选网络,本质上不是选“最快的连接方式”,而是选“哪种复杂性更适合被你管理”。
这句话非常关键。因为任何高性能网络都会把复杂性从一个地方转移到另一个地方。InfiniBand 把复杂性更多放在专用体系和集中编排上,换来高性能和可预测性。RoCEv2 把复杂性更多留在以太网生态和参数调优上,换来通用性和成本优势。FatTree 把复杂性隐藏在均衡结构里,DragonFly 和 Mesh 则把复杂性显式地暴露给拓扑设计和流量管理。
因此,真正高明的架构决策,不是追求“绝对先进”,而是寻找“复杂性可控”的位置。对于一个组织而言,最昂贵的往往不是设备采购,而是长期运营中的不确定性。一个在实验室里只慢 3 微秒的方案,可能在生产中因为调优难、抖动大、扩容复杂而变成成本黑洞。
Key Takeaways
-
不要只看带宽,先看通信是否参与了计算本身。 在大规模训练里,网络不是辅助设施,而是系统的一部分。时延的微小变化,会放大为训练效率和资源利用率的巨大差异。
-
协议之争的本质,是治理方式之争。 InfiniBand 更偏向集中式编排和高可预测性,RoCEv2 更偏向通用网络上的优化。前者降低运行的不确定性,后者降低部署门槛。
-
拓扑不是布线图,而是空间策略。 FatTree、Torus、Mesh、DragonFly 代表的是不同的通信几何学。它们决定了系统如何分摊拥塞、如何扩展、如何组织协同。
-
先匹配负载,再选择网络。 如果工作负载依赖强同步、低抖动、超大规模扩展,优先考虑专用和强编排方案。如果更重视生态兼容与成本,可优先考虑以太网 RDMA 路线。
-
把复杂性放在你能管理的地方。 最好的架构,不一定是指标最漂亮的架构,而是长期运维中最可控、最少出故障的架构。
结语:AI 基础设施的终局,不是更快的线,而是更聪明的空间
我们习惯把技术进步理解成“速度越来越快”。但在 AI 集群里,更深的变化其实是:系统开始像空间结构一样被思考。哪些节点该互为邻居,哪些流量该优先直达,哪些协调应当集中,哪些摩擦必须消除,这些问题共同决定了一个集群的上限。
所以,未来真正拉开差距的,不只是你买了什么网卡、什么交换机,而是你是否意识到:算力集群不是把机器连起来就结束了,它是在设计一种新的几何秩序。谁能更好地组织这种秩序,谁就不仅拥有更快的网络,也拥有更高的系统文明。
当你下一次看到“400G”“800G”“万卡集群”这些词时,不妨先别急着问“有多快”,而是先问一句更重要的话:这套系统打算用什么空间逻辑,让这些算力真正协同起来?
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣