真正的算力护城河,不是更多 GPU,而是更像 Kubernetes 的集群抽象

Kevin Di

Hatched by Kevin Di

Jul 13, 2026

1 min read

86%

0

当 10 万卡集群撞上现实:瓶颈从算力,滑向组织方式

如果你今天拥有 10 万块 H100,最先把你卡住的,往往不是模型,而是系统如何被组织起来。电力、光模块、交换机、故障恢复、拓扑、并行策略,这些词表面上像基础设施细节,实际上决定了一件更根本的事:你的算力是不是能够被持续地、可预测地、低损耗地调用。

这就是超大规模 AI 基础设施最反直觉的地方。我们常以为“更强的 GPU 就意味着更快的训练”,但当规模上升到十万卡,真正稀缺的不是单卡性能,而是把分散资源编排成一个稳定计算体的能力。换句话说,AI 竞赛表面上在比芯片,底层却越来越像在比调度系统、网络抽象和故障治理。

这也解释了为什么 OpenStack 和 Kubernetes 这类基础设施抽象会重新变得重要。它们不是“额外一层软件”,而是把复杂资源变成可预测服务的方式。对于 AI 集群来说,问题从来不只是“有没有 GPU”,而是“GPU 是否能像一个统一系统那样被调用”。

当资源规模足够大时,性能优势会被组织成本吞没;真正的壁垒不再是拥有算力,而是让算力保持可用、可扩展、可恢复


第一性原理:集群的敌人,不是缺少芯片,而是复杂度外溢

十万卡级别的 AI 集群里,一个惊人的事实是,GPU 本身的功耗只是故事的一部分。真正吞噬系统能力的,是 GPU 周边的一整套配套:CPU、NIC、PSU、交换机、光模块、存储节点,以及这些东西之间无处不在的通信开销。于是,计算问题迅速变成了供电问题、散热问题、布线问题、故障恢复问题

这意味着什么?意味着“算力”不是一个纯粹的芯片属性,而是一个系统属性。一个 700W 的 GPU,如果要靠一整台服务器来喂养,再叠加网络、机架、互连和机房约束,它就不再是“700W 的事情”,而是一个需要电厂级别、园区级别、运维级别共同参与的复杂系统。

更重要的是,网络架构会决定集群的真实边界。张量并行需要极低延迟,流水线并行要求稳定吞吐,数据并行更适合跨岛互联。于是同一批 GPU 在逻辑上要同时扮演不同角色,它们像是一个乐队里既要独奏、又要合奏、还要轮换位置的演奏者。单从芯片看,这些角色都在“算”;但从系统看,它们是在不同网络层中受制于不同的物理约束。

这正是超大规模 AI 训练和传统 HPC 的分野。传统超级计算机更像一台巨大的机器,而超大规模 AI 集群更像一个由多个计算岛组成的城市。城市里最重要的不是每栋楼多高,而是道路、供电、消防、物流和容错是否足够成熟。


最关键的转折:AI 集群正在从“单体加速器”走向“云原生编排”

真正值得注意的,不是某个交换机更快,或者某种光模块更便宜,而是整个行业正在悄悄转向一种新的组织逻辑:把 GPU 集群当成可编排的云原生资源池,而不是一台超大号机器

这里的逻辑,和 Kubernetes 在 OpenStack 上运行几乎是同构的。OpenStack 提供的是资源抽象层,它把计算、存储、网络统一成可预测接口;Kubernetes 则在这个抽象之上实现更高层次的调度和弹性。对于 AI 集群来说,真正需要的也是这种分层:底层是电力和网络,中层是拓扑和容错,上层是训练任务编排。

如果没有这种分层,系统就会退化成“每个问题都在应用层解决”。比如网卡故障要写进训练代码,光模块坏了要重启整个作业,检查点频率一高就吞掉 MFU,跨岛通信要手工适配拓扑。表面上这是工程细节,实质上是基础设施没有被抽象好,复杂度被迫上浮到业务层

这也是为什么小规模团队容易被“快”迷惑。小集群里,手工处理、频繁 checkpoint、简单粗暴的网络配置都能跑通,因为复杂度还没爆炸。可一旦规模到达十万卡,过去那些“暂时先这样”的做法会突然变成主成本,甚至让训练时间损耗超过训练本身。

小规模时代的优秀工程实践,不一定能扩展成大规模时代的正确架构。真正的分水岭,在于你能否把复杂度压回基础设施层,而不是让它渗透进模型代码。


一个更深的视角:网络不是管道,而是模型的一部分

很多人讨论大模型训练时,把网络当作“把 GPU 连起来的管子”。这个比喻在小规模时还勉强成立,但在大规模时就完全失效了。因为网络不只是搬运数据,它还在定义并行方式的边界、拓扑感知的代价、失败恢复的粒度

可以把它理解为一个三层张力结构:

  1. 计算层决定单次矩阵运算的速度。
  2. 通信层决定这些矩阵如何在多个 GPU 之间被切分、同步和重组。
  3. 组织层决定一旦出错,系统是否能保持训练连续性。

当模型规模增大,通信层会反过来塑造计算层。比如张量并行依赖高带宽低延迟,数据并行则允许更粗粒度的同步,MoE 又会把 All to All 通信推到前台。于是,所谓“模型架构创新”实际上常常是在和网络拓扑谈判:你能不能承受这个通信图?你愿不愿意为这种稀疏路由支付更高的互连成本?

这也解释了为什么会出现“计算岛”这种设计。它不是单纯为了节约钱,而是为了让系统在局部保持高密度协作,在整体维持较低成本的跨岛同步。它很像一个连锁企业的门店网络:门店内部高度协同,门店之间只传递必要信息。你不可能让每个门店都像总部一样互联,因为那样会把整个组织拖进昂贵的通信泥潭。

而轨道优化、中间机架、铜缆替代光模块等设计,本质上都是在回答同一个问题:通信图能否被改写成更接近物理现实的形状。如果能,就能省下大量成本和能耗;如果不能,系统就会被光学器件、布线距离和故障概率吞掉。


真正被忽视的竞争力:不是峰值性能,而是故障的经济学

在十万卡集群里,故障不是异常,而是常态。光模块会坏,网卡会热,GPU 会出 ECC 错误,驱动会卡死,节点会宕机。规模越大,第一次故障发生得越快。于是问题变成:你如何让故障不演变成训练中断,不演变成数百 GPU 天的浪费

这时候,checkpointing 看起来像安全网,实际上却可能成为性能税。因为它把训练过程切成碎片,暂停、写盘、恢复、回读,每一层都在消耗 MFU。传统思路是在“损失较小”和“恢复较稳”之间折中,但在超大集群里,另一种更有效的思路是:把恢复能力做进系统本身,而不是事后补救

这就是内存重建、RDMA 复制、热备用节点的意义。它们不是附加功能,而是把训练当作一个连续流,把失败当作可以局部修复的系统事件。想象一下机场塔台的控制逻辑:飞机不能因为一条跑道故障就让全机场停摆,而是要能快速切换、重规划、继续流转。十万卡集群也一样,最昂贵的不是坏掉的硬件,而是因坏硬件导致的全局停顿。

这里有一个很重要的判断标准:容错能力是否在网络层实现,还是在应用层硬扛。如果故障需要模型代码来兜底,那么复杂度会指数式上升。如果故障可以通过基础设施自动重构,那么系统就能把失败吸收在局部,保住整体吞吐。

大规模系统里,可靠性不是为了少报错,而是为了让错误不变成组织成本。


一个统一框架:把 GPU 集群理解为“分层自治系统”

如果把这些看似分散的议题收束起来,会得到一个非常有用的框架:超大规模 AI 集群不是一块巨大的计算板,而是一个分层自治系统

可以这样看:

  • 物理层:电力、散热、机架、光模块、铜缆。
  • 互连层:NVLink、以太网、InfiniBand、拓扑设计。
  • 调度层:张量并行、流水线并行、数据并行、MoE 路由。
  • 可靠性层:热备、RDMA 复制、RAS、checkpoint 策略。
  • 平台层:OpenStack、Kubernetes 式资源抽象和生命周期管理。

这个框架最重要的启发是:每一层的目标函数都不一样。物理层优化的是成本和能效,互连层优化的是带宽和延迟,调度层优化的是 MFU,可靠性层优化的是连续性,平台层优化的是可管理性。失败往往发生在某一层的局部最优,破坏了整系统的全局最优。

因此,真正成熟的 AI 基础设施,不是把每层都拉到极致,而是让各层之间的接口足够清晰。比如,平台层应该屏蔽节点故障的细节,调度层应该知道拓扑感知的通信代价,可靠性层应该能在不打断作业的情况下修复局部故障。只有这样,模型团队才不会每次扩大训练规模时都重新发明一遍基础设施。

从这个角度看,OpenStack 和 Kubernetes 的价值就不只是“也可以跑 AI”,而是它们代表了一种已经被验证过的思想:让资源变成标准接口,让复杂性留在平台内部。这正是十万卡 AI 集群最需要学会的事情。


Key Takeaways

  1. 别把 GPU 当成独立算力单元。 在十万卡规模,GPU 只是系统中的一个节点,真正的瓶颈在电力、网络、拓扑和故障恢复。
  2. 把复杂度压回基础设施层。 不要让网卡故障、拓扑切换、容错恢复进入训练代码,应该通过平台抽象和自动化来吸收。
  3. 网络架构就是模型架构的一部分。 张量并行、流水线并行、数据并行、MoE 的可行性,最终都取决于网络层的现实约束。
  4. 优先优化连续性,而不是只追求峰值性能。 在超大集群里,少一次中断的价值,往往大于一点峰值带宽提升。
  5. 用分层自治思维设计系统。 物理、互连、调度、可靠性、平台五层目标不同,必须明确边界,才能避免局部最优毁掉全局。

结语:未来的 AI 军备竞赛,比的是谁更会“把机器变成平台”

十万卡集群的真正启示,不是“规模越大越强”,而是“规模越大,越考验你是否懂得抽象”。当 GPU 变成成百上千台服务器、数以万计的光模块和交换机、以及不断发生的小故障时,算力本身已经不再是问题的中心。中心变成了:你能否把这些硬件组织成一个像 Kubernetes 一样可调度、像 OpenStack 一样可预测、像云服务一样可恢复的系统。

所以,未来最强的 AI 基础设施公司,未必是拥有最多芯片的公司,而是最擅长把芯片变成服务的公司。真正的护城河,不是把更多 GPU 堆在一起,而是让它们像一个平台那样稳定运转。

当你开始这样思考时,问题就彻底变了。你不再问“我还能买多少卡”,而是问“我能否把这批卡组织成一种更高阶的机器”。这,才是十万卡时代最重要的竞争力。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣