真正决定 AI 胜负的,不是算力,而是把算力变成可流动的能力

Kevin Di

Hatched by Kevin Di

May 02, 2026

1 min read

86%

0

你买到的不是 GPU,而是一整套“流动性系统”

如果一台机器能提供数百 TFLOPS,为什么真正的大规模 AI 竞赛里,胜负却越来越像在比电力、光模块、布线、故障恢复和内存带宽?这看起来很反直觉,但它几乎定义了当代 AI 基础设施的现实:算力不是稀缺资源,能够被高效搬运、编排和持续供给的算力才是稀缺资源

过去我们习惯把芯片当成核心,把网络当成配角。但当集群规模膨胀到数万卡,系统的本质发生了变化。GPU 不再是独立的“计算单元”,而更像是装在一张巨大电网里的发电机。真正决定输出的,不只是发电机有多强,而是电网能否稳定输送、能否跨区域调度、能否在故障时不把整个城市拉闸。

这也是为什么“10 万卡 H100 集群”这样的规模会把许多原本看似独立的问题压成一个问题:计算、通信、供电、容错、内存层级,最后都变成同一个问题的不同侧面。而这个问题可以被概括为一句话:如何把昂贵且脆弱的算力,变成一种可持续流动的工业化资源。

在大模型时代,瓶颈早已不是“能不能算”,而是“能不能一直算、便宜地算、成体系地算”。


从芯片到系统,真正的成本中心在“搬运”而不是“计算”

如果只看单卡性能,很容易被纸面数字迷惑。H100 这类 GPU 的峰值能力惊人,但当一台服务器里还要配 CPU、NIC、PSU,整个集群还要配交换机、光模块、存储和控制节点时,单卡的神话很快会被系统工程吞没。更残酷的是,规模越大,系统开销越不像“附属成本”,越像主成本

这里有一个关键洞见:在超大规模训练中,最贵的不是计算本身,而是让计算彼此看见、彼此同步、彼此容错的代价。张量并行要求 GPU 之间高频交换中间结果,流水线并行要求跨节点协调,数据并行要求全局汇总梯度。不同并行策略实际上是在不同距离上“租用带宽”。

这就像一座城市的交通系统。你如果只看汽车发动机的马力,会以为交通效率只取决于车本身。但真实决定城市运行质量的,是道路密度、立交层级、信号灯协调、事故恢复速度,以及你是否愿意在高峰时段把所有车都塞进同一条路上。大模型集群也是这样,GPU 是车,网络是路,训练拓扑是城市规划

于是,一个看似纯技术的问题,迅速转化成了资本配置问题。用什么交换机,走以太网还是 InfiniBand,是否采用更高端的光模块,叶交换机怎么摆,服务器是否轨道优化,是否把交换机放进机架中间以换取更多铜缆覆盖,每一个选择都在重新定义“每一块算力的边际成本”。

这也是为什么在很大规模上,省下来的不只是设备钱,还有长期的电费和运维复杂度。更重要的是,省钱并不总是压缩性能,而是减少系统为了维持性能所必须支付的摩擦成本


训练的真正敌人不是慢,而是“局部失败变成全局停摆”

如果说成本问题揭示了基础设施的经济学,那么可靠性问题揭示的就是它的物理学。单机时代的故障,大多是局部事件。服务器重启,任务恢复,损失可以接受。可在 10 万卡级别,局部故障已经不再局部。一个网卡、一块光模块、一颗 GPU 的异常,都可能穿过并行依赖链,迅速演化成整个训练作业的停摆。

这背后的核心不是“硬件会坏”,而是并行系统把故障放大了。越是依赖紧耦合同步,越是任何一处抖动都可能成为全局中断。张量并行的高带宽要求,让服务器内部几乎像一块巨型 GPU,但它的脆弱性也随之上升。MoE、all to all、跨岛通信,这些让性能更强的机制,也在系统中引入了更多相互依赖点。

于是,真正成熟的大规模训练不只是追求更高吞吐,还要设计“失败的姿势”。如果一个架构只能在理想状态下表现良好,那它在工业上还不算成熟。相比之下,可以快速替换故障节点、可以通过后端网络重建内存状态、可以减少 checkpointing 损失的系统,才是在现实中更强的系统

这里有一个值得反复咀嚼的反直觉:传统 checkpointing 看起来稳妥,实际上可能非常昂贵。因为它把系统时间切碎成大量“停下来保存”的间隙,而在超大集群里,每一次保存都意味着巨大的机会成本。相反,如果能利用后端网络做内存重建,让一个故障节点在秒级恢复到可训练状态,那么你不是在“容错”,而是在把错误成本压缩成可忽略的摩擦。

在大模型训练里,可靠性不是“少坏几次”这么简单,而是“坏了以后还能多快回到流动状态”。

这个视角极其重要。因为它把故障恢复从一个运维问题,重新定义为一个吞吐率问题。谁能把故障转化为最小的时间损失,谁就拥有更高的有效算力利用率。说到底,训练集群的价值不是静态配置,而是全年累计可用的“有效计算小时数”。


PIM 的真正启示:不是更快的芯片,而是更少的搬运

如果大规模 GPU 集群是在外部系统层面解决“搬运”的问题,那么 d-Matrix 这类 PIM 路线则是在芯片内部重新定义“搬运”的必要性。它的意义不只在于某项基准成绩更高,而在于它提出了一个更深的问题:为什么 AI 芯片要把那么多资源消耗在把数据从内存搬到计算单元上?

传统芯片的世界里,算术单元和内存是分离的。计算越多,数据搬运越频繁,延迟和能耗就越容易被内存访问吞噬。PIM 的思路恰恰相反:既然数据已经在内存附近,为什么不就地处理?这会牵动一整套架构变化。你可以减少寄存器和 ALU 的占用,把更多芯片面积让给 SRAM;你可以把更多常驻工作集留在片上,减少对片外 DRAM 的访问;你可以在定点运算上取得极高的效率,从而把一部分模型推理负担直接压缩在更近的数据层里。

把它和前面的超大集群放在一起看,就会出现一个惊人的统一性。无论是机房级别的网络优化,还是芯片级别的 PIM 设计,本质上都在做同一件事:让数据离计算更近,让计算之间的同步更少,让搬运这件事更便宜

这提供了一个非常实用的分析框架,可以叫做 “三层搬运成本”

  1. 芯片内搬运:寄存器、SRAM、DRAM 之间的数据流动。
  2. 节点间搬运:GPU 之间的张量并行、流水线并行、数据并行通信。
  3. 机房间搬运:交换机层级、光模块距离、前端网络和后端网络的组织方式。

在这三层里,越往外,搬运越贵,越容易引入延迟、故障和资本开销。也就是说,系统设计的高级目标不是让某一层极致强大,而是用更少的外层搬运,尽量把工作压回到更近的层级完成

这也解释了为什么一些看似“新颖”的芯片路线并不一定更有商业优势。芯片创新如果不能转化为部署层面的总成本下降,最终可能只是在另一种更贵的方式里做同样的事。真正有价值的创新,往往不是单点峰值提升,而是让整个系统中的搬运链条缩短。


未来的竞争不是“谁的峰值更高”,而是“谁的系统更像一条高速管道”

把这些线索合在一起,我们会看到一个新的竞争单位。以前我们评估 GPU,主要看 FLOPS、显存、带宽。现在这些指标仍然重要,但它们已经不够了。还必须问四个更接近现实的问题:

  • 这套系统的电力密度有多高?
  • 这套系统的网络搬运成本有多低?
  • 故障发生时,系统能否秒级回到可训练状态
  • 模型规模扩大时,前端网络会不会先于后端网络成为瓶颈?

这四个问题最终都指向一个统一结论:AI 基础设施的胜利者,不是买到最多芯片的人,而是把芯片组织成最少摩擦的流动系统的人

这也是为什么 Ethernet、InfiniBand、Spectrum-X、Tomahawk、光模块、铜缆、中间机架、轨道优化、内存重建、PIM,这些看似分散的话题,实际上都围绕同一条主线旋转。它们不是不同赛道,而是同一件事的不同层次:如何让“可用算力”尽可能接近“标称算力”。

当我们从这个角度看训练集群,很多争论会自动重排。比如,有些方案在单项性能上更亮眼,却可能在成本、功耗、故障恢复上留下更大的系统缺口。另一些方案也许纸面峰值不够夸张,但如果它能减少光模块数量、降低链路故障、简化布线、压低能耗、提高 MFU,它在商业上反而更强。

真正的基础设施能力,不是堆砌更强的部件,而是减少部件之间相互打架的机会。

这点对于模型推理同样成立。推理场景里,芯片的局部计算效率当然重要,但如果内存访问、数据搬运和集群调度把收益吃掉,最终客户看到的还是成本与延迟。PIM 的价值正在于,它试图把一部分推理从“计算搬运型”工作,改造成“数据就地型”工作。换句话说,它不是只想让芯片更快,而是想让系统更少折返。


Key Takeaways

  1. 把 AI 系统看成“流动系统”,而不是“芯片堆叠”。 真正决定成本和性能的,往往是算力如何在节点、机架、机房之间流动。

  2. 优先优化搬运,而不是只优化峰值。 无论是芯片内 PIM,还是集群中的网络拓扑,减少数据搬运通常比单点提速更有价值。

  3. 把故障恢复当成吞吐设计的一部分。 秒级恢复、内存重建、备用节点热切换,都是在保护有效训练时间,而不只是修硬件。

  4. 用“三层搬运成本”评估系统方案。 同时看芯片内、节点间、机房间的搬运代价,避免只在一层优化,却在另一层制造瓶颈。

  5. 不要被纸面峰值迷惑,关注可持续有效算力。 一套方案如果需要更高电力、更贵光模块、更频繁 checkpointing 才能维持性能,它的真实效率可能远低于表面数字。


结语:AI 时代最贵的,不是算力,而是让算力不被浪费的智慧

我们正在进入一个非常特殊的工程时代。过去,计算能力的提升主要靠更快的芯片;现在,决定性优势越来越来自系统层面的编排能力。谁能把电力、网络、内存、容错、拓扑和芯片组织成一条低摩擦的高速管道,谁就能把同样的硬件变成更高的有效产出。

这意味着,未来的 AI 竞争可能会越来越不像“谁买了更强的 GPU”,而更像“谁更懂得让 GPU 不被卡住”。而这背后的真正能力,也许不是硬件崇拜,而是一种新的系统思维:把每一瓦电、每一米光纤、每一次同步、每一次故障,都视为可优化的流动问题

当你下一次看到一个惊人的模型训练规模时,不妨换个问题问自己:它真正展示的,究竟是算力,还是把算力变成稳定、廉价、连续产出的能力?

答案往往决定了谁只是拥有机器,谁才真正拥有工业级智能。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣