当软件跑得更快,真正被重新定义的其实是硬件

Kevin Di

Hatched by Kevin Di

Jul 26, 2026

1 min read

84%

0

你以为AI竞争拼的是模型,实际上拼的是谁先把系统边界推平

如果一套AI推理引擎能把速度提升到原来的2.1倍,甚至3.8倍,而底层GPU又是动辄数千美元的昂贵设备,那么一个刺眼的问题就出现了:究竟是谁在决定AI的胜负,模型、框架,还是那张显卡本身?

更反直觉的是,答案往往都不是单独的某一个。真正决定结果的,是系统的边界在哪里被压缩,哪里被放大。今天看起来像是“软件优化”的胜利,明天往往会反过来改写硬件的价值结构,甚至重新定义什么叫“算力”。

这就是当前AI基础设施最值得深挖的地方。表面上,一边是推理引擎在疯狂提速,另一边是GPU芯片、封装、HBM和互联在继续堆料。看起来像两条平行线,实际上它们正在互相逼迫,互相解释,最后共同指向一个结论:AI时代的性能瓶颈,不再是单点算力,而是系统协同的总和。


从“更快”到“更值钱”:软件优化不是省钱,而是重划战场

当一个推理引擎宣称比常见方案快出数倍,很多人的第一反应是性能参数表,第二反应是谁又卷起来了。但更深一层看,这类进步真正改变的不是“跑分”,而是每一张GPU可被榨出的有效产出

这像什么?像一座水电站,发电机没换,输电系统没换,但水轮机效率提高了。表面上你只是把更多水转成了电,实际上你是在重新定义这座电站的经济性。原本昂贵的设备,因为利用率更高,瞬间变得更便宜了。AI推理也是一样,模型不变、芯片不变,调度、缓存、通信、批处理、精度切换这些环节一旦优化,GPU就像突然从“高价买来的大排量发动机”变成了“真正跑满的机器”。

这件事的意义常常被低估。因为在基础设施领域,性能提升并不只是更快,而是让成本曲线改道。当每单位吞吐量的成本下降,之前很多“不划算”的模型部署方案就突然可行了。更大的模型可以上线,更长的上下文可以接受,更复杂的服务链可以被实时调用。于是,软件优化不是边角料,而是AI产业从“实验室炫技”走向“规模化交付”的门票。

你以为优化是在帮硬件省一点电,实际上它是在帮商业模式重新定价。

这就引出一个常被忽视的张力。人们习惯把硬件视为“能力边界”,把软件视为“边界内的技巧”。可在AI推理时代,软件越来越像一把刀,直接切开硬件表面看似牢不可破的天花板。性能比拼已经不只是“谁的卡更强”,而是谁更懂得让每一次显存访问、每一段互联、每一次调度都少一点浪费。


NVIDIA的护城河,究竟是芯片,还是把复杂性封装成了产品?

如果只盯着GPU核心算力,很容易把AI硬件想简单了。真正贵的从来不只是那颗芯片,而是整套把芯片变成可用算力的系统能力。电源设计、PCB、封装、HBM、互联、软件栈、调优经验,这些东西叠加起来,才构成了今天的AI帝国。

一个很值得玩味的现实是,很多时候,单颗逻辑Die本身并不是成本最吓人的部分。先进制程、chiplet封装、HBM、高规格互联,这些组件各自分摊着成本,也各自分摊着难度。看起来像一块卡,实际上像一整座微型工厂。于是问题来了:既然如此昂贵,为什么仍然有人愿意买?答案并不是“因为没得选”,而是因为这套系统把复杂性包装成了确定性。

这才是关键。AI基础设施真正卖的不是晶体管,而是**“拿来就能跑”的确定性产能**。你买到的不是一片裸露的硅,而是一个被验证过、兼容过、调优过、可扩展的系统。对于大型模型训练和推理来说,时间比理论峰值更重要,稳定比纸面参数更重要,可扩展比单卡极限更重要。

但这套护城河也并非坚不可摧。因为一旦软件层把效率极限往前推,硬件层的优势就会被迫转向另一个维度。过去靠单芯片的吞吐和生态锁定来赢,未来则越来越依赖系统级的带宽、互联和并行组织能力。也就是说,护城河不是消失了,而是被迫从“芯片中心”迁移到“系统中心”。

这是一种非常重要的产业变化。芯片设计不再只是单颗Die的竞赛,而是如何让更多芯片像一个更大的芯片那样工作。换句话说,AI硬件的终极竞争,不再是把一颗芯片做得多猛,而是把几十颗、上百颗芯片组织得像一个统一的计算体。


当单卡不够强,真正的答案不是“再堆一张”,而是把互联变成新的算力

很多人会本能地把问题理解成“算力不够就加卡”。但在大模型时代,单纯加卡只是把问题从计算搬到通信。你可以把它想成一支乐队,如果每个乐手都更强,但指挥系统跟不上,演出来的仍然只是杂音。

这也是为什么“单芯片IO能力”会越来越重要。不是因为IO听起来更高级,而是因为模型规模一旦进入超大参数区间,瓶颈经常不在矩阵乘法本身,而在卡与卡之间如何交换信息。训练时要同步梯度,推理时要协调KV缓存,专家模型要做路由,分布式并行要做切分。每一项都在消耗带宽,每一次等待都在侵蚀吞吐。

于是,互联不再只是配角,而开始变成新的算力定义方式。600GB不够,那就1TB。8P不够,那就16P、32P。这个逻辑听起来像“堆料竞赛”,但本质上它是对一个现实的承认:当模型足够大,算力的单位就不再是一颗芯片,而是一组能够高效协同的芯片。

这里有一个特别值得记住的框架,可以叫做三层算力观

  1. 硅上算力:单颗芯片能做多少运算。
  2. 板上算力:多颗芯片如何在一块板或一台机器内协同。
  3. 网络算力:多台机器如何像一个系统一样组织起来。

过去很多技术讨论只停留在第一层,但AI的真实战场越来越在第二层和第三层。推理引擎的优化,往往是在释放第一层和第二层之间的摩擦成本。硬件扩容,往往是在把第二层和第三层的延迟压到足够低。真正的胜负,不是某一层极限更高,而是层与层之间的损耗更小

现代AI竞争的本质,不是把一台机器变成超级机器,而是把很多机器变成一台机器。


最深的破绽,不是某个环节不够强,而是“系统默认浪费”太多

把两类信息放在一起看,会出现一个极有启发性的结论:软件优化和硬件堆料并不是对立的,它们共同指向同一个敌人,系统中的默认浪费。

默认浪费有三种。第一种是计算浪费,芯片忙着等数据。第二种是带宽浪费,数据已经准备好了,却卡在传输和同步上。第三种是经济浪费,贵重硬件的峰值能力没有转化为稳定产出。很多AI系统最昂贵的地方,不是买硬件,而是买了硬件之后却没有充分使用。

这就是为什么推理引擎的重要性被不断放大。它不是一个“加速器”,而是一个把浪费变成产能的中间层。批处理、内存管理、并行策略、量化精度、调度机制,这些看似工程细节,实际上是在决定你买来的硬件,到底是80分利用率还是30分利用率。一个30分的系统,可能需要两倍机器才能完成同样工作。一个80分的系统,则等于白送了大量有效算力。

同样地,硬件堆料的意义也不是“永远更大更强”,而是当软件已经把效率推高之后,硬件必须继续解决新的瓶颈。软件把旧问题压缩掉,硬件再去承接新的边界,这形成了一个不断上移的循环。于是整个行业看起来像一直在加速,实际上是在不断改写“足够好”的标准。

这种循环会产生一个很重要的战略判断:**真正领先的公司,不是单纯押注某一层,而是能同时理解边界收缩和边界扩张的人。**他们知道什么时候该把系统榨干,什么时候该把系统拓宽。前者让成本下降,后者让规模上升。两者缺一不可。


Key Takeaways

  1. 别只看峰值算力,看有效算力。 一张GPU的价值,不在理论上能跑多快,而在推理栈优化后,能稳定交付多少吞吐。

  2. 把互联当作算力的一部分。 当模型和并行规模继续扩大,卡与卡之间的通信效率,已经是决定胜负的核心指标。

  3. 真正的护城河是复杂性的封装能力。 能把电源、封装、HBM、软件栈和调优经验整合成“开箱即用”系统,才是高壁垒。

  4. 用三层算力观审视系统:硅上、板上、网络。 任何一层短板都会吞噬整体性能,优化不能只盯单点。

  5. 追问默认浪费在哪里。 许多AI成本并不是“硬件太贵”,而是硬件被浪费了。先减少浪费,再谈扩容。


结语:AI时代最稀缺的,不是更强的芯片,而是更少的无效边界

如果把今天的AI基础设施看成一场战争,那么表面的胜负手是芯片,深层的胜负手却是系统是否能持续消灭无效边界。推理引擎提速,看似是软件胜利,实际上是在逼硬件重新证明自己。硬件继续加码,看似是堆料升级,实际上是在回应软件把旧瓶颈拆掉之后出现的新瓶颈。

所以,AI竞争的真正主题可能不是“谁拥有最强的单点”,而是谁能最早把算力从一块卡,升级为一整个协同体。当你开始这样看,很多争论会突然变得清晰:芯片不是终点,框架也不是终点,终点是让昂贵资源尽可能少地浪费在等待、同步和空转上。

换句话说,未来最有价值的不是更大的机器,而是更少浪费的系统。谁先做到这一点,谁就不只是跑得更快,而是重新定义了什么叫“快”。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣