算力的真正竞争,不在峰值,而在边界如何被重新定义
Hatched by Kevin Di
May 16, 2026
1 min read
8 views
66%
你以为在比性能,其实在比边界
当一家公司把一块芯片做得更快,另一家公司把一套集群做得更大,表面上看,它们像是在同一条赛道上竞争。可真正决定胜负的,往往不是谁的单点指标更漂亮,而是谁先把“系统的边界”改写了。芯片的边界,机架的边界,数据中心的边界,甚至故障不会扩散的边界,都是竞争的一部分。
这就是今天最容易被忽略的一件事:算力战争已经从“做更强的部件”转向“重画连接方式”。不是单纯把 GPU 做得更快,也不是单纯把 Kubernetes 部署得更多,而是要让硬件、网络、调度和故障域共同组成一个新的整体。谁能把这些层次缝合得更好,谁就能把“规模”变成“能力”。
如果只盯着峰值数字,你会看见 2000T FP16、51.2T 交换带宽、900GB 互联;但如果换个角度看,你会发现这些数字背后真正争夺的对象是:谁来定义资源如何被访问、如何被隔离、如何被扩展。
在现代算力系统里,性能不是先天属性,而是边界设计的结果。
从一根线到一张网:连接方式决定系统能长多大
过去很多人理解互联,只看带宽大小,好像线越粗就越强。但真正关键的是,互联到底是给“一个盒子里的几块卡”用,还是给“一个可扩展的数据中心”用。这两者看起来都叫互联,实际上属于完全不同的世界。
一个典型的误区是把所有 NVLink 都当成同一种东西。实际上,框内互联、机柜级网络、芯粒到芯粒互联,本质上是三种不同的系统语言。框内互联更像是一个房间里的对话,地址和访问路径相对直接,出了问题,大不了整箱重启。可当互联上升到 pod 级别,事情就完全变了,开始接近网络系统的逻辑,必须考虑路由、隔离和故障不要外溢。
这件事的意义在于,规模化不是简单复制节点,而是让每一层都能承受更大的不确定性。你可以把它想成城市交通。小区内的道路,只要车能快速通行就够了;而城市主干道,除了速度,还要有路由、限流、分区和事故隔离。把小区道路当成城市干线来设计,或者把城市干线当成小区道路来管理,都会出大问题。
同样,芯片到芯片的互联也不是“更快的线”这么简单。它决定了计算资源能否从一颗芯片,扩展为一个协同工作的整体。只有当互联从“物理连通”变成“可编排的资源层”,算力才真正具备横向扩展的生命力。
这也是为什么今天最值得关注的不是某一条链路有多快,而是这条链路把系统划分成了什么样的层级。互联不是附属品,它是系统架构本身。
OpenStack 和 Kubernetes 的关系,正像算力互联的分层演化
如果把视角从硬件拉到软件,你会看到一个惊人的平行结构。OpenStack 和 Kubernetes 的关系,恰好揭示了现代基础设施的真正方向:抽象层必须足够稳定,资源层必须足够可预测。
Kubernetes 之所以能在各种环境中运行,不是因为它“聪明”,而是因为它依赖的是一致的资源接口。OpenStack 之所以有价值,也不是因为它某一个功能特别花哨,而是因为它把计算、存储、网络抽象成了一个跨数据中心的可控平台。两者结合时,Kubernetes 通过 API 使用这些资源,而 OpenStack 负责让资源表现得统一、可扩展、可预期。
这和 GPU 互联的演化几乎是同构的。框内互联解决的是“怎么让一组卡像一组卡那样工作”,pod 级互联解决的是“怎么让一群机器像一个系统那样协同”,而芯粒级互联解决的是“怎么让芯片内部的多个部分像一个更大的芯片那样统一”。从软件到硬件,本质都在做同一件事:把复杂性封装到更低层,把可编排性暴露给更高层。
这也解释了为什么很多基础设施工程的失败,表面上是性能不够,实际是抽象层设计错了。你如果把每个容器都看成独立孤岛,调度就会碎裂;你如果把每颗 GPU 都看成孤岛,训练就会被通信拖垮;你如果把每一台机器都当成同质部件,故障域就会互相污染。
真正成熟的平台,不是把一切都统一成一个巨大黑盒,而是把系统拆成几层,每层各自承担不同的确定性。OpenStack 提供的是资源池的秩序,Kubernetes 提供的是工作负载的秩序,NVLink 体系提供的是算力单元之间的秩序。秩序,才是规模化的前提。
最危险的不是不够强,而是把局部最优当成全局答案
很多技术竞赛里,最常见的失误不是做得太差,而是做得太像一种“聪明的补丁”。当正面竞争压力过大时,最容易出现的策略就是改口径,换 benchmark,找旁门左道,或者在局部指标上做出夸张的漂亮数字。
这类做法短期内往往有效,因为市场和发布会只看到一个最亮的点。可系统工程的残酷性就在于,局部最优通常会在规模化之后暴露代价。例如,链路级别的错误检测如果不能覆盖存储粒度,带宽宣传就可能与可靠性现实脱节。再比如,某种互联如果只是看起来很快,但无法控制故障扩散,它就不是真正适合大规模部署的互联。
这是一条非常重要的规律:
越接近物理层,越不能靠话术赢;越接近规模层,越不能靠单项数字赢。
把这条规律放到基础设施市场里看,你会明白为什么真正难的不是做出一个“能演示”的产品,而是做出一个“能长期跑”的系统。演示只需要峰值,生产需要边界。演示只需要最优路径,生产需要故障路径。演示只需要单次成功,生产需要百万次重复。
所以,真正值得敬畏的,不是某一次发布会上创下的新高,而是一个系统能否同时做到:高速、可扩展、可隔离、可调度、可维护。缺了其中任何一项,所谓领先都可能只是局部幻觉。
这也给所有硬件和云平台厂商一个相同的提醒:不要只在单点性能上和对手比拼,要在系统定义权上竞争。谁能定义接口,谁能定义故障域,谁能定义资源边界,谁就更接近下一代基础设施的主导权。
重新理解“超车”:真正的超车不是换赛道,而是把赛道变成系统
很多人喜欢把技术突破描述成“弯道超车”。这个说法听起来很热血,但它常常误导我们,以为超越只需要一个奇招。现实中更深刻的变化,往往不是找到一条更窄的捷径,而是把原本分散的部件重组成一个更高层的系统。
这就是为什么算力产业里真正重要的,不是“有没有更高的带宽”,而是“带宽被放进了什么结构里”。同样是 900GB 级别的互联,如果它用于机箱内,那么重点是卡之间的协作;如果它用于芯粒之间,那么重点是封装内的统一;如果它用于更大规模的 pod,那么重点就是路由、地址与故障隔离。同一个数字,放进不同系统语境里,意义完全不同。
Kubernetes 和 OpenStack 的关系也说明了同一件事。Kubernetes 并没有消灭基础设施复杂性,它只是把复杂性下沉,让上层使用者只面对更稳定的 API。高阶系统的强大,不是因为它看起来更简单,而是因为它把不该暴露给用户的不确定性藏了起来。
这启发我们重新理解“超车”的本质。真正的超车不是在旧指标上拼命刷新,而是把旧指标变成新系统的一个局部参数。比如,单卡算力不再是最终答案,节点间通信才是;单机带宽不再是最终答案,集群故障隔离才是;某个芯片的峰值不再是最终答案,整个资源池是否能稳定调度才是。
换句话说,下一代竞争的核心不是把一个点做到极致,而是把点之间的关系设计到极致。
Key Takeaways
-
不要只看峰值指标,要看边界设计。 同样是高带宽、高算力,真正决定系统价值的是它服务于什么规模、什么故障域、什么调度模型。
-
把互联分成三层看:机箱内,机柜级,芯粒级。 三者解决的问题不同,不能用同一个标准评判,也不能混用架构思路。
-
成熟平台的核心不是更复杂,而是更稳定的抽象。 OpenStack 给资源池带来一致性,Kubernetes 在此之上提供编排,底层硬件互联则负责把算力单元组织成可扩展系统。
-
警惕局部最优幻觉。 单点宣传很容易赢,长期运行很难伪装。凡是不能处理故障传播、资源隔离和真实一致性的方案,最终都会在规模化后暴露代价。
-
把竞争焦点从“谁更快”转向“谁定义了系统”。 真正的主导权不在某个数值上,而在资源如何被切分、调度、隔离和扩展。
结语:硬科技的胜负,最终是秩序之争
很多人谈硬件,习惯谈性能、工艺、带宽、功耗,仿佛只要参数更大,胜利就会自然到来。可真正到了大规模系统,决定性因素往往不是某个参数,而是你能不能把混乱组织成秩序。
算力互联的演进,和云原生基础设施的演进,说到底都指向同一个真相:现代系统的竞争,不是单个部件对单个部件的较量,而是抽象层对抽象层的较量,边界设计对边界设计的较量,秩序生成能力对秩序生成能力的较量。
所以,当我们再看到某个芯片发布会上的惊人数字,或者某个平台宣称自己已经“全面升级”时,真正该问的不是“它快不快”,而是:它把系统边界改写成了什么样子,它让哪些复杂性消失了,又把哪些责任留给了下层。
这才是下一轮基础设施竞争最值得记住的地方。不是谁更会跑,而是谁更会组织奔跑。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣