算力战争真正打的不是芯片,而是控制权
Hatched by Kevin Di
Apr 19, 2026
1 min read
3 views
86%
你以为在选架构,其实在选权力结构
当我们讨论 AI 加速器时,最容易被问到的是:GPGPU、RISC-V 加 DSA,还是 Dataflow DSA,谁更先进,谁更快,谁更优雅?这个问题听起来像技术问题,但真正决定胜负的,从来不只是算力密度,而是谁控制数据流,谁控制内存,谁控制生态,谁就控制了整场游戏。
这就是一个很少被正面说透的现实:硬件架构不是单纯的工程选择,它首先是政治经济学。接口标准怎么演进,内存怎么共享,设备能不能绕过 CPU 直连,谁能拥有一致性视角,这些看似底层的决定,实际上都在重新分配产业里的权力。你会发现,很多“技术之争”背后,真正的争夺点不是性能,而是控制路径。
如果把现代算力系统想成一座城市,那么 CPU 不是唯一的市长,GPU、SSD、网卡、加速器也都在争夺道路、仓储、调度权。PCIe、NVLink、CXL 这些协议,不只是不同的路网方案,而是不同的治理哲学:到底是让每个区自成王国,还是让所有交通都经过市政中心。
争夺的核心,不是算得更快,而是能不能绕开中枢
过去十年,AI 和数据中心领域最重要的变化之一,不是某颗芯片单点性能提升,而是加速器开始夺走 CPU 的中间层权力。传统 CPU 模式里,任务调度、内存分配、设备编排大多由主机掌控,外围设备只是执行者。但一旦 GPU 变成真正的大规模计算主角,这种结构就开始失衡。
CUDA 的意义就在这里。它不只是一个编程模型,更像是在 CPU 身边建立了一个独立王国。GPU 有自己的内存体系,任务可以在 GPU 内部完成,甚至通过 pin host 内存来强行锁定一部分系统资源,使得数据通路不再完全由 CPU 说了算。对于 CPU 而言,这不是“多了一个外设”,而是“丢了部分主权”。
这也解释了为什么接口标准会变成战场。若 PCIe 演进缓慢,GPU、SSD、RDMA 这些设备的性能就会被中间通道卡住,算力的上层革命就会被基础设施拖后腿。于是厂商不得不寻找替代路径,比如 GPU 间的专用互联,或者在 PCIe 上继续挖潜做直通技术,让数据尽量不经过 CPU。
真正决定加速器价值的,不是它峰值能跑多快,而是它能否减少“必须经过谁”的次数。
这里的关键不是带宽数字本身,而是数据主路径的归属。如果所有设备的交互都必须先回到 host memory,再由 CPU 协调,那么 CPU 仍然是主宰。反过来,如果设备之间能直接 peer to peer,甚至形成自己的局域一致性,那么系统权力就发生了重构。
为什么一致性不是纯技术词,而是商业边界
很多人把“内存一致性”看成一个偏学术的词,像是架构课上的抽象概念。但在数据中心和 AI 场景里,它其实是一个极强的商业边界工具。
最简单的理解是:一致性决定了谁能像“同一个系统”那样工作。如果 CPU、GPU、网络卡、存储设备彼此之间能共享一种统一视图,那么开发者的心智负担就会急剧下降,软件栈也会更容易扩展。反过来,如果设备之间只能靠复制、锁存、显式同步来协调,那么每加一类设备,就要多一层复杂度,多一个生态壁垒。
这就是为什么 CXL 这种协议显得很特别。它表面上像是一种很温和的演进,能够让现有 PCIe 设备和交换芯片做相对有限的改动就接上去。但它真正的力量在于,它把一致性设计的中心牢牢放在 host CPU 上。所有设备的数据交换都回到 host memory,甚至连基于 switch 的直通空间都被压住。看起来像开放,实际上是一种秩序重建。
这并不矛盾。一个成功的标准,往往不是最激进,而是最能把复杂性收编进既有权力结构。你可以把它理解成一种“温和的锁定”机制:允许新设备加入,但前提是它们不要破坏中心。这样既能扩展生态,又能避免边缘设备形成独立联盟。
标准的最高明之处,不是让所有人都变强,而是让所有人的变强方式都依赖同一个中心。
这就引出了一个极其重要的判断框架:谁掌握一致性,谁就掌握系统扩张的节奏。因为一致性不是单纯的缓存协议,它定义了软件可以怎样写,硬件可以怎样连,生态可以怎样长,最终决定谁能把自己的模式变成默认模式。
真正的竞争,是把“局部最优”变成“全局默认”
如果只看技术参数,GPU、NVLink、CXL、DSA、数据流架构,似乎各有各的合理性。但把它们放到产业竞争里看,会发现所有路线都在争夺一个更深层的目标:把自己的局部最优,变成整个系统的默认接口。
NVIDIA 的优势,不只是 GPU 算力强,而是它把计算组织方式也一起带走了。CUDA 让开发者不是在“用一块卡”,而是在接受一整套以 GPU 为中心的编程与调度秩序。NVLink 则进一步强化这种中心化,让 GPU 之间可以更顺畅地互联,把原本受制于通用互联的瓶颈绕开。它的本质不是“更快的线”,而是“更少的让步”。
相对地,像 CXL 这样的方案更像是一种“收编型创新”。它不追求立刻推翻旧秩序,而是通过兼容、缓慢迁移和一致性规范,把新设备纳入主机中心逻辑中。这种路线对平台方很有吸引力,因为它不会立刻打碎现有软件和供应链,也不会让边缘厂商轻易建立自己的独立体系。
而 DSA 的问题就在这里。一个新的加速器路线,首先要面对的未必是“能不能算”,而是“谁会为它买单,为什么会买单,买单之后还能不能持续盈利”。如果市场上没有足够强的客户牵引,没有明确的预算来源,没有能压住部署和运维复杂性的商业模型,再漂亮的架构也只会停留在白板上。
这正是技术讨论里最容易被忽略的一层:架构不是先于商业存在的,它是商业边界被技术形式化之后的产物。你设计一个 DSA,不只是为了让某种工作负载更快,而是为了回答一个更尖锐的问题:客户愿不愿意为这种“更快”支付持续的系统成本。否则,性能只是论文,产业却不会给你席位。
一个新的判断框架:算力架构的三层战争
如果想真正理解今天的数据中心和 AI 硬件竞争,可以用一个简单但很有效的框架,把战争分成三层:
1. 通路层
谁控制数据怎么走。
这层看的是 PCIe、NVLink、以太网、RDMA、直通等。问题不只是带宽,而是数据必须经过谁,能不能绕开中枢,能不能让设备之间直接对话。
2. 语义层
谁定义“共享”和“一致”的规则。
这层看的是 CXL 这类协议,以及内存模型、地址空间、缓存一致性的定义。谁说了算,就决定了软件能写多简单,系统能扩多大,生态会不会碎成一地。
3. 商业层
谁付钱,谁被锁定,谁能长期收租。
这层看的是客户是谁,预算在哪里,部署成本谁承担,维护复杂度谁来消化。技术路线如果不能在这里闭环,前两层再强也只是局部胜利。
这个框架有一个很实用的结论:不要只问某项技术是否先进,要问它究竟是在加强开放,还是在重塑控制点。很多时候,一项技术看起来是在提升性能,实际上是在重新分配谁可以做什么决策。
例如,设备直通看起来像“去中心化”,但如果它只是把数据路径从 CPU 旁边挪开,而没有解决软件协调和生态兼容,它就很难规模化。相反,一些看似保守的设计,比如把所有交互收束到 host memory,虽然没有那么激进,却更容易成为默认标准,因为它让平台方和开发者都能继续用熟悉的秩序。
关键问题不是选哪条路,而是谁有能力让别人只能走这条路
到了这里,真正的答案开始浮现:AI 加速器之争,不是单纯的“哪种架构更好”,而是“哪种架构更容易成为别人绕不开的基础设施”。
这会改变你看待很多问题的方式。比如,为什么某些厂商宁愿推动兼容性很强但中心化更强的协议,也不愿意让高性能直通轻易普及?因为一旦边缘设备能自由形成强互联网络,中心平台的议价能力就会下降。再比如,为什么某些芯片明明可以更快的互联,却在标准推进上拖延?因为标准一旦成熟,能力就会下沉到整个生态里,差异化优势会被稀释。
这不是阴谋论,而是平台竞争的常识。基础设施的本质,就是把对手变成你的使用者。最强的产品,不是让自己永远领先,而是让别人即使追上,也只能在你设定的轨道里追上。
换句话说,算力竞争的终局,不是“谁跑分高”,而是“谁定义系统默认行为”。你卖的是芯片,但别人买到的其实是路径、规则和依赖关系。
Key Takeaways
- 不要只看性能数字,要看控制路径。带宽、延迟、峰值吞吐很重要,但更关键的是数据是否必须经过某个中心节点。
- 一致性是权力,不只是技术。谁定义共享内存和缓存一致性的规则,谁就拥有系统扩张的主导权。
- 架构必须和商业闭环一起判断。一个加速器能不能赢,不取决于它有多聪明,而取决于客户是否愿意为它持续付费。
- 标准的力量在于收编,而不只是开放。最成功的协议,往往不是最激进的,而是最能让新旧生态都服从同一中心的。
- 问“谁会被绕过”,比问“谁更快”更有洞察力。因为每一次绕过,都是一次权力转移。
结语:未来的赢家,不是最快的芯片,而是最会定义默认值的系统
我们总喜欢把硬件进步想象成一条线性赛跑,好像谁算得更快,谁就会自然赢得世界。但数据中心和 AI 产业的现实告诉我们,真正的胜负手不是速度本身,而是谁能把自己的速度变成别人必须服从的规则。
所以,下一次当你看到一项新互联协议、新一致性机制、或者新型加速器架构时,不妨先别问它“快不快”,先问三个更本质的问题:它让谁失去中间权力,它让谁成为默认中心,它让谁更难脱身。
答案往往比跑分更重要。因为在算力战争里,最快的不是最强的,最强的,是能决定别人怎么跑的那一个。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣