芯片战争真正争的不是算力,而是谁能定义“系统边界”

Kevin Di

Hatched by Kevin Di

Jun 30, 2026

1 min read

88%

0

如果一块更快的芯片反而卖不出去,问题出在哪?

很多人看 AI 芯片,只看两个数字:峰值算力基准测试。但真正决定一颗芯片能不能改变行业的,往往不是它在实验室里能跑多快,而是它能不能被放进真实系统里,继续保持那种快。

这就是当下芯片竞争最反常的地方:技术上更激进的方案,未必商业上更划算;而看起来更保守、甚至更“工程化”的协议和平台设计,常常反而更有统治力。表面上,这是关于 GPU、PIM、PCIe、NVLink、CXL 的故事。更深一层,这是关于一个核心问题:计算到底应该围绕谁组织,谁拥有系统的中心位置,谁就拥有产业的定价权。

换句话说,今天芯片公司卖的已经不只是芯片,而是对“系统边界”的定义权。

真正的竞争,不是谁把单点性能做得更高,而是谁能把自己的架构变成默认架构,把别人的工作变成旁支工作。


1. 为什么“更快”经常输给“更容易接入”

先看一个直觉上很难接受的事实:一颗芯片即使在结构上更先进,也不一定更容易卖。原因不在芯片内部,而在芯片外部。

AI 计算不是孤立发生的。模型推理要经过数据搬运、内存访问、调度、通信、缓存一致性、软件栈适配、容错和部署管理。对客户来说,真正买到手的不是一块硅片,而是一个端到端的系统承诺。如果一颗芯片需要你重写部署方式、改变内存布局、调整调度习惯、重新设计板级互联,那么它的“性能优势”就会被摩擦成本吃掉很多。

这解释了为什么一些新架构会陷入尴尬处境。PIM 这类把计算塞进内存附近的路线,理论上非常诱人,因为它直接瞄准了 AI 的最大瓶颈之一:DRAM 访问太贵。如果能把更多数据留在片上,把计算做在更接近数据的地方,那么延迟、能效、带宽占用都会改善。听起来像是对传统 GPU 的一次降维打击。

但现实并不只看物理极限,还看部署极限。很多性能数字只有在特定模式下成立,而这些模式往往并不是大规模生产环境里默认可用的。于是,一个看起来“比 GPU 快很多”的方案,最后会被客户问出一个朴素问题:

我为什么要为这部分性能,付出额外的软件、运维和系统复杂度?

这不是保守,这是商业理性。

一个很形象的类比是:你可能造出一辆赛道车,时速远超家用车,但如果它只能在无风、干燥、专用跑道、专业技师伴随的条件下发挥优势,那它并不自动意味着更好的交通工具。AI 芯片也是如此。客户购买的不是“最快一圈”,而是“日常里更省钱、更稳、更容易接入现有车队”。


2. 计算的真正瓶颈,不是算力,而是“谁能穿过内存墙”

如果把芯片比作工厂,过去大家拼的是生产线上的机器速度。可到了 AI 时代,最贵的环节往往不是机器本身,而是原材料在仓库、厂房和机器之间来回搬运的成本。

这就是为什么 内存中处理 会显得如此有吸引力。它不是单纯追求更高的 FLOPS,而是试图缩短“数据离计算核心”的距离。因为在大模型推理中,很多时候不是算不动,而是等数据太久。你可以有很强的 ALU,但如果 ALU 前面排着长队等内存,那再强的算力也会空转。

PIM 的价值,在于它把芯片面积的分配逻辑重新写了一遍。传统设计里,大量面积被寄存器、ALU、控制逻辑占据,芯片像是一座装备豪华但仓储不够的工厂。PIM 则像是把部分“货架”和“搬运工”直接内嵌进仓库旁边,于是更多面积可以用于 片上 SRAM,减少片外 DRAM 往返。

这里有个关键洞察:更高的算力密度,本质上是在为更高的内存密度服务。不是先算后存,而是先把数据留住,再算。

这点对推理尤为重要。训练场景可以容忍更复杂的调度和更高的能耗,因为它追求的是一次性大规模优化。推理不同,它更像一家高频营业的餐厅。你不需要每道菜都用最高级的分子料理技法,你需要的是高吞吐、低等待、稳定出餐。客户真正关心的,是每个 token 的综合成本,而不是峰值纸面参数。

在 AI 时代,性能不是单点速度,而是数据流经系统时损失了多少时间和电。

这就把竞争焦点从“核心算力”转向了“系统内存路径”。谁能最有效地减少数据搬运,谁就能把理论优势变成账单上的优势。


3. 为什么互联协议决定了谁是主角

如果说芯片内部竞争的是数据离计算有多远,那么芯片之间竞争的就是:谁来定义数据怎么流动

这一步往往被低估。很多人会把 PCIe、CXL、NVLink 之类的东西当作“基础设施细节”,但它们其实决定了整个算力帝国的政治结构。谁是 host,谁是 device,谁能直接访问谁的内存,谁必须经过中转,谁可以点对点直连,谁就拥有中心地位。

PCIe 时代的默认世界观是 CPU 中心。设备可以很强,但必须挂在 CPU 这棵树上。即使有 peer to peer、direct path、RDMA 这类能力,它们也往往是在既有主从关系下做局部优化。换句话说,设备被允许更快,但不被允许独立

这就是为什么协议设计比很多人想象得更政治化。一个协议如果让设备之间可以自由直连,就意味着新的中心可以出现;如果所有数据交互都必须经过 host memory,那么 CPU 仍然是全局裁判。表面上这是兼容性和简洁性的选择,实质上是权力结构的选择。

NVLink 之所以重要,不只是因为它快,而是因为它把“快”变成了可组织的系统级能力。当 GPU 和 CPU 能共享更紧密的地址空间、内存访问和调度语义时,原本必须切开的任务边界就可以重新缝合。一个 kernel 不必再像搬家一样在 CPU 和 GPU 之间拷来拷去,它可以更像一个统一计算体,在最合适的地方执行。

这类设计的意义极大,因为它改变了“默认思维模型”。在传统视角里,CPU 负责调度,GPU 负责加速。可当互联足够深,系统就可能进入一个新阶段:任务不再先属于 CPU 或 GPU,而是先属于整个统一系统。谁更适合跑哪一段,就让谁跑哪一段。

而 CXL 的出现,则提醒我们另一件事:最强的标准未必是最炫的标准,往往是最容易被产业大规模吸收的标准。它可能没有那么激进,但它能把越来越多设备纳入一个共享的、以 host 为中心的内存语义中。对于产业来说,这种“能铺开”的能力,往往比理论上更美的架构更有杀伤力。

这里就出现了一个看似矛盾、其实非常关键的结论:

越是想挑战现有系统的芯片,越必须先赢得系统协议;越是想让架构成立,越要先让自己看起来像基础设施,而不是异类。


4. 真正的竞争单位,不是芯片,而是“可调用的整体”

把前面的线索合起来,我们会发现一个更深的框架:今天的芯片竞争,本质上是在争夺可调用性

什么叫可调用性?就是一项计算能力,能否像函数一样被系统轻松调用。它不只是快,还要满足四个条件:

  1. 可接入:能否挂进现有系统,不强迫客户重构全部基础设施。
  2. 可组合:能否和 CPU、GPU、存储、网络、加速器共同工作。
  3. 可调度:能否被统一的软件栈管理,而不是依赖特殊手工路径。
  4. 可计费:能否稳定地转化成每美元性能、每瓦性能和每机柜性能的优势。

这四点决定了一颗芯片到底是“单点奇迹”,还是“系统平台”。

PIM 路线的魅力在于,它从物理层面攻击了内存墙。GPU 路线的威力在于,它从吞吐和生态层面完成了规模化。PCIe、NVLink、CXL 的意义,则在于谁能把自己的能力包装成系统语言。三者不是同一层面的竞争,而是同一场战争里的不同战场。

于是我们就能理解为什么有些芯片会在评测里惊艳,在采购里平庸。它们赢在“芯片分数”,却输在“系统分数”。而系统分数往往由三种成本决定:

  • 集成成本,接入是否麻烦;
  • 迁移成本,软件是否要重写;
  • 运营成本,规模化后是否稳定、可预测、可维护。

真正伟大的芯片,不是把其中某一项拉到极致,而是把三项同时压低。因为企业买的从来不是一项指标,而是一整套未来的确定性。

一个芯片公司最危险的错觉,是把“能跑起来”当成“能赢”。


5. 该如何判断一项芯片创新,是真突破还是漂亮陷阱

既然“快”不等于“赢”,那我们该怎样识别一项新架构到底有没有商业命运?我建议用一个简单但很有效的判断框架:性能,接入,语义,规模

1. 性能:它快在哪里

不要只问峰值数字,要问它的快是建立在什么前提上。是默认模式,还是特殊模式?是理想负载,还是典型负载?是单卡演示,还是集群稳定运行?

如果优势只能在实验室条件下成立,那它更像一个技术样品,而不是可部署产品。

2. 接入:它需要你改多少东西

最容易被忽略的一点是集成摩擦。一个新方案如果必须让客户重新设计内存层次、编译链、调度器和监控系统,那它的“性能红利”可能还没兑现,就先被项目成本吞掉了。

3. 语义:它和系统默认假设冲突多大

协议和架构的深层问题,不是带宽,而是语义。它是让系统更统一,还是让系统多出一个异类孤岛?它是把设备纳入 host 中心,还是允许新的中心出现?

这决定了它是补丁,还是平台。

4. 规模:它能否在大规模部署后保持优势

很多硬件创新在小规模样机上很漂亮,一旦进入真实数据中心就暴露问题。热设计、良率、运维、故障恢复、软件兼容,这些都可能让纸面优势缩水。真正值得下注的创新,必须通过规模化考验。

这个框架还有一个好处:它提醒我们,最有价值的创新经常发生在“让复杂性消失”的地方。最强的系统,不一定是功能最多的系统,而是让用户感觉最少被系统打扰的系统。


Key Takeaways

  1. 不要只盯算力,先看系统边界。芯片能否成功,更多取决于它是否能嵌入现有数据中心,而不是峰值有多高。
  2. 内存路径往往比计算核心更重要。AI 推理的关键瓶颈常常是数据搬运和 DRAM 访问,而不是纯粹的运算速度。
  3. 协议就是权力结构。PCIe、NVLink、CXL 这类互联标准,决定了谁是 host,谁能直连,谁拥有系统中心。
  4. 判断新架构时,要看四个维度:性能、接入、语义、规模。任何一项短板都可能吞噬全部优势。
  5. 真正可持续的创新,是把复杂性从用户身上拿走。越能让系统像一个整体工作,越可能形成长期壁垒。

结语:下一代芯片的胜负手,是谁能把自己变成“默认选项”

我们习惯把芯片竞争想成一场跑分大战,但这其实过于肤浅。更准确地说,这是一场关于系统默认值的争夺。谁能让自己的计算方式、内存路径、互联协议和软件语义成为默认,谁就不只是卖硬件,而是在定义整个行业如何思考计算。

所以,芯片战争的终局也许不是“谁最快”,而是“谁最不像一块孤立的芯片”。当一项技术足够成功时,它会从一个产品,变成一个前提。到了那时,用户甚至不再讨论它,因为它已经悄悄成为所有人工作的基础。

这才是最深的护城河:不是让别人惊叹你的速度,而是让别人离不开你所定义的世界。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣