Why AI Is Hitting a Hardware Wall: The Hidden Economics of Token by Token Thinking
Hatched by Kevin Di
Jun 13, 2026
1 min read
2 views
84%
当模型越聪明,为什么机器反而越慢?
一个看似悖论的问题正在决定 AI 时代的胜负:大模型越强,推理反而越像一场被单线程锁死的接力赛。训练阶段可以把算力像洪水一样灌进去,但一旦进入生成,文本必须一个词元一个词元地吐出来,前一个词元不出来,后一个词元就无从谈起。你可以把它想成一本书的装订过程,印刷机也许能并行生产整摞纸张,但装订只能按页排队完成。
这就是今天 AI 最深的张力之一。我们总在谈“更大的模型”“更强的芯片”“更多的并行”,可语言模型的核心生成机制却天然带着顺序性。模型每一步都要读取当前状态,结合历史词元的内部表示,在巨大的词表里做一次概率选择,再把这个结果送进下一轮。换句话说,AI 不是简单地在算一个答案,而是在一边算,一边不断修改自己下一步可计算的世界。
真正的问题因此不是“能不能更快”,而是:如何让一种本质上串行的工作,尽可能像并行系统那样高效运行。
AI 的瓶颈不只是算力总量,而是算力是否被迫服务于顺序性。
这也是为什么芯片架构、编译模型、内存组织和软件生态突然变得比模型参数本身更重要。大模型时代的竞争,不再只是算法竞赛,而是对“顺序计算如何被重构”的系统性竞赛。
语言模型真正吃掉的,不是算力,而是“等待时间”
语言模型在每个词元上做的事情,看起来只是一次前向传播,实际却牵扯到两类极重的计算负担:大矩阵乘向量,以及注意力机制。前者像一台巨型冲压机,后者像一张不断扩大的关系网。随着上下文增长,模型不是在重复同样的工作,而是在面对越来越长的历史,这让推理过程像背着一整座图书馆爬楼梯。
关键在于,生成式模型的时间结构不是平铺的,而是链式的。训练阶段可以把很多样本并行喂进去,推理阶段却必须等前一个词元落地。这意味着很多硬件优化的传统思路,比如单纯把峰值算力做大,往往只能改善“瞬时吞吐”,不能真正消灭“等待”。如果每一步都要先完成历史检索,再完成新词选择,再写回缓存,那么系统的瓶颈就不只是 FLOPS,而是数据搬运、缓存命中和延迟累积。
这也解释了为什么 KV cache 如此关键。它不是一个工程细节,而是语言模型的短期记忆结构。每个先前位置的 Key 和 Value 向量都在告诉系统一句话:过去不会消失,但它也不能以无限代价被重复读取。于是,AI 推理的本质逐渐显露出来,不再是“更像大脑”,而更像一门如何以最低能耗维持高频记忆访问的工程学。
如果把传统 CPU 看成精致的通用行政系统,把 GPU 看成大规模军团式调度,那么语言模型推理更像一个高压工厂,最贵的并不是工人数量,而是工序之间来回搬运零件的成本。很多时候,芯片并不是在“算不过来”,而是在“搬不过来”。
为什么未来芯片的胜负,不在通用,而在“刚好够通用”
在 AI 时代,通用 CPU 仍然重要,但它不再是最优解的中心。真正高效的路径越来越像一种折中艺术:既不能像 FPGA 那样过度自由,导致面积和功耗被吞噬,也不能像完全固定的 ASIC 那样僵硬到无法适应变化。这正是 DSP、TPU、NPU、CGRA、RPP 等架构依次登场的背景。
可以把这些架构理解为不同程度的“专门化”:
- CPU 像瑞士军刀,什么都能做,但每样都不极致。
- GPU 像流水线工厂,擅长大规模同构任务。
- TPU 更像为矩阵乘法定制的冲压车间。
- NPU 则把能耗和移动端约束当作第一原则。
- CGRA 和 RPP 代表一种更有意思的方向:让硬件既保留专用加速的效率,又保留一定的软件可编程性。
这背后其实是一个深刻的产业判断:真正值钱的不是把某一类计算做到极致,而是让硬件贴合真实工作负载的结构。语言模型推理的结构不是随机的,它高度重复、强依赖历史、对内存敏感、对延迟敏感、对并行粒度有特定要求。所以,最有机会的芯片并不是“最快的芯片”,而是“最懂这类顺序并行混合任务的芯片”。
CGRA 之所以重要,是因为它回答了一个长期难题:能不能做出一种比 FPGA 更省、更快,比 GPU 更贴近数据流,又比 ASIC 更容易部署的方案。粗粒度可重构阵列给出的答案是肯定的。它不试图把每个门级细节都变成可重构对象,而是把粒度抬到字级,让 ALU、互联和数据路径更接近真实程序的数学结构。这就像不是把每块砖都可变形,而是预先做好模块化的房间,再按需拼装成不同建筑。
最理想的硬件,不是最自由的,而是最少浪费地适配目标任务的。
这句话对 AI 尤其重要。因为 AI 负载的变化速度很快,但它们的底层算子并没有那么复杂,很多时候只是大规模矩阵运算、稀疏访问和可预测的数据流。也正因此,能否把“通用编程体验”和“专用硬件效率”结合起来,成了整个行业的核心竞争点。
重新理解可重构:不是“硬件能变”,而是“计算被重新组织”
很多人听到可重构硬件,第一反应是“硬件会变”。但更准确地说,真正被重构的不是硅片本身,而是计算的组织方式。这点非常重要,因为它把话题从器件层提升到了系统层。
例如,FPGA 的强项在于细粒度可重构,几乎可以把逻辑门按需组合,但代价是复杂的互连、较大的面积和功耗开销。CGRA 则进一步做减法,把可重构的单位放大到字级,减少控制复杂度,保留更好的延迟和能效。RPP 这类方案又往前走了一步,用准静态的方式简化编排,配合 SIMT 编程模型,尽量让程序员沿用熟悉的 CUDA 思维,同时把底层映射成数据流图,再映射到物理数据路径。
这里有一个很值得咀嚼的洞察:编程模型本身就是硬件架构的一部分。如果开发者要为每个新芯片重新学习一套“只属于这块芯片”的语言和心智模型,那硬件再强,也很难形成规模化生态。反过来,如果硬件能接住现有生态,比如 CUDA,那么它就不只是一个加速器,而是一个能插进现有工作流的生产系统。
这也是为什么“可编程性”与“高能效”并不是天然对立的。过去我们常常默认,越像 ASIC 就越难用,越像软件就越低效。但现在的趋势是把这个二分法打碎。好的架构不再问“你能不能适配我”,而是问“我能不能把你的思维方式翻译成我的执行方式”。
这类翻译能力,决定了一个芯片能否从论文走向市场。因为现实世界的 AI 应用并不只在实验室里运行,它们还要面对成本、功耗、部署速度、开发者习惯和供应链约束。最强的芯片,不一定是最激进的芯片,而是最能把工程摩擦降到最低的芯片。
从单词元到产业联盟:AI 竞争的本质是控制“延迟的总成本”
如果把视角拉远,就会发现 AI 时代的竞争图景和 PC、手机时代非常相似。过去决定平台权力的,不只是硬件性能,而是硬件与软件、制造与生态、设计与供应链的组合方式。今天的 AI 时代,新的权力中心正在形成:一边是芯片设计能力,一边是先进制程制造能力,一边是软件生态和开发者接口。
这就是为什么一些人把新的产业组合看作 AI 时代的主导联盟。因为 AI 时代不是单点冠军的时代,而是系统级协同的时代。模型要快,不只是模型层面要优化,芯片、内存、编译器、运行时、通信链路都要一起配合。推理的速度不是一个数字,而是一个链条上的总和。
从这个角度看,语言模型的“逐词元生成”提供了一个极具启发性的隐喻。整个系统也像是在逐层生成自己的下一步:
- 模型生成下一个词元,依赖 KV cache。
- 编译器生成下一段执行路径,依赖中间表示和硬件约束。
- 芯片生成下一次计算结果,依赖片上存储和数据流组织。
- 产业生成下一轮竞争优势,依赖设计、制造和生态协同。
每一层都不是在无限自由地选择,而是在前一层留下的状态中寻找最优动作。AI 时代的真正规律,也许不是“更快的算法打败更快的芯片”,而是谁能把顺序性折叠得更薄,谁就能把延迟的总成本压得更低。
这解释了为什么边缘 AI、服务器推理、训练加速会走向不同的架构路径。边缘场景最怕功耗和面积,数据中心最怕吞吐和成本,二者共同的敌人则是无谓的数据搬运。于是,未来的优势不再属于单一通用架构,而属于那些能针对任务结构做出足够精确重构的系统。
Key Takeaways
- 不要把 AI 推理理解成“算得多”,而要理解成“等待多”。很多性能损失来自顺序依赖、缓存访问和数据移动,而不是纯算力不足。
- 关注硬件是否贴合工作负载结构,而不是只看峰值指标。对语言模型推理来说,内存层次、数据流组织和延迟往往比理论 FLOPS 更重要。
- 把可编程性看成生态能力,而不是妥协。能兼容 CUDA 或类似编程习惯的架构,更容易把硬件优势转化为实际部署优势。
- 在 CPU、GPU、TPU、NPU、CGRA、RPP 之间比较时,要问任务的粒度是什么。词元级、矩阵级、字级和图级工作负载,对架构的要求完全不同。
- 在做技术选型时,优先寻找“减少数据搬运”的方案。无论是片上存储、数据流复用,还是分层内存,减少搬运几乎总是比单纯堆算力更划算。
结语:未来的 AI 不是更像大脑,而是更像一条被重新设计过的流水线
人们常说 AI 发展像一场智力竞赛,但更准确地说,它越来越像一场组织方式的竞赛。语言模型的本质顺序性提醒我们:即使是最先进的智能系统,也不是纯粹靠更强大脑赢的,而是靠把记忆、计算、编排和生态连接成一个更少浪费的整体。
这也是今天最值得重新理解的一点。我们不该只问“模型有多聪明”,更该问“这个聪明是如何被执行出来的”。当一个系统必须一个词元一个词元地前进时,决定它速度的,不只是思考能力,还有它能否把每一步之间的空转缩到最小。
未来真正稀缺的,不是算力本身,而是把顺序性变成高效生产力的能力。谁能做到这一点,谁就不只是造出了更快的芯片,而是重新定义了 AI 时代的计算边界。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣