AI 芯片的终局,不是更强的 GPU,而是更精确的分工
Hatched by Kevin Di
Aug 28, 2026
1 min read
2 views
93%
一个反直觉的问题是:如果未来的 AI 芯片市场仍然高速增长,为什么最有价值的方向可能不是制造一颗更强的通用 GPU?
答案或许藏在两个看似无关的变化里。第一,ASIC 目前在 AI 芯片市场中的份额还不足 10%,但预计到 2027 年可能增长到 30%,年复合增长率约为 30%。第二,云端大模型基础设施正在把一次推理拆成 Prefill 和 Decoder 两个阶段,并为它们配置不同类型的 GPU,甚至让计算、显存带宽、缓存和调度系统彼此分离。
表面上看,一个变化发生在芯片设计层面,另一个发生在数据中心架构层面。更深的联系是:AI 基础设施正在从追求单点性能,转向追求任务与资源之间的精确匹配。
这不仅意味着 ASIC 会增长,也意味着“什么叫一颗好芯片”正在改变。未来的竞争重点,未必是某个芯片在实验室跑分多高,而是整个系统能否把不同工作阶段交给最合适的资源,同时在延迟、吞吐、成本和可靠性之间持续做出动态权衡。
从全能机器到专用流水线
传统计算设备的核心想象,是一颗足够强大的处理器承担尽可能多的任务。GPU 之所以在生成式 AI 时代占据中心位置,正是因为它提供了强大的并行计算能力、成熟的软件生态和相对广泛的适应性。面对不断变化的模型结构,这种通用性是一种巨大的保险。
但通用性也意味着浪费。就像一辆拥有八个发动机的卡车,如果它每天只负责在城市里运送小包裹,那么发动机的峰值功率并不等于运营效率。大量资源可能消耗在不需要的地方,真正限制系统的反而是道路拥堵、装卸时间和调度失误。
大模型推理正逐渐暴露出类似问题。一次请求并不是一种均匀的计算任务,而是一条包含多个阶段的生产流程。Prefill 阶段需要读取用户输入,构建中间状态,通常具有较强的计算密度。Decoder 阶段则要逐步生成 token,反复访问已经形成的缓存,往往更受显存带宽和数据搬运速度限制。
如果用同一种昂贵资源处理两个阶段,就像让同一批工人既负责高强度设计,又负责大量重复搬运。系统当然可以运行,但资源利用率很难达到最优。更合理的方式,是在 Prefill 阶段使用算力更强的 GPU,在 Decoder 阶段使用算力相对弱一些但带宽更大的 GPU,让不同硬件承担不同瓶颈。
这就是架构分离的真正含义。它不是简单地把一个程序拆成两半,而是承认:同一个业务流程内部,不同阶段的稀缺资源并不相同。
ASIC 的崛起也遵循同一逻辑。ASIC 并不试图在所有任务上胜过 GPU,它选择牺牲一部分通用性,换取特定工作负载上的能效、延迟、面积或成本优势。当模型结构、算子类型和服务规模足够稳定时,专用化就不再是冒险,而可能成为一种经济必然。
真正稀缺的不是算力,而是匹配能力
过去讨论 AI 芯片,最容易陷入一个简单指标:每秒可以完成多少次计算。但在真实云服务中,用户购买的不是理论算力,而是一个承诺,例如请求必须在某个时间内完成,系统必须承受高峰流量,长文本和短问题都要获得相对稳定的体验。
因此,基础设施的核心指标不是单一的峰值,而是 服务等级目标,也就是 SLO。一台设备即使平均吞吐很高,只要在高峰期排队严重,或者少数请求延迟突然失控,它对业务的价值就会大幅下降。
可以把 AI 推理系统想象成一家餐厅。Prefill 像是厨师根据订单准备食材和完成复杂烹饪,Decoder 则像是不断把已经准备好的菜品快速装盘并送出。前者可能需要强火和复杂操作,后者更依赖传送带、工作台和配送速度。如果所有环节都让最昂贵的厨师完成,餐厅未必更快,反而可能因为后厨拥堵而降低整体服务能力。
更进一步,推理系统还必须处理不同类型的订单。即时问答关注首 token 延迟,长文本生成关注持续吞吐,企业任务可能更重视稳定性和可预测性,离线批处理则可以牺牲实时性来换取更低成本。它们对计算、带宽、缓存和调度的需求完全不同。
所以,未来的数据中心不会只是拥有更多芯片,而会拥有一组更加异质化的资源池。强算力 GPU、带宽型 GPU、专用推理芯片、缓存池、网络资源和存储资源,都可能被作为独立能力进行编排。
AI 基础设施的核心竞争,不是把所有任务都交给最强的芯片,而是让每个任务尽可能短暂地占用最合适的芯片。
这也解释了为什么缓存复用和阶段调度如此重要。Prefill 阶段如果能够更多复用已有 Cache,就能减少重复计算。Decoder 阶段如果能够集中提高吞吐,就能让有限的带宽服务更多请求。两者的优化方向不同,甚至可能互相争夺资源。没有调度系统,硬件分离只会把问题从芯片内部转移到芯片之间。
ASIC 与分离式架构,其实是同一场革命
ASIC 和分离式架构的共同点,可以概括为一个三层模型。
第一层是 工作负载分解。系统不再把 AI 看成一个整体任务,而是识别其中不同阶段的计算模式。训练、Prefill、Decoder、检索、缓存访问和通信,都可能拥有不同的瓶颈。
第二层是 资源专门化。针对明确且稳定的瓶颈,使用更适合的硬件。算力密集型任务需要强计算资源,带宽密集型任务需要更快的数据访问,固定算子可以交给 ASIC,变化较大的任务则保留在 GPU 上。
第三层是 软件编排。专用硬件越多,调度就越重要。系统必须知道哪个请求处于什么阶段,哪些缓存可以复用,哪类资源即将过载,哪些请求拥有更高优先级,以及如何在 SLO 约束下重新分配任务。
缺少第一层,专用化没有依据。缺少第二层,分解无法转化为性能收益。缺少第三层,资源池越复杂,系统越可能陷入局部最优,甚至比统一架构更难管理。
这套模型也揭示了一个常见误区:人们经常把 ASIC 与 GPU 看成替代关系,把 GPU 与分离式架构看成竞争关系。实际上,它们更可能形成组合关系。GPU 负责变化快、需要灵活性的部分,ASIC 负责规模大、模式稳定的部分;强算力设备处理计算瓶颈,带宽型设备处理记忆体瓶颈;统一平台提供软件与调度,异构硬件提供成本和效率。
因此,AI 芯片市场的增长不一定意味着某一种芯片彻底消灭另一种芯片。更可能的情形是,市场按照工作负载不断分层。某个芯片的价值,不再取决于它能否成为唯一平台,而取决于它能否在系统中占据一个不可替代的高价值位置。
为什么“下注”本身变成了能力
在技术快速变化的阶段,过早专用化存在明显风险。今天最热门的模型结构,明天可能被新的注意力机制、压缩方法或推理范式改变。ASIC 的设计周期长,一旦工作负载发生变化,硬件可能迅速失去优势。
但完全依赖通用 GPU 也有另一种风险。随着推理规模扩大,电力、显存、供应链和资本开支会成为硬约束。即使 GPU 仍然拥有最好的通用性,也未必适合承担每一种重复性工作。
这使得芯片公司的策略不再是押注一个赢家,而是建立一组不同期限的选择权。通用 GPU 是对不确定性的保险,ASIC 是对稳定工作负载的提前锁定,网络和互联技术是对分离式架构的基础设施投资,软件调度则是把这些选择权转化为实际收益的机制。
这里的关键不是“多做几种芯片”这么简单,而是要判断何时应该专用化。可以用三个问题检验一个工作负载是否适合 ASIC:
- 它的计算模式是否足够稳定,未来几年内不会频繁改变?
- 它是否在大规模部署中持续占用大量资源,并且通用 GPU 存在明显浪费?
- 它的性能瓶颈是否足够清晰,例如固定在某类算子、带宽或数据搬运上?
如果三个问题的答案都趋向肯定,专用芯片就可能拥有坚实的经济基础。反之,如果模型仍在快速迭代,或者业务流量高度不稳定,保留 GPU 的灵活性往往更重要。
同样,判断是否采用分离式架构,也不能只看理论吞吐。必须同时评估数据传输成本、缓存一致性、调度复杂度、故障隔离和 SLO 变化。分离不是免费的,它把原本隐藏在单机内部的协调问题,显式地暴露给整个系统。
从买芯片到设计资源组合
对于 AI 公司和云服务商而言,最重要的决策变化是:不要再只问“哪颗芯片最快”,而要问“我的业务需要怎样的资源组合”。
例如,一个以短问答为主的产品,可能更在意首 token 延迟和高并发响应,需要强 Prefill 能力和高效缓存。一个以长篇内容生成为主的产品,可能更受 Decoder 吞吐和显存带宽影响。一个企业级智能体平台,则可能同时面对检索、工具调用、长上下文和多轮交互,最重要的能力未必是某个单项跑分,而是能否在多种工作流之间动态调度。
这会改变基础设施的采购方式。未来的采购对象可能不是一批型号相同的服务器,而是一套能够根据业务变化进行重组的资源池。评估指标也应从芯片峰值性能扩展为每次有效请求的成本、不同流量下的尾延迟、缓存复用率、资源利用率和故障时的降级能力。
更值得注意的是,软件团队的角色会被重新定义。调度器不再只是把任务排队,而是在做一种实时的经济决策:把哪种请求交给哪种硬件,何时保留缓存,什么时候牺牲吞吐来保护延迟,如何让高优先级任务穿过拥堵,以及如何在资源紧张时进行过载处理。
这意味着 AI 基础设施的护城河,可能逐渐从单颗芯片的性能转移到 软硬件协同形成的资源配置能力。芯片是资产,调度系统是把资产变现的组织能力。没有后者,前者很容易沦为昂贵而闲置的库存。
Key Takeaways
- 用工作负载而不是芯片型号来规划基础设施。 先拆分 Prefill、Decoder、缓存、检索和通信的瓶颈,再决定需要什么硬件。
- 把 SLO 放在峰值算力之前。 同时观察首 token 延迟、尾延迟、持续吞吐和高峰期稳定性,避免被单一跑分误导。
- 在稳定且规模足够大的环节考虑 ASIC。 对变化快的模型保留 GPU 的灵活性,对重复性高的瓶颈进行专用化。
- 把缓存与调度视为一等基础设施。 Cache 复用、优先级、过载处理和资源隔离,可能比增加少量计算能力带来更大的收益。
- 用资源组合思维替代单点采购思维。 强算力、带宽、存储、网络和专用芯片应当被视为可以动态编排的能力,而不是彼此孤立的设备。
最终,AI 芯片产业的变化并不是从 GPU 时代简单走向 ASIC 时代,也不是从集中式架构简单走向分离式架构。真正发生的是一次更深层的转变:计算正在从“设备拥有多少能力”,转向“系统能否在正确的时间调用正确的能力”。
当模型越来越复杂、请求越来越多样、服务等级越来越严格时,最昂贵的浪费不是芯片暂时空闲,而是让错误的芯片处理错误的任务。未来最强的 AI 基础设施,未必看起来像一台性能惊人的超级机器,而更像一个能够不断重新分工的城市:高速公路服务长途运输,支路处理本地配送,仓库保存高频物资,交通系统根据拥堵实时改道。
真正的终局不是所有资源都变得一样强,而是它们能够被足够精确地组织起来。届时,芯片的价值将不只由晶体管数量决定,也由它在这张动态网络中承担什么角色决定。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣