AI芯片的真正战场,不是算力,而是记忆层级的再设计
Hatched by Kevin Di
May 29, 2026
1 min read
9 views
84%
当AI推理越来越便宜,为什么芯片反而要重新发明“记忆”
一个看似矛盾的事实正在发生:大模型推理越来越普及,市场却没有朝着“更强的通用GPU”一条路收敛,反而开始分叉成两种截然不同的方向。一种方向是把芯片做得更激进,把计算和数据流彻底重排;另一种方向是把现有架构继续打磨,在不推翻体系的前提下,想办法把瓶颈一点点挪走。
这背后真正的问题不是“谁的算力更强”,而是一个更底层的问题:推理时代,芯片到底是在买计算,还是在买记忆的搬运能力?如果把这件事想明白,就会发现很多关于ASIC、GPU、3D DRAM、mesh众核的争论,其实都指向同一个核心矛盾:AI推理不是纯计算问题,而是数据如何在极短时间内、以极低能耗,被送到正确位置的问题。
换句话说,未来芯片竞争的重点,正在从“谁能算得更快”转向“谁能让数据少走几步”。
推理的本质,不是算术,而是搬运术
很多人下意识把AI芯片想成“乘法器更多、频率更高、并行度更大”的机器。但在推理场景里,真正昂贵的往往不是那一下矩阵乘法,而是为了做那一下乘法,数据来回穿梭所消耗的时间和能量。
你可以把这件事想象成一家高峰期的餐厅。厨师的刀工再快,如果食材总是放在仓库最远的角落,服务员每次都要穿过整家店去取,最后整个餐厅的效率仍然会被“走路”拖垮。AI芯片里的SRAM、DRAM、HBM、本地缓存、片上网络,本质上就是这家餐厅里的厨房、备菜间、仓库和传菜通道。
在推理中,模型参数常常大得惊人,局部SRAM再怎么优化,也很难把所有需要的数据都留在近处。于是问题变成了:如何在不让数据远行的前提下完成计算。这就是为什么会出现两条路线:
- 激进路线:彻底重构数据流和计算单元,尽量让数据在算子附近就地处理。
- 柔和路线:维持mesh众核等相对通用的组织方式,但通过更高带宽、更近距离的DRAM,比如3D DRAM,把“仓库”尽可能搬到“厨房”旁边。
这不是技术口味之争,而是架构哲学之争。
推理芯片的核心矛盾,从来不是“有没有足够多的算力单元”,而是“数据是否能在合适的时间出现在合适的位置”。
两种路线,其实是在回答同一个问题:数据应该离计算多近
如果把AI芯片看成一个城市,那么GPU更像是一个已经建成的大都市,基础设施完善,适合承载各种交通需求,但城市太大,路网复杂,拥堵也难避免。ASIC则像围绕某类核心活动新建的功能城区,街道不一定最通用,但动线更短,效率更高,针对特定需求可以做到极致。
这就是为什么市场会同时出现两种看似矛盾的判断:一方面,通用GPU依然是AI算力生态的中心,生态、软件、开发者和部署便利性让它拥有强大的惯性;另一方面,ASIC芯片份额却被看好有机会从不足10%升至30%。这并不意味着GPU会被迅速淘汰,而意味着推理工作负载正在把芯片市场拆分成“通用平台”和“专用机器”两类需求。
这里最值得警惕的误区是,把ASIC理解为“只要特定就一定更好”。事实上,ASIC真正厉害的地方不是“特定”,而是它能围绕特定数据流重写系统边界。当模型形态、上下文长度、精度要求、吞吐目标都足够明确时,芯片可以不再把资源浪费在通用性上,而集中投入到最关键的路径上,比如更近的存储、更短的互连、更少的中间拷贝、更高的能效比。
而mesh众核加3D DRAM的思路,则代表另一种现实主义:既然大规模推理时代还离不开灵活性,那就先不推翻现有框架,而是把最痛的地方先治好。SRAM小的问题,本质上是“近端缓存不够装”。3D DRAM的价值,不只是更大容量,更是把容量以更低延迟、更高带宽的方式贴近计算阵列,减少那种反复跨层访问的摩擦成本。
这意味着,真正的分歧不是“通用还是专用”,而是:
- 是把计算中心做得更像一个封闭的局部系统,尽量在局部解决问题;
- 还是把整个系统做成一个更聪明的层级网络,让不同层的记忆体各司其职。
前者追求架构重写,后者追求层级重整。
ASIC崛起,不是GPU失效,而是“推理经济学”变了
很多关于AI芯片的讨论,常常把问题说成“谁会赢”。但现实可能更像“谁会在什么任务上赢”。训练和推理并不是同一种经济模型。训练阶段追求的是大规模吞吐和迭代能力,推理阶段追求的则是单位请求的成本、延迟和能效。
这会导致一个关键变化:当AI服务从实验室走向大规模在线业务,芯片的价值衡量方式就会从“峰值性能”转向“每次响应的总成本”。如果一个ASIC能在特定模型上把延迟压低、能耗降低、机架密度提高,即便它不如GPU通用,也可能在商业上更有吸引力。
这也是为什么市场预测里,ASIC份额增长得不是“突然”,而是“持续”。30%的年复合增长率意味着它不是一次性的炒作,而是一种由工作负载形态驱动的结构性迁移。想象一下,如果一家云厂商每天要处理数十亿次推理请求,那么节省的不只是芯片采购成本,而是整个数据中心的电力、散热、机柜空间、运维复杂度,以及最重要的,单位请求的毛利。
在这个意义上,ASIC不是GPU的反面,而是推理商业化成熟后的自然分支。当模型能力开始标准化,硬件就有机会为这份标准化提供更窄但更深的优化。
但这并不意味着ASIC会“一统天下”。恰恰相反,市场越成熟,越会呈现出分层结构:
- 前沿探索需要通用GPU,因为模型变化快,架构试验多。
- 稳定部署会更偏向ASIC,因为需求清晰,规模巨大。
- 过渡地带则会依赖类GPU但更强调存储层优化的方案,比如mesh众核结合3D DRAM。
这才是更接近现实的图景:不是单一赢家,而是按任务分层的硬件生态。
真正的分水岭,是“可预测性”而不是“性能极限”
如果要给这场变革找一个最深层的关键词,那一定是可预测性。
GPU之所以强大,是因为它足够通用,能适配不确定的未来。ASIC之所以有吸引力,是因为它愿意押注某种可预测的未来。mesh众核加3D DRAM之所以有价值,是因为它试图在一定程度上把不确定性留给软件,把确定性留给存储层级和数据路径。
这里的本质差别在于:
- 通用架构赌的是“未来会继续变化,所以我必须灵活”。
- 专用架构赌的是“未来的主流工作负载已经足够稳定,可以围绕它优化”。
这也是为什么当人们谈ASIC时,真正重要的不是“有没有更强的算力”,而是“模型和业务是否足够稳定到值得做专门化投资”。如果一个工作负载每三个月就重写一次,那么ASIC的回报会被快速侵蚀。如果一个工作负载能稳定存在多年,比如大规模推荐、检索增强推理、固定结构的多模态服务,那么专用化就会越来越划算。
从这个角度看,3D DRAM不是一个单纯的工程补丁,而是一种战略信号。它说明产业正在意识到,很多瓶颈并不在计算单元本身,而在层级记忆系统的组织方式。当SRAM不够大时,最笨的办法是硬塞更多SRAM,代价是面积和功耗;更聪明的办法是承认分层存储不可避免,然后让高带宽、大容量、近距离的DRAM参与到计算流程中。
这其实像是在重新设计图书馆。过去的目标是让每个座位旁边都堆满书,结果空间不够。新的思路不是把每本书都搬到桌边,而是让书架、索引、传送和借阅系统变得极其高效,让人几乎感觉不到自己在找书。推理芯片的未来,很可能就是这样一种“无感搬运”的系统。
你该如何理解下一代AI芯片竞争
如果把这些趋势收束成一个判断,那就是:下一代AI芯片的胜负手,不在于谁把峰值算力做得更高,而在于谁能把数据移动成本压得更低,并且把这种低成本规模化复制。
这句话很重要,因为它会改变你看待芯片路线图的方式。过去看芯片,很多人只盯着TOPS、频率、制程、核心数。未来更该盯的是:
- 计算单元和存储之间有多近?
- 数据从DRAM到算子的路径有多短?
- 这个架构是否针对目标模型的访存模式做了优化?
- 在真实业务负载下,单位请求成本能降多少?
如果一个方案只是在峰值参数上漂亮,但数据路径很长,那么在推理时代它未必占优。反过来,一个看起来没有那么“猛”的方案,只要能让数据更少搬家、更少等待、更少浪费,就可能在商业上赢得更大份额。
这就是为什么,硬件竞争正在从“算力军备竞赛”转向“架构经济学”。ASIC的崛起和3D DRAM的流行,并不是两个分散现象,而是同一趋势的两个侧面:前者代表对特定任务的极致收缩,后者代表对存储层级的精细重构。一个把边界收紧,一个把路径缩短。
未来最值钱的芯片,不一定是最快的芯片,而是最少让数据走弯路的芯片。
Key Takeaways
- 不要只看算力指标,要看数据移动成本。在推理场景里,很多时候真正的瓶颈是存储层级和带宽,而不是乘法单元数量。
- ASIC的增长本质上是推理经济学变化的结果。当业务稳定、规模巨大、延迟敏感时,专用化会越来越有吸引力。
- 3D DRAM不是补丁,而是架构策略。它的价值在于把更大的记忆容量贴近计算,减少SRAM不足带来的访问代价。
- 未来不是GPU对ASIC的零和战争,而是分层共存。探索用通用平台,稳定部署用专用芯片,中间地带用更强调存储优化的混合架构。
- 判断芯片路线图时,先问工作负载是否稳定。越稳定的任务,越值得围绕其数据流做专门优化。
结语:AI芯片的下一轮革命,可能是一次“去远距离化”
如果说过去十年芯片创新的关键词是“更多算力”,那么接下来十年更可能是“更少搬运”。这不是一个浪漫的口号,而是由物理定律、能耗现实和商业部署共同逼出来的结果。只要模型继续增长,只要推理继续规模化,芯片就必须学会让记忆离计算更近,让路径更短,让每一次数据访问更像一次精准投递,而不是一次长途运输。
这会重新定义什么叫做高性能。真正先进的芯片,不是把更多东西塞进同一个硅片,而是把系统组织得足够聪明,让你感觉不到系统内部有那么多层。也许未来我们回头看今天,会发现AI芯片领域最重要的转折,并不是某个算力数字冲上了新高,而是产业终于意识到:在推理时代,赢的不是最快的计算,而是最优雅的记忆系统。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣