真正限制大模型的不是算力,而是数据走错了路

Kevin Di

Hatched by Kevin Di

Aug 19, 2026

1 min read

94%

0

一个芯片拥有 638 TFLOPS 的算力,却可能比一块算力更高的 GPU 更适合运行大模型。一个拥有万亿参数的模型,也未必需要在每次推理时激活全部参数。听起来矛盾,实际上它们共同揭示了人工智能基础设施中最容易被忽略的事实:大模型竞争的核心,正在从“能算多少”转向“数据要走多远,以及必须走几次”。

这会改变我们理解芯片、模型规模和推理成本的方式。过去,人们习惯用参数量、峰值算力和制程工艺来描述系统能力。但在真实的模型运行中,最昂贵的往往不是乘加操作,而是等待数据从较慢的存储层被搬到计算单元,再把结果送往下一个节点。模型越大,路由越复杂,上下文越长,这种搬运和等待就越可能成为真正的瓶颈。

因此,下一阶段的 AI 优化,不是简单地把发动机做得更大,而是重新设计城市的道路、仓库和交通规则。

计算峰值的幻觉:芯片真正出售的是等待时间

比较 AI 芯片时,TFLOPS 很容易成为最醒目的指标。它像汽车广告中的最高时速,能够说明发动机的上限,却不能告诉你在拥堵的城市道路上,汽车究竟能多快到达目的地。对大模型而言,计算单元只是旅程的一部分,数据能否及时抵达,往往决定了最终体验。

以一套包含 SN40L 芯片的系统为例,其单芯片 BF16 算力为 638 TFLOPS,表面上并不一定压倒所有高端 GPU。但它配备了三层数据流存储结构:约 520MB 的片上 SRAM、64GB 的 HBM,以及 1.5TB 的外部内存。多芯片系统中,片上 SRAM 与 HBM 之间的带宽可以达到 25.5TB/s,HBM 与外部 DDR 之间的带宽也达到 1600GB/s。

这些数字的意义不只是“内存更大”或“带宽更高”。它们代表了一种不同的设计哲学:让尽可能多的中间状态停留在离计算单元最近的地方。 如果一项计算需要反复读取权重、激活值和缓存,那么每次跨越存储层级都会增加延迟。哪怕计算本身只需要几纳秒,数据搬运也可能让整个流程被迫停顿。

可以把它想象成一家餐厅。片上 SRAM 是厨师手边的砧板,容量有限,但取用几乎不需要转身。HBM 是厨房里的冷藏柜,容量更大,取用略慢。外部 DDR 则像楼下仓库,存货更多,但每次取货都要派人离开厨房。传统思路可能只关注厨师每秒能切多少菜,而真正影响出餐速度的,是他有多少时间在等待食材。

这也是为什么低延迟场景并不总是由峰值算力最高的芯片获胜。运行 Llama 3.1 8B 时,如果系统能够让关键数据保持在高速存储层,端到端延迟可以低于 0.01 秒。对实时对话、搜索增强、代理调用和工业控制来说,用户感知到的不是芯片的理论算力,而是这段等待是否足够短。

AI 芯片的第一产品不是计算能力,而是被消除的等待时间。

万亿参数并不等于每次都要搬运万亿参数

存储层级解释了芯片为什么要靠近数据,而稀疏模型则解释了模型为什么不必每次使用全部数据。

混合专家模型,也就是 MoE,将一个巨大的前馈网络拆分为许多专家模块。面对不同输入,路由器只激活其中一部分专家。于是,模型可以拥有极大的总参数量,却只让其中一小部分参与单次计算。这种机制类似一所拥有数千名专科医生的医院。医院的总专业能力很强,但一个普通病人不需要同时接受所有医生的诊断。

问题在于,专家数量增加后,模型并没有自动变得高效。每一次选择都需要路由,每一个参与推理的分支都可能产生自己的 KV 缓存。KV 缓存保存了上下文中已经计算出的键和值,使模型不必在生成每个新 token 时重新处理全部历史内容。上下文越长,分支越多,KV 缓存就越像一座不断扩张的档案馆。

当路由层数接近 120 层时,缓存管理会成为明显限制。原因不是模型突然失去了数学计算能力,而是不同分支的缓存难以高效组织、传输和复用。若继续增加路由深度,理论上的稀疏性可能被通信和内存访问成本抵消。此时,模型虽然只激活少量专家,却要为这些专家维护大量分散的状态。

这带来一个重要区分:参数稀疏不等于数据稀疏。 一个模型可以在计算上只激活 5% 的参数,却在缓存、路由和通信上付出远超 5% 的代价。就像医院只让一位医生接诊,却要求病人的全部病历先在几十栋楼之间传阅,节省下来的诊断时间很快会被行政流程吞掉。

一种解决思路,是把路由结构分布到多个节点上。例如,在 15 个不同节点中安排跨越式路由,让计算负载被分散。但这又提出了新的系统问题:入口节点需要完成数据加载和嵌入,不能像其他节点一样承担同等数量的层。否则,集群的头部会形成拥堵,后面的节点即使空闲,也无法弥补入口等待。

因此,MoE 的真正难题不是“如何增加专家”,而是“如何让专家的调用路径足够短、足够稳定,并且让缓存能够跟着数据流动”。

模型规模、集群规模和成本之间的隐藏关系

如果只看参数数量,扩大模型似乎是一条直接的路线:参数越多,能力越强。但参数增长带来的成本并不以线性方式出现,因为系统还必须同时扩大存储、互联、缓存和调度能力。

一个典型例子是,某类更大的模型虽然前馈参数只比 175B 参数的模型多约 1.6 倍,成本却可能达到约 3 倍。差异并不主要来自单次矩阵乘法,而来自更大的集群和更低的整体利用率。更多的机器意味着更多通信,更复杂的同步,也意味着更多计算单元可能在等待别的节点完成工作。

这可以用一个简单公式理解:

有效性能 = 峰值算力 × 利用率 ÷ 数据移动成本。

很多系统只优化公式的第一项,却忽略了后两项。假设一台机器拥有极高的峰值算力,但实际利用率只有 30%,另一台芯片的峰值算力低一些,利用率却达到 70%,后者在真实任务中完全可能更快、更便宜。

推理成本也因此高度依赖工作负载。对于 GPT 4 级别、8K 上下文的推理,在高利用率和大批量条件下,使用 128 张 A100 的估算成本约为每 1000 tokens 0.0049 美元,使用 128 张 H100 则约为 0.0021 美元。这些数字并不意味着所有用户都能获得同样的价格,因为低批量、突发流量和较短请求会显著降低利用率。它们真正说明的是:硬件升级只有在系统能够持续喂饱硬件时,才会转化为成本优势。

这里存在一个常见误区。人们认为更强的芯片会自然带来更低的单位成本,但如果模型的路由不均衡、缓存无法复用,或者请求太零散,新增算力只会增加闲置资源。就像扩建高速公路并不能解决所有交通问题。如果车辆都在同一个收费站排队,公路本身再宽也没有意义。

从“参数中心”转向“数据路径中心”

把存储层级、MoE 路由和推理成本放在一起,可以得到一个更有解释力的框架:模型系统的效率,取决于数据路径的长度、分叉数量和重复搬运次数。

可以用三个问题审视任何大模型系统。

第一,数据离计算单元有多远?权重和激活值是在片上 SRAM 中重复使用,还是必须频繁往返于外部内存?如果数据经常跨越多个层级,峰值算力就难以兑现。

第二,一次请求会产生多少分叉?MoE 路由虽然减少了激活参数,但每个分支都可能带来缓存和通信负担。路由器选择了更少的专家,不代表网络移动了更少的状态。

第三,同一份数据被搬运了多少次?如果多个层、多个专家或多个节点反复读取相同内容,那么最有效的优化可能不是增加计算单元,而是改变数据布局,让中间结果停留在原地。

这个框架也解释了为什么专用芯片可能在某些场景中击败通用 GPU。GPU 的价值在于通用性和生态,它能处理极其广泛的任务。专用架构则可以围绕特定的数据流重排计算,把更多状态固定在高速存储中,减少不必要的往返。它牺牲了一部分灵活性,却换取了更稳定的延迟和更高的有效利用率。

未来的芯片比较,可能需要从“每秒完成多少次运算”升级为“每个 token 让数据移动了多少字节”。模型比较也不能只看总参数,而要同时看每个 token 激活多少参数、产生多少 KV 缓存、经过多少路由节点,以及这些状态能否被局部复用。

这意味着模型架构和硬件架构将越来越难以分开设计。一个不考虑缓存布局的 MoE 模型,会把压力转嫁给芯片和网络。一个只追求带宽,却不理解模型路由的芯片,也可能无法获得实际收益。真正高效的系统必须让模型的稀疏性与硬件的存储层级相互匹配。

Key Takeaways

  1. 评估芯片时,不要只看 TFLOPS。 同时检查片上 SRAM、HBM 容量、各层级带宽,以及真实任务中的利用率和端到端延迟。

  2. 评估 MoE 模型时,区分参数稀疏与数据稀疏。 重点测量每个 token 的 KV 缓存规模、路由分支数量和跨节点通信量。

  3. 把数据路径画出来。 对一次推理标记权重、激活值和缓存经过了哪些存储层级与网络节点,优先优化重复搬运和入口拥堵。

  4. 不要把更大集群自动等同于更低成本。 只有在批量、负载均衡和缓存复用都足够好时,新增硬件才会带来单位 token 成本下降。

  5. 优先设计局部性。 能在同一芯片、同一节点或同一存储层内完成的工作,不要轻易跨越网络。减少一次远距离数据移动,可能比增加一组计算核心更有价值。

结语:下一场竞争,是谁能让数据少走一步

大模型时代的规模竞赛,表面上仍然是参数、芯片和集群的竞赛,但更深层的竞争是对物理距离的管理。参数必须被存放,缓存必须被维护,专家必须被召回,结果必须在节点之间传递。每一次移动都有成本,每一次分叉都有管理成本,每一次等待都会侵蚀理论算力。

这也重新定义了“更大的模型”意味着什么。真正先进的模型,不一定是拥有最多参数的模型,而是能够以最少的数据移动,调用最合适的参数,并让中间状态尽可能留在原地的模型。

未来最强的 AI 系统,不是计算最多的系统,而是让数据最少走弯路的系统。

当我们再次听到某款芯片拥有更高算力,或某个模型拥有万亿参数时,应该追问的不是“它有多大”,而是:这些数据在哪里?它们要走多远?有多少次必须等待?答案,才决定了一个系统究竟是在展示规模,还是在真正创造智能。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣