真正的AI算力,不在峰值,而在精度与带宽的配平

Kevin Di

Hatched by Kevin Di

Aug 08, 2026

1 min read

93%

0

真正昂贵的,往往不是把所有事情都做到最高规格,而是错误地把所有事情都做到同一种规格。

一块芯片可以拥有惊人的峰值算力,却在真实的大模型服务中表现平庸;一个模型也可以大部分使用低精度计算,却仍然依赖少数高精度组件维持稳定。看似一个问题属于硬件,另一个属于算法,实际上它们都指向同一个更深层的命题:复杂系统的效率,不取决于某个指标有多高,而取决于不同指标之间是否彼此配平。

这改变了我们理解大模型基础设施的方式。未来的竞争不只是“谁的算力更多”,也不只是“谁能把数字压得更低”,而是:谁最懂得把不同的精度、带宽、容量、延迟和灵活性,分配到真正需要它们的地方。

峰值性能为什么经常是一种幻觉

评价芯片时,人们很容易被一个数字吸引:每秒可以完成多少次计算。但大模型推理不是一场只考计算速度的考试,而更像一个拥有多个收费站的城市交通系统。即使高速公路足够宽,只要出口拥堵、仓库容量不足,或者不同区域之间的道路太窄,整体吞吐量仍然上不去。

大模型推理至少同时受到几类资源约束:计算能力、内存容量、内存带宽、芯片间互联带宽、输入输出带宽,以及软件层面的灵活性和可编程性。它们不是可以相互替代的同一种资源。算力不足时,增加带宽帮助有限;带宽不足时,增加计算单元只会让更多单元等待数据;内存容量不足时,再快的计算也无法容纳完整的模型和缓存状态。

可以用一个简单的近似来理解这种关系:系统的有效性能,往往接近于所有关键环节中最慢的一环,而不是各项能力的平均值。更准确地说,瓶颈还会随着工作负载变化。短文本生成、超长上下文、批量服务、专家混合模型和多轮对话,都会把瓶颈推向不同位置。

例如,在生成式模型中,每生成一个新词,都需要读取大量权重,并不断更新注意力所需的缓存。如果计算单元很强,却需要从较慢的内存中反复搬运数据,那么芯片大部分时间并没有进行有效计算。此时,购买更多计算单元,像是在一个已经堵车的收费站前继续修建更宽的高速公路,视觉上更宏大,交通状况却没有改变。

峰值算力描述的是发动机的能力,有效吞吐描述的是整辆车能否把燃料、乘客和动力同时送到目的地。

这也是为什么只在某个单点冲刺到极限的架构,很容易被系统级需求拉回现实。极高的计算速度如果没有相称的内存带宽,极大的内存容量如果无法快速访问,单芯片性能如果无法通过互联扩展,最后都会转化为闲置的晶体管和未兑现的宣传数字。

精度不是全局开关,而是一张预算表

混合精度提供了另一个重要的视角。很多人把低精度理解成一种简单的压缩策略:既然较低精度更快、更省内存,那就把整个模型都转换过去。但真实的模型并不是一块均匀的金属,它更像一座城市,交通主干道、供水系统、仓库和普通住宅,对基础设施的要求并不相同。

有些模块对数值误差相当敏感。嵌入模块负责把离散符号映射为连续表示,输出头决定模型最后如何把内部状态转化为词语概率,专家混合模型中的门控模块负责决定信息流向哪个专家,归一化操作维持不同层之间的尺度关系,注意力操作则直接影响上下文信息如何被聚合。它们并不一定拥有最多的乘法运算,却可能承担最关键的数值协调功能。

因此,一个更聪明的策略不是追求全局统一的低精度,而是进行精度分区:对误差容忍度高、计算量大的部分使用较低精度,对误差敏感、会影响全局稳定性的部分保留较高精度。与此同时,主权重、权重梯度和优化器状态也可以保存在更高精度中,避免训练过程中误差不断累积,最终破坏模型的动态稳定性。

这背后有一个容易被忽略的事实:精度的价值不是均匀分布的。 在某些矩阵乘法中,降低精度可以大幅减少内存流量和计算成本;但在归一化、概率分布和路由决策中,一次微小误差可能被后续层放大。低精度节省的是资源,高精度购买的是稳定性。真正的问题不是“要不要低精度”,而是“哪里值得为高精度付费”。

可以把精度看作一张有限预算表。假设系统只能提供固定的存储空间、带宽和功耗,那么将所有模块都设为高精度,可能导致模型无法部署;将所有模块都设为低精度,则可能造成训练不稳定、路由失真或输出质量下降。合理的做法,是把高精度投入到那些具有高误差放大率的节点。

高精度不应该像奢侈品一样平均铺开,而应该像保险一样配置在最可能引发系统性故障的地方。

这个思路也解释了一个反直觉现象:更高精度并不必然意味着更高的总体成本。如果只有少数关键组件保留高精度,而大多数计算密集部分使用低精度,那么模型可能同时获得稳定性与效率。局部的昂贵,反而可以换来全局的便宜。

从混合精度到混合系统:真正的单位不是芯片,而是工作流

把这两条线索放在一起,可以得到一个更完整的框架:大模型基础设施优化,本质上是在做多维度的混合配置。 混合的对象不只有精度,也包括存储层级、计算单元、互联方式、软件调度和服务策略。

同一个模型的不同部分,可能需要不同的硬件待遇。密集矩阵计算需要高吞吐的计算阵列;频繁访问的缓存需要高带宽内存;容量巨大的权重可以放在更便宜但更慢的存储层;门控和控制逻辑需要更高的灵活性;跨芯片通信则要求稳定的互联带宽。若试图用一种固定、单一、极端优化的芯片满足所有要求,通常会在某些维度上产生严重浪费。

这可以称为瓶颈迁移模型。当你解决一个瓶颈,另一个瓶颈就可能显现出来:

  1. 提升计算能力后,内存带宽成为限制。
  2. 增加内存带宽后,互联或输入输出成为限制。
  3. 扩大容量后,调度和数据搬运成为限制。
  4. 使用更低精度后,数值稳定性和软件校准成为限制。
  5. 采用更专用的硬件后,模型变化和工作负载变化又会暴露可编程性不足。

所以,系统优化不能只问“哪个指标最高”,而要问“下一个瓶颈在哪里”。一项设计如果只把当前瓶颈推到极限,却没有为下一层瓶颈留下余量,得到的往往只是短期的实验室优势。

这也是专用加速器面临的核心挑战。专用化可以在稳定的算子、固定的精度和规则的访问模式上实现极高效率,但大模型服务具有强烈的不确定性。模型架构会变,专家路由会变,序列长度会变,用户请求的批次会变,甚至同一模型在训练和推理阶段的资源压力也不同。硬件越专用,单点效率可能越高;但工作负载一旦偏离假设,闲置和调度损失也可能越严重。

因此,可编程性不是效率的敌人,而是对不确定性的保险。它可能牺牲一部分理论峰值,却能让系统适应新的算子、稀疏模式、精度方案和服务形态。对于生命周期很短、变化很快的大模型基础设施而言,这种适应性本身就是一种性能。

用“误差放大率”和“资源回报率”重新设计系统

如果要把上述思想转化为工程方法,可以建立两个简单但有用的指标。

第一个是误差放大率。它表示某个模块输入中的微小数值误差,经过后续计算后,会对最终输出造成多大影响。门控、归一化、注意力权重和输出概率附近的操作,往往值得重点测量。误差放大率越高,就越不适合盲目降低精度。

第二个是资源回报率。它表示在某个模块上投入额外的带宽、容量、精度或计算能力,能够换回多少整体收益。一个模块即使计算量很大,如果它受制于内存访问,那么增加计算单元的资源回报率可能很低;相反,稍微增加缓存或带宽,可能立即提升整个服务的吞吐。

将两个指标交叉起来,可以得到四类决策:

  1. 高误差放大率、高资源回报率:优先保留高精度,并提供稳定的带宽与计算资源。
  2. 高误差放大率、低资源回报率:重点保证数值安全,但不必无限堆叠硬件。
  3. 低误差放大率、高资源回报率:适合使用低精度和专用加速,追求规模化收益。
  4. 低误差放大率、低资源回报率:避免过度优化,接受一定的近似或共享资源。

这个框架比“全模型统一量化”或“全系统追求最高算力”更接近现实。它允许工程师把资源花在真正决定结果的地方,也允许系统在不关键的环节主动接受近似。

在实际部署中,还应把服务目标纳入考量。低延迟在线问答和高吞吐离线处理,未必需要同一种芯片配置;短上下文和超长上下文,内存带宽与容量的权重不同;小批次请求强调响应速度,大批次请求则更看重单位成本。所谓最优架构,从来不是脱离场景的绝对答案,而是对特定工作流的资源配平。

Key Takeaways

  1. 不要用峰值算力代表系统性能。 同时测量计算、内存容量、内存带宽、互联、输入输出和调度开销,找出真实工作负载中的最慢环节。
  2. 把精度当作预算,而不是开关。 先识别误差放大率高的模块,再决定哪些地方保留高精度,哪些地方使用低精度。
  3. 优化下一个瓶颈,而不是重复强化当前瓶颈。 每次扩展算力、带宽或容量后,都重新评估瓶颈是否已经迁移。
  4. 为变化保留可编程性。 如果模型结构、序列长度和服务模式仍在快速变化,适度牺牲理论峰值,换取更长的适应周期,可能更划算。
  5. 用工作流而不是单个芯片评估成本。 真正需要比较的是每次有效输出的总成本、延迟、稳定性和可扩展性,而不是产品规格表上的一个最大数字。

结语:最强的系统,可能是最懂得“不平均”的系统

过去的工程直觉喜欢整齐:统一的精度、统一的硬件、统一的指标、统一的优化目标。大模型却把这种整齐的代价暴露出来了。它的不同模块承担不同职责,不同阶段遭遇不同瓶颈,不同用户请求消耗不同资源。任何试图用一种标准覆盖全部问题的方案,最终都可能在系统边界处付出代价。

真正先进的架构不是让每个部分都最强,而是让每个部分恰好得到它所需要的东西:该快的地方获得带宽,该大的地方获得容量,该准的地方保留精度,该灵活的地方保留可编程性。

效率的最高形式,不是把所有资源压榨到极限,而是让没有一种资源被迫独自承担整个系统的复杂性。

这或许也是大模型时代最重要的设计转变。未来的胜负,不会只属于拥有最大计算峰值的机器,而会属于最能识别差异、容纳差异,并把差异转化为整体协同的系统。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣