真正限制大模型的,不是算力,而是数据离计算有多远

Kevin Di

Hatched by Kevin Di

Aug 29, 2026

1 min read

94%

0

一个参数规模达到1.8万亿的模型,最先撞上的墙可能不是芯片不够快,而是数据搬得不够快。

这听起来反直觉。过去十年,模型参数从AlexNet时代不到0.07B,增长到今天的万亿级规模,计算需求和显存需求膨胀了数千倍,但单颗GPU的算力、显存容量和互连带宽并没有以同样速度增长。于是,AI系统的核心问题悄悄发生了变化:我们不再只是寻找更快的计算单元,而是在设计一个让计算单元尽量少等待的空间。

这也解释了两个看似属于不同领域的工程事实:循环神经网络会通过持久化机制,把权重留在本地缓存中,避免每次迭代重新读取;超大规模GPU集群则需要通过Scale Up、Scale Out以及专用互连协议,尽量缩短GPU之间交换数据的路径。

它们实际上在解决同一个问题:计算性能的上限,越来越取决于数据的位置,而不是计算本身。

从“算得快”转向“等得少”

想象一家餐厅。厨师是计算单元,食材是模型参数和中间结果,厨房里的操作台是高速缓存,仓库是显存,城市外的配送中心则像远端存储。如果每做一道菜都要跑到仓库取食材,厨师再快也没有意义。真正高效的厨房,会把高频食材放在手边,把不常用的东西放在稍远的位置,并设计好补货路线。

计算系统同样如此。数据离计算单元越近,访问延迟越低,所需的通信能耗越小,计算单元的有效利用率越高。所谓峰值算力,只是厨师挥刀的理论速度;真正决定产出的,是厨师有多少时间在等待食材。

循环层中的持久化机制提供了一个极其清晰的例子。它要求使用FP16,并且要求权重矩阵足够小,能够在多次迭代之间留在本地缓存中。当隐藏层规模处于合适范围时,权重不必反复从更远的存储层级搬运,循环计算便可以持续复用这些数据。对于序列长度为256、批量大小为64的GNMT训练,隐藏单元达到1024以内时,就可能获得这种优化带来的收益。

这里真正重要的并不是某个具体阈值,而是背后的规律:局部性本身就是一种算力。

同一组权重如果每一步都要跨越内存层级移动,它的计算成本就不只是乘法和加法,还包括读取、排队、传输、同步以及可能发生的重传。如果权重能够停留在计算附近,系统就相当于“免费”获得了更多有效吞吐。

这给AI系统带来一个容易被忽略的判断标准:不要只问一颗芯片每秒能做多少次运算,还要问完成一次有效运算,需要搬运多少字节,以及这些字节要经过多少个边界。

缓存与互连,其实是同一张地图

本地缓存和GPU互连看起来一个属于单芯片优化,一个属于数据中心网络设计,但它们可以被放进同一张地图中理解:这是一张由距离、带宽和同步成本共同构成的数据移动地图

在这张地图上,不同通信区域承担不同职责。

业务网络负责输入数据、输出结果、模型参数、检查点以及存储系统之间的连接。它覆盖范围最大,需要与云存储和业务接口互通,因此更强调通用性、可扩展性和协议兼容性。它像城市道路,连接的地点最多,但不适合承担所有高速运输任务。

Scale Out网络负责把训练任务扩展到更多GPU机柜,支撑数据并行和流水线并行。它像高速公路,目标是把大量计算节点组织成一个更大的整体。规模扩大之后,问题不再只是单条链路的速度,而是当数万张卡同时通信时,网络是否会出现拥堵、带宽收敛和同步等待。面向AI优化的以太网协议,正是在试图让这种大规模横向扩张不至于被通信成本吞噬。

Scale Up网络则更接近一台机器内部的神经系统。它承载推理阶段的大显存协同,也承载张量并行和专家并行中的高频数据交换。这类通信的距离更短,但要求更苛刻,因为GPU之间可能需要持续进行张量同步,甚至把部分聚合操作放到交换机中完成。专用互连协议和交换结构的价值,不只是提供更高带宽,而是让通信行为更贴合GPU的内存语义、并行模式和编程方式。

这三种网络并非简单的速度等级,而是三种不同的空间关系:

  1. 业务网络解决可达性。 数据能否到达正确的系统。
  2. Scale Out解决规模性。 更多计算节点加入后,整体是否仍然有效。
  3. Scale Up解决紧密协同性。 多个计算单元能否像一个更大的计算体一样工作。

如果把所有通信都交给同一种网络,就像让城市道路同时承担小区通勤、跨城物流和手术室内的血液循环。表面上都是“运输”,但延迟容忍度、带宽模式和故障代价完全不同。

大模型的真正瓶颈,是“工作集”失控

理解这件事,可以借助一个更有用的概念:工作集。工作集不是模型的全部参数,而是在某一段时间内,计算真正频繁访问的数据集合。

一个模型可以非常大,但某个计算阶段的工作集可能很小。如果这部分数据能够放在近处,系统仍然可能高效。反过来,一个看似不大的计算,如果每一步都要访问远端数据,也可能表现得极慢。

循环层的持久化优化,本质上是在控制工作集:让反复使用的权重停留在本地。张量并行则是在更大的尺度上做同样的事情:把需要高频交换的张量放在具有极低延迟和高带宽的互连域内。专家并行进一步提出了新的挑战,因为不同专家的访问模式可能产生强烈的点对点通信需求,网络拓扑是否能维持接近1:1的带宽关系,就直接影响计算是否会被通信拖住。

因此,模型并行策略不应只按显存容量来切分,还应按通信频率来切分。一个简单但有力的原则是:

高频共享的数据,应该被放置在更近的地方;低频访问的数据,才值得被放到更远的地方。

这条原则会改变很多系统设计决策。

例如,在设计一个推理服务时,不能只计算模型是否能装进全部GPU显存,还要分析每一层的激活值在哪些GPU之间流动、流动的频率是多少、是否需要全局同步,以及交换机能否执行聚合操作。如果某组张量在每个token生成阶段都要跨越多个交换层,那么即使每张GPU的计算利用率看起来很高,端到端延迟仍可能被通信路径主导。

同样,在训练中,增加GPU数量并不必然带来线性加速。加入更多设备后,计算工作被分摊了,但梯度同步、流水线交接和专家路由也会增加。当通信成本的增长速度超过计算节省时,集群就进入一种危险状态:设备数量更多,理论算力更大,实际训练时间却没有明显下降。

一个统一的设计框架:距离预算、通信预算与同步预算

要把“数据位置”真正变成工程方法,可以为每个AI工作负载建立三种预算。

第一种是距离预算

距离不只是物理距离,也包括内存层级、交换机数量、协议解析、排队和软件栈路径。一次访问从本地缓存到片上内存、显存、同机GPU、同机柜GPU,再到远端机柜,成本会逐级增加。

对于每个关键数据结构,都应回答三个问题:它被谁访问,它多久被访问一次,它能否长期停留在当前层级。如果一个权重在循环迭代中不断复用,却被反复从远端层级读取,那么优先级最高的优化不是增加算力,而是改变放置位置。

第二种是通信预算

通信预算关注单位计算需要搬运多少数据。可以把它粗略理解为“每完成一次有效计算,需要付出多少数据移动成本”。当模型并行导致大量All reduce、All to All或点对点交换时,通信预算会迅速上升。

这时,协议优化、内存语义、重传机制和在网计算就不再是底层细节。它们决定了通信是否能以更少的芯片面积、更低的延迟和更少的软件参与完成。一个能在交换节点完成部分聚合的系统,相当于把数据处理点提前放到了运输途中,减少了不必要的往返。

第三种是同步预算

并行计算最昂贵的地方,有时不是传输本身,而是等待最慢的参与者。一次全局同步中,只要一个GPU因为拥塞、重传或负载不均而迟到,其他GPU就可能一起空转。

所以,评估互连系统不能只看峰值带宽,还要看尾延迟、拥塞行为和拓扑中的最坏路径。能够在不同层级保持稳定带宽关系的组网方案,价值在于降低了同步的不确定性。对于大规模训练来说,稳定的平均性能往往不如可预测的尾延迟重要。

这三个预算可以进一步转化为一个实际决策顺序:先找出最频繁访问的数据,再找出最常发生的通信模式,最后识别最容易造成全局等待的同步点。优化不应从“哪张卡最快”开始,而应从“整个工作流在哪里停顿”开始。

Key Takeaways

  1. 先画数据流,再选硬件。 标出模型参数、激活值、梯度和检查点的访问频率与流动路径,避免只按显存容量或峰值算力做决策。
  2. 把高频工作集放近。 能够跨迭代复用的权重,应优先考虑本地缓存、显存驻留或更紧密的GPU互连域;不要让高频数据反复穿越远端网络。
  3. 按通信模式选择互连。 业务访问、横向扩展和紧密协同分别需要不同的网络设计。通用以太网的可达性,不能自动替代面向Scale Up的低延迟互连。
  4. 用尾延迟而非峰值带宽评估系统。 训练和推理经常受最慢链路、最拥塞路径和最后一个完成同步的GPU影响。
  5. 把模型并行视为数据放置问题。 数据并行、张量并行、流水线并行和专家并行不仅是算法选择,也是对工作集、距离预算和同步预算的重新安排。

结语:未来的算力,是被合理放置的算力

AI基础设施正在经历一次观念转换。过去,人们把计算看成中心,把内存和网络看成围绕计算服务的附属设施。今天,这种层级关系正在倒转。随着模型规模继续增长,计算单元越来越容易获得,真正稀缺的是让正确的数据在正确的时间抵达正确的位置。

一个小型循环层通过本地持久化减少数据移动,一个万卡集群通过专用互连和分层拓扑降低跨设备协作成本。尺度不同,逻辑却完全一致:不要让计算为了寻找数据而等待。

因此,下一代AI系统的竞争,不只是芯片性能的竞争,也不是网络带宽的简单竞争,而是数据空间设计的竞争。谁能更准确地预测工作集,更合理地安排数据距离,更少地支付通信和同步成本,谁就能把相同的硬件转化为更多有效智能。

真正的超级计算机,不一定是拥有最多计算单元的机器,而可能是那台让计算单元最少等待的机器。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣