当显存追不上参数:把网络当作内存,重构大模型的计算拓扑

Kevin Di

Hatched by Kevin Di

Apr 15, 2026

1 min read

85%

0

如果模型参数每十年增长数千倍,而单卡显存和算力远远跟不上,这个生态的下一次突破会来自哪里?不是更大的 GPU,而是把“内存的语义”从主机板上搬到网络上,把网络设计成新的、可编程的记忆层级。

增长的错位与新的瓶颈

过去十年里,模型规模从不足一千万参数,演进到以万亿参数计算,增长是几千倍的量级。但硬件端的算力和显存并未同步增长。这种错位制造了一个本质性问题:如何在有限的片上资源下,支持远超过单卡容量的模型与极高并行度的训练过程?

当单一 GPU 无法承载完整模型时,两个传统路径出现了:一是把计算拆成更多小块,横向扩展到成百上千甚至十万卡的集群,这要求大规模的 Scale Out 网络互连;二是把显存逻辑扩展在近接设备上,采用 Scale Up 的大显存并行,或者在机柜内形成低延迟、高带宽的互联域。两种路径并非等价,它们驱动的是两类截然不同的工程与编程取舍。

这不是简单的带宽问题。延迟、内存语义、重传策略、协议的工程化成本,以及芯片面积的开销,共同决定了能否以合理成本实现更大规模的模型并行。


两种互联范式的张力:同步的简洁对异步的可伸缩性

在技术上,我们可以把现有互联技术粗略分为两类:提供 Load/Store 级别的内存语义的互连,和以 RDMA 为代表的消息式、异步的数据搬运机制。

以 RDMA 为例,它把远程内存访问视为一次异步的数据搬运。软件要生成工作任务 WQE,发出 doorbell 通知,网卡去 DMA,然后远端网卡写回,接收方生成完成事件 CQE,应用轮询完成。这一套流程在延迟和软件复杂性上有明显的税。对于需要大量小粒度同步访问的并行算法,RDMA 的开销会迅速放大。

相对地,像 CXL、NVLink 这样的互联,向上层提供 Load/Store 语义。对 CPU 或 GPU 来说,访问远端内存就像访问本地内存一条指令完成。省去了 WQE、CQE、doorbell 的大量开销,指令级的延迟可以压到微秒量级以下。这种同步内存语义对编程模型是一次解放,使得工程师可以用熟悉的共享内存思维去设计分布式算法。

但这种便利并非没有代价。实现跨设备缓存一致性,会带来协议复杂度和硬件资源消耗。尤其在非常大规模的拓扑中,维持全局一致性将变得昂贵,甚至不可行。这就是为什么在业界同时出现了两条路线:一种是以 NVLink、NVSwitch、以及新兴的 UALink 为代表的紧耦合、低延迟互连,优先服务于需要内存语义的 Scale Up 场景;另一种是基于以太网的优化协议,如 UEC,面向极大规模 Scale Out 训练。

对工程师来说,这是一道根本性的抉择:要不要把远程内存看成可以同步访问的寄存器级资源?如果要,那么网络必须承担缓存一致性的复杂性;如果不要,那么程序必须接受异步搬运带来的编程和性能成本。


把网络当作“分级内存”:一个更接近现实的架构模型

把这两个范式放在一起思考,会得出一个更具操作性的结论:未来的 AI 计算系统不该只选边,而应把网络设计为一个多级、可分区的内存语义连续体。我把这套思路化为两个互补的模型:

  1. 内存语义连续体(Memory Semantics Continuum)
  • 在最内层,保持主机内核与设备之间的严格一致性与寄存器级访问语义。这是对延迟极其敏感的路径,适用于张量并行、专家并行等需要频繁同步的小粒度通信场景。
  • 在中间层,形成机柜级或片级的一致性域。通过专门的交换机硬件和协议优化在网计算,像 All reduce 等通信操作可以被下推到交换机层面,从而减少端到端往返和主机干预。
  • 在最外层,采用 RDMA 式的异步搬运,连接大规模训练集群和持久存储,承载 checkpoint、参数分片、训练样本分发等大吞吐但对延迟容忍的流量。
  1. 三层互联架构(Three Tier Interconnect Architecture)
  • Tier 1: 本地一致性域。利用 NVLink、NVSwitch、UALink 等实现寄存器级 Load/Store 访问,提供极低延迟和高带宽。适合对时间敏感的同步访问。
  • Tier 2: 机架或集群级加速域。交换机具备在网计算能力,支持优化的 All reduce、聚合和转发,维持近似端到端的带宽比 1:1。这里做工程优化以节省芯片面积和实现低时延转发。
  • Tier 3: 广域 Scale Out 网络。使用以太网与 RDMA 优化协议,保证可伸缩性、互通性和与云存储的集成。

将网络视作分级内存有两个直接好处。第一,工程上可以把复杂的缓存一致性限制在可控的域内,从而避免在全网范围内传播高复杂度的协议成本。第二,程序员可以按需选择内存语义:关键路径使用 Load/Store 的简单同步模型,背景任务使用 RDMA 的高带宽异步搬运。


工程取舍與实用建议

把理论模型落地,需要在硬件、网络协议与软件栈三方面做出明确的设计选择。以下是一些可操作的原则和建议。

  1. 划分一致性边界

在设计集群时,应把一致性域限定在能够被硬件高效支持的物理范围内,例如同一个机柜或同一路由层级内。跨域通信默认回退到异步 RDMA 式语义。这样可以把复杂的缓存协议集中在硬件上可管理的范围内,避免一致性消息在大规模网络中泛滥。

  1. 把常用同步模式下推到网络设备

对于 All reduce、聚合、广播等模式,交换机做在网计算可以显著降低延迟和主机开销。实现时要在协议层面优化报文格式和重传机制,以削减芯片实现成本并保持低解析延迟。

  1. 为程序员提供清晰的抽象和回退策略

语言和运行时应该暴露一个明确的 API,让工程师声明一致性需求和语义边界。运行时可以根据拓扑和负载动态选择在网计算或 RDMA。这样可以兼顾性能和可移植性。

  1. 量化“延迟税”和“带宽收敛比”

把延迟和带宽作为第一阶资源进行计量,尤其是关注端到端的延迟组成。设计上应保证在单层或多层互连拓扑中维持 1:1 的带宽收敛比,这样在点对点通信需求上不会出现瓶颈。

  1. 芯片面积与协议复杂度的权衡

协议越复杂,需要的硬件逻辑和状态越多,芯片面积与功耗随之上升。在实现 Load/Store 语义时,需要在性能和实现成本之间找到平衡点。简化报文格式和重传机制是节省芯片资源的直接方法。


具体例子:从微观延迟到宏观效率的链路

想象两个训练阶段:阶段 A 是模型前向传播和反向传播中的紧耦合 All reduce,阶段 B 是异步的 checkpoint 存储与参数预取。阶段 A 需要亚微秒级的同步访问,任何软件层的轮询或门铃开销都会带来显著拖累。Tier 1 的 Load/Store 语义和在机柜内的 NVLink 互联能够把这一耗时降到最低。

阶段 B 则恰恰相反。它关注吞吐而非每次访问延迟,RDMA 式的异步搬运在可扩展性和与云资源集成上节省成本。这两个阶段在同一训练作业中并存,如果没有分级的互连策略,集群会在单一协议上被迫妥协,导致整体效率下降。

通过把网络设计成多层的内存语义体系,我们可以在单一训练流程中同时获得低延迟同步和大规模可伸缩性。

把网络当作内存,並不是把一切都变成共享内存,而是有策略地赋予网络不同等级的内存语义,以适配不同的计算模式。


Key Takeaways

  • 把网络视作分级内存,而非单一通信通道。 设计时明确不同语义域和它们的物理边界。
  • 在软件层暴露语义等级,运行时动态选择在网计算或 RDMA。 让程序员声明一致性需求,系统自动优化。
  • 在网计算和简化的报文协议能显著节省芯片面积并降低延迟。 这对大模型的同步通信至关重要。
  • 对大多数训练任务,混合策略优于单一路径。 把同步的关键路径收敛到低延迟域,把异步数据搬运放到可伸缩域。

結論:网络不是连接器,而是记忆体的一部分

当模型规模继续快速膨胀時,简单地堆叠更多算力将越来越不可行。真正的杠杆点在于重新定义内存和网络的关系,把网络设计成一种可编程的、分级的记忆层级。這樣我們既能保留共享内存带来的编程简洁,又能在更广阔的尺度上保持可伸缩性與成本效益。

未来五年內,最有可能推动大模型能力跃迁的,并不是单一公司能造出的更大显存芯片,而是那些能把网络语义工程化,使得不同一致性需求在物理层面被高效匹配的系统架构。换句话说,内存不再只是芯片上的一块静态资源,它会成为由网络、交换、协议和运行时共同编织的一张动态神经网。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣
当显存追不上参数:把网络当作内存,重构大模型的计算拓扑 | Glasp