真正的 AI 瓶颈,不在 GPU 里,而在最后一个词元离开 GPU 的瞬间
Hatched by Kevin Di
Aug 24, 2026
1 min read
2 views
88%
一个词元为什么值得讨论整座机房
如果一台 GPU 集群每秒可以完成数万亿次运算,用户却仍然要等待半秒、两秒,甚至更久才能看到下一个字,那么问题可能根本不在算力不足。更反直觉的是:决定体验的,往往不是模型在 GPU 内部完成了多少计算,而是一个已经生成的词元,如何离开加速器,穿过内存、网络和软件栈,最终变成屏幕上的字符。
大模型时代最容易被忽略的事实是,计算的价值只有在结果被及时搬运、解释和交付之后才会兑现。模型参数从存储系统进入计算集群,激活值在多个 GPU 之间流动,专家并行任务被分发到不同设备,最后生成的词元又被传到 CPU,经过逆词元化,才成为用户看得懂的文本。所谓推理,不是 GPU 独自完成的一场表演,而是一条跨越芯片、交换机、内存和应用接口的流水线。
这带来一个值得重新审视的问题:当模型规模增长数千倍,而计算能力和显存容量远没有同步增长时,我们究竟是在建设更强的计算机,还是在建设一套更复杂的数据移动系统?
我的答案是后者。AI 基础设施的核心竞争力,正在从单点算力转向一种更难衡量的能力:让正确的数据,以正确的语义,在正确的时间抵达正确的位置。
对大模型而言,计算不是孤立的动作,而是数据在不同层级之间协作的结果。
大模型把网络从配套设施变成了计算的一部分
早期的计算机系统通常把网络看作外部连接。处理器负责计算,内存负责存储,网络负责把机器连接起来。对于许多传统应用,这种分工依然有效,因为一次请求往往可以在单台服务器内完成,网络只是输入和输出的通道。
大模型改变了这一结构。一个模型可能拥有远超单块 GPU 显存容量的参数,需要被切分到多个设备甚至多个机柜中。训练时,数据并行、流水线并行、张量并行和专家并行会持续交换梯度、激活值、部分结果以及专家路由信息。推理时,模型需要在有限显存中保存参数和键值缓存,并在多个加速器之间协调计算。此时,网络不再是计算之后的运输环节,而是计算本身的一部分。
可以把一座 AI 机房想象成一座巨大的工厂。GPU 是高速加工中心,显存是工位旁边的工具柜,交换机则像工厂内部的输送带和分拣中心。如果输送带狭窄、拥堵或路线设计不合理,再快的加工中心也只能等待材料。更麻烦的是,AI 任务不是简单地把货物从甲地送到乙地,而是要求大量设备在极短时间内交换中间结果。只要其中一个环节迟到,其他设备就可能集体空转。
因此,不同类型的通信必须被区别对待。
业务网络承载输入数据、输出结果、模型参数和检查点,需要连接存储系统、云服务和业务接口,强调广泛互通以及成熟的以太网能力。它像工厂与外部世界之间的公路,覆盖面广,连接对象复杂。
横向扩展网络服务于大规模训练中的数据并行和流水线并行,需要把计算扩展到大量 GPU 机柜,重点是规模、稳定性以及大范围的数据搬运。它像工厂之间的高速物流网络。
纵向扩展网络则直接服务于张量并行、专家并行以及推理中的大显存协作。它要求极低延迟、高带宽,并且可能把聚合计算直接放到交换机中完成。它更像加工中心之间的内部机械臂,移动的不是成品,而是下一步计算所必需的中间状态。
这三种网络都叫网络,却不是同一种问题。把面向业务的连接方式直接套用到 GPU 内部协作上,就像用城市公路运输工厂内部的半成品。道路也许足够宽,但转弯、装卸和调度方式都不适合生产节拍。
“最后一个词元”暴露了系统的真实边界
理解推理延迟,不能只看一次完整回答需要多少秒。对文本生成而言,更重要的是用户何时看到第一个词元,以及之后每个词元多久出现一次。生成过程通常不是一次性吐出整段文本,而是不断重复执行下一步预测:模型生成一个词元,更新状态,再预测下一个词元。
当完成的词元被传输到 CPU,并在 CPU 上进行逆词元化,系统才获得可交付的文本。这个动作看起来很小,却揭示了一个关键事实:GPU 内部的高性能计算,并不等于用户已经获得结果。
设想一个餐厅。后厨可以在十秒内做出一道菜,但如果出餐口距离餐桌很远,服务员每次只能端一盘,还要在门口重新确认订单,顾客仍然会觉得上菜很慢。大模型推理的“后厨”是 GPU,词元生成是出菜,传输和逆词元化是出餐流程。用户感知到的是餐桌前的等待,而不是后厨里的浮点运算次数。
这也解释了为什么推理系统中的某些优化会产生看似不成比例的收益。减少一次设备间同步,可能比增加一些计算单元更有价值;让词元在更接近消费方的位置完成处理,可能比单纯提高 GPU 峰值吞吐更有效;让交换机参与聚合,可能减少大量数据绕路返回 GPU 的成本。
这里可以提出一个实用的分析框架,叫作四层交付链:
- 生成层:模型是否能够及时计算出下一个词元。
- 搬运层:词元以及相关状态是否需要跨 GPU、跨交换机或跨主机传输。
- 解释层:词元是否需要被送到 CPU,经过逆词元化和格式处理。
- 呈现层:结果是否能通过服务接口、连接协议和客户端及时到达用户。
许多系统只优化第一层,因为 GPU 利用率最容易被监控,也最容易写进宣传材料。但用户体验往往由最慢的一层决定。若生成层耗时一毫秒,搬运和解释层耗时五毫秒,那么继续把生成层优化到零点八毫秒,几乎不会改变用户感受。
AI 推理的终点不是“算出词元”,而是“让词元成为可被使用的语言”。
真正的单位不是带宽,而是语义距离
讨论互连技术时,人们常用带宽和延迟来描述性能。这些指标当然重要,但面对大模型,还需要引入一个更有解释力的概念:语义距离。
语义距离不是物理距离,而是数据从产生到被消费时,需要经过多少次重新解释、重新封装和权限转换。一个词元从 GPU 生成后直接被相邻设备消费,语义距离很短。一个中间结果先被封装成通用报文,再经过主机内存、CPU 软件栈和交换机,最后由另一块 GPU 重新解析,语义距离就很长。
语义距离越长,系统通常需要付出更多成本:更多协议头,更多内存拷贝,更多队列调度,更多上下文切换,以及更多等待不确定性。即使物理链路带宽很高,数据仍可能在每一站被迫“换一种语言”表达。
这正是面向 AI 场景设计的互连协议具有价值的地方。支持内存语义,意味着设备之间可以更直接地理解彼此的内存操作;支持在网计算,意味着部分聚合操作不必把数据全部送回某个 GPU 才能完成;针对协议格式和重传机制进行优化,则可以减少解析成本和芯片面积,使硬件把资源用在真正影响计算节奏的地方。
以专家并行为例。一个词元经过路由后,可能被发送到不同专家所在的设备。如果通信系统只能提供粗糙的广播或固定拓扑,数据就会在少数链路上形成拥堵。更灵活的点对点通信能力,以及单层和多层交换拓扑,可以让系统在扩展规模时维持更接近一比一的带宽收敛比。这里的关键不只是“连接更多 GPU”,而是让新增的 GPU 不会同时制造新的交通瓶颈。
这可以形成第二个判断原则:互连性能应当按应用语义衡量,而不只是按链路峰值衡量。对于需要频繁同步的并行模式,低延迟可能比总带宽更重要。对于大规模参数和检查点搬运,持续吞吐可能更重要。对于逐词元生成,尾延迟和抖动则可能比平均延迟更影响体验。
同一套硬件,在不同的语义距离下,会表现出完全不同的价值。就像一条每小时能通过十万辆车的高速公路,如果所有车辆都必须在出口处经过一个只能处理一千辆车的收费站,那么整条路的标称能力并不能代表实际通行能力。
从“堆更多卡”转向“设计更短的闭环”
过去扩展 AI 能力的直觉是增加 GPU 数量。这个方法在模型和数据规模增长的早期非常有效,但当通信量随并行度快速增长时,系统可能出现一种危险的反直觉现象:增加设备反而降低有效利用率。
原因在于,更多设备意味着更多边界、更多同步关系和更多潜在拥堵点。如果计算任务被切成十份,每份都需要等待其他九份的结果,那么单个设备的速度提升并不一定会缩短整个任务的完成时间。系统的有效性能取决于最慢的通信路径、最拥堵的交换节点以及最迟到的参与者。
因此,AI 集群设计需要从“峰值算力思维”转向“闭环完成思维”。所谓闭环,是指从输入进入,到模型完成必要计算,再到词元被解释并交付,整个链路是否稳定、短促而可预测。一个闭环的性能可以粗略表示为:
有效体验 = 计算吞吐 × 通信完成率 × 交付及时性
这不是严格的工程公式,而是一个提醒。任何一项接近零,整体价值都会迅速下降。GPU 利用率很高,但跨设备通信经常重传,通信完成率就不高。词元已经生成,但还要等待 CPU 批量处理,交付及时性就会下降。服务端吞吐很高,但单个请求的尾延迟严重,用户仍会感到系统迟钝。
这个框架也给工程实践提供了优先级:
首先,绘制一次完整的词元路径,而不是只查看 GPU 内部时间。路径应包括输入读取、模型分片、并行通信、词元生成、词元传输、逆词元化以及输出接口。
其次,区分首词元延迟和后续词元间隔。初始化阶段可能需要加载上下文和建立键值缓存,解码阶段则更像一个持续运行的反馈回路。两者的瓶颈不同,不应使用同一组指标解释。
再次,检查最短路径之外的异常路径。平均值通常掩盖不了解的尾延迟,例如某个交换节点拥堵、某类报文重传,或 CPU 处理偶尔触发调度抖动。对交互式应用而言,百分之一的慢请求也可能决定用户对系统的印象。
最后,优先减少语义转换。能在交换机完成的聚合,不要反复搬回设备;能由加速器直接消费的数据,不要先绕行通用处理器;能用面向 AI 的协议表达的操作,不要强迫它套入为普通业务设计的路径。
Key Takeaways
-
把推理终点定义为用户收到可读文本,而不是 GPU 生成词元。 监控指标应覆盖词元从生成到逆词元化再到接口交付的全过程。
-
按通信语义选择互连层级。 业务网络强调广泛互通,横向扩展网络强调大规模搬运,纵向扩展网络强调低延迟协作和在网计算,三者不能简单互换。
-
用语义距离寻找隐性瓶颈。 统计数据经历了多少次封装、拷贝、解析和上下文切换,往往比只看链路带宽更能发现问题。
-
分别优化首词元延迟与词元间隔。 初始化阶段和解码阶段的资源行为不同,混用指标会导致错误的优化方向。
-
扩容前先检查通信闭环。 增加 GPU 之前,确认交换拓扑、点对点能力和带宽收敛比能够支撑新的并行模式,否则新增算力可能变成新增等待。
结语:未来最重要的加速,不一定发生在计算单元里
大模型的发展正在迫使我们重新定义“计算机性能”。过去,我们习惯把处理器看成中心,把网络看成连接,把输出看成计算完成后的附属步骤。如今,模型的参数规模、并行方式和逐词元生成机制已经打破了这条边界。
一个词元在 GPU 中被预测出来,只完成了它生命的一半。它还需要穿越互连系统,抵达 CPU 或其他消费方,被还原成语言,再进入用户真正使用的接口。这个微小的路径,映射出整座 AI 基础设施的设计哲学:设备是否理解彼此,网络是否参与计算,系统是否围绕数据的真实语义组织起来。
下一代 AI 的速度,不只取决于它能算得多快,更取决于它能否让结果少走几步路。
当我们再次谈论更大模型、更多 GPU 和更高带宽时,也应该追问一个更基本的问题:从一个词元被生成,到一个人真正读到它,中间究竟有多少不必要的距离?谁能把这段距离缩短,谁就不仅是在优化网络,而是在重新设计智能抵达世界的方式。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣