真正的智能,取决于信息能否走最短的路
Hatched by Kevin Di
Aug 12, 2026
1 min read
0 views
92%
一个模型能否理解语言,真的只取决于它有多少层、多少参数吗?一个拥有数万张 GPU 的智算中心,真正的瓶颈又一定是算力不够吗?
这两个问题看似分属不同世界:前者讨论神经网络如何理解“银行”在不同句子中的含义,后者讨论服务器之间如何以微秒级速度交换数据。但它们指向同一个更深的问题:一个复杂系统如何在不被通信拖垮的前提下,形成有效的整体判断?
从 Transformer 的自注意力,到智算中心中的 RDMA 网络,最值得关注的并不是某项技术的参数,而是一种共同的系统哲学:智能与性能,往往不来自增加更多孤立的部件,而来自降低部件之间交换上下文的成本。
真正的瓶颈,不是计算,而是上下文的流动
早期神经网络常常依赖结构本身理解顺序。例如,循环网络通过逐步读取词语来保留前文信息。这样的机制类似一个人阅读长句时,只能把刚刚读过的内容暂存在脑中,再继续向前处理。句子越长,距离越远的信息越容易衰减,训练也越难并行。
Transformer 做了一个关键转变:它不再把“理解顺序”的全部负担交给网络结构,而是让数据本身携带位置关系,并通过注意力机制,让一个词在处理时直接查看其他词。翻译一个句子中的词时,模型不必严格按照从左到右的路径逐层传递信息,而可以根据当前任务,动态决定哪些词最值得参考。
例如,“我把苹果放在桌子上,因为它已经熟了”中的“它”,需要结合“苹果”和“桌子”来判断指代对象。模型的关键能力不是记住一条固定路线,而是构造一个有条件的连接网络:在此处,“苹果”获得更高权重;换一个句子,注意力分配就可能完全不同。
这揭示了一个常被忽略的事实:理解不是把所有信息平均地存储下来,而是在正确的时刻,把相关信息快速调入当前计算。
智算中心中的通信问题也具有相同结构。训练一个大型模型时,参数、梯度和中间状态被分散在许多 GPU 上。每张卡都能高速进行矩阵计算,但如果 GPU 之间传递数据的路径过长,计算单元就会等待通信完成。此时,系统的速度不由最快的 GPU 决定,而由最慢的数据交换环节决定。
传统 TCP/IP 网络在通用性方面非常出色,但数据往往需要经过操作系统内核协议栈。数据包在应用、内核、网卡之间来回切换,产生额外的复制、调度和处理开销。RDMA 的核心价值,则是让一台主机更直接地访问另一台主机的内存,从而绕过部分内核路径。
在一些同集群内部一跳可达的场景中,应用层端到端时延可以从约 50 微秒降到 RoCE 的约 5 微秒,甚至 InfiniBand 的约 2 微秒。这个数量级的差异,并不是简单地把网卡做得更快,而是重新设计了信息抵达计算单元的路径。
当系统的主要成本来自等待时,优化计算本身往往不如优化信息抵达计算的方式。
注意力与 RDMA:两种不同层次的“绕路”
自注意力和 RDMA 并不是同一种技术,也不能简单地说一个“等同于”另一个。前者解决的是表示与语义问题,后者解决的是主机与设备之间的通信问题。它们的深层联系在于:二者都在减少不必要的中间层,并把资源交给更接近任务本身的机制来调度。
在语言模型中,固定的处理路径可能造成信息损失。一个词必须经过多次中间状态,才能影响远处的另一个词。自注意力则提供了更灵活的连接方式,允许模型根据上下文建立直接关系。它帮助模型处理词义消歧、词性标注、命名实体识别和语义角色等任务,因为这些任务都要求模型判断:当前元素与哪些其他元素有关,以及这种关系是什么。
在高性能网络中,操作系统内核并非没有价值。它提供通用抽象、安全控制、拥塞处理和兼容性。但当一个训练集群需要让大量 GPU 频繁交换张量时,通用路径的灵活性会转化为延迟。RDMA 的设计,就是把一些原本由通用系统承担的工作,转移到更靠近硬件和应用的路径中。
这可以用机场来类比。普通网络像一座服务所有旅客的综合机场:安检、转运、行李分拣和登机流程非常通用,但每一步都有管理成本。RDMA 更像为固定航线设计的专用通道,它减少中间转运,使数据更快到达目的地。自注意力则像一套实时调度系统,它不要求每个词都经过相同的站点,而是依据当前任务,安排最有价值的连接。
两者共同依赖一种能力:知道哪些信息应该被直接连接,哪些信息不必经过昂贵的中转。
但这里也存在重要的张力。连接越自由,系统越灵活,却越难管理。自注意力需要计算大量词与词之间的关系,序列变长后,代价会迅速增加。RDMA 也不是“绕过内核”之后一切自动变快。InfiniBand 需要专用网卡、交换机、线缆和子网管理器;RoCE 则需要精细配置 Headroom、PFC 和 ECN 等机制。在大规模集群中,通信路径越直接,系统对拥塞、故障和资源隔离的要求越高。
因此,低延迟不是免费午餐。减少中间层,意味着必须把原本隐藏在中间层中的复杂性,重新暴露给系统设计者。
从“中心控制”到“动态路由”:复杂系统的两种秩序
大型系统要想高效运行,既不能让所有决策都集中到一个地方,也不能让每个节点完全自由行动。真正有效的架构,通常在全局规划与局部适应之间建立分工。
在 InfiniBand 网络中,交换机本身不运行传统意义上的路由协议。子网管理器负责计算转发表,并统一下发分区、服务质量等配置。这是一种集中式的全局秩序:系统先建立网络地图,再让数据流按照预设规则高速通过。
但在超大规模组网中,仅有静态规划并不够。流量会变化,链路会拥塞,某些路径会暂时变得昂贵。因此,InfiniBand 又可以使用基于逐包的自适应路由,根据网络状态动态选择路径。集中式管理提供可控性,局部动态路由提供弹性。
Transformer 也采用了类似的双层逻辑。模型通过训练形成相对稳定的内部表示,这些表示包含词语、实体、关系和语义角色等结构。到了具体输入上,自注意力又会根据当前上下文重新分配权重。模型既不是每次都从零开始判断,也不是把所有句子都套进固定模板。
我们可以把这种结构概括为一个“表示与路由”框架:
- 表示层负责把原始对象转换成可计算的内部结构。语言模型把词转换为包含语义关系的向量,网络设备则把拓扑、端口、队列和链路状态转换为可执行的转发表与策略。
- 路由层负责决定当前信息应该流向哪里。注意力决定哪些词相互影响,网络调度决定数据包经过哪条路径。
- 执行层负责以尽可能低的成本完成实际操作。模型执行矩阵计算,网络完成内存访问和数据传输。
- 反馈层负责修正前面三层。训练误差改善模型表示,拥塞状态和链路变化修正网络路径。
这个框架的价值在于,它解释了为什么“更多资源”不一定带来更强性能。如果表示层很差,注意力只能在混乱的信息中选择。如果路由层很差,再强的计算设备也会长期等待。如果执行层被复制、调度和协议开销拖慢,整个系统的理论吞吐量就只是纸面数字。
系统能力不是各个部件能力的简单相加,而是表示、路由、执行和反馈之间的乘积。任何一层接近零,整体性能就会坍塌。
真正的规模化,始于对“相关性”的管理
很多技术系统在规模扩大后变慢,并不是因为工作量线性增加,而是因为连接关系失控。一个小团队可以让每个人直接沟通;当人数达到数千,所有人都参与所有讨论,沟通成本会吞噬生产力。一个短句可以让每个词关注其他词;当上下文扩展到极长,全部连接的成本就会成为负担。一个小型集群可以使用简单网络;当 GPU 数量达到万卡规模,拥塞、队列和故障传播会变成核心问题。
因此,规模化的关键不是让所有节点都能连接所有节点,而是建立高质量的选择机制。注意力的本质不是“看见一切”,而是对可见信息进行加权。高性能网络的本质也不是让所有链路无限扩容,而是让数据尽量少走无谓路径,并在必要时进行有效调度。
这提供了一个实用的系统设计准则:在优化之前,先问三个问题。
第一,哪些信息必须直接可达?如果某类信息会被高频访问,应该尽量减少中间拷贝和转换。对语言模型而言,这是重要上下文之间的关系;对训练集群而言,这是频繁同步的参数、梯度和激活值。
第二,哪些连接只是理论上可能,实际很少发生?如果所有潜在连接都被同等对待,系统会把大量资源花在低价值通信上。注意力需要形成稀疏或有层次的关注机制,网络则需要合理的拓扑、分区和服务质量策略。
第三,哪些复杂性应该集中管理,哪些应该下沉到局部?全局策略适合处理拓扑、权限和资源隔离,局部机制适合处理瞬时拥塞、队列状态和当前上下文。把所有问题交给一个中心会形成瓶颈,把所有问题交给局部又会造成失控。
这套准则不只适用于 AI 基础设施。数据库查询优化、组织协作、软件模块设计,甚至个人学习,都存在同样的结构。学习者不是把所有知识平均记住,而是建立能快速调用的概念网络;团队不是让所有人参加所有会议,而是设计清晰的信息路由;软件不是把所有模块互相暴露,而是让高频、重要的接口足够直接。
Key Takeaways
- 先找通信瓶颈,再找计算瓶颈。 当 CPU、GPU 或员工都在等待时,不要急着增加资源,先测量数据、决策和任务在系统中的流动路径。
- 把高频关系设计成低成本关系。 对模型来说,改善重要上下文的可达性;对集群来说,优化高频同步流量的网络路径;对团队来说,缩短关键决策的信息链。
- 用表示减少混乱,用路由减少浪费。 先建立稳定的内部结构,再根据当前情境动态选择相关信息,而不是依靠固定流程或全量连接。
- 不要把“绕过中间层”误解为简单化。 直接访问、专用网络和动态调度都能降低延迟,但会把配置、故障隔离、拥塞控制等责任交给架构设计者。
- 规模化时优先控制连接复杂度。 不是每个节点都需要连接所有节点。清晰的分区、层次化结构、服务质量和选择机制,往往比单纯增加带宽更重要。
结语:最强的系统,是让相关性变得便宜
我们通常用参数量、带宽、算力和设备数量来衡量一个系统有多强。但这些指标只描述了系统拥有多少资源,没有说明资源能否在正确时间抵达正确位置。
一个语言模型之所以能够处理歧义,不是因为它把每个词都同等记住,而是因为它学会了在上下文中建立有意义的关系。一个智算中心之所以能够扩展到万卡规模,也不是因为每张 GPU 独自变得更快,而是因为 GPU 之间的协作不再被低效的通信路径拖住。
这两种系统共同告诉我们:智能的核心,不只是计算能力,而是对相关性的组织能力。
当下一次面对一个复杂系统时,不妨不要先问“还能增加多少资源”,而是问:“哪些信息正在绕远路?哪些连接真正重要?哪些中间层正在保护系统,哪些中间层只是在制造等待?”
也许未来最重要的架构创新,不是再造一个更大的中心,而是让每一次重要的关系,都能以更短、更准确、更可控的路径发生。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣