当AI系统开始忘记“边界”,性能才真正起飞

Kevin Di

Hatched by Kevin Di

Jul 02, 2026

1 min read

84%

0

真正的瓶颈,不是算力,而是边界

如果把一个大模型系统比作一座工厂,那么今天最昂贵的不是机器本身,而是机器之间来回搬运原料的路。很多人谈AI性能时,第一反应是更大的GPU、更快的芯片、更强的模型结构。但真正决定吞吐量和成本曲线的,往往是那些看不见的“边界”, , 计算边界、缓存边界、网络边界、业务轮次边界。

这也是一个很反直觉的事实:AI性能优化的核心,正在从“把单点做快”转向“把边界做薄”。当系统足够大时,性能不再主要取决于某个芯片有多快,而取决于数据、状态和通信能否像水一样连续流动,而不是被一层层协议和隔离切碎。

这正是AI工厂与大模型推理优化之间最深的共同点。看似一个讨论基础设施,一个讨论模型技巧,实际上它们都在回答同一个问题:当AI从实验室走向服务业,系统究竟该围绕什么来组织?

三种网络,三种世界观

传统AI集群里,通常同时存在三套网络:Scale-Up网络负责把GPU更紧密地连成一个大芯片,Scale-Out网络负责节点间横向扩展,Front-End网络负责存储、管控和南北向业务流量。这个结构乍看合理,但它默认了一个前提:不同流量应该被严格隔离,各走各路。

问题在于,AI工作负载并不总是乖乖待在这些边界里。推理时,前端请求要进入计算节点,缓存要在节点间或主机内存中复用,模型内部还要高频交换中间状态。于是,网络不再只是“连通工具”,而变成了系统性能的地形图。哪里有隔离,哪里就有额外跳数、协议转换、拥塞控制和带宽浪费。

于是出现了两种思路。一种是继续强化分层,让每种流量都有专属通道,通过更强的互联把边界压低。另一种更激进,直接把边界打通,让Front-End和Scale-Out合并,让“请求入口”和“分布式通信”变成同一张网里的不同语义。前者是修路,后者是拆墙。

这两种思路背后,其实是对AI系统本质的不同判断。如果你认为AI是一台更复杂的服务器,就会倾向于层层分区。如果你认为AI更像一座持续运行的工厂,状态在不同环节之间不断流转,那么你就会开始追求一个更统一的流动平面。

当系统规模足够大时,网络架构不再是“连接问题”,而是“组织问题”。

这句话很重要。因为它说明,AI基础设施的进化方向,不只是更快的互联,而是更少的语义断裂。真正高效的系统,不是让每条路都最优,而是让路与路之间尽可能少发生“翻译”。

推理优化的本质,是把记忆从“昂贵状态”变成“可流动资产”

如果说AI工厂关心的是数据流动,那么推理优化关心的就是状态流动。Transformer的瓶颈,并不只在计算量,更在KV Cache。每生成一个token,模型都在积累历史记忆,而这份记忆的增长速度,往往比我们想象得更快。

于是,所有聪明的优化都在围绕一件事展开:如何让记忆更小、更可共享、更可复用

MQA把多个头共享同一组K和V,让KV Cache显著缩小。GQA介于MHA与MQA之间,在效果和成本之间折中。MLA进一步通过低秩压缩,把缓存变成一种更“稀疏”的表示。Local Attention则干脆告诉系统,不必每一层都看全局,很多层只需要看附近的窗口,只有少数层承担全局理解的职责。跨层KV共享更进一步,把相邻层的缓存压到一起,减少重复存储。

这些方法看起来是算法层的花活,但它们的共同目标其实非常朴素:把原本一次性、独占式、不可复用的状态,改造成可共享、可压缩、可迁移的状态单元。

一个好理解的类比是办公楼里的电梯系统。最浪费的做法,不是电梯太慢,而是每个人都拥有一部只为自己服务的电梯。MQA和GQA像是在让更多人共用一组电梯,Local Attention像是让大多数人只在本楼层活动,跨层KV共享像是把相邻楼层的结构打通,减少重复建设。最终,系统快起来,不是因为某个人跑得更快,而是因为楼里少了太多不必要的走廊。

从模型压缩到系统合并,背后是同一种设计哲学

表面上看,大模型推理优化和AI网络架构优化属于两个层次。但它们其实共享同一个设计哲学:把“边界”从硬隔离变成柔性接口,把“状态”从静态资产变成动态缓存。

这个哲学有三个非常关键的维度。

1. 让昂贵的东西尽量少重复

无论是KV Cache,还是前端到后端的数据传输,最贵的往往不是一次计算,而是重复发生的重复计算、重复传输、重复分配。长对话场景里,历史上下文会一轮轮累积,如果每次都重新构建缓存,系统就会像不停重修一座已经建好的桥。

因此,轮次间缓存的意义极大。把Prefix和生成结果对应的KV存到主机内存里,后续请求直接复用,本质上是在承认一件事:很多“重新开始”,其实都是不必要的。

这和网络合并的思想一致。若Front-End和Scale-Out之间反复跨越协议边界,那么每次请求都像在不同城市之间换乘。若将入口与分布式通信合并,系统就能少做几次“登记”和“中转”。

2. 让状态的组织方式贴近业务现实

Character.AI类场景的一个关键特征是对话很长,平均轮次很多。也就是说,系统的真实形态不是“单次生成”,而是“持续关系”。因此,缓存不该只围绕单次请求设计,而应围绕会话生命周期设计。

这就是优秀系统设计的标志:不是按理想工作流组织,而是按真实行为组织。

同样,AI工厂的网络也不该只按传统企业网络思维组织。训练和推理已经让“计算、存储、管控、业务输入”高度耦合,继续把它们当作彼此独立的域,只会制造更多跨域成本。现代AI集群越来越像一个统一的流体系统,而不是一组相互隔绝的楼层。

3. 让局部最优服从全局流动

很多优化之所以失败,是因为它们只优化了局部指标。比如单独看某一层attention,减少参数和缓存似乎很好,但如果它导致系统在其他位置更复杂,那总体收益就未必成立。再比如,网络里单独优化某个链路的吞吐,如果整体端到端路径仍有频繁转发和协议翻译,最后也不会真正提升服务能力。

所以更成熟的思路不是问“这个点能不能再快一点”,而是问“这条路径上,哪里在制造非必要的断裂”。

性能提升的真正密码,不是局部压榨,而是全局连续性。

一个新的视角:AI系统正在从“模块化机器”变成“记忆型流水线”

如果把这些线索连起来,我们会得到一个比“更快的模型”更大的判断:未来的AI基础设施,不是由模块拼起来的机器,而是由状态贯通的流水线。

这意味着什么?意味着推理系统的价值,不再只来自一次回答,而来自回答之间如何延续。意味着网络不再只是搬运包,而是承载状态流转。意味着缓存不再只是节省时间,而是系统记忆的一部分。意味着模型结构也不再只是追求表达能力,而是与部署方式共同设计。

这是一个非常深刻的变化。过去,算法团队、基础设施团队和平台团队经常各自优化自己的那一段:算法想要精度,基础设施想要带宽,平台想要稳定性。可是在AI服务时代,真正决定体验的,不是某一段单独多优秀,而是整个链路能否形成一个低摩擦的记忆回路

你可以把它想成一条生产线。旧时代的流水线强调分工,每个工位只负责自己的一小步。新一代AI流水线则更像一个会记忆的工厂,原料进入后,状态会在各工位间保留、复用、压缩、共享,直到最后生成结果。系统竞争力不再来自单个工位,而来自工位之间的“连续性设计”。

这也解释了为什么一些看似偏底层的优化,会直接影响商业模式。因为当缓存能跨轮次复用,当网络能合并语义域,当模型能减少KV负担,单位推理成本就会下降,长会话的服务体验也会改善。最终,产品就不只是“能回答”,而是“能长时间维持关系”,这才是AI应用真正的护城河之一。

Key Takeaways

  1. 别只盯着算力峰值,先找边界摩擦。 许多性能损耗不是算出来的,而是跨网络、跨层、跨轮次重复搬运状态造成的。

  2. 把状态当作一等公民。 KV Cache、会话记忆、前后端流量,都是系统核心资产,应该像数据产品一样被设计,而不是被动消耗。

  3. 优先消灭“重复做同一件事”的成本。 无论是MQA、Local Attention,还是跨轮次缓存,核心都是减少重复存储和重复传输。

  4. 用业务形态反推系统形态。 长对话适合会话级缓存,统一入口适合合并网络,持续服务适合低摩擦流水线,而不是静态分区。

  5. 问自己一个更大的问题:系统是在执行任务,还是在维持连续关系。 一旦答案偏向后者,很多架构选择都会发生改变。

结语:真正的AI竞争,不是更会算,而是更会流

我们常把AI进化理解成“模型越来越强”,但更准确的说法可能是:AI系统正在学会如何让知识、状态和请求更顺畅地流动。 当一个系统不再执着于每次都从零开始,不再把网络、缓存、会话和模型层层切断,它就开始拥有工厂级的生产效率,也拥有服务业级的连续体验。

所以,未来最强的AI系统,也许不是那种每一步都最精密的系统,而是那种最少制造断点的系统。它知道哪里该压缩,哪里该共享,哪里该合并,哪里该保留。它不是把每个零件都做到极致,而是让整个机器像一个有记忆的生命体一样运转。

当AI开始忘记边界,性能才真正开始记住用户。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣