LLM 推理的真正难题,不是算力,而是配平
Hatched by Kevin Di
May 12, 2026
1 min read
6 views
88%
你以为在买 GPU,其实是在买一组互相掣肘的约束
如果一个 LLM 推理系统真的只需要“更多算力”,那事情本该简单得多。买更强的卡,扩几台机器,堆更多并行度,吞吐和延迟自然会变好。但现实恰恰相反,很多系统越扩越贵,越堆越复杂,最后性能瓶颈却不在算力,而在内存容量、带宽、互联、流量形态、上下文长度、调度方式这些彼此咬合的约束上。
这就是 LLM 推理最反直觉的地方:它不是一个单点优化问题,而是一个多维配平问题。你在一处把指标推高,往往会在另一处制造新的瓶颈。高算力 GPU 很贵,但不一定适合解码;高带宽卡可能擅长吐 token,却未必适合 prefill;同构集群易管理,却可能在复杂流量下白白浪费资源;异构集群更便宜,却要求调度系统足够聪明。
LLM 推理系统的核心竞争力,不是把某一项做到极致,而是把一组相互冲突的资源,配成一个在真实流量下仍然稳定工作的整体。
这个判断听起来像工程经验,实际上它更像一条系统设计定律。只要你把推理看成“模型跑在 GPU 上”,你就会倾向于寻找单一答案。可一旦你把它看成“请求在不同资源之间流动”,真正的问题就变成了:什么应该被放在哪种资源上,什么时候放,放多久,谁来决定,代价由谁承担。
真正的分水岭:LLM 推理不是一个阶段,而是一条流动的管线
传统计算任务里,CPU、GPU、内存、网络常常各司其职,分工边界比较清楚。但 LLM 推理不同,它的瓶颈会沿着请求生命周期不断迁移。一个请求先进入 prefill,这时计算密集,算力最关键;随后进入 decoding,这时每生成一个 token 都要频繁读写 KV Cache,变成内存带宽敏感;如果上下文很长,KV Cache 还会大到足以压垮 HBM,必须 offload 到 CPU 内存,甚至跨设备借内存;如果多个模型、多种 LoRA、不同 QPS 混在一起,调度问题又会压过单点性能。
这意味着,推理系统不是在跑一个固定函数,而是在跑一条资源需求不断变形的流。同一个请求在不同阶段,对硬件的理想要求完全不同。prefill 像在高速公路上加速,拼的是发动机;decoding 像在城市里频繁启停,拼的是燃油效率和响应灵敏度;长上下文则像往车里不断塞行李,拼的是空间管理,而不是马力。
这也解释了为什么很多“单项极强”的芯片或方案,最终很难在真实场景里赢得全面竞争。推理不是单纯追求峰值,而是在一串阶段中尽量少掉链子。一个系统如果只懂得“把某阶段做到最强”,却不能识别阶段切换、流量分布和资源约束,就会像一台在跑道上很猛、却进不了弯道的赛车。
更重要的是,LLM 推理的难点并不只是在单个请求内部流动,还在多请求之间的耦合。不同请求长度不同,QPS 不同,SLO 不同,模型大小不同,甚至 GPU 的拓扑和网络条件也不同。于是,真正需要被优化的,不是“某个 token 的计算”,而是“整个系统如何在这些多样化请求之间分配有限资源”。
从“跑得快”到“摆得对”:推理系统的本质是空间设计
如果把推理系统看成一间仓库,你就会更容易理解这一点。很多人会把优化重点放在搬运速度上,仿佛只要叉车足够快,仓库就会高效。但实际上,决定效率的常常是货架怎么摆、通道怎么留、热销品放哪里、冷门品能不能共享空间、临时爆单时怎么腾挪。
LLM 推理系统里的“货架”,就是模型、LoRA、KV Cache、并行切分后的计算单元、不同类型的 GPU、CPU 内存和网络。不同系统之所以看起来做法各异,本质上是在回答同一个空间问题:如何把请求和资源摆放成一种最不浪费的形态。
例如,多 LoRA 服务的核心不是“多跑几个模型”,而是让多个小流量适配器共享一个基座模型,把额外开销压到最低。这里真正重要的能力不是模型本身,而是参数增量的复用能力。这把“模型服务”从“为每个任务单独部署”变成“在同一个底座上装卸不同能力”,系统复杂度才开始下降。
再看 split prefill 和 decoding 的思路,它本质上不是在做一次简单拆分,而是在承认:不同阶段应该被放到不同性质的硬件上。算力强的卡更适合 prefill,带宽强的卡更适合 decoding,中间再用高速互联把 KV Cache 接起来。这种设计的精髓不在于“拆”,而在于“把计算和数据流重新分配到最合适的资源池里”。
长上下文场景则更极端。这里的关键问题甚至不是算力,而是 KV Cache 的空间政治。谁占用 HBM,谁借用 CPU 内存,谁先被换出,谁能借到远端空闲空间,谁又不能无限借。这类系统把推理问题直接推向了“内存管理”层面,提醒我们:当上下文足够长时,LLM 推理已经不再是传统意义上的模型执行,而更像一个高压下的分布式缓存系统。
当上下文变长、模型变多、流量变杂之后,推理系统的第一原则不再是“把计算做快”,而是“把稀缺资源摆对”。
为什么异构不是复杂度的副产品,而是优化本身
很多人直觉上会觉得,异构集群是不得已的折中,因为同构系统更简单、更容易管理。但如果把成本和性能放到一起看,就会发现这其实是个误解。真正昂贵的往往不是异构本身,而是你试图把所有流量都塞进同一种资源模型里,最后为最坏情况买单。
LLM 推理的流量通常并不均匀。有的模型 QPS 高但请求短,有的模型 QPS 低但上下文长,有的请求延迟敏感,有的可以容忍较高尾延迟。若给所有任务配同一类 GPU,就会出现两种浪费。第一种是性能浪费,高规格资源被低强度请求占着;第二种是机会浪费,本来可用更便宜资源承接的任务,却被昂贵资源吞掉了。
这就是异构策略存在的真正理由。它不是为了“看起来先进”,而是为了把流量的差异,映射到硬件差异上。高算力卡服务计算密集阶段,高带宽卡服务内存密集阶段,较弱但便宜的卡承接轻量请求,某些模型通过更细粒度的参数共享降低驻留成本。系统的目标不再是统一,而是让差异成为效率来源。
但异构也会带来一个更深的问题:调度必须具备语义感知能力。你不能只看“有多少空卡”,还要看这张卡适不适合这个请求,这个请求现在处于什么阶段,它的 KV Cache 规模有多大,SLO 允许什么样的抖动,当前网络是否足够快,是否会因为迁移代价反噬收益。
这也是为什么很多系统方案开始围绕“请求类型”而不是“设备类型”来组织:
- 看请求的阶段,决定它更像计算密集还是带宽密集。
- 看请求的规模,决定它应不应该独占资源。
- 看请求的 SLO,决定是否允许迁移、拆分、共享或降级。
- 看整个集群的资源曲线,决定是否借内存、跨卡分配、或动态切换策略。
换句话说,异构不是简单地把机器拼在一起,而是要让调度器理解“哪些差异值得利用,哪些差异必须隐藏”。
一个更通用的框架:把推理系统看成“约束编译器”
如果要给这些系统一个统一的抽象,我会把它叫做约束编译器。
输入不是程序,而是请求分布、模型集合、SLO、上下文长度、GPU 类型、拓扑结构、网络条件和成本预算。输出不是某个固定执行计划,而是一套可以在线调整的映射关系:哪个请求跑在哪类 GPU 上,prefill 和 decoding 如何切分,KV Cache 如何放置和迁移,LoRA 适配器如何共享,何时 batching,何时分流,何时借内存,何时放弃最优算力换取更稳的尾延迟。
这个框架有三个层次:
第一层是算子层。 关注 FlashAttention、PagedAttention、定制 CUDA kernel、分布式注意力这些局部加速手段。它们决定单点效率上限。
第二层是布局层。 关注模型并行、阶段切分、KV Cache 放置、GPU 选择、跨设备通信。这一层决定整体资源是否匹配。
第三层是策略层。 关注流量调度、SLO 保证、动态借用、异构感知、租户隔离、负载均衡。这一层决定系统是否能在真实世界里稳定运转。
很多失败的系统,问题并不在算子层,而是在布局层和策略层。它们可能在基准测试里很亮眼,却在真实流量下迅速变得脆弱,因为真实世界里最棘手的变量不是单卡速度,而是资源约束之间的联动。
这也解释了为什么“某种芯片是否适合推理”不能只看峰值参数。你买的不是一个静态器件,而是一整套能否与推理约束相匹配的能力组合。算力、容量、带宽、互联、IO、灵活性、可编程性,任何一个都不能太差。不是因为每项都必须顶尖,而是因为推理是一个没有单一决定因素的系统工程。
芯片竞争从来不只是“谁更快”,而是谁更像一个能够被推理系统有效编排的资源池。
Key Takeaways
- 不要把 LLM 推理理解成“算力竞赛”。更准确的描述是:它是算力、容量、带宽、互联和调度之间的配平问题。
- 把请求看成流动的阶段,而不是静态任务。prefill、decoding、长上下文缓存迁移,分别对应完全不同的资源瓶颈。
- 异构不是复杂化,而是把差异变成成本优势。前提是调度器能够感知请求特征,并把任务映射到合适的硬件。
- 真正重要的是布局能力。模型并行、KV Cache 放置、LoRA 共享、阶段切分,决定了系统是否浪费资源。
- 评价推理系统时,要看尾延迟和资源曲线,而不是只看峰值吞吐。真实世界的价值来自稳态表现,而不是单点极限。
结语:未来的推理系统,像操作系统,不像加速器
我们过去总习惯把推理系统想成一个加速器,仿佛只要不断压榨硬件峰值,性能就会自然提升。但更准确的类比,其实是操作系统。它的职责不是把某一个指令跑到极致,而是在有限资源、复杂约束和不断变化的负载之间,持续做出正确的分配。
这也许是 LLM 推理最重要的认知升级:未来的竞争,不是谁能把某个 benchmark 再提高几个百分点,而是谁能更好地管理“差异”。差异的模型,差异的流量,差异的上下文长度,差异的 GPU,差异的 SLO。谁能把这些差异编排成秩序,谁就能把成本、性能和可用性同时拉到一个更高的层次。
所以,下一次当你看到某个推理系统宣称“更快、更强、更省”时,不妨换个问题问自己:它到底是更强了一张卡,还是更聪明地组织了一整个世界?
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣