当算力变成水电:人工智能真正的护城河正在下沉

Kevin Di

Hatched by Kevin Di

Aug 30, 2026

1 min read

94%

0

一个看似荒谬的问题正在决定人工智能公司的生死:当一块曾经每小时超过8美元的H100,如今可以以约2美元出租时,真正稀缺的究竟还是算力吗?

答案可能比“模型能力”更不舒服。算力正在迅速变成一种基础设施,而模型也正在从神秘的黑箱,变成可以被替换、压缩、微调和重新部署的软件组件。与此同时,最容易被忽视的细节,例如一个填充符是否错误地占用了结束符的位置,可能比多买几百张GPU更快地摧毁一个系统。

这两件事表面上分属不同世界:一边是GPU租赁价格、基础模型融资和集群利用率,另一边是聊天模板、特殊词元和无限生成。但它们共同揭示了同一个转折点:人工智能的竞争,正在从拥有稀缺资源,转向控制复杂系统的接口。

从购买稀缺性,到购买可替代性

在生成式人工智能的早期阶段,公司的战略往往可以浓缩成一个简单公式:更多GPU,更多训练数据,更大的模型,更多融资。H100价格高企时,租到一批GPU本身就像获得了一张入场券。创业者需要向投资人证明,自己有能力训练一个足够大的基础模型,而投资人也愿意为这场高成本竞赛下注。

但价格下降并不只是让训练变便宜。它同时暴露了一个事实:许多团队过去购买的不是生产能力,而是稀缺感。

如果从零训练一个大型模型需要16个节点以上,而微调一个成熟模型通常只需要一个节点或几个节点,那么两者就不仅是成本不同,还是商业逻辑不同。前者要求团队建立一整套数据工程、分布式训练、模型评估和故障恢复能力。后者则可以直接利用已有模型,把资源集中到特定行业、特定任务和特定用户身上。

这类似于电力行业从自建发电厂转向购买电力。电力变便宜以后,企业不会因此全部去建造发电厂。恰恰相反,更多企业会把精力投入到真正区别于竞争对手的地方,例如产品设计、供应链和客户关系。

人工智能也正在经历同样的变化。基础模型训练越来越像发电,而推理、微调、数据处理和应用集成越来越像用电。能够持续租到算力当然重要,但它本身不再构成足够强的护城河。

更微妙的是,硬件之间也开始出现真正的可替代性。只要某种加速器能够运行主流推理代码,支持常见模型架构,并且解决兼容性问题,它就不必在每一项指标上击败H100。它只需要成为一个足够可靠的替代方案。

当基础设施可以被替换时,真正的资产不再是基础设施本身,而是围绕它建立的工作流。

这解释了为什么市场会从大型集群训练转向推理和小规模微调。需求没有消失,而是被重新切割了。少数团队仍然需要巨型集群训练超大模型,但绝大多数团队需要的是稳定地服务用户、快速迭代版本,并以合理成本适配业务场景。

一个词元错误,为什么足以让系统失控

软件系统的接口问题,往往比硬件故障更危险,因为它们看起来像是“正常工作”。一个GPU完全无法启动,工程师会立刻排查。一个模型能够输出文字,却因为结束符和填充符被错误地映射,导致训练时结束符被屏蔽,最终出现无限生成,问题则可能潜伏很久。

在一个推理模型中,开头标记、结束标记、用户角色、助手角色,以及思考过程的开始和结束标记,并不是装饰性的文本。它们构成了模型理解对话结构的协议。聊天模板自动添加开始标记,推理框架也可能自动添加一次。如果调用编码器时再次添加特殊标记,就会出现重复的开始符。重复本身未必立即报错,却可能改变模型接收到的序列结构。

同样,<think></think>被分配为专用词元,意味着系统需要明确区分“内部推理区域”和“面向用户的回答区域”。不同模型家族的词元编号又不相同。某个模型原本没有开始符,就必须借用另一个保留词元。换言之,模型的能力并不只存在于参数中,也存在于一份极其脆弱的协议里。

这份协议就像集装箱运输中的标准接口。集装箱本身可以来自不同制造商,轮船、火车和卡车也可以属于不同公司,但只要尺寸、锁扣和装卸规则一致,整个系统就能运转。若某个港口把锁扣和排水孔混为一谈,问题不会只影响一个箱子,而会沿着整个供应链扩散。

模型部署也是如此。一个号称“兼容”的模型,若聊天模板不一致,特殊词元映射不一致,批处理中的填充策略不一致,或者推理框架对开始符的处理不一致,那么所谓兼容只是一种市场宣传,而不是工程事实。

这正是算力商品化与模型协议复杂化之间的关键连接:越是容易替换底层资源,接口越成为系统的核心资产。

当H100、其他加速器和不同云平台都能完成相似的推理任务时,企业真正需要管理的是模型如何进入系统,数据如何被编码,输出如何被评估,版本如何回滚,以及失败如何被发现。底层资源可以更换,但接口错误会让所有资源同时失效。

人工智能竞争的三层结构

可以把人工智能系统拆成三层:资源层、能力层和协调层。

资源层包括GPU、内存、网络、存储和云服务。它决定系统能否运行,以及运行成本是多少。随着供应商增加、硬件替代品出现、推理效率提升,资源层的差异会逐渐缩小。它仍然重要,但越来越接近采购和运营问题。

能力层包括基础模型、微调权重、训练数据和推理方法。这里仍然存在显著差异,尤其是在推理能力、语言覆盖、专业知识和延迟方面。但成熟开放模型的扩散,正在降低很多公司的进入门槛。除非团队拥有独特数据、新架构、显著更低的延迟,或某个大型模型无法覆盖的语言和场景,否则从零训练基础模型很难形成合理的回报。

协调层则包括所有让系统可靠工作的东西:

  1. 输入如何按照正确的模板编码。
  2. 特殊词元如何映射和验证。
  3. 训练时哪些位置参与损失计算。
  4. 推理时何时停止生成。
  5. 不同硬件和框架如何保持行为一致。
  6. 模型升级后,如何判断质量是否真的提高。
  7. 发生异常时,如何快速定位是数据、模型、协议还是硬件问题。

很多公司把大量预算投入能力层,却把协调层当作胶水代码。结果是,它们拥有一个很强的模型,却无法稳定地服务用户;拥有一组昂贵的GPU,却无法知道GPU究竟被什么任务占用;拥有一个漂亮的基准分数,却无法解释线上质量为什么下降。

协调层的价值在于,它把可替代的组件组合成不可轻易替代的系统。一个企业可以更换底层模型,也可以更换GPU供应商,但如果它已经建立了可靠的数据管道、评估体系、部署工具和故障诊断机制,那么替换成本就会转移到竞争对手身上。

从模型崇拜,转向系统可验证性

这带来一个重要的管理原则:不要只问“这个模型有多强”,还要问“这个系统在什么条件下会失败”。

例如,部署一个推理模型时,团队至少应当把以下内容当成正式资产,而不是临时配置:

  1. 模板测试:验证开始符、结束符、用户和助手角色是否只出现一次,并确认不同推理框架的行为一致。
  2. 词元注册表:明确记录每个模型家族的特殊词元编号,不依赖模糊的名称或默认配置。
  3. 停止条件测试:用短回答、长回答、多轮对话和异常输入测试模型是否能够正常结束。
  4. 填充与损失测试:确认填充符不会错误地变成结束符,也不会在训练时被错误屏蔽。
  5. 硬件替换测试:在不同加速器和不同推理后端上比较输出、延迟、显存使用和错误率。
  6. 业务评估集:不要只测通用基准,还要测真实用户问题、边界案例和高风险任务。

这些工作看起来不像“人工智能创新”,却决定了创新能否被稳定地交付。一个每小时便宜几美元的GPU,只有在系统能够充分利用它时才真的便宜。一个参数更大的模型,只有在模板、停止条件和评估体系都可靠时才真的更强。

这也改变了团队应该招聘和奖励的人才类型。未来最有价值的工程师,未必只是能够训练更大模型的人,也包括能够追踪一条请求从用户输入到最终输出的完整路径的人。他们理解编译器、分布式系统、数据质量、模型行为和业务指标之间的相互作用。

人工智能的下一场竞争,不是把某个零件做到极致,而是让所有零件在变化中仍然保持可预测。

给建设者的现实策略

如果一家团队今天才开始建设人工智能产品,最危险的选择是先问“我们能不能训练一个自己的基础模型”。更好的问题是:哪些环节能够形成独特反馈,哪些环节可以借助现成组件,哪些接口必须由我们自己掌控。

一种更稳健的路径是先建立任务闭环。选择一个明确场景,使用成熟模型完成初版,记录真实输入、失败类型、用户修正和最终结果。然后把最频繁、最有价值的失败转化为数据和评估集,再决定应该微调模型、改进提示、替换推理引擎,还是优化产品流程。

这个顺序很重要。没有真实反馈时,训练更大的模型往往只是扩大不确定性。相反,一个小规模模型配合高质量数据、稳定协议和快速评估,可能比一个更大的通用模型更有商业价值。

团队也应该把基础设施预算分成两部分:一部分用于获取计算资源,另一部分用于降低切换成本。后者包括模型抽象层、标准化输入输出、可重复的部署脚本、跨硬件测试和详细的可观测性。表面上看,这些投入不会立刻提高基准分数,却能让公司在价格变化、模型更新和供应商调整时保持选择权。

关键要点

  1. 把GPU视为可替换的生产资料,而不是公司的身份象征。 计算资源的价格和供应会波动,系统迁移能力才是长期资产。
  2. 把聊天模板和特殊词元当作生产协议管理。 所有开始符、结束符、角色符、思考符和填充符都应有自动化验证。
  3. 优先投资真实数据反馈,而不是盲目从零训练模型。 只有当独特数据、架构或任务需求足够明确时,基础模型训练才可能合理。
  4. 建立跨模型、跨框架、跨硬件的回归测试。 “能运行”不等于“行为一致”,尤其是在生成停止、批处理和多轮对话方面。
  5. 衡量系统的可替换性和可恢复性。 能否在一天内更换模型或加速器,往往比单次测试中的最高分更能体现工程成熟度。

真正稀缺的不是更大的机器

人工智能产业正在经历一次认知上的降温。过去,规模本身可以制造优势,昂贵的GPU和庞大的训练集群让竞争看起来像一场资本耐力赛。现在,随着算力价格下降、成熟模型开放、微调门槛降低,产业开始显现出更接近软件工程的本质。

这并不意味着规模不再重要。少数团队仍会训练更大的模型,硬件效率仍会影响成本,模型能力仍会决定产品上限。但规模优势若无法被可靠地接入数据、产品和运营流程,就只是悬浮在空中的能力。

未来最强的人工智能公司,可能不是拥有最多GPU的公司,也不是参数数量最大的公司,而是能够在底层组件不断变化时,仍然快速学习、稳定交付和低成本迁移的公司。它们的护城河藏在协议、评估、数据闭环和故障恢复之中,藏在那些不适合发布会,却决定每一次真实请求成败的细节里。

当算力像水电一样从墙上接入,问题就不再是“我们拥有多少资源”,而是“我们能否把普通资源组织成特殊能力”。这也许是人工智能商业化真正的分水岭:不是谁买到了最昂贵的机器,而是谁最早意识到,下一代基础设施的核心不是机器,而是机器之间不会悄悄出错的秩序。

Sources

← Back to Library

Hatch New Ideas with Glasp AI 🐣

Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)

Start Hatching 🐣