真正稀缺的不是算力,而是让系统停止自我重复的能力
Hatched by Kevin Di
Jun 26, 2026
1 min read
4 views
72%
价格暴跌之后,真正值钱的东西反而浮出来了
如果一块 H100 显卡从每小时 8 美元跌到 2.85 美元,为什么许多人依然感觉自己买不起算力?答案可能并不在价格表上,而在系统是否会自我重复。
表面上看,这是一个关于 GPU 供需变化的故事:训练需求下降,微调更便宜,基础模型公司减少,推理和小规模调优成为主战场。可更深一层看,这其实是一个关于生成系统如何摆脱局部最优的问题。无论是语言模型的采样,还是 AI 基础设施的商业模式,最危险的事情都不是“不够强”,而是反复生成已经生成过的东西。
这就是一个耐人寻味的连接点。模型在推理时会出现重复,市场在繁荣期会重复扩张,创业者在融资叙事里会重复上一轮“训练更大模型”的逻辑。于是,一个看似属于算法细节的参数,top_p、top_k、repetition_penalty,竟然能够成为理解整个行业周期的隐喻:任何复杂系统如果没有偏离重复的机制,最终都会把资源耗在自己的回声里。
一、为什么“更聪明”不等于“更不重复”
很多人第一次接触生成模型时,会直觉地以为,模型越大,就越不会犯低级错误。现实恰好相反。模型能力提高,确实会降低很多错误,但它并不会自动消除一种更隐蔽的失败模式,模式坍缩:不断回到熟悉、安全、可预测的轨道上。
这正是 top_p 和 repetition_penalty 背后的共同问题。top_p 的作用,是让模型不要只盯着最高概率的少数 token,而是在一个累计概率阈值内保留更多选择,给生成过程留出弹性。repetition_penalty 则更直接,它把已经出现过的 token 适度降权,强行提醒系统:你已经说过一次了,不必再说一遍。
这两者看似是解码技巧,实则是在对抗同一种倾向:系统在压力之下,会倾向于选择最熟悉的路径。熟悉意味着低风险,但也意味着低信息量。一个模型如果只会继续强化自己刚说过的内容,最后就会像一个只会绕圈的演讲者,语言看起来流畅,实质却在原地打转。
这件事并不只发生在 token 层面。创业公司在技术路线选择上,也有类似的重复冲动。某条路线刚刚带来一轮融资,于是所有人都想用更大的参数、更大的集群、更像上一代赢家的叙事去复制成功。但市场不是语言模型,它不会因为你重复得更大声就奖励你。相反,当环境变化时,重复上一轮答案,往往意味着更快出局。
重复惩罚不是为了让模型更“创新”,而是为了避免它沉迷于最省力的答案。
这一点放到产业里,几乎就是一句残酷的真相。很多公司并不是输在“不够先进”,而是输在过于依赖一种已经被证明有效的叙事。算力价格下跌看似是利好,但它也在逼迫所有人承认:真正稀缺的,从来不是“更多的资源”,而是用资源做出新区别的能力。
二、GPU 泡沫退潮后,市场开始奖励“少而准”
H100 价格回落之所以重要,不仅因为它让训练成本下降,更因为它改变了“什么值得被训练”的边界。曾经,只要有一笔足够大的融资,很多团队就会把“从零训练基础模型”视为理所当然的目标。巨大的集群、宏大的参数规模、足够吓人的故事,几乎构成了那个阶段的成功模板。
但当现实回到成本约束,行业迅速从“谁能买最多 GPU”转向“谁能更有效地使用更少的 GPU”。这时,微调的优势就显现出来了。它通常只需要单节点或少量节点,能更快验证产品,更快接近收入,也更容易形成闭环。于是,市场开始奖励的,不再是最雄心勃勃的起点,而是最少浪费的路径。
这背后有个非常重要的结构性变化:基础模型的竞争不再是单纯的规模竞赛,而是差异化竞赛。如果一个团队不能在架构、延迟、语言覆盖、数据优势或专用场景上提出明显不同,它就很难说服投资者为何要再造一个相似的模型。换句话说,行业正在从“堆叠同质化能力”转向“压缩重复,放大差异”。
这就像解码策略从贪婪搜索转向 top_p。不是为了任性,而是为了不被最容易的选择绑架。过去的市场逻辑告诉你,最大的集群最有说服力。现在的市场逻辑越来越像在说,最少的无效计算才有说服力。
这里有一个很实用的类比:
- 训练基础模型像开一家大型中央厨房,先投入巨大成本,再指望规模回收。
- 微调像在现成厨房里改菜单,先确定顾客口味,再决定要不要扩张。
前者适合资源极度充沛、且能建立长期护城河的玩家。后者更适合快速迭代、贴近需求、以产品牵引模型的团队。市场环境一变,真正占优的就不是“最大厨房”,而是最能减少试错损耗的厨房。
三、从 token 到资本,系统最怕的都是“局部最优幻觉”
语言模型的重复问题和 GPU 市场的泡沫问题,最深层其实共享同一个机制:局部最优幻觉。
在生成任务里,局部最优是“下一步最可能的 token”,它常常让句子看起来合理,却可能把整段文本带入重复、空转、缺乏新意的陷阱。重复惩罚和采样策略的意义,就是让模型意识到:眼前最顺滑的选择,不一定是整体上最好的选择。
在产业竞争里,局部最优则是“看起来最容易融资、最快显得强大、最符合上一轮成功路径的策略”。例如,继续堆更大的训练集群,继续讲通用大模型故事,继续复制已有架构。这些路径短期内很舒服,因为它们有先例、有估值锚点、有可展示的规模感。但一旦外部条件变化,这些选择就会像高概率 token 一样,把系统推向重复和拥塞。
局部最优的最大危险,不是它错得离谱,而是它太像正确答案。
这也是为什么很多创业者会在一个看似繁荣的市场里,做出实际上极其脆弱的决策。因为当融资环境宽松时,资源会掩盖效率问题;当资源变贵或需求结构改变时,效率问题会突然以极高的代价暴露出来。H100 价格下降并不意味着泡沫结束了,它更像是一个显影剂,把哪些项目只是“靠贵资源撑着”照得更清楚。
从这个角度看,GPU 泡沫的收缩不是坏消息,而是一种校准。它迫使团队回答一个更诚实的问题:如果你不能依赖无限算力,你到底靠什么赢?
而这个问题的答案,通常不会是“我也能训练一个差不多的模型”。那只是重复。真正有价值的答案,往往是:
- 我有独特数据,别人拿不到。
- 我有更低延迟的架构,适合实时场景。
- 我有明确垂直场景,模型质量可以围绕任务定义。
- 我能把模型部署得更便宜、更稳定、更可控。
这些都不是“更大”,而是“更不重复”。
四、一个更有用的框架:把 AI 系统看成“抑制回声”的装置
如果把模型和市场放在同一张图里,我们会得到一个很实用的框架:任何 AI 系统,真正的核心能力不是单纯地产出,而是在产出中持续抑制回声。
可以把它分成三层:
1. 生成层:避免句子层面的自我复读
这是最直观的一层。top_p、top_k、repetition_penalty,本质是在保持可用性的前提下,给输出引入足够的变化空间。它们不是为了追求“随机”,而是为了防止输出被单一高概率路径垄断。
2. 产品层:避免功能层面的自我复刻
很多 AI 产品的问题不是不好用,而是太像别人的产品。它们只是把现有能力换个壳重新包装。这样的产品短期可能能跑起来,但很难建立真正的用户粘性,因为它们没有解决一个足够具体、足够痛的差异化问题。
3. 产业层:避免资本层面的自我复制
当市场奖励某一类故事时,资本会自然向同一方向聚集。于是更多人做同类模型,更大集群被建起来,更相似的融资材料被递出去。看似繁荣,实则是系统在复制自己的上一轮判断。H100 价格回落之后,这种复制会越来越难被掩盖。
这三层其实是同一件事:如何防止系统把历史当成未来。
如果一个团队能在这三层同时做到“少重复”,它就拥有真正的结构优势。因为它不仅会生成新东西,还知道哪些旧东西不该再生成。它不仅会训练模型,还知道哪些训练不值得。它不仅会扩张,还知道何时该收缩。
这也是今天最值得重新理解的一点:AI 时代最宝贵的能力,不是把一个系统推到更大的规模,而是让它具备自我去重的能力。
Key Takeaways
-
不要把更大的规模误认为更强的能力。 很多时候,真正决定成败的是系统是否能避开重复,而不是它能否持续放大已有模式。
-
在生成策略上,top_p 和 repetition_penalty 的意义不只是调参。 它们代表了一种更普遍的思维方式:给系统留出偏离熟路的空间,并惩罚低信息量的重复。
-
在 AI 创业上,微调时代奖励的是差异化,而不是同质化扩张。 如果没有独特数据、低延迟架构、垂直场景或强分发能力,重走基础模型路线会越来越难。
-
判断一个项目是否健康,可以问它是否依赖“回声”。 如果它的增长主要来自复制上一轮成功故事、复制相似架构、复制同类融资逻辑,那它的脆弱性很高。
-
最好的系统不是最少出错的系统,而是最少自我重复的系统。 这是模型、产品、资本三者共享的底层原则。
结语:真正的竞争,是谁先停止复读
我们常把 AI 竞争理解为算力之争、模型之争、人才之争,但更深处,它其实是一场去重复能力的竞争。模型如果只会走最可能的下一步,就会陷入语言回声。公司如果只会走最熟悉的融资和训练路径,就会陷入产业回声。资本如果只会追逐上一轮赢家,就会陷入估值回声。
所以,H100 价格下跌并不只是一个供应链现象。它在提醒我们:当资源不再足够昂贵,所有假装独特的东西都会变得更容易分辨。真正有价值的,不是继续放大旧答案,而是能在复杂性中及时停下,识别重复,然后转向新的路径。
换句话说,未来不会奖励最能“生成”的系统,未来会奖励最能识别何时不该再生成的系统。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣