真正的智能,不在算力峰值,而在把记忆放在离思考最近的地方
Hatched by Kevin Di
Apr 24, 2026
1 min read
10 views
86%
一句最反常识的话:模型越来越强,往往不是因为它“更会算”,而是因为它“更会看”
如果一个系统要理解语言,它究竟应该把力量花在更复杂的结构上,还是花在更好的记忆与检索上?这个问题看起来像机器学习内部的技术分歧,但它其实触及了智能的本质。我们通常以为,能力来自更深的网络、更大的参数、更多的算力;可另一种视角却提醒我们,真正决定理解质量的,可能不是“想得多快”,而是“能否在关键时刻准确地看到相关信息”。
这也是为什么 Transformer 和内存中处理芯片这两个看似相距甚远的主题,放在一起会突然变得极有启发性。前者告诉我们,语言理解的负担可以从固定的顺序结构,转移到数据内部的关系组织上。后者则告诉我们,计算的负担也可以从远离数据的冗余搬运,转移到更靠近数据的位置上。两者共同指向一个更深的原则:智能的进化,不只是增加计算,而是重新安排计算、记忆和访问的关系。
语言模型真正学会的,不是“规则”,而是“关系地图”
自注意力的革命,表面上像一种更灵活的运算方式,本质上却是一次认知分工的重写。传统思路里,序列理解依赖结构,位置、顺序、层级都要由网络显式承担。而自注意力做了一件更聪明的事,它让每个词都能去看句子里的其他词,从而自己判断当前语境中谁更重要。
这带来的变化远不只是翻译更准。一个词的词性、歧义、实体身份,往往并不是它“自身”决定的,而是它与周围词语之间的关系决定的。比如“苹果”在“我吃了一个苹果”里是水果,在“苹果发布新手机”里是公司名,真正需要建模的不是词条本身,而是上下文关系。自注意力就是把这种关系显式化,让模型把句子看成一个不断变化的关系网络,而不是一串静态符号。
智能不是把每个元素记得更牢,而是更快地找到元素之间真正有意义的关联。
这也解释了为什么内部表示如此关键。一个模型越能在内部形成有意义的表示,它在翻译、标注、实体识别、语义角色分析等任务上的表现就越好。换句话说,优秀模型不是简单地存储答案,而是在“看到”语言时,自动生成一张可操作的关系地图。它把语序的重担从结构上挪开,转移到表示上,转移到数据本身组织出的语义纹理上。
如果把这个过程类比成阅读人类写作,传统结构像是在要求读者必须按固定框架逐句解码,而注意力机制更像是读者可以随时回看前文,标记伏笔,追踪指代,捕捉反转。理解因此不再是线性展开,而是动态回溯和重组。语言之所以能被机器处理得越来越像“理解”,正是因为模型开始学会把相关性当作主要信息载体。
计算瓶颈的真正敌人,不是 FLOPS,而是搬运数据
如果说 Transformer 解决的是“该看哪里”的问题,那么 PIM,尤其是内存中处理,解决的则是“看东西时别走太远”的问题。这里有一个经常被低估的事实:在现代 AI 芯片里,最昂贵的往往不是计算本身,而是数据从内存到计算单元之间的来回搬运。很多时候,延迟和能耗的主要来源,不是算术运算太复杂,而是数据走得太远。
这就是为什么片上 SRAM、计算密度、内存密度这些指标如此重要。Groq 一张卡有 230MB 片上 SRAM,而 d-Matrix 则能做到 2GB。差距不是“多一点缓存”这么简单,而是整个架构哲学的差异:究竟是让计算靠近数据,还是让数据疲于奔命地围着计算跑?PIM 的魅力就在这里,它把一部分运算放进内存附近,减少昂贵的片外 DRAM 访问,从而把性能和能效提升的空间打开。
不过,任何新架构的故事都必须经受现实检验。新颖不等于更好,令人兴奋也不等于一定有商业可行性。尤其当性能演示建立在“性能模式”下时,最关键的问题不是峰值能跑多快,而是在真实部署中,系统是否仍然划算、稳定、可规模化。这点非常重要,因为基础设施世界里,真正决定胜负的往往不是实验室里的极限值,而是长期运行中的单位成本、热设计、可靠性和可维护性。
这类争论之所以有价值,是因为它揭示了一个常被忽略的规律:算力的提升并不总是来自更强的执行单元,很多时候来自更少的无效移动。 这和 Transformer 的思想高度一致。注意力并不是把每个 token 的处理变得更暴力,而是把信息访问变得更精准。PIM 也不是让芯片“更卖力”,而是让数据与计算之间的距离变短。它们共同反对一种粗暴的工程直觉,即只要堆更多硬件,就能自然获得更高智能。
同一个深层原则:把“相关的东西”放在一起
把这两条线索并在一起,会得到一个很少被明确说出的结论:智能系统最重要的优化目标,不是单点性能,而是相关性聚合。
在语言模型里,相关性聚合表现为注意力。与当前词最相关的上下文被聚焦,远处但关键的信息被重新拉近。模型不再机械地按位置递推,而是在一个动态权重网络里组织意义。在芯片架构里,相关性聚合表现为内存和计算的贴近。与当前运算相关的数据被尽量留在近处,减少跨层级搬运,降低延迟和能耗。
这两个世界里的“近”不是空间上的简单距离,而是意义上的近。对 Transformer 来说,重要的是上下文关联近;对 PIM 来说,重要的是访问路径近。二者都在对抗一种共同的浪费:把本应同时出现、共同参与决定结果的信息,拆散到远处,然后再付出高昂代价把它们重新拉回。
可以把它想成餐厅后厨。一个笨拙的厨房会让厨师在灶台、冰箱、备料台之间来回奔跑,速度再快也会被路线拖垮。聪明的厨房则会把常一起使用的食材和工具放在同一区域,减少无效移动。Transformer 的注意力像是在每道菜开做前,快速判断今天最相关的食材组合是什么。PIM 则像是把常用食材直接放到厨师手边,避免让厨师为了找盐来回跑半天。
现代智能系统的竞争,不只是“谁能算得更快”,而是“谁能让最相关的信息以最低成本参与计算”。
这也是为什么“表示”与“硬件”其实不是两个孤立层次,而是同一个原则的两种实现。好的表示,意味着系统可以用更少的结构做更多事情。好的硬件,意味着系统可以用更少的数据搬运完成更多计算。前者提升理解效率,后者提升执行效率。最终,两者都在为同一种能力服务:把世界压缩成一张足够有用的关系网。
为什么这件事会决定 AI 的下一阶段
今天很多关于 AI 的讨论,仍然沉迷于“更大”。更大的模型,更大的 GPU 集群,更大的上下文窗口,更大的参数预算。可当模型越来越大,系统复杂度也在指数级上升,真正的约束开始从算法创新转向工程瓶颈。训练阶段如此,推理阶段更是如此。一个模型即便学得再好,如果在部署时成本过高、延迟太高、能耗太高,它在现实中仍然可能输给一个更小但更经济的系统。
这就是为什么“性能模式”这样的词值得警惕。它提醒我们,峰值指标往往只是故事的一半。真正值得问的是:在真实负载下,系统是否依然保持高效?是否仍然能把优势转化为商业价值?是否能在高并发、低延迟、长时间运行的条件下维持成本优势?如果答案是否定的,那么所谓技术领先很可能只是展示层面的领先。
从这个角度看,Transformer 和 PIM 共同教会我们的,不是某一种具体技术路线,而是一种判断方法。面对任何 AI 系统,都应该问两个问题:
- 它是否更擅长识别相关信息?
- 它是否更擅长以低成本调动相关信息?
前者决定模型是否“懂”。后者决定系统是否“用得起”。这两个问题合在一起,才构成真正可持续的智能能力。只追求前者,会得到聪明但昂贵的模型;只追求后者,会得到高效但贫乏的系统。只有当理解和执行同时优化,AI 才会从演示走向基础设施。
这也解释了为什么未来的竞争很可能不再只发生在模型层,而会发生在模型与硬件共同设计的层面。模型训练时如何组织表示,推理时如何选择精度,芯片如何匹配访问模式,内存如何布局,缓存如何复用,这些原本分散的问题,实际上都在回答同一个系统性问题:如何让“相关的东西”尽可能聚拢,而不是彼此追逐。
Key Takeaways
- 不要只问模型有多大,要问它是否学会了好的关系结构。 优秀的注意力机制,本质上是在构造一张更有效的语义地图。
- 不要只看峰值算力,要看数据搬运成本。 很多 AI 系统的瓶颈不在计算单元,而在内存访问与数据传输。
- 把“相关的东西”放近,是智能系统最朴素也最强大的原则。 在算法层是注意力,在硬件层是 PIM。
- 评估新架构时,必须区分演示性能与部署性能。 能跑出漂亮 benchmark,不代表能在真实业务里赚钱。
- 思考 AI 时,要同时看表示与基础设施。 谁能同时提升理解效率和执行效率,谁就更可能在下一阶段胜出。
结尾:智能的未来,也许不是更强的脑,而是更好的神经布局
我们习惯把智能想成一种“更多”的东西,更多参数,更多乘加,更多记忆,更多层数。可如果把 Transformer 和内存中处理放在一起看,会发现更深的趋势恰恰相反:真正有突破性的系统,不一定是加法意义上的更大,而是结构意义上的更近。
理解语言时,把相关上下文拉近;执行计算时,把相关数据拉近。前者让模型更会“看”,后者让芯片更会“走”。两者最终都在说明一件事:智能不是把所有东西都算一遍,而是以最小代价,把最该被看见的东西,准确地放到思考中心。
也许我们该重新定义“更聪明的机器”了。它不是那种最努力的机器,而是那种最懂得如何组织关系、如何安放记忆、如何减少无效距离的机器。未来的胜负,可能不取决于谁拥有最多的算力,而取决于谁最会安排思考与记忆之间的距离。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣