The Real Skill Is Not Prompting: It Is Managing Context Like a Budget
Hatched by john ke
May 02, 2026
1 min read
4 views
86%
你以为你在和 AI 对话,其实你在做资源调度
为什么同样是 ChatGPT,有人得到的是空话,有人却能榨出接近专家级的输出?很多人把问题归咎于模型本身,或者归咎于“不会写 prompt”。但更深一层的真相是:你不是在向 AI 提问,你是在管理一个有限的上下文系统。
这件事听起来技术,但本质上很像经营一家小公司。你不能把所有文件都塞给新人,也不能让每个任务都从零开始讲背景,更不能把最贵的员工拿去做最廉价的杂务。真正高效的人,不是“会聊天”,而是知道什么时候该喂信息,什么时候该收缩,什么时候该换人,什么时候该存档。
这就是为什么很多人和 AI 的互动会陷入一种怪圈:输出总是“正确但没用”。不是因为模型笨,而是因为人类在用一种极其浪费的方式消耗它的有限注意力。把 AI 当成无限耐心的助手,结果反而比把它当成一个高薪实习生更低效。
关键不是让 AI 知道更多,而是让它在正确的时刻知道正确的事。
问题不在答案浅,而在你把系统当成了无限
大多数人以为,AI 对话的核心是“问得好不好”。其实更准确的说法是,AI 对话的核心是上下文分配。每一条消息、每一次修改、每一段背景说明,都在争夺同一份预算。预算一旦被浪费在重复解释、无效累积和低价值请求上,真正重要的信息就会被挤出系统。
这也是为什么简单请求和冗长请求的效果差距如此之大。不是因为长句更专业,而是因为长句把有限 token 用在了不必要的地方。你说“把这个按钮改成蓝色”,模型几乎没有歧义。你说“能不能把这个按钮组件的样式改成蓝色,不要现在的颜色”,信息并没有增加,成本却翻了很多倍。清晰不是风格问题,而是资源效率问题。
更进一步,很多人做迭代时也在无意识地“叠加债务”。你让模型生成一次,发现问题,再让它根据输出继续改,下一轮又把上一轮完整输出和新要求一起带进去。于是对话像滚雪球一样越滚越大,消耗越来越高,噪音越来越多。表面上是在不断优化,实际上是在不断积累冗余。
这就像修车时,你每次都把整辆车拖回工厂重新报修,而不是直接改掉出问题的零件。能修,但成本极高。
三种最贵的浪费:重复解释,累积修改,错误分工
如果把 AI 协作看成一个系统,最常见的浪费有三种。
1. 重复解释背景
很多人每开一个新对话,都要把项目目标、业务背景、输出偏好、技术栈重新讲一遍。结果不是模型学得慢,而是你把最贵的部分花在了“初始化”。真正高效的系统,应该把稳定信息变成长期记忆,把变化信息留在临时上下文里。
这类分层很重要。比如一个 AI 助手知道你偏好详细解释、你在做什么项目、你常用什么工具,下次就不用再浪费一大段文字交代这些基础事实。它像是一个预先安装好配置的工作台,而不是每次都从搬桌子开始。
2. 累积式修改
人类很容易犯一个习惯性错误:把 AI 的每次输出都当成“新材料”,然后在其上继续添加指令。结果越改越厚,越厚越乱。
更聪明的方式是替换,而不是累积。当你发现方向不对,不是继续往旧输出上堆要求,而是回到原始任务定义,直接修改 prompt,让系统重新生成。这样做并不“浪费”,恰恰相反,它减少了上下文中的噪音密度。
可以把这想象成写代码时的干净重构,而不是在一个充满注释和补丁的旧文件上继续打补丁。补丁看起来省事,长期看往往是灾难。
3. 错误分工
不是每一项任务都该交给最强的模型。让最贵的大模型去处理心跳请求,就像让米其林主厨帮你切葱花。技术上可行,组织上荒谬。
更合理的方式是按任务价值分层路由。简单、频繁、低风险的请求,交给便宜模型甚至免费的模型。复杂、需要推理、需要高可靠性的任务,再交给最强模型。这样不是“抠门”,而是在建立一套真正专业的成本结构。
最贵的资源,应该用于最难替代的环节,而不是最琐碎的动作。
真正的高手,不是会提问,而是会做上下文工程
这里有一个很重要的认知升级:AI 时代的核心技能,不是 prompt writing,而是 context engineering。
Prompt writing 关注的是“这一句怎么写得更像指令”。Context engineering 关注的是“哪些信息应该进入系统,哪些应该留在系统外,信息应该以什么顺序进入,何时切换模型,何时重置,何时持久化”。它关心的是整个协作流程,而不是某一句话的修辞。
这就像做导演。导演不会把所有镜头都一股脑拍完,也不会把灯光、布景、演员调度混成一锅粥。导演的工作,是把信息分阶段投放,让每一部分在正确的时机发挥作用。你先让模型读资料,再让它规划,再让它执行,这不是拖慢速度,而是在减少无效搜索。
很多人误以为“多给信息”一定更好。其实恰恰相反,信息过载会让模型像在浓雾里开车,车越好,撞得越贵。一个优秀的协作流程,应该像机场塔台一样,明确告诉每个系统什么时候起飞,什么时候滑行,什么时候等待。
这也解释了为什么“限制”有时是好事。看似无限的对话,实际上很容易在不知不觉中失真。早期内容被挤掉,后期内容覆盖前期内容,系统开始自相矛盾。明确的上限虽然不讨喜,但它迫使你提前整理,提前归档,提前决定什么值得保留。
边界不是敌人,边界是迫使你形成结构的工具。
一个更实用的模型:把 AI 对话当成四层系统
如果只记住一个框架,可以记住这个:输入层,工作层,记忆层,分流层。
1. 输入层:只传最小必要信息
不要把所有背景都一次性塞进去。先给目标,再给约束,再给样例,最后才给执行细节。像搭积木一样逐层增加,而不是像倒垃圾一样一次倾倒。
原则:能一句说清,就不要写一段。
2. 工作层:用短回路迭代
让模型先产出一个最小可用结果,然后你修改原始任务,而不是无限追加评论。这样每一次迭代都在修正方向,而不是在堆叠历史。
原则:替换旧指令,不要给旧指令加厚外套。
3. 记忆层:存稳定,不存波动
适合写入长期记忆的,是稳定偏好和长期项目状态,比如语气偏好、专业背景、常用工具、项目目标。不要把容易变化的内容塞进去,比如临时决策、密码、短期安排。
原则:记住你的工作方式,不要记住你的瞬时噪音。
4. 分流层:让不同模型做不同工作
简单请求走便宜模型,复杂请求走强模型。不要让高成本系统处理低价值任务。
原则:让能力和任务价值匹配。
这个四层系统的好处是,它把“跟 AI 聊天”变成了一种可设计、可优化、可复用的工作流。你不再是随机问答,而是在经营一个智能管道。
你真正需要训练的能力,是“信息经济学”
最有趣的地方在于,这些技巧并不只是关于 AI。它们其实在训练一种更普遍的能力,叫做信息经济学:知道什么信息值钱,什么信息便宜,什么信息该保留,什么信息该丢弃,什么信息应该留给机器,什么信息应该留给人。
在传统工作里,很多人失败不是因为不努力,而是因为他们没有把信息当资源管理。开会时讲了太多背景,真正的决定被埋掉了。做项目时把所有历史都塞进一份文档,结果没人知道该看哪一层。写需求时每次都加新的修饰词,最后连团队自己都不知道究竟要什么。
AI 只是把这个问题放大了。因为机器没有模糊的“感觉差不多”,它只吃结构化输入,吞吐有限,注意力有限,记忆有限。你怎么对待它,某种程度上就暴露了你怎么对待复杂系统。
所以,最值得培养的不是“多会说”,而是“会删”。不是“多给”,而是“给对”。不是“让系统记住一切”,而是“让系统保留真正重要的东西”。
高水平协作的本质,不是增加信息量,而是提高信息密度。
Key Takeaways
- 把 AI 当成有限上下文系统,而不是无限聊天对象。 任何多余的字,都会占用真正有价值的预算。
- 迭代时优先修改原始 prompt,而不是在旧输出上层层追加。 这会显著减少冗余和 token 浪费。
- 将稳定信息写入记忆,将变化信息留在临时对话里。 记住偏好和背景,不要记住噪音。
- 用分阶段加载代替一次性投喂。 先读资料,再做计划,最后执行,效果通常比一口气塞满更好。
- 让最贵的模型处理最难的问题。 简单请求交给便宜模型,复杂任务再升级,成本和质量都会更优。
结语:边界不是限制,而是能力的形状
很多人把 AI 的限制看成缺陷,总想绕过去,延长它,抹平它,让对话永远不要结束。但真正成熟的使用方式,恰恰是尊重边界。因为边界会迫使你更清楚地表达,更早地归档,更谨慎地分配资源,也更准确地判断什么值得继续,什么应该重开。
换句话说,AI 的价值不只是回答问题,而是逼你升级自己和信息之间的关系。你越会管理上下文,就越不需要靠运气得到好答案。你越懂得分层、删减、路由和记忆,就越能把模型从“会说话的工具”变成“可控的思维系统”。
也许真正该问的,不是“这个模型有多强”,而是:我有没有能力让它只在该发力的地方发力?
当你开始这样思考,AI 的上限才真正开始向你展开。
Sources
Hatch New Ideas with Glasp AI 🐣
Glasp AI allows you to hatch new ideas based on your curated content. Let's curate and create with Glasp AI :)
Start Hatching 🐣