Agent正式进入下半场:做减法

1 阅读8分钟

img_v3_02158_f8b3d650-0af4-421d-a626-6351e053886g.png


GPT-6 Astra来了说快删除之前提示词规则,Anthropic说砍掉80%提示词,两家巨头两个月内说了同一句话:提示词该删了。

GPT-6 Astra今天全量开放,奥特曼官宣实现AGI,多少有点吹牛的水分,哈哈哈😄 😄。 但比模型本身更引人注意的,是OpenAI工程师Victor Nunez在X上发的第一句话: 趁Astra开始推出,回去清理你的AGENTS.md和Skills,该删的删。 不是让你写新提示词,也不是你优化,而是让你删!🗑️

这画面就有点眼熟了。

就在三天前,9月2日,Anthropic刚发布了Claude Fable 5.1的官方提示词指南。那份指南列出了15个Fable 5.1跟上一代的行为差异,每一条都附了修正建议。 翻完一遍你会发现,大部分建议的核心就一句话:少写点

再往前推两个月,今年7月发布fable5时候,Anthropic干了一件让很多开发者看不懂的事。他们针对Claude Opus 5和Claude Fable 5这两个新模型,把Claude Code的系统提示词砍掉了超过80%。跑完内部编码评测后,没有检测到任何可测量的性能损失。 注意,是删除,不是优化,也不是压缩,是直接砍掉五分之四。 消息出来的时候,开发者社区直接炸了。

当时咱们的第一反应是:我们这几年精心打磨的提示词工程,难道全白写了? 现在看来,你别说,可能真是。 --- 前两年我们怎么玩AI的? 模型听不懂人话,我们就拼命写规则。它理解歪了,加一句解释。老在同一个地方犯错,加一条限制。还犯,再补三个例子,术语是few-shot。 就像给一个记不住事的新员工贴便签。流程记不住,贴一张。老忘签字,贴一张。总搞错客户名,再贴一张。 日积月累,显示器边框贴满了,键盘缝里塞着,连他后脑勺都快贴不下了。 我们管这叫“提示词工程”,觉得自己挺专业。 后面还有harness工程,现在最近是loop工程。。。 xx工程-层出不穷。。估计未来还有e2e工程,哈哈,还真没准。

但!新模型一来,这堆便签话术全变成了绊脚石。 Anthropic团队翻内部使用记录时发现,同一个请求里经常出现互相冲突的要求。系统提示词说“不要加注释”,Skill说“适当补充文档”,用户又临时要求“把复杂逻辑解释清楚”。模型其实能明白用户到底要什么,但它得先处理这些矛盾的指令,之后才干活。 早期为了防止Claude误删代码或乱写注释,团队在系统提示词里写了一大堆硬性规则。比如“默认不写注释。永远不要写多行文档字符串——最多一行简短注释”。这套方法放在早期模型身上当然有用,但随着Claude能力提升,问题冒出来了。


旧模型缺判断力,规则不写死不行。可新模型已经能结合上下文自己判断了。 于是Anthropic把那句长长的硬性规定,精简成了一句话: > “写出来的代码要像周围的代码,匹配它的注释密度、命名方式和惯用法。” 规则清单变成了判断依据。告诉模型“注释写几行”,变成告诉模型“拿什么当参照”。删掉的不是上下文本身,而是人类替旧模型预先做好的判断

OpenAI这边情况类似。 Astra对Skill和AGENTS.md里的指令更敏感了。以前你写一句“所有方案要经过审批”,老模型看见就当没看见,方案照出。Astra不跟你来这套。它真停下来问你:“找谁批?”然后就在那儿等着。 你过去为了堵漏洞写的那些规则,什么“注意语气”“检查格式”“别忘了做A再做B”,Astra全当真。一条含糊的,它停下来反复确认。两条冲突的,它直接死机。


那这事儿跟你我啥关系? 关系大了。 想想你自己用ChatGPT的时候,它答得不好,你第一反应是啥? “别用‘delve’。”“说人话。”“别老是先否定再翻转。”“多说点,但也别太多。” 一条不够加两条,两条不够加五条。这就是条件反射,过去几年被训练出来的肌肉记忆。 但Astra的逻辑换了,你这套全废了。它现在能主动问你“你指的是A还是B?”能在写代码前先跑测试,改个按钮颜色都要先写单元测试。你以为你加的规则是在帮它,实际上是在拖它后腿。你的那些“多说点”“说人话”,在它这儿全变成了需要解码的指令。它得先琢磨你到底想要啥,再琢磨怎么干活。 绕一大圈。


为什么删了反而更好?

看Anthropic那篇题为《The new rules of context engineering for Claude 5 generation models》的文章把这事讲透了。

核心原因其实就两:

第一,注意力预算。AI模型和人一样,工作记忆有限。你塞给它的上下文规则越多,它花在权衡这些规则上的注意力就越多,留给真正干活的注意力就越少。

第二,上下文的边际递减效应。上下文里的Token越多,模型精确召回信息的能力就越差。你一次性塞给一个人100页文档,还指望他记住每一页的细节——不现实。 所以Anthropic那场“提示词大裁员”,本质是把“给规则”变成了“让它判断”

他们总结了几条新玩法:

    • 让模型自己判断:以前是“默认不写注释”,现在是“匹配周围代码的风格”。要求看着少了,模型需要做的判断反而更多了。
    • 设计接口而不是给示例:过去给模型塞工具调用范例是铁律,但新模型很容易把示例当成唯一答案。不如把接口设计清楚,让模型自己推断怎么用。
    • 需要时再加载,不要一下子全加载:大量验证和说明常驻系统提示词,用户只改一句文案,也得先陪模型跑一遍长长的上下文。现在把这些拆成独立Skills,按需加载。
    • 说一次就好:旧模型容易忘指令,同一条规则往往要反复出现。新模型理解更深,重复提醒反而制造冲突。 - 交给模型自动记忆:过去项目说明、用户偏好全往AGENTS.md里堆。现在长期状态交给自动记忆,AGENTS.md只保留真正反常识的坑。
    • 直接给参考材料:新模型不需要你把所有要求翻译成一份“适合AI阅读”的简化说明。HTML原型、测试用例、现有代码、评分标准,都可以直接当参考。 Thariq把这套演化描述成 “短—长—短” 。早期模型需要短提示词加大量示例,模型理解力上来之后提示词越写越长,现在又短回去了。 我们现在正好站在第二个拐点上。

过去的垫脚石,今天全成了绊脚石!

有个细节特别逗。 一个开发者拿Astra在虚幻引擎里造曼哈顿,一条街一条街建,花了一周。他让一个Astra当经理拆任务,另一个当执行者,最多96个子智能体同时开工。 他让模型把每个阶段做到“极好”,模型就乖乖往前推。某天他脑子一抽,改成了“完美”。 完蛋。 模型立刻钻进细枝末节出不来,一个窗户的纹理能调俩小时,项目直接卡死。

一个词,就差一个词。 所以你想,我们过去写的那一厚摞提示词,里面有多少像“完美”这样的词?有多少模棱两可的限制?有多少自己都没想明白的规矩? 新模型来了,它们全成了坑,全成了阻力;过去的垫脚石,今天全成了绊脚石!


上半场:加法;下半场:减法

过去几年,AI开发的故事是加法。模型不够聪明,就用规则来补。一条不够加两条,两条不够加五条。Harness越来越厚,提示词越来越长。 现在,短板补上了。规则本身变成了新的错误来源。 Anthropic在7月证明了:删掉80%的提示词,性能没降。9月2日,他们又用Fable 5.1的指南补了一刀。三天后,OpenAI跟着喊了一遍。

两家AI巨头公司,两个月内,说了同一句话:该删了。

趁现在刚推送,赶紧去翻翻你那些提示词吧。 看看哪些是真需要的,哪些是当年为了兜底加的补丁。

该撕的撕,该扔的扔。 旧的不去新的不来,哈哈!

以前是你教它怎么走,现在是——别挡它道,放手让他自己跑🏃🏃🏃🏻‍♀️