做 AI 辅助开发的同学,最近大概都有过这种体感:
同一个提示词、同一份代码库,两个月前它能给出完整的重构方案和边界处理;现在它回了一半,还说"大致如此,你可以照着调整"。
你以为是自己 prompt 退步了。但很可能——模型真的变了,而版本号一个字没动。
2026 年上半年,一位 AMD 的 AI 高级总监提交了一份带有完整遥测数据的 GitHub issue。这份数据之所以珍贵,是因为它不是"我感觉变笨了",而是在同一团队、同一类工程任务、同一批工具链下,跨三个月、6,852 次会话的量化记录。
结果很难看。
一、73% 的思考坍塌
先看最直观的一项:模型输出的"思考过程"长度,断崖式下滑。
核心指标对比(同一模型,2026 年 1 月 → 3 月):
- 思考过程中位长度:约 2,200 字符 → 约 600 字符(暴跌 73%)
- 完成任务所需 API 重试次数:激增约 80 倍
- 修改代码前主动读取的文件数:6.6 个 → 2.0 个(不足以理解多文件依赖)
- 复杂任务早停频次:接近 0 → 每天约 10 次(重构被半途放弃)
数据集覆盖:17,871 个思考块、234,760 次工具调用、6,852 个 Claude Code 会话。
600 字符是什么概念? 连"先把这个模块的依赖读一遍、再决定改哪"这种基本策略都写不完整。它不再是"想清楚再动手",而是"先蒙一个再说"。
更值得注意的是对照组:模型号没换(Opus 4.6 stable),任务类型没换,团队没换。唯一变的是时间——同一个版本号,在两个月里表现出了明显不同的行为。社区把这种现象叫做 silent regression(静默退化)。
二、不只是"变笨",还有"变贵"和"变短"
静默退化之外,还有两个配套的坑。
1)额度消耗远比宣传的快
Anthropic 官方 GitHub Issue #41930(2026-04-01)记录了这样一个案例:付费用户的 5 小时会话窗口,19 分钟就耗尽,单条 prompt 就能吃掉 3%~7% 的会话额度。厂商确认了这是 bug 叠加容量限制所致。
2)上下文窗口名不副实
多个厂商宣传模型支持 100 万 token 上下文,但用户侧的实测反馈高度一致:用到 20% / 40% / 48% 左右,输出质量就开始明显下降——忘记之前的约定、逻辑开始出错、前后不一致,有时候模型自己都会承认"我好像漏掉了前面的内容"。
宣传的是上限,不是可用的稳定区间。这两者之间,差着两倍以上的距离。
三、这不是某一家的问题
如果只有一家这样,那叫个案。但横向看:
MeasuringU 的 AI 聊天软件 UX 基准(2026) 显示:所有被测产品的净推荐值(NPS)相比 2025 年全部下滑。
而用户被问到"你最不满意哪一点"时——
各产品的用户吐槽重点:
- ChatGPT:准确性/可靠性("它对错误非常自信")、长对话变卡、免费版功能受限
- Claude:额度限制(免费付费都烦)、响应慢、任务理解偏差
- Gemini:答案不准确/不一致("我还得自己去核实")、误解指令、卡顿
- Grok:幻觉循环、慢、隐私观感差
跨产品最共性的痛点,从头到尾是同一个:准确性与可靠性。 其次是额度限制和响应速度。
一句话总结 2026 年的 AI 工具:比以往更有用,但比宣传的更不可靠——这两件事同时成立。
四、为什么会这样?(社区推测,非厂商承认)
需要说清楚:厂商并没有公开承认"主动降质"。以下是社区从遥测和 bug 报告中归纳的几个方向性推测,仅供参考:
- 动态路由与负载均衡:高峰期把请求路由到更小/更便宜的副本;
- 静默量化或蒸馏:为省算力悄悄压缩模型精度,行为随之漂移;
- 后训练对齐偏移:为了安全、合规或成本,牺牲了部分复杂推理能力;
- 容量瓶颈下的策略性早停:任务太重就直接收尾,避免占资源。
真相如何,外人无法确认。但对使用者来说,成因不重要,"版本号 ≠ 行为一致"这件事很重要。
五、那我们该怎么办?
抱怨之外,有几件事现在就能做。
1)把"版本号"从信任锚点里拿掉
模型 ≠ 传统软件。传统软件打上 v1.2.3 就是可复现的;AI 的同一个名字底下,行为可以逐月漂移。
2)关键任务一定要交叉验证
King's College London 与 IPPR 的调查(约 4,000 人,含 1,000 名大学生)给出过一个很扎心的数字:85% 用过 AI 的学生遇到过它的产出有问题(事实错误 37%、编造来源或统计 31%),但只有 15% 的人会总是核查,19% 承认很少或从不核查。
涉及数据、引用、API、依赖库的,一律二次核实;跨两个模型交叉问一遍,成本低、收益高。
3)长任务主动拆短
既然上下文在 20%~48% 处开始退化,就别把整个项目一股脑塞进去。按模块拆、每个会话只解决一件事、关键约定写在开头并定期复述。
4)留意"额度黑洞"
如果发现单次对话吃额度飞快、或模型开始频繁早停,先怀疑后端异常(查官方 status / issue),不要急着怀疑自己的 prompt。
5)重要链路考虑本地化
这条最适合对稳定性、可复现性、数据不外传有要求的场景:把模型固定版本跑在本地,版本号就真的是版本号,行为可复现,也不受云端策略调整影响。
说到这,顺手安利一下我自己做的两个小东西,都是零依赖、本地跑、无外联的思路:
ning-lang:自研的小语言,含解释器与 C 后端,能把脚本编译成原生可执行文件。想要"确定的行为",自己编出来的东西最确定。gitee.com/waWAwlou/ni…codeshield:本地零外联的安全自检工具。gitee.com/waWAwlou/co…
六、最后
AI 工具这一轮的问题,本质不是"它不行了",而是它的可靠性增长速度,跟不上我们对它的依赖增长速度。
我们开始把生产任务交给它,但它还停留在"很好的助手、不太稳的执行者"阶段。
保持怀疑、保持验证、保持一条本地的退路——大概是 2026 年用 AI 最务实的姿势。
你最近有没有明显感觉到它在"偷懒"?评论区聊聊,最好带上日期和场景。