逐浪 · 第十七篇 基模决战:当所有人都在卷模型,我们能卷什么
模型之间的代差在缩小,工程化差距在拉大。
中秋国庆假期还没开始,AI圈已经打起来了。
GPT-6 Astra 发布,Claude Opus 5.2 和 Fable 5.2 灰度测试,Google 用马甲在 Arena 偷测 Gemini 4 Pro,国内 Kimi、DeepSeek、Qwen、阶跃星辰集体亮牌。量子位用一句话概括这场面:“该来的、可能来的、偷偷摸摸已经在考场里的,全赶到一块儿了”。
看完这场“决战”,我的感受不是紧张,是更笃定了。
一、这场决战在打什么
先把各家动态列一下。
OpenAI:GPT-6 Astra(已发布)
9 月 3 日发布,OpenAI 称其为“目前全球最智能、且对齐程度最高的模型”。在代表高阶数学能力的 FrontierMath Tier 4 上得分 97.6%,在 ARC-AGI-3 上从上一代的 7.8% 跃升至 99.9%。上线才两周多,已经拿下约 13% 的企业 AI 支出份额,而 Anthropic 的 Fable 系列只有 8%。
Anthropic:Claude Opus 5.2 / Fable 5.2(灰度中)
社区里呼声最高的是这两款。多位开发者反馈,原本调用 Fable 5.1 的请求,在后台被静默重定向到了新版本;有人在高推理模式下实测,新模型的输出质量明显优于 GPT-6 Astra,代价是速度更慢、成本更高。最戏剧性的是 Opus 5.2 的“午夜惊魂”——9 月 17 日晚间 Anthropic 突然切断灰测通道,活跃测试账号一度归零,仅一天后就重新上线,范围还从 Claude Code 扩大到了 Chat 和 Cowork。
Google:Gemini 4 Pro(马甲测试中)
Arena 平台出现了一个名叫 gemini-3.8-flash 的模型,但测试者很快发现“这玩意儿根本不像 Flash”。社区流传的基准图称其在编码、智能体与推理任务上全面超过 GPT-6 Astra 与 Claude Fable 5.1。不过这张图无官方出处、无测试配置、无复现链接,引用时只能写“网传基准图称”。
国内厂商:集体憋大招
Kimi 官方发布了一串神秘数字(圆周率但缺少最前面的 3.1),疑似预告 K3.1 即将上线,但随后迅速删除。DeepSeek 的下一张 Pro 牌已经提前写进官方文档。Qwen4 亮出了新架构——8 月发布的 Qwen3.8-Flash-Next 就是其架构预览版。阶跃星辰 9 月 20 日突然发布 Step 5 Preview,稀疏 MoE 架构,总参 600B、激活仅 27B,在 AA 榜单拿下 44 分,单任务成本仅为 Claude Opus 5 的 1/8。
二、但我看到的不是模型能力
这场决战里,有一个数字特别值得注意。
Astra 在专门使用 2026 年 6 月至 8 月新漏洞构建的测试中,漏洞利用成功率高达 39%,而上一代 Sol 是 5.5%。
从 5.5% 到 39%,是七倍。媒体会强调“AI 能力暴增”。
但我看到的是另一件事:
还有 61% 没成功。
而这 61%,恰恰是工程化要处理的部分——失败了怎么办?谁来发现?谁来恢复?谁来追责?
模型能力的天花板在快速抬高,但工程化落地的地板还没跟上。
这就是这场决战真正暴露出来的裂缝。
三、为什么我反而更笃定了
过去一年多,我一直在做一件事:Harness 工程。
状态管理、门控、审计、对账、契约守卫、故障恢复。这些词听起来都不如“GPT-6”“Gemini 4”性感。
但这场决战恰好证明了三件事。
第一,模型越强,Harness 越值钱
当模型之间的代差在缩小,工程化差距在拉大。
Fable 5.2 推理比 Astra 强,Opus 5.2 前端有优势,Astra 网络操作领先,Gemini 4 Pro 网传编码和智能体任务突出。没有一个模型全面胜出,每一个都有自己的擅长域。
这意味着未来 Agent 系统必须能动态路由到不同模型。
而“路由到不同模型”这件事,不是模型能力问题,是工程问题。
我在 DebateClaw 里设计的契约路由和场景白名单,恰好就是解决这一复杂性的先手。当时做的时候觉得是“过度设计”,现在看来是“提前量”。
第二,安全对齐成了隐形门槛
Astra 发布前已经触及关键网络能力门槛,OpenAI 明确表示该模型的网络安全能力暂不开放。Anthropic 也因国家安全指令暂停了部分访问。
这预示着一件事:未来模型的可用性,将越来越受制于“信任框架”。
不是“哪个模型更强”,而是“哪个模型被允许用、在什么场景下用、谁有权调用”。
这些问题的答案,不在模型里,在 Harness 层。
我在信创环境部署的经验——私有化、审计、权限控制——在合规敏感场景中,会越来越值钱。
第三,“模型无关性”成了稳定锚
基模决战意味着模型格局仍会剧烈变化。
今天 Fable 5.2 领先,明天可能是 Gemini 4 Pro,后天可能是别的。
如果我的系统绑定某一个模型,就意味着每次格局变化都要重做。
而我的选择是:不绑定任何单一模型,构建跨模型的 Harness 层。
这个“模型无关性”,在未来变局中是稳定的锚点。
模型会换,Harness 不会。
四、这场决战改变了什么,没改变什么
| 改变了 | 没改变 |
|---|---|
| 模型能力上限 | 工程化落地的瓶颈 |
| 模型之间的代差 | 可靠交付的需求 |
| API 可调用的能力 | 谁为调用结果负责 |
| 基准测试的分数 | 真实业务中的稳定性 |
换句话说:模型在卷“能做什么”,但没人替用户回答“做错了怎么办”。
这就是 Harness 工程要回答的问题。
五、一个更冷的判断
这场决战让我想起一句话:
当所有人都在卷同一个方向时,价值正在向另一个方向迁移。
当所有人都在卷模型能力时,“让模型稳定干活”的能力正在变得稀缺。
模型能力是显性的,可以比较,可以排名。所以大家都在卷。
工程化能力是隐性的,不容易被看见,不容易被量化。所以大家都不愿意卷。
但真正的护城河,恰恰在没人愿意卷的地方。
六、收尾
这场基模决战,表面上是 OpenAI、Anthropic、Google 和国内厂商的能力比拼,深层是 AI 产业从“内容生成”向“任务执行”的范式迁移。
对一线开发者来说,最直接的影响是:
模型 API 的能力天花板在快速抬高,但“工程化落地”的瓶颈依然存在。
模型发布在加速,但让这些模型在真实业务中稳定运行,是另一场更持久、更困难的战役。
这场战役不在模型里,在 Harness 里。
所以,当所有人都在问“哪个模型更强”的时候,我更关心另一个问题:
当模型换了一代又一代,你的系统还站得住吗?
大厂在卷底座。底座很重要,但底座有一个特点——它会换。
模型会换,框架会换,底座的状态机会重写,API 会升级。每一次变化,都会向上传导。如果没有一层结构挡住它,业务就要跟着重做一遍。
我在做的,就是那一层。
不在底座里,也不在业务里,在它们之间。负责翻译、负责约束、负责兜底。底座不可改的时候,它绕;业务要演进的时候,它挡。
这一层没有名字,大厂内部通常把它分散在各团队里。但它是把“模型能力”变成“可靠交付”的必经之路。
模型会换,Harness 不会。底座会换,适配层不会。
这就是我选择站的位置。
技术标签:#基模决战 #Harness工程 #AI Agent #工程化 #AI趋势
专栏:《逐浪》