最疯狂的一周
9 月 1 日到 3 日,四家厂商在 72 小时内连发四款旗舰级模型:
- 9/1 Anthropic:Claude Fable 5.1 / Mythos 5.1
- 9/2 Meta:Muse Spark 1.3
- 9/2 Google:Gemini 3.8 Flash / 3.8 Flash Cyber
- 9/3 OpenAI:GPT-6 Astra
按 Artificial Analysis 智能指数排:Fable 5.1(66)、Muse Spark 1.3(62)、GPT-6 Astra(61)、Gemini 3.8 Flash(59)——最高的和最低的只差 7 分。
但价格呢?每百万输出 token:Gemini 3.8 Flash 是 3.75 美元,Fable 5.1 和 Astra 是 50 美元,差 13 倍;算上 Meta 那档允许数据训练的 0.2 美元,价差直接拉到 100 倍以上。
能力在收敛,价格却在剧烈分层。这周最值得琢磨的就是这件事。
四款模型横向对比
| 模型 | 智能指数 | 输入价 / 百万 token | 输出价 / 百万 token | 核心定位 |
|---|---|---|---|---|
| Claude Fable 5.1 | 66 | 未公开具体档 | $50 | 长程稳定编码、科研推理 |
| Muse Spark 1.3 | 62 | — | 低至 $0.2(特定档位) | 长周期 Agent、编程 |
| GPT-6 Astra | 61 | $10 | $50 | 软件工程、自主长任务 |
| Gemini 3.8 Flash | 59 | $0.75 | $3.75(优惠至 12/31) | 高性价比通用主力 |
逐款拆开看
Claude Fable 5.1(66 分,当前最高)
Anthropic 这次发了两款——Fable 5.1 面向全平台,Mythos 5.1 走白名单给网安和生命科学团队,两者同底座,区别在安全防护等级。Fable 5.1 主打长程稳定编码,能连续跑很久不跑偏,科研和代码基准大幅领先前代。
同一天 Anthropic 还升级了"计算机使用"能力——操作改在后台完成,不抢你鼠标键盘,人机能并行两条工作流(Beta,Pro/Max 订阅可用,macOS 15+)。
GPT-6 Astra(61 分,最贵也最激进)
10 万块 GPU 在得州 Stargate 基地训练,OpenAI 总裁 Brockman 直接以"欢迎进入 AGI 时代"收尾发布会。它也是首个达到内部 Critical 网络安全能力门槛的模型,测试中发现过两个零日漏洞。
争议点在于架构:据报道 Astra 用了"循环深度"技术,把部分推理过程从可读的思维链转移到不可读的内部计算里,安全研究者担心这会削弱推理过程的可监控性。OpenAI 首席科学家回应称"媒体报道存在混乱",会坚持思维链可监控。
价格是最狠的一刀:50 输出,约为 GPT-5.6 Sol 的 2.5 倍。
Muse Spark 1.3(62 分,性价比黑马)
Meta 首席 AI 官 Alexandr Wang 称这是"迄今模型性能上最大的一次跃升",编程能力超过 GPT-5.6 Sol、与 Fable 5.1 持平。内部对比上一代:工具调用少 20%、token 省 25%,还能在一个线程里同时维持多个工作流。
它最特殊的是有一档 $0.2 的低价位(允许用数据训练),这也是把整周价差拉到 100 倍的原因。
Gemini 3.8 Flash(59 分,六周第三迭代)
六周内第三款 Flash,距 3.7 只有三周。14 项基准里 8 项登顶,输出速度约 300 token/秒,Arena 上 Agent 排名从 #32 冲到 #14,文本榜 #7(超过 Opus 5 High)。
但有个坑值得单独说:虽然单价没变(3.75),实测它处理同样的任务会多输出约 30% 的 token、多走几轮工具调用,算下来单任务成本其实高了约 40%。
三个反直觉的发现
1. 能力在收敛,价格却在撕裂。 四款模型智能指数只差 7 分,但单 token 价格差 100 倍。这意味着"选模型"从技术判断变成了纯经济账——同样的活,选错模型的成本差可能是几十倍。
2. 单价便宜 ≠ 单任务便宜。 Gemini 3.8 Flash 就是活例子:单价不变,但因为输出 token 多了 30%、Agent 轮次更多,实际单任务成本反而涨了 40%。
真实成本公式应该是:单任务成本 = 单价 × 实际消耗 token 量 只看报价单上的单价,做预算必然被打脸。这也是很多团队"明明选了便宜模型,账单却没降"的原因。
3. Flash 级模型已经摸到上代旗舰的屁股。 Gemini 3.8 Flash 59 分,已经追平甚至超过上一代旗舰。现在"要不要上旗舰"不再是能力问题,而是这个任务值不值那个价。
那到底该怎么选?
| 你的场景 | 建议 | 理由 |
|---|---|---|
| 长程编码、科研项目 | Fable 5.1 | 分数最高、长程稳定不跑偏 |
| 自主 Agent、软件工程自动化 | GPT-6 Astra | 能力最强,但价格最贵 |
| 长周期 Agent + 控成本 | Muse Spark 1.3 | 分数接近、token 省 25% |
| 高频通用任务、批量处理 | Gemini 3.8 Flash | 单价最低、速度最快 |
| 拿不准 / 场景杂 | 多模型接入层 | 按任务路由,见文末 |
别把鸡蛋放一个篮子。这周三家还集体宕机过——Claude、Grok、ChatGPT 在一个半小时内先后挂掉,当时所有绑死单家的应用全军覆没。能力分层 + 可用性风险,这两件事同时指向同一个答案:你需要一层能按任务路由、还能自动故障转移的接入层。
关于多模型接入
如果你不想每家对接一遍 SDK、每家管一套 Key,也不想锁死在某一家的可用性上,可以考虑用一层多模型统一接入服务——对外只有一个地址一个 Key,内部按策略把请求分到不同模型,某家挂了自动切走。
我们这边长期做这件事,主流模型都能接,额度稳定、能开正规发票,新模型上线也照样兼容。
你那个场景最后选了哪款,评论区聊聊。