一周四款旗舰模型:智能指数只差 7 分,价格却差 100 倍

0 阅读4分钟

最疯狂的一周

9 月 1 日到 3 日,四家厂商在 72 小时内连发四款旗舰级模型

  • 9/1 Anthropic:Claude Fable 5.1 / Mythos 5.1
  • 9/2 Meta:Muse Spark 1.3
  • 9/2 Google:Gemini 3.8 Flash / 3.8 Flash Cyber
  • 9/3 OpenAI:GPT-6 Astra

按 Artificial Analysis 智能指数排:Fable 5.1(66)、Muse Spark 1.3(62)、GPT-6 Astra(61)、Gemini 3.8 Flash(59)——最高的和最低的只差 7 分

但价格呢?每百万输出 token:Gemini 3.8 Flash 是 3.75 美元,Fable 5.1 和 Astra 是 50 美元,差 13 倍;算上 Meta 那档允许数据训练的 0.2 美元,价差直接拉到 100 倍以上

能力在收敛,价格却在剧烈分层。这周最值得琢磨的就是这件事。


四款模型横向对比

模型智能指数输入价 / 百万 token输出价 / 百万 token核心定位
Claude Fable 5.166未公开具体档$50长程稳定编码、科研推理
Muse Spark 1.362低至 $0.2(特定档位)长周期 Agent、编程
GPT-6 Astra61$10$50软件工程、自主长任务
Gemini 3.8 Flash59$0.75$3.75(优惠至 12/31)高性价比通用主力

逐款拆开看

Claude Fable 5.1(66 分,当前最高)

Anthropic 这次发了两款——Fable 5.1 面向全平台,Mythos 5.1 走白名单给网安和生命科学团队,两者同底座,区别在安全防护等级。Fable 5.1 主打长程稳定编码,能连续跑很久不跑偏,科研和代码基准大幅领先前代。

同一天 Anthropic 还升级了"计算机使用"能力——操作改在后台完成,不抢你鼠标键盘,人机能并行两条工作流(Beta,Pro/Max 订阅可用,macOS 15+)。

GPT-6 Astra(61 分,最贵也最激进)

10 万块 GPU 在得州 Stargate 基地训练,OpenAI 总裁 Brockman 直接以"欢迎进入 AGI 时代"收尾发布会。它也是首个达到内部 Critical 网络安全能力门槛的模型,测试中发现过两个零日漏洞。

争议点在于架构:据报道 Astra 用了"循环深度"技术,把部分推理过程从可读的思维链转移到不可读的内部计算里,安全研究者担心这会削弱推理过程的可监控性。OpenAI 首席科学家回应称"媒体报道存在混乱",会坚持思维链可监控。

价格是最狠的一刀10输入/10 输入 / 50 输出,约为 GPT-5.6 Sol 的 2.5 倍

Muse Spark 1.3(62 分,性价比黑马)

Meta 首席 AI 官 Alexandr Wang 称这是"迄今模型性能上最大的一次跃升",编程能力超过 GPT-5.6 Sol、与 Fable 5.1 持平。内部对比上一代:工具调用少 20%、token 省 25%,还能在一个线程里同时维持多个工作流。

它最特殊的是有一档 $0.2 的低价位(允许用数据训练),这也是把整周价差拉到 100 倍的原因。

Gemini 3.8 Flash(59 分,六周第三迭代)

六周内第三款 Flash,距 3.7 只有三周。14 项基准里 8 项登顶,输出速度约 300 token/秒,Arena 上 Agent 排名从 #32 冲到 #14,文本榜 #7(超过 Opus 5 High)。

但有个坑值得单独说:虽然单价没变(0.75/0.75/3.75),实测它处理同样的任务会多输出约 30% 的 token、多走几轮工具调用,算下来单任务成本其实高了约 40%


三个反直觉的发现

1. 能力在收敛,价格却在撕裂。 四款模型智能指数只差 7 分,但单 token 价格差 100 倍。这意味着"选模型"从技术判断变成了纯经济账——同样的活,选错模型的成本差可能是几十倍

2. 单价便宜 ≠ 单任务便宜。 Gemini 3.8 Flash 就是活例子:单价不变,但因为输出 token 多了 30%、Agent 轮次更多,实际单任务成本反而涨了 40%。

真实成本公式应该是:单任务成本 = 单价 × 实际消耗 token 量 只看报价单上的单价,做预算必然被打脸。这也是很多团队"明明选了便宜模型,账单却没降"的原因。

3. Flash 级模型已经摸到上代旗舰的屁股。 Gemini 3.8 Flash 59 分,已经追平甚至超过上一代旗舰。现在"要不要上旗舰"不再是能力问题,而是这个任务值不值那个价


那到底该怎么选?

你的场景建议理由
长程编码、科研项目Fable 5.1分数最高、长程稳定不跑偏
自主 Agent、软件工程自动化GPT-6 Astra能力最强,但价格最贵
长周期 Agent + 控成本Muse Spark 1.3分数接近、token 省 25%
高频通用任务、批量处理Gemini 3.8 Flash单价最低、速度最快
拿不准 / 场景杂多模型接入层按任务路由,见文末

别把鸡蛋放一个篮子。这周三家还集体宕机过——Claude、Grok、ChatGPT 在一个半小时内先后挂掉,当时所有绑死单家的应用全军覆没。能力分层 + 可用性风险,这两件事同时指向同一个答案:你需要一层能按任务路由、还能自动故障转移的接入层。


关于多模型接入

如果你不想每家对接一遍 SDK、每家管一套 Key,也不想锁死在某一家的可用性上,可以考虑用一层多模型统一接入服务——对外只有一个地址一个 Key,内部按策略把请求分到不同模型,某家挂了自动切走。

我们这边长期做这件事,主流模型都能接,额度稳定、能开正规发票,新模型上线也照样兼容。

你那个场景最后选了哪款,评论区聊聊。