72小时,五大模型杀疯了:编程界的“王座”还没坐热就被踹下来了

0 阅读7分钟

一、全景总览

关于“智能指数”  :数据来自独立评测机构Artificial Analysis的Intelligence Index,综合衡量模型在推理、知识、编码等多维度能力。

二、官方发布报告解读

2.1 Anthropic:Claude Fable 5.1 / Mythos 5.1

官方定位:“世界上最先进的编码和知识工作模型”。

发布时间与方式:9月1日凌晨发布,延续“先静默后爆发”的风格——当天发布公告并开放API,而非进行数周宣传活动。Fable 5.1与Mythos 5.1同时问世,两者是同一底层模型,只是安全防护级别不同。Mythos 5.1仅通过可信访问计划提供给审核过的网络安全和生命科学机构。

官方宣称的核心提升

价格的真实变化:输入10/输出10/输出50/百万token维持不变。缓存读取价格从1降至1降至0.25/百万token,降幅75% 。Anthropic声称典型工作负载成本降低约25%,高度Agent化工作负载最高可降低45%。

未明说的细节:Artificial Analysis实测显示,在最高努力档下,Fable 5.1的单任务成本反而比上一代高20%——“缓存便宜了,但输出的东西多了,总账单反而被抬上去”。

API层真正的“杀招”  :Messages API新增规则——思考块与产生它的历史上下文绑定。想改历史消息,旧思考块会被直接删除。官方说法是“堵住未经授权的大规模模型蒸馏”。受影响的是长对话里删旧消息、动态改系统提示、自动压缩上下文的Agent应用。目前只针对8月31日及以后新建的账户,但官方已放话“未来会扩展到所有API账户”。

早期客户案例

  • Millennium:一个约百万分之一概率的软件崩溃,团队查了四五年无果。Fable 5.1反汇编第三方库,与core dump比对,最终定位到外部库漏洞。
  • Ramp:机器学习任务连续自主运行38小时。发现实验受标签问题影响后修正方案,启动六组并行实验。
  • Browserbase:浏览器Agent测试完成82%  任务(Fable 5为57%,Opus 5为74%)。
  • MongoDB:约三天完成复杂原型——先读代码和文档,再设计方案,连续运行几小时实现。
  • Shopify:分析横跨三个代码库、八项以上服务的改动,梳理请求经过的完整链路。

2.2 Google:Gemini 3.8 Flash / 3.8 Flash Cyber

官方定位:“迄今最聪明的Flash模型”,面向长程软件工程、自主Agent和复杂企业工作流。

发布时间:9月2日上线。这是Google六周内发布的第三款Flash模型——3.6 Flash(7月21日)→3.7 Flash(8月13日)→3.8 Flash(9月2日)。Flash系列不得不代替迟迟没有出现的3.5 Pro,证明Google仍有能力留在牌桌上

官方宣称的核心提升

价格:输入0.75/输出0.75/输出3.75/百万token——仅为Fable 5.1和Astra的7.5%  。但这是限时优惠价,2027年1月1日起将翻倍至1.5/1.5/7.5

性能来源的坦诚交代:Google明确表示3.8 Flash“works harder”——在复杂任务上执行更多推理步骤、反复调用工具。代价是消耗更多token。官方甚至建议“若算力成本是首要约束,可调低推理档位,或继续使用3.7 Flash”。

2.3 Meta:Muse Spark 1.3

官方定位:五个月内第四款Muse Spark,最强调编码和Agent任务的一版

发布时间:9月2日。Meta首席AI官汪滔称这是“迄今在模型性能上最大的一次跃升”,编程能力超过GPT-5.6 Sol、与Fable 5.1持平。在X上对谷歌“贴脸开大”:“gemini who?”。

官方宣称的核心提升

维度数据
DeepSWE v1.175.4分,排名第一
长上下文(256K-512K)98.5分,领先第二名GPT-5.6 Sol的91.5分
长上下文(512K-1M)98.1分,领先第二名73.8分
工具调用平均减少20%  
Token使用平均减少25%  

价格:输入1.25/输出1.25/输出4.25/百万token(缓存命中0.15)。另有musespark1.3contributor版本,输入0.15)。另有`muse-spark-1.3-contributor`版本,输入0.1/输出$0.2/百万token,代价是对话数据会被Meta用于改进产品。

官方展示的航空工程流体仿真案例:模型拿到CFD模拟结果和STEP格式CAD模型后,需完成——整理分析目标/计算域/网格/材料参数/边界条件 → 提取峰值轴向速度/最大湍流强度/湍动能/受力 → 分析升力/阻力/激波/流动分离/湍流 → 按指定结构输出PDF报告。包含文件读取、数据分析、专业知识处理、结果提取、报告撰写和格式输出多个步骤

2.4 Alibaba:Qwen3.8-Max(0902版本)

官方定位:针对编程(Coding)和专业办公(Cowork)进行专项后训练。

发布时间:9月2日。

官方宣称的核心提升

基准成绩
CodeArena前端编程总榜1691分,全球第一
较旧版本提升+22分
超越的模型Claude Opus 5、Kimi K3等

价格:每百万token综合平均仅$5。CodeArena性价比榜单显示它“直接‘斩杀’所有价格大于5美元的其他模型”。

参数:总参数2.4万亿,支持100万上下文

2.5 OpenAI:GPT-6 Astra

官方定位:“目前全球最智能、且对齐程度最高的模型”。OpenAI联合创始人兼总裁Greg Brockman在发布电话会议上直言“欢迎来到AGI时代”。

发布时间:9月4日凌晨。此前一天OpenAI已放出预告《通往Astra之路》。Astra即日起先向“可信访问”和Daybreak网络安全项目中的有限企业开放,未来几天内陆续覆盖ChatGPT Plus/Pro/Business/Enterprise及API/AWS客户。

官方宣称的核心提升

基准Astra对比
FrontierMath Tier 497.6%Fable 5.1为87.8%
ARC-AGI-399.9%GPT-5.6 Sol仅7.8%
Terminal-Bench Science 0.164.6%Fable 5.1为52.6%,成本低31%
Terminal-Bench 4.057.9%Fable 5.1为55.8%
ExploitBench100%前代78.5%
DeepSWE v1.174.1%
OSWorld 2.072.6%GPT-5.6 Sol为65.7%,任务时间75→40分钟
AutomationBench41.4%GPT-5.6 Sol为18.1%,Fable 5.1为31.4%

价格:输入10/输出10/输出50/百万token——与Fable 5.1持平,是GPT-5.6 Sol的2.5倍。输入超过27.2万token后整单按输入20/输出20/输出75计费。缓存读取享受90%折扣,缓存写入加收25%溢价。

官方演示任务:填写报税表、更新CRM、整理日程、制作财务模型、分析科研数据、搭建网站、设计PCB电路板、创建3D游戏场景。

早期客户案例

  • Legora(法律科技)  :几分钟检查41份财务文件,找出4个埋入错误,成绩比上一代提高近40%  。
  • Playco(游戏开发)  :人工修复减少50%  ,一次生成3个可玩主题版本。

三、评测报告

3.1 Artificial Analysis:智能指数与成本效率

关键发现

  • Muse Spark 1.3(xhigh)单任务成本仅 0.55,比同档竞品(GPT5.6 Sol 0.55**,比同档竞品(GPT-5.6 Sol 0.95、Grok 4.6 $0.94)低70%以上**,处于智能vs成本的最优边界。
  • Gemini 3.8 Flash单任务成本$0.58,但“非常啰嗦(very verbose)”——完成智能指数测试共输出1.2亿token,同类中位数仅7100万
  • Muse Spark 1.3(max)限量预览,62分仅次于Claude的Fable和Opus系列。

3.2 DeepSWE v1.1:长程软件工程

DeepSWE v1.1由Datacurve发布,113道任务分布在91个开源仓库、5种语言,参考答案平均写668行代码、改7个文件。

关键发现

  • Gemini 3.8 Flash用更多步骤和token“堆”出了与Opus 5相同的分数。省钱是真的——DeepSWE上单任务成本约为Opus 5的两成——但省的是“把活干完的总账”,不是每句话的报价。
  • Muse Spark 1.3在DeepSWE上以75.4分超越所有竞品。

3.3 CodeArena:前端编程

模型CodeArena分数排名
Qwen3.8-Max(0902)1691第1
Claude Opus 5被超越
Kimi K3被超越

CodeArena是聚焦前端编程能力(WebDev)的全球权威第三方榜单。Qwen3.8-Max较旧版本提升22分登顶。

3.4 Terminal-Bench 4.0:终端编程

模型Terminal-Bench 4.0
GPT-6 Astra57.9%
Claude Mythos 5.1(安全限制更少)60.9%
Claude Fable 5.155.8%
Claude Opus 552.3%
GPT-5.6 Sol37.3%

关键发现:Mythos 5.1比Fable 5.1高出5.1个百分点——Anthropic将差距归因于Fable 5.1的网络安全防护机制介入。

3.5 其他独立评测

ARC-AGI-3(抽象推理)  :

  • GPT-6 Astra:99.9%  (使用OpenAI专属适配器)
  • GPT-5.6 Sol:7.8%
  • 重要脚注:使用标准测试工具时,Astra得分仅约62.7%

Artificial Analysis Coding Agent Index

  • GPT-6 Astra得分67分,恰好卡在Opus 5和Fable 5之间
  • 真正拉开差距的是长上下文仓库的自主导航能力,而非单纯的语法生成

BenchLM综合评分(231个模型):

  • GPT-6 Astra:81.9/100,排名第4
  • Agentic类别:第23/144
  • Coding类别:第32/149

四、实测反馈

模型正面反馈负面/争议
Claude Fable 5.1长任务稳定性极强,连续38小时自主运行;企业级debug能力突出最高努力档下单任务成本比上一代高20%
Gemini 3.8 Flash速度快(302 token/秒),价格极低“能跑但不对”——3D场景“漏水”;非常啰嗦;Terminal-Bench 4.0仅19.1%
Muse Spark 1.3成本极低($0.55/任务);长上下文能力突出推理耗时是Gemini 3.8 Flash的3倍;MineBench Elo评分(1787)低于Gemini 3.8 Flash(1888)
Qwen3.8-Max前端编程第一;价格仅$5主要优势集中在前端,全栈能力待验证
GPT-6 Astra综合能力最强;企业实测提升显著(法律+40%,游戏-50%人工修复)价格是GPT-5.6 Sol的2.5倍;ARC-AGI-3的99.9%依赖昂贵适配器

五、选型标准

标准一:看“任务类型”而不是“总分”

任务类型推荐模型理由
写业务代码、脚本、CRUDGemini 3.8 Flash / Qwen3.8-Max性价比最高
大型重构、跨文件架构调整Claude Fable 5.1长程稳定性强,百万token上下文
前端开发Qwen3.8-MaxCodeArena第一,价格仅$5
长Agent任务、科研自动化Muse Spark 1.3 / Fable 5.1DeepSWE前两名
安全、漏洞挖掘GPT-6 AstraExploitBench 100%

标准二:看“生态接入”而不是“孤军作战”

编程不是模型单打独斗。谷歌接入了自家全家桶,Meta有Muse Code和Model API,Anthropic有Claude Code这套终端工作流。选型时先看它跟你日常用的工具链通不通——Cursor、Vercel、Devin、Warp、Lovable在Fable 5.1发布几小时内就上线了支持——比纠结几个点的分数差实际得多

标准三:算“综合成本账”而不是“单价账”

真实成本看三块:token单价、缓存和上下文费用、返工成本。便宜但老答错的模型,反复纠错的隐性成本远高于单价差。Fable 5.1把缓存读取降价75%,就是在告诉重度用户:跑Agent类任务,缓存成本往往比表面单价更值得算

六、未来编程之争

智谱在8月31日给出了能力演进判断:Chat→Coding→Agent→Co-work→Autonomous AI。目前行业重心处于第二级至第四级之间。

编程这个最早落地的能力,仍然是竞争焦点。但竞争单位已经从“代码交付”变成了“任务交付”  ——模型要能理解完整项目上下文、调用工具、持续完成一条更长的工作链。

价格正在向一个相对平均的水准收敛。以往更以性价比取胜的中国模型在提价,美国顶尖模型的实际订阅花费有所下降。

编程模型的差距正在以“月”为单位变化。今天的排名三个月后可能就变样。

一些思考

模型单句概述
Claude Fable 5.1长任务最稳,科研和复杂重构的首选,但最高档成本反而更贵
Gemini 3.8 Flash价格屠夫,适合常规编程,复杂任务需谨慎——“能干但不开窍”
Muse Spark 1.3长上下文王者,DeepSWE第一,性价比突出,但推理较慢
Qwen3.8-Max前端编程第一,价格仅$5,前端开发首选
GPT-6 Astra综合能力最强,企业实测提升显著,但最贵且有跑分水分

没有“所有编程都最强”的模型。对个人来说,最好的编程模型不是榜单上分数最高的,而是结合实际任务用得最顺、错误率最能承受、成本最能接受的那个。