一、全景总览
关于“智能指数” :数据来自独立评测机构Artificial Analysis的Intelligence Index,综合衡量模型在推理、知识、编码等多维度能力。
二、官方发布报告解读
2.1 Anthropic:Claude Fable 5.1 / Mythos 5.1
官方定位:“世界上最先进的编码和知识工作模型”。
发布时间与方式:9月1日凌晨发布,延续“先静默后爆发”的风格——当天发布公告并开放API,而非进行数周宣传活动。Fable 5.1与Mythos 5.1同时问世,两者是同一底层模型,只是安全防护级别不同。Mythos 5.1仅通过可信访问计划提供给审核过的网络安全和生命科学机构。
官方宣称的核心提升:
价格的真实变化:输入50/百万token维持不变。缓存读取价格从0.25/百万token,降幅75% 。Anthropic声称典型工作负载成本降低约25%,高度Agent化工作负载最高可降低45%。
未明说的细节:Artificial Analysis实测显示,在最高努力档下,Fable 5.1的单任务成本反而比上一代高20%——“缓存便宜了,但输出的东西多了,总账单反而被抬上去”。
API层真正的“杀招” :Messages API新增规则——思考块与产生它的历史上下文绑定。想改历史消息,旧思考块会被直接删除。官方说法是“堵住未经授权的大规模模型蒸馏”。受影响的是长对话里删旧消息、动态改系统提示、自动压缩上下文的Agent应用。目前只针对8月31日及以后新建的账户,但官方已放话“未来会扩展到所有API账户”。
早期客户案例:
- Millennium:一个约百万分之一概率的软件崩溃,团队查了四五年无果。Fable 5.1反汇编第三方库,与core dump比对,最终定位到外部库漏洞。
- Ramp:机器学习任务连续自主运行38小时。发现实验受标签问题影响后修正方案,启动六组并行实验。
- Browserbase:浏览器Agent测试完成82% 任务(Fable 5为57%,Opus 5为74%)。
- MongoDB:约三天完成复杂原型——先读代码和文档,再设计方案,连续运行几小时实现。
- Shopify:分析横跨三个代码库、八项以上服务的改动,梳理请求经过的完整链路。
2.2 Google:Gemini 3.8 Flash / 3.8 Flash Cyber
官方定位:“迄今最聪明的Flash模型”,面向长程软件工程、自主Agent和复杂企业工作流。
发布时间:9月2日上线。这是Google六周内发布的第三款Flash模型——3.6 Flash(7月21日)→3.7 Flash(8月13日)→3.8 Flash(9月2日)。Flash系列不得不代替迟迟没有出现的3.5 Pro,证明Google仍有能力留在牌桌上。
官方宣称的核心提升:
价格:输入3.75/百万token——仅为Fable 5.1和Astra的7.5% 。但这是限时优惠价,2027年1月1日起将翻倍至7.5。
性能来源的坦诚交代:Google明确表示3.8 Flash“works harder”——在复杂任务上执行更多推理步骤、反复调用工具。代价是消耗更多token。官方甚至建议“若算力成本是首要约束,可调低推理档位,或继续使用3.7 Flash”。
2.3 Meta:Muse Spark 1.3
官方定位:五个月内第四款Muse Spark,最强调编码和Agent任务的一版。
发布时间:9月2日。Meta首席AI官汪滔称这是“迄今在模型性能上最大的一次跃升”,编程能力超过GPT-5.6 Sol、与Fable 5.1持平。在X上对谷歌“贴脸开大”:“gemini who?”。
官方宣称的核心提升:
| 维度 | 数据 |
|---|---|
| DeepSWE v1.1 | 75.4分,排名第一 |
| 长上下文(256K-512K) | 98.5分,领先第二名GPT-5.6 Sol的91.5分 |
| 长上下文(512K-1M) | 98.1分,领先第二名73.8分 |
| 工具调用 | 平均减少20% |
| Token使用 | 平均减少25% |
价格:输入4.25/百万token(缓存命中0.1/输出$0.2/百万token,代价是对话数据会被Meta用于改进产品。
官方展示的航空工程流体仿真案例:模型拿到CFD模拟结果和STEP格式CAD模型后,需完成——整理分析目标/计算域/网格/材料参数/边界条件 → 提取峰值轴向速度/最大湍流强度/湍动能/受力 → 分析升力/阻力/激波/流动分离/湍流 → 按指定结构输出PDF报告。包含文件读取、数据分析、专业知识处理、结果提取、报告撰写和格式输出多个步骤。
2.4 Alibaba:Qwen3.8-Max(0902版本)
官方定位:针对编程(Coding)和专业办公(Cowork)进行专项后训练。
发布时间:9月2日。
官方宣称的核心提升:
| 基准 | 成绩 |
|---|---|
| CodeArena前端编程总榜 | 1691分,全球第一 |
| 较旧版本提升 | +22分 |
| 超越的模型 | Claude Opus 5、Kimi K3等 |
价格:每百万token综合平均仅$5。CodeArena性价比榜单显示它“直接‘斩杀’所有价格大于5美元的其他模型”。
参数:总参数2.4万亿,支持100万上下文。
2.5 OpenAI:GPT-6 Astra
官方定位:“目前全球最智能、且对齐程度最高的模型”。OpenAI联合创始人兼总裁Greg Brockman在发布电话会议上直言“欢迎来到AGI时代”。
发布时间:9月4日凌晨。此前一天OpenAI已放出预告《通往Astra之路》。Astra即日起先向“可信访问”和Daybreak网络安全项目中的有限企业开放,未来几天内陆续覆盖ChatGPT Plus/Pro/Business/Enterprise及API/AWS客户。
官方宣称的核心提升:
| 基准 | Astra | 对比 |
|---|---|---|
| FrontierMath Tier 4 | 97.6% | Fable 5.1为87.8% |
| ARC-AGI-3 | 99.9% | GPT-5.6 Sol仅7.8% |
| Terminal-Bench Science 0.1 | 64.6% | Fable 5.1为52.6%,成本低31% |
| Terminal-Bench 4.0 | 57.9% | Fable 5.1为55.8% |
| ExploitBench | 100% | 前代78.5% |
| DeepSWE v1.1 | 74.1% | — |
| OSWorld 2.0 | 72.6% | GPT-5.6 Sol为65.7%,任务时间75→40分钟 |
| AutomationBench | 41.4% | GPT-5.6 Sol为18.1%,Fable 5.1为31.4% |
价格:输入50/百万token——与Fable 5.1持平,是GPT-5.6 Sol的2.5倍。输入超过27.2万token后整单按输入75计费。缓存读取享受90%折扣,缓存写入加收25%溢价。
官方演示任务:填写报税表、更新CRM、整理日程、制作财务模型、分析科研数据、搭建网站、设计PCB电路板、创建3D游戏场景。
早期客户案例:
- Legora(法律科技) :几分钟检查41份财务文件,找出4个埋入错误,成绩比上一代提高近40% 。
- Playco(游戏开发) :人工修复减少50% ,一次生成3个可玩主题版本。
三、评测报告
3.1 Artificial Analysis:智能指数与成本效率
关键发现:
- Muse Spark 1.3(xhigh)单任务成本仅 0.95、Grok 4.6 $0.94)低70%以上**,处于智能vs成本的最优边界。
- Gemini 3.8 Flash单任务成本$0.58,但“非常啰嗦(very verbose)”——完成智能指数测试共输出1.2亿token,同类中位数仅7100万。
- Muse Spark 1.3(max)限量预览,62分仅次于Claude的Fable和Opus系列。
3.2 DeepSWE v1.1:长程软件工程
DeepSWE v1.1由Datacurve发布,113道任务分布在91个开源仓库、5种语言,参考答案平均写668行代码、改7个文件。
关键发现:
- Gemini 3.8 Flash用更多步骤和token“堆”出了与Opus 5相同的分数。省钱是真的——DeepSWE上单任务成本约为Opus 5的两成——但省的是“把活干完的总账”,不是每句话的报价。
- Muse Spark 1.3在DeepSWE上以75.4分超越所有竞品。
3.3 CodeArena:前端编程
| 模型 | CodeArena分数 | 排名 |
|---|---|---|
| Qwen3.8-Max(0902) | 1691 | 第1 |
| Claude Opus 5 | — | 被超越 |
| Kimi K3 | — | 被超越 |
CodeArena是聚焦前端编程能力(WebDev)的全球权威第三方榜单。Qwen3.8-Max较旧版本提升22分登顶。
3.4 Terminal-Bench 4.0:终端编程
| 模型 | Terminal-Bench 4.0 |
|---|---|
| GPT-6 Astra | 57.9% |
| Claude Mythos 5.1(安全限制更少) | 60.9% |
| Claude Fable 5.1 | 55.8% |
| Claude Opus 5 | 52.3% |
| GPT-5.6 Sol | 37.3% |
关键发现:Mythos 5.1比Fable 5.1高出5.1个百分点——Anthropic将差距归因于Fable 5.1的网络安全防护机制介入。
3.5 其他独立评测
ARC-AGI-3(抽象推理) :
- GPT-6 Astra:99.9% (使用OpenAI专属适配器)
- GPT-5.6 Sol:7.8%
- 重要脚注:使用标准测试工具时,Astra得分仅约62.7%
Artificial Analysis Coding Agent Index:
- GPT-6 Astra得分67分,恰好卡在Opus 5和Fable 5之间
- 真正拉开差距的是长上下文仓库的自主导航能力,而非单纯的语法生成
BenchLM综合评分(231个模型):
- GPT-6 Astra:81.9/100,排名第4
- Agentic类别:第23/144
- Coding类别:第32/149
四、实测反馈
| 模型 | 正面反馈 | 负面/争议 |
|---|---|---|
| Claude Fable 5.1 | 长任务稳定性极强,连续38小时自主运行;企业级debug能力突出 | 最高努力档下单任务成本比上一代高20% |
| Gemini 3.8 Flash | 速度快(302 token/秒),价格极低 | “能跑但不对”——3D场景“漏水”;非常啰嗦;Terminal-Bench 4.0仅19.1% |
| Muse Spark 1.3 | 成本极低($0.55/任务);长上下文能力突出 | 推理耗时是Gemini 3.8 Flash的3倍;MineBench Elo评分(1787)低于Gemini 3.8 Flash(1888) |
| Qwen3.8-Max | 前端编程第一;价格仅$5 | 主要优势集中在前端,全栈能力待验证 |
| GPT-6 Astra | 综合能力最强;企业实测提升显著(法律+40%,游戏-50%人工修复) | 价格是GPT-5.6 Sol的2.5倍;ARC-AGI-3的99.9%依赖昂贵适配器 |
五、选型标准
标准一:看“任务类型”而不是“总分”
| 任务类型 | 推荐模型 | 理由 |
|---|---|---|
| 写业务代码、脚本、CRUD | Gemini 3.8 Flash / Qwen3.8-Max | 性价比最高 |
| 大型重构、跨文件架构调整 | Claude Fable 5.1 | 长程稳定性强,百万token上下文 |
| 前端开发 | Qwen3.8-Max | CodeArena第一,价格仅$5 |
| 长Agent任务、科研自动化 | Muse Spark 1.3 / Fable 5.1 | DeepSWE前两名 |
| 安全、漏洞挖掘 | GPT-6 Astra | ExploitBench 100% |
标准二:看“生态接入”而不是“孤军作战”
编程不是模型单打独斗。谷歌接入了自家全家桶,Meta有Muse Code和Model API,Anthropic有Claude Code这套终端工作流。选型时先看它跟你日常用的工具链通不通——Cursor、Vercel、Devin、Warp、Lovable在Fable 5.1发布几小时内就上线了支持——比纠结几个点的分数差实际得多。
标准三:算“综合成本账”而不是“单价账”
真实成本看三块:token单价、缓存和上下文费用、返工成本。便宜但老答错的模型,反复纠错的隐性成本远高于单价差。Fable 5.1把缓存读取降价75%,就是在告诉重度用户:跑Agent类任务,缓存成本往往比表面单价更值得算。
六、未来编程之争
智谱在8月31日给出了能力演进判断:Chat→Coding→Agent→Co-work→Autonomous AI。目前行业重心处于第二级至第四级之间。
编程这个最早落地的能力,仍然是竞争焦点。但竞争单位已经从“代码交付”变成了“任务交付” ——模型要能理解完整项目上下文、调用工具、持续完成一条更长的工作链。
价格正在向一个相对平均的水准收敛。以往更以性价比取胜的中国模型在提价,美国顶尖模型的实际订阅花费有所下降。
编程模型的差距正在以“月”为单位变化。今天的排名三个月后可能就变样。
一些思考
| 模型 | 单句概述 |
|---|---|
| Claude Fable 5.1 | 长任务最稳,科研和复杂重构的首选,但最高档成本反而更贵 |
| Gemini 3.8 Flash | 价格屠夫,适合常规编程,复杂任务需谨慎——“能干但不开窍” |
| Muse Spark 1.3 | 长上下文王者,DeepSWE第一,性价比突出,但推理较慢 |
| Qwen3.8-Max | 前端编程第一,价格仅$5,前端开发首选 |
| GPT-6 Astra | 综合能力最强,企业实测提升显著,但最贵且有跑分水分 |
没有“所有编程都最强”的模型。对个人来说,最好的编程模型不是榜单上分数最高的,而是结合实际任务用得最顺、错误率最能承受、成本最能接受的那个。