9 月大模型榜单:第一名又换了,但开发者该看的不是它

0 阅读10分钟

在这里插入图片描述

9 月头两周,五家厂商发了六个旗舰:Anthropic 的 Claude Fable 5.1(9 月 2 日)、阿里的 Qwen3.8-Max-0902(9 月 2 日)、Meta 的 Muse Spark 1.3 和谷歌的 Gemini 3.8 Flash(9 月 3 日)、OpenAI 的 GPT-6 Astra(当地时间 9 月 3 日),中间歇了不到一周,DeepSeek V4.1 Flash(9 月 10 日)压轴。

发布季一到,榜单就成了流量密码。我把三份最有存在感的榜单翻了一遍,看到一个每次发布季都重演、但每次都有人当真的场面:三份榜单,三个第一。LMArena 综合榜的头名是 7 月就发布的 Claude Fable 5;Artificial Analysis 智能指数的头名是 Claude Fable 5.1;各类聚合转述榜里"登顶"的是 GPT-6 Astra——而它登顶前三天,LMArena 综合榜的前 20 里根本没有它。

榜单是声望指标,不是选型指标。 开发者从榜上要拿走的不是"谁第一",是三列数据——分项能力、成本、可得性。这篇文章拆给你看:第一名是怎么被三份榜单造出三个答案的,以及哪三列才是选型的真凭据。

版本基准:榜单快照为 LMArena(2026-09-13 与 09-16)与 Artificial Analysis Intelligence Index v4.2(2026-09-07),发布事件与定价核自各厂商官方公告。榜单实时变动,一切以当日官网为准。

两周六个旗舰,三个第一

先看这轮发布潮都落了什么牌,每一条都核过官方公告:

日期模型厂商一句话定位
9-02Claude Fable 5.1Anthropic官方称"迄今最强的编码与知识工作模型",缓存读取降价 75%
9-02Qwen3.8-Max-0902阿里2.4T 参数 MoE 旗舰的月度迭代,Max 级首次官宣将开源
9-03Muse Spark 1.3MetaAA 指数 53 分,与 7 月的 Claude Fable 5 并列第 4
9-03Gemini 3.8 Flash谷歌DeepSWE 工程榜 74% 领先组里最便宜的一个
9-03GPT-6 AstraOpenAI官方称"全球最智能、对齐程度最高",上下文 105 万 token
9-10DeepSeek V4.1 FlashDeepSeek552B 参数 MoE、全新 CED 架构,权重 MIT 开源,官方称性能全面超越 V4 Pro

然后是榜单。同一批模型,三份榜单给出三个第一:

  • LMArena 综合榜(9 月 13 日快照):头名是 claude-fable-5,Elo 1506——一个 7 月 1 日发布的模型。前 10 名里 Anthropic 占 7 席。GPT-6 Astra 不在前 20。
  • AA 智能指数 v4.2(9 月 7 日快照):头名是 Claude Fable 5.1(57 分),GPT-6 Astra 第二(55 分)。
  • 聚合转述榜:GPT-6 Astra 登顶的标题满天飞。这个说法也没错——9 月 16 日再看 LMArena 的机构分页,GPT-6 Astra 确实排到了第一,领先第二名 4.4 分。代价是那行小字:投票数才 10.4K——对比 GPT-5.5 的 81.3K——名次置信区间宽到 1-6 名。

三个第一都是真的,也都当不得选型依据。想知道为什么,得看每份榜的第一名是怎么产生的。

第一名是怎么产生的:一半靠投票,一半靠刷题

两份主流榜单,两套世界观。

LMArena 是众包盲测:402 个模型、28 家厂商、累计 1180 万次真人匿名投票,按 Elo 积分排座次。可信度来自"真人盲测",毛病也来自"真人"——投票量决定置信度,而投票量需要时间。9 月 13 日快照里有个扎眼的细节:排第一的 claude-fable-5 攒了两个多月、30.1K 张票;9 月 2 日刚发的 fable-5.1-max 只有 5.8K 张票,压在 #5。同一个系列,新版压不过旧版——不是新版弱,是新版没票。Meta 那对 Muse Spark 是同款剧情:9 月 3 日刚发的 1.3 只有 4.7K 张票,压在 #8;可排 #4 的 1.2 也才 3.2K 张票,置信区间宽到 ±11——榜面前排有一半是"票还没攒够"的座次。

这就是我说的声望指标:众包榜的名次里,一半是模型水平,一半是曝光时长。发布第一天就冲去读榜,读到的是别人两个月的投票积累。

AA 走另一条路:固定基准评测,聚合十项基准(数学、科学、编程、多步推理等)打综合分。没有真人情绪,分数可以复现。但它有另一类坑——口径会升级。9 月 4 日 AA 把指数从 v4.1 升到 v4.2,调整了任务组成与权重,Claude Fable 5.1 的分数从发布报道时的 66 分变成 57 分。模型一行权重没动,账面掉了 9 分。AA 自己提示 v4.2 与旧版不可直接比较,但转发的标题不管这些,"暴跌 9 分"比"口径调整"有流量多了。

至于各类聚合榜、自建榜,多数是前两者的搬运再拌上自家权重。读它们之前,先找到"评分从哪来"那行小字。说个我自己这次的遭遇:回源核查时 arena.ai 官网直接被 Cloudflare 拦在门外,甩给我一页"Attention Required";不死心换了个榜单聚合站,还是同一页拦截。最后是从转载其官方数据的快照站拿的数。你看,连榜单第一手数据的可得性,本身就是个工程问题。

同一批模型,名次对不上账

把三份榜的名次横过来对,才见真章。这张表我自己整理的,四个数据列四个快照日期,也是本文最想让你带走的东西:

模型(厂商)LMArena 综合¹AA 指数²AA WebDev³AA DeepSWE⁴
Claude Fable 5.1(Anthropic)#5#1(57 分)#2(1762)未上榜
GPT-6 Astra(OpenAI)前 20 外,9-16 冲至 #1#2(55 分)#1(1797)74%(领先组)
Claude Opus 5(Anthropic)#10#3(54 分)#3(1688)74%(领先组)
Gemini 3.8 Flash(谷歌)#9(初步数据)#10(47 分)156774%(领先组)
Kimi K3(月之暗面)#17#8(50 分)#5(1674)69%
GLM-5.3(智谱)#19#9(49 分)160969%
Qwen3.8-Max(阿里)前 20 外#10(47 分)#6(1670)57%
DeepSeek V4.1 Flash(DeepSeek)前 20 外未收录未收录未收录

¹ 2026-09-13 快照;Arena 按推理档位分条目(-max/-high 是同一模型的不同档),表中取该模型最高档位名次。² 2026-09-07,v4.2 口径。³ 编码分项 Elo,09-05 更新。⁴ 工程任务通过率,09-03 更新。

对着表说三个观察。

第一,国产模型的名次在两榜之间差出 8 到 10 位。 Kimi K3 在 AA 排 #8,到 LMArena 掉到 #17;GLM-5.3 从 #9 掉到 #19;Qwen3.8-Max 在 AA 勉强挂住 #10,在 LMArena 干脆不在前 20。哪家"更准"没有答案——两家的题和投票人群完全不同——但"某某国产模型全球前十"这种标题,先问一句哪个榜、哪个快照,再决定信几成。顺带一个反差:LMArena 前 20 里仅有的两个非闭源模型,kimi-k3-max(#17)和 glm-5.3-max(#19),全是国产。闭源旗舰的声望场里,开源模型能挤进前 20,这件事本身比名次更有信息量。

第二,总分差 2 分,分项可能换了天下。 AA 综合分 Fable 5.1 只比 GPT-6 Astra 高 2 分,看着咬得死。但拆开看:编码分项 WebDev 上 Astra 反超 35 分排第一;工程任务 DeepSWE 上 Astra 有 74% 的成绩,Fable 5.1 干脆未上榜。做编码工具链的团队如果只读总分,会把这两个模型的排位读反。

第三,最新的模型永远在榜外。 DeepSeek V4.1 Flash 9 月 10 日发布,AA 快照(9-07)和 LMArena 快照(9-13)都没来得及收它,四个数据列全是"未收录"。第三方自建榜倒是收得飞快,已经把它排到国产第 2 了——收得快和口径硬,你只能挑一头。追新模型看榜,等于看后视镜开车。

别读总分,读三列

那榜单对开发者就没用了吗?不是。把总分那一列关掉,留这三列,每一列都能直接进选型文档。

列一:分项能力。 你做的应用吃哪个分项,就看哪个分项。做编码助手和代码 Agent 的,WebDev 和 DeepSWE 比 57 对 55 的总分诚实得多:DeepSWE 的领先组是 Astra、Opus 5、Gemini 3.8 Flash 三个并列 74%,国产旗舰 GLM-5.3 和 Kimi K3 都在 69%——差 5 个点,不是差一个时代。做通用对话、知识工作的,再看综合分和各自的长文本、多模态能力。

列二:成本。 AA 有一列"综合任务成本",跑完基准上的一道题要花多少美元,比每百万 token 报价更贴近真实体感(口径:AA 综合任务成本,非 token 单价):

模型AA 综合任务成本DeepSWE 工程任务成本
GPT-5.6 Luna$0.10$0.61
GLM-5.3 Flash$0.18$0.24
GLM-5.3$1.26$3.99
Kimi K3$1.58$4.65
GPT-6 Astra$2.57$6.52
Gemini 3.8 Flash$2.36
Claude Fable 5.1$6.12
Claude Opus 5$11.84

Fable 5.1 一道题 6.12GLM5.3Flash一道题6.12,GLM-5.3 Flash 一道题 0.18,34 倍。能力差多少?AA 综合分 57 对 46。再往深看一层:GPT-6 Astra 的 API 定价是输入 10/输出10 / 输出 50(每百万 token),上一代 GPT-5.6 Sol 输入还是 $5——旗舰第一次把涨价涨成了翻倍,而它在 AA 总分上比第一名还低 2 分。旗舰的溢价买的不是那 2 分,是上限场景的保险;日常任务让便宜模型扛,是这个表最直接的读法。

列三:可得性。 榜单不回答"你能不能用",这一列得自己盘:DeepSeek V4.1 Flash 权重 MIT 开放下载,GLM-5.3 是 753B 参数 + MIT 协议,Qwen3.8-Max 官宣将开源(Max 级第一次);而 Astra、Fable 5.1、Gemini 3.8 Flash 全部闭源 API,Astra 还是分阶段开放(先受信组织,数日内才轮到 Plus/Pro 与 API、AWS)。企业落地的老约束在这儿一条没变:要私有化的团队,榜单前十的门只开了一半——能进前十还开源的,就是国产那几个。

谁该跟榜走,谁该把总榜关掉

最后给工程落点,分两拨人。

做尝鲜、做研究、做竞品分析的,跟榜走没毛病。 总榜名次就是声望排序,用它度量"这家厂商现在站在哪",比任何新闻稿都准。LMArena 前 10 被 Anthropic 拿走 7 席,这个事实对判断 Claude 系在西方用户群体里的口碑,比 50 篇软文都有用。只是记住你在读的是声望,不是能力差距。

做生产选型的,把总榜关掉,用上面三列。 给个我自己在用的例子:「手搓企业智能体」系列七集,IT 服务台 Agent 从对话、工具、记忆到工作流全部跑在 DeepSeek 上,中间一次都没换过模型。为什么?服务台场景一轮对话十几次工具调用,成本列的权重远大于能力列——一个 69% 和 74% 的 DeepSWE 差距,用户在这边感知不到,但账单感知得到;再加上它是 MIT 开源,哪天要私有化部署,门是开着的。同样的逻辑反过来:如果你在做代码 Agent 或高价值复杂任务,为 Astra、Fable 5.1 这个档位付溢价,是对"失控的那一次调用"买保险——这两件事不矛盾,矛盾的是用一个总榜名次同时决策这两件事。

9 月这轮发布季的模型,哪个值得单独跑一次 Java 接入实测?我有自己的答案了,留给「望远镜·首测」。榜单下个月还会换第一,三列数据的读法不会过时。