Mistral新王炸Le Chonk,被Claude和GPT甩出两条街

0 阅读4分钟

昨天,Mistral 冷不丁甩出了一只“肥猫”——Le Chonk(Mistral Large 4),1 万亿参数、49B 激活,号称“中国以外最强开源权重”。欧洲 AI 这是要支棱起来了?先别急着嗨。

说起 Mistral,现在提起来可能不少人已经没啥印象了。但 2023 年底那阵子,它可是欧洲 AI 的脸面——Mistral 7B 一出手就开源干翻 Llama 2 13B,紧接着 Mixtral 8x7B 更绝:官方不发论文、不开发布会,直接在 X 上甩了个磁力链接,把 87GB 的模型权重当种子“泄漏”出去,全网直呼狠人,那会儿大家都觉得欧洲要出个能跟 OpenAI 掰手腕的了。

结果才两三年,声量就下去了。直到昨天这只猫又杀回来,我本来也挺兴奋,毕竟欧洲能打的真不多。但冷静扒了一圈独立实测和社区反应,发现这猫没宣传那么神,也没那么废——它卡在一个很微妙的位置。

Mistral 官方公告 hero 图

官方数字看着很猛:DeepSWE 62%、Cybench 93%、Dense200 视觉定位 42% 还压了 GPT-6 Astra 一头。但这些都是 Mistral 自报、还没独立复现的,当宣传稿看就行。

真正有意思的是第三方 Artificial Analysis 的 Intelligence Index v4.3.2,用同一版本横向比,ML4 Preview 只拿了 38 分:

模型地区AA Intelligence Index
Claude Opus 5.5美国57.6
GPT-6 Astra美国52.7
Gemini 4 Argon美国52.6
GLM-5.3中国44.8
Kimi K3中国43.6
Qwen3.8中国40
Mistral Large 4法国38
DeepSeek V4 Pro中国36
Nemotron 3 Ultra美国23
gpt-oss-120b美国12

结论很直白:它确实碾压欧美开源(gpt-oss 才 12 分),但没超过中国开源——MiMo、GLM-5.3、Kimi 全在它上面。“中国以外最强”这话没毛病,因为欧美本来就没人跟。

独立博主 Thorsten Meyer 自己上手跑了 reality check,几个点挺实在:网安是真强,Cyber Index 50、CyberGym-E2E 82% 还压过 Luna 的 78%,开源前三稳了;速度 116 tok/s、首响 1.46 秒,比中位数高;文档读图一次能吃 100 张。但他一句**“agentic 和长任务,别用”**——因为幻觉/编造在 agent 里是雪球,他实测 ML4 照样会编。

能不能自己跑?另一位实测博主算了笔硬账:1T 的 MoE 就算压到 2-bit,也得 512GB 统一内存的工作站才动得了,4-bit 要 768GB+ 的服务器。“你的笔记本在‘万亿’两个字出来时就出局了。”实测速度:512GB 机 2-bit 大概 15–25 tok/s,DDR5 服务器 4-bit 只有 6–10 tok/s。所以别幻想塞进 Mac。

社区这边,Hacker News 一天干到 1449 分,七成以上正面。大家乐的是法国人敢接“肥猫”梗,还有“3800 张卡训出 1T,xAI 可是二三十万张”的效率反差。但也有人冷笑:benchmark 图表排得“过于巧”,而且“之前都宣布过好几次了”。

Mistral 官方创意配图

好消息是它真有进步。AA Index 上 Large 3 才 9 分,Medium 3.5 是 14,ML4 一下到 38——这是欧洲 lab 最大的一步跨越。而且真正的卖点不是“最强”,是三件事:①效率(3800 卡对比手数量级更小)②主权(全欧洲训练部署、受欧盟法律管,权重月底放出可自托管)③网安(闭源拒答的漏洞复现它做,82% 全场最高)。

最后说两点想法。

  1. 别被“1 万亿”和“最强”带节奏。它的真实定位是“中国以外最强开源”,而真相是连中国开源都没超过。对绝大多数人,GLM-5.3-Flash 更强还便宜 4 倍;真要前沿能力,美国闭源还在前面。它的价值是给“被合规绑死的人”——军工、涉密、医疗、DORA——一个能自己托管、不靠美国云的欧洲选项。
  2. 真正值得等的是 10 月 27 日的权重加许可证。现在只是 API 预览,等于“只有成绩单没有考卷”。等权重放出、社区独立复测,尤其是那 82% 的漏洞复现分(闭源是因为拒答才零分,不是真不会),含金量到底多少,那时才看得清。大伙觉得这猫值不值得等,哈哈?

参考资料(本文事实来源):

邵奈一 十万+读者同行。感谢你的阅读,咱们下篇接着聊。