昨天,Mistral 冷不丁甩出了一只“肥猫”——Le Chonk(Mistral Large 4),1 万亿参数、49B 激活,号称“中国以外最强开源权重”。欧洲 AI 这是要支棱起来了?先别急着嗨。
说起 Mistral,现在提起来可能不少人已经没啥印象了。但 2023 年底那阵子,它可是欧洲 AI 的脸面——Mistral 7B 一出手就开源干翻 Llama 2 13B,紧接着 Mixtral 8x7B 更绝:官方不发论文、不开发布会,直接在 X 上甩了个磁力链接,把 87GB 的模型权重当种子“泄漏”出去,全网直呼狠人,那会儿大家都觉得欧洲要出个能跟 OpenAI 掰手腕的了。
结果才两三年,声量就下去了。直到昨天这只猫又杀回来,我本来也挺兴奋,毕竟欧洲能打的真不多。但冷静扒了一圈独立实测和社区反应,发现这猫没宣传那么神,也没那么废——它卡在一个很微妙的位置。
官方数字看着很猛:DeepSWE 62%、Cybench 93%、Dense200 视觉定位 42% 还压了 GPT-6 Astra 一头。但这些都是 Mistral 自报、还没独立复现的,当宣传稿看就行。
真正有意思的是第三方 Artificial Analysis 的 Intelligence Index v4.3.2,用同一版本横向比,ML4 Preview 只拿了 38 分:
| 模型 | 地区 | AA Intelligence Index |
|---|---|---|
| Claude Opus 5.5 | 美国 | 57.6 |
| GPT-6 Astra | 美国 | 52.7 |
| Gemini 4 Argon | 美国 | 52.6 |
| GLM-5.3 | 中国 | 44.8 |
| Kimi K3 | 中国 | 43.6 |
| Qwen3.8 | 中国 | 40 |
| Mistral Large 4 | 法国 | 38 |
| DeepSeek V4 Pro | 中国 | 36 |
| Nemotron 3 Ultra | 美国 | 23 |
| gpt-oss-120b | 美国 | 12 |
结论很直白:它确实碾压欧美开源(gpt-oss 才 12 分),但没超过中国开源——MiMo、GLM-5.3、Kimi 全在它上面。“中国以外最强”这话没毛病,因为欧美本来就没人跟。
独立博主 Thorsten Meyer 自己上手跑了 reality check,几个点挺实在:网安是真强,Cyber Index 50、CyberGym-E2E 82% 还压过 Luna 的 78%,开源前三稳了;速度 116 tok/s、首响 1.46 秒,比中位数高;文档读图一次能吃 100 张。但他一句**“agentic 和长任务,别用”**——因为幻觉/编造在 agent 里是雪球,他实测 ML4 照样会编。
能不能自己跑?另一位实测博主算了笔硬账:1T 的 MoE 就算压到 2-bit,也得 512GB 统一内存的工作站才动得了,4-bit 要 768GB+ 的服务器。“你的笔记本在‘万亿’两个字出来时就出局了。”实测速度:512GB 机 2-bit 大概 15–25 tok/s,DDR5 服务器 4-bit 只有 6–10 tok/s。所以别幻想塞进 Mac。
社区这边,Hacker News 一天干到 1449 分,七成以上正面。大家乐的是法国人敢接“肥猫”梗,还有“3800 张卡训出 1T,xAI 可是二三十万张”的效率反差。但也有人冷笑:benchmark 图表排得“过于巧”,而且“之前都宣布过好几次了”。
好消息是它真有进步。AA Index 上 Large 3 才 9 分,Medium 3.5 是 14,ML4 一下到 38——这是欧洲 lab 最大的一步跨越。而且真正的卖点不是“最强”,是三件事:①效率(3800 卡对比手数量级更小)②主权(全欧洲训练部署、受欧盟法律管,权重月底放出可自托管)③网安(闭源拒答的漏洞复现它做,82% 全场最高)。
最后说两点想法。
- 别被“1 万亿”和“最强”带节奏。它的真实定位是“中国以外最强开源”,而真相是连中国开源都没超过。对绝大多数人,GLM-5.3-Flash 更强还便宜 4 倍;真要前沿能力,美国闭源还在前面。它的价值是给“被合规绑死的人”——军工、涉密、医疗、DORA——一个能自己托管、不靠美国云的欧洲选项。
- 真正值得等的是 10 月 27 日的权重加许可证。现在只是 API 预览,等于“只有成绩单没有考卷”。等权重放出、社区独立复测,尤其是那 82% 的漏洞复现分(闭源是因为拒答才零分,不是真不会),含金量到底多少,那时才看得清。大伙觉得这猫值不值得等,哈哈?
参考资料(本文事实来源):
- Artificial Analysis:Mistral Large 4 独立评测(AA Intelligence Index=38、Cyber Index 50 / CyberGym-E2E 82%):artificialanalysis.ai/articles/mi…
- DataStudios:规格与训练背景(1.05T/49B 激活/1M 上下文、3800 GPU、权重 10-27):www.datastudios.org/post/mistra…
- ai-tldr:Mistral Large 4 模型卡:ai-tldr.dev/models/mist…
- VectorWire:权重 10-27 与授权背景:vectorwire.ai/article/mis…
- 独立博主 Thorsten Meyer 的 hands-on 实测(cyber、速度、文档读图):thorstenmeyerai.com/reality-che…
- Hacker News 社区讨论(1449 分):news.ycombinator.com/item?id=499…
邵奈一 十万+读者同行。感谢你的阅读,咱们下篇接着聊。