Kimi K3 重磅发布:2.8万亿参数开源模型,前端编程全球第一,正面硬刚 Claude 和 GPT

167 阅读9分钟

Kimi K3 重磅发布:2.8万亿参数开源模型,前端编程全球第一,正面硬刚 Claude 和 GPT

扫码_搜索联合传播样式-标准色版.png

全球首个开源 3T 级大模型来了,前端编程直接登顶。门主连夜肝完资料,带你看看它到底有多能打。


一、为什么会写这篇

昨天凌晨,月之暗面发布了 Kimi K3。

说实话,看到参数规模的时候我愣了一下——2.8 万亿,全球首个开源 3T 级模型。

之前 Kimi K2 发布的时候,1 万亿参数已经让人惊叹了。这才过了不到一年,直接翻到了 2.8 万亿。

更让我意外的是,它在 Frontend Code Arena 前端编程榜单上直接干到了全球第一,把 Claude Fable 5 和 GPT-5.6 Sol 都压在了下面。

作为一个天天跟代码打交道的 Java 老炮,这种消息肯定是第一时间关注的。

于是我连夜把官方博客、技术报告、第三方评测翻了个遍,整理出这篇文章。

希望能帮你快速搞懂 Kimi K3 到底强在哪,跟 Claude、GPT 比到底差多少,以及它值不值得你上手。


二、Kimi K3 是什么

先看核心参数,一张表说清楚:

属性数值
总参数量2.8 万亿
每次激活参数约 500 亿(16 / 896 个专家)
上下文窗口100 万 token
架构KDA 混合线性注意力 + 注意力残差
多模态原生支持视觉理解(图文输入,文本输出)
默认思考模式Max(极致模式),后续增加 Low/High
开源时间2026 年 7 月 27 日前
发布版本K3 Max(通用版)、K3 Swarm Max(并行版)

门主点评: 2.8 万亿参数,100 万上下文,开源。这三个关键词放在一起,冲击力确实不小。


三、架构解读:2.8 万亿参数是怎么驯服的

参数堆上去容易,但怎么让它真正干活,才是技术活。

K3 在架构上做了两个关键改进:

3.1 Kimi Delta Attention(KDA)

传统 Attention 的问题是:上下文越长,计算量呈平方级增长。100 万 token 下,每个 token 都要跟其他所有 token 交互,显存和延迟都扛不住。

KDA 的思路是:把长上下文拆成"已总结的历史"和"新来的变化"(Delta),历史部分用线性方式维护一个紧凑的记忆状态,新 token 只重点关注变化部分。

官方数据:百万 token 场景下,解码速度最高提升 6.3 倍

3.2 Attention Residuals(AttnRes)

模型层数越深,信息从底层传到顶层就越容易衰减。

AttnRes 在注意力机制上加了专门的残差连接,让每一层的输出可以更直接地跳过中间层,保留更原始的信息。

官方数据:训练效率提升约 25%,额外成本不到 2%

3.3 MoE 架构

896 个专家,每次只激活 16 个。

配合 Stable LatentMoE 框架、Quantile Balancing 和 Per-Head Muon 优化,K3 相比 K2 的整体扩展效率提升约 2.5 倍

graph TD
    A[输入 Token] --> B[Router 路由]
    B --> C[共享专家]
    B --> D[16/896 路由专家]
    C --> E[KDA 混合线性注意力]
    D --> E
    E --> F[Attention Residuals]
    F --> G[输出]
    
    style A fill:#4A90D9,color:#fff
    style G fill:#4A90D9,color:#fff
    style B fill:#E6A817,color:#fff
    style D fill:#E6A817,color:#fff

门主点评: KDA 解决长序列问题,AttnRes 解决深度问题,MoE 控制成本。三个组合拳打下来,2.8 万亿参数才能落地。


四、跑分对比:跟 Claude、GPT 正面硬刚

这是大家最关心的部分。

4.1 综合排名

在 Artificial Analysis Intelligence Index 上,K3 得分 57 分,排名第三:

排名模型得分
1Claude Fable 5
2GPT-5.6 Sol
3Kimi K357
4Claude Opus 4.8
5GPT-5.5

官方也很坦诚:整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol。

但拆到具体项目,情况就不一样了。

4.2 编程能力对比

基准测试Kimi K3Claude Fable 5GPT-5.6 SolOpus 4.8GLM-5.2
DeepSWE67.570.073.059.046.2
Program Bench77.876.877.671.963.7
Terminal Bench 2.188.384.688.884.682.7
FrontierSWE81.286.671.366.767.3
SWE Marathon42.035.039.040.013.0

关键发现:

  • Program Bench:K3 77.8 分,超过 Fable 5 和 GPT-5.6 Sol
  • SWE Marathon(长会话编程):K3 42 分,比 Fable 5 高 7 分,比 GPT-5.6 Sol 高 3 分
  • Terminal Bench 2.1:K3 88.3 分,跟 GPT-5.6 Sol 的 88.8 分几乎持平
  • FrontierSWE:K3 81.2 分,超过 GPT-5.6 Sol 的 71.3 分,但低于 Fable 5 的 86.6 分

4.3 前端编程:全球第一

在 Frontend Code Arena 上,K3 以 1679 分 排名第一:

排名模型分数
🥇Kimi K31679
🥈Claude Fable 51631
🥉GPT-5.6 Sol xHigh1618

这个榜单是百万级用户参与的盲测,用户不知道自己在选哪个模型,结果可信度很高。

4.4 智能体与推理能力

基准测试Kimi K3Fable 5GPT-5.6 SolOpus 4.8
BrowseComp(长上下文检索)91.288.090.484.3
Automation Bench30.829.129.727.2
GPQA-Diamond93.592.694.191.0
OmniDocBench(视觉文档)91.189.885.887.9

门主点评: K3 不是全面碾压,而是"多点开花"。编程和 Agent 能力是第一梯队的,综合智能跟 Fable 5 和 GPT-5.6 Sol 还有差距,但已经超过了 Opus 4.8。


五、实际案例:它能干到什么程度

跑分是参考,实战才是硬道理。

案例 1:从零开发 GPU 编译器

K3 从零构建了一个叫 MiniTriton 的编译器,包含完整的 DSL 前端、MLIR 中间表示、优化 Pass 和 PTX 代码生成管线。

在部分工作负载上,性能达到甚至超过了官方 Triton 和 torch.compile,还能完成 nanoGPT 的端到端训练。

更离谱的是: K3 开发后期,一个早期版本的 K3 已经承担了团队大部分 GPU 内核优化工作。

案例 2:48 小时自主设计芯片

在连续 48 小时的自主 Agent 运行中,K3 基于开源 EDA 工具独立完成了一颗 4mm² 芯片的设计、优化与验证,集成了 146 万个标准单元。

案例 3:两小时复现一周的科研工作

K3 用约 两小时 完成了通常需要资深研究员 一到两周 才能完成的工作:

  • 阅读并交叉验证 20 多篇论文
  • 评估 300 多种状态方程
  • 生成 3000 多行 Python 代码
  • 产出交互式分析仪表盘

门主点评: 跑分可以刷,但芯片设计和编译器开发这种真实任务做不了假。K3 的 Agent 长程执行能力确实到了一个新高度。


六、API 价格:贵不贵?

官方定价:

项目价格(每百万 token)
输入(缓存命中)$0.30
输入(缓存未命中)$3.00
输出$15.00

对比一下:

模型输出价格(每百万 token)
Kimi K3$15.00
Claude Fable 5约 $75
Claude Opus 4.8约 $37.50
GPT-5.6 Sol约 $60
DeepSeek V4 Pro$0.50

K3 的输出价格是 Fable 5 的 20%,Opus 4.8 的 40%。

得益于 Mooncake 分离式推理架构,编程场景的缓存命中率可超过 90%,实际成本更低。

不过也要注意: K3 的定价比上一代 K2.6 涨了近 3 倍(K2.6 输出 $4/百万 token),更强的能力确实带来了更高的成本。


👇 三连支持,动力源泉

如果这篇文章帮你省下了踩坑的时间,欢迎:

🔹 点赞 —— 让更多人看到这篇干货 🔹 在看 —— 你的认可是我持续输出的动力 🔹 转发 —— 分享给身边正在做AI Agent的朋友

你的每一个小动作,对我都很重要 ❤️


🙏 关于作者

你好,我是 空门技术栈,一个常年和Bug战斗、持续填坑的Java开发者。

专注分享:

  • ✅ Java / Spring Boot / Spring AI Alibaba 企业级实战
  • ✅ RAG知识库、AI Agent、多智能体协作落地经验
  • ✅ Docker部署、微服务架构、线上问题排查
  • ✅ 偶尔聊聊「如何保住头发」这类程序员终极话题 😂

不搞水文,不贩卖焦虑,只写能跑通、能落地、能帮你少加班的实战内容。

关注我,咱们一起少踩坑,多写优雅代码。


📖 更多干货推荐


🎁 粉丝福利

本文涉及的 完整源码 + 可运行Demo + 配置示例,已打包整理好。

免费获取方式: 私信空门技术栈,领取源码包。

有任何问题,也欢迎后台私信,门主看到都会回复~

💬 对文章内容有疑问?想看下一篇写什么主题?

直接在评论区留言,你的每一条评论我都会看。说不定下一篇文章的主题,就来自你的问题!


🤝 项目合作 / 技术咨询

平时工作之余,也会接一些技术项目和咨询,主要方向:

⚔️ 企业级开发

  • Java / Spring Boot 项目开发与重构
  • 微服务架构设计与落地
  • 系统性能调优、线上问题排查

🤖 AI 应用落地(这是我最近的主力方向)

  • Spring AI Alibaba / RAG / Agent 应用开发
  • 企业私有知识库搭建
  • AI能力接入现有业务系统
  • 大模型本地化部署与调优

🛠️ 技术顾问 / 疑难Bug排查

  • 项目架构评审与方案设计
  • 线上疑难问题定位解决
  • 技术选型与团队培训

如果你正遇到以下情况,欢迎找我聊聊:

  • ✅ 想做AI项目,但技术方案拿不准
  • ✅ 项目卡在某个Bug上很久,团队搞不定
  • ✅ 想把AI接入现有业务,不知道从哪下手
  • ✅ 需要靠谱的开发外包或长期技术顾问

📮 联系渠道(按回复速度排序)

  1. 最快:私信空门技术栈
  2. 邮件2929119150@qq.com(请注明来意和具体需求)

一个人踩坑,是事故;一群人踩坑,就是《避坑宝典》。

—— IT 空门,与诸君共修技术大道 😎