Kimi K3 技术解读:2.8万亿参数开源模型的架构创新与性能实测

685 阅读5分钟

概览

2026年7月16日,月之暗面在 WAIC 2026 开幕前夜正式发布 Kimi K3——2.8万亿参数的开源模型,截至发布时是全球参数规模最大的开源模型,也是首个突破 3万亿级别的开源模型。

本文从技术角度拆解它的架构创新和性能表现。


一、架构:KDA + AttnRes + MoE

Kimi K3 的核心架构变化围绕两个技术突破展开:

Kimi Delta Attention(KDA):混合线性注意力

传统 Transformer 注意力机制在长上下文场景下的计算复杂度为 O(n²)。KDA 是一种混合线性注意力机制,基于 Gated DeltaNet 架构扩展,引入细粒度逐通道门控机制,将注意力计算线性化。

实测效果:在百万 token 上下文场景下,实现最高 6.3 倍解码加速

对于需要处理完整代码库或超长文档的 Agent 场景,这项技术让百万 token 上下文在实际工程中变得经济可用。

Attention Residuals(AttnRes):可学习的残差连接

传统的残差连接以固定权重累加各层输出。AttnRes 用学习到的、依赖输入的注意力机制取代固定权重,让模型自行决定从前面各层提取多少信息。

实测效果:以不到 2% 的额外训练成本,换取约 25% 的训练效率提升

在大规模 MoE 模型中,训练成本是限制模型规模发展的核心瓶颈。能在几乎不增加预算的情况下提升训练效率,意味着同样的算力可以训练出更强的模型。

MoE 配置

配置项数值
总参数2.8 万亿
专家数量896
激活专家数16(每次推理)
上下文窗口100 万 token
支持模态原生图像+文本输入,输出文本
思考模式始终开启,默认 max

结合 Stable Latent MoE 框架,模型在 896 个专家中高效激活 16 个,扩展效率相比 K2 提升约 2.5 倍。


二、性能表现:编程登顶,多任务覆盖

编程能力

Frontend Code Arena(WebDev Arena):1679 分,全球第一,超越 Claude Fable 5。该榜单由用户匿名投票产生,累计约 48 万次投票支持。

K3 在 7 个前端细分领域中的 6 个位居第一(品牌营销、基于参考的设计、数据分析、消费产品、模拟、内容创作工具),仅在游戏领域小幅落后 Fable 5。

三类代码基准测试(长周期软件工程、模型研究能力、智能体编码):整体表现强劲,多数情况下超越 Fable 5,少数基准仅次于 Fable 5 或 GPT-5.6 Sol。

知识工作

GDPval-AA v2:1687 分,排名第三,超越 Claude Opus 4.8 Max(1600 分),仅次于 Claude Fable 5 Max 和 GPT-5.6 Sol Max。该榜单评估 44 个职业、9 个主要行业的工作表现。

AA-Briefcase:1527 分,排名第二,超越 GPT-5.6 Sol Max,仅次于 Claude Fable 5 Max。

长上下文检索

BrowseComp:91.2 分,当前最好水平。得益于 100 万 token 上下文窗口,单智能体设置下无需额外上下文压缩即可完成高难度信息检索任务。

实战案例

官方展示了两个值得关注的工程验证:

芯片设计:连续 48 小时自主 Agent 运行,K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,独立完成了一颗面积 4mm² 芯片的构建、优化与验证,集成 146 万个标准单元,仿真解码吞吐持续超过每秒 8700 token。

科研编程:约 2 小时完成交叉验证 20+ 篇论文,评估 300+ 种状态方程,生成 3000+ 行 Python 代码并产出交互式分析仪表盘。通常这类工作需资深研究人员 1-2 周。

综合智能

在 Artificial Analysis Intelligence Index 上得分 57,超过 Claude Opus 4.8,落后于 Claude Fable 5 和 GPT-5.6 Sol。月之暗面在发布博客中坦言,K3 整体表现仍落后于最强闭源系统,但已在多项任务上展现出追赶甚至超越的能力。


三、定价与开源策略

API 定价(国内人民币计价)

场景价格(元/百万 token)
输入(缓存命中)2
输入(未命中缓存)20
输出100

这是迄今中国 AI 实验室发布的最昂贵模型,与 Anthropic Claude Sonnet 系列价格持平。但依托 Mooncake 分离式推理架构,编程场景缓存命中率超过 90%,实际输入成本约为标准价的 1/4。

开源计划

完整模型权重计划于 2026 年 7 月 27 日 前向社区发布。API 兼容 OpenAI SDK,降低开发者接入门槛。


四、行业技术观察

Kimi K3 的发布有几个值得关注的技术信号:

  1. 线性注意力的工程验证:KDA 证明了混合线性注意力在超大规模模型中的商业可行性,6.3 倍解码加速使百万 token 上下文在 Agent 场景中真正可用。

  2. 开源模型规模的持续突破:过去 12 个月中 9 个月保持开源模型规模上限,K3 首次突破 3 万亿参数门槛。

  3. 中国 AI 从参数竞赛到生态竞争:当 OpenAI、Anthropic 持续走封闭路线时,中国 AI 公司通过"开放权重+低定价+开发者生态"组合拳,正在重塑全球 AI 竞争的技术格局。


数据来源:月之暗面官方发布、快科技、Artificial Analysis、OpenRouter