国产旗舰三强横评:Kimi K3、GLM-5.3、Hy4 全上 1M 上下文,但差距不在跑分
本文所有参数、价格、榜单分数均来自厂商官方文档 / 模型卡 / 云厂商控制台 / 公开评测机构,关键数字已标注来源与统计口径。三家我都在实际任务里跑过,不吹不黑,只讲能落地的部分。
一、先给结论
如果你只关心一句话:
2026 年 8 月之后,国产旗舰的"参数军备竞赛"阶段结束了,1M 上下文、MoE 稀疏架构、开源权重已经成了三家标配。真正的分水岭变成了三件没人爱讲的事:License 能不能商用、批量推理支不支持、以及跑分和干活到底是不是一回事。
三个支撑事实:
- 三个模型全是 1M 上下文(K3 1,048,576 / GLM-5.3 1,048,576 / Hy4 1M)——这在半年前还是旗舰独享的规格,现在是国产入门线。
- 腾讯内部盲测结果反直觉:163 名专家、203 个工程任务,Hy4 preview(2.99/4)> Kimi K3(2.94)> GLM-5.3(2.92)。但 GLM-5.3 的智能指数是三者里最高的(60 分)。跑分第一的那个,盲测排第三。
- License 差距比跑分差距大得多:Hy4 是 Apache 2.0(能直接商用),K3 是自定义的 Kimi K3 License(有附加条款),GLM-5.3 权重 8 月 29 日才开源。这一条直接决定你能不能把它放进产品里卖钱。
二、一张表看清三个模型
先把硬参数摆出来,后面再逐条拆:
| 维度 | Kimi K3 | GLM-5.3 | Hy4 preview |
|---|---|---|---|
| 厂商 | 月之暗面 | 智谱 AI | 腾讯混元 |
| 发布时间 | 2026-07-16(权重 07-27) | 2026-08-14(权重 08-29) | 2026-08-28 |
| 总参数 / 激活 | 2.8T / 104B | 未公开(官方称"更小参数规模") | 770B / 49B |
| 架构 | 93 层 MoE,16/896 路由专家 | MoE | 78 层 MoE,256 路由专家 top-8 |
| 上下文 | 1,048,576 | 1,048,576 | 1M |
| 最大输出 | — | 131,072 | — |
| 原生视觉 | ✅ | ❌(纯文本) | — |
| License | Kimi K3 License(自定义) | 开源(8/29 权重) | Apache 2.0 |
| 输入价(每百万 token) | 0.30(命中) | ¥8(命中 ¥2)/ 国际 $1.40 | 限时免费期 |
| 输出价(每百万 token) | $15.00 | ¥28 / 国际 $4.40 | 限时免费期 |
光看这张表,你大概会觉得"K3 参数最大最强、GLM-5.3 最便宜、Hy4 没价"。但真到选型的时候,这三个直觉全是错的。
三、Kimi K3:参数王,也是"最慢的那个"
硬指标
- 2.8 万亿总参数、1040 亿激活:93 层稀疏 MoE,每 token 走 16 个路由专家(共 896 个)+ 2 个共享专家
- KDA(Kimi Delta Attention)混合线性注意力:官方称在百万 token 上下文下解码最高快 6.3 倍
- AttnRes(注意力残差):训练效率提升约 25%,额外成本不到 2%
- 1M 上下文 + 原生视觉
- 权重已开源,同时开源了 MoonEP、FlashKDA、AgentEnv 三套 Infra
价格(官方 API 口径,9 月 1 日复查):
| 计费项 | 价格(每百万 token) |
|---|---|
| 输入(缓存未命中) | $3.00 |
| 输入(缓存命中) | $0.30 |
| 输出 | $15.00 |
缓存命中降 90%——这个幅度比多数海外旗舰都狠,说明 K3 的自动上下文缓存是默认开启且命中策略做得比较激进。
两个必须知道的坑
坑 1:它是主流旗舰里最慢的
Artificial Analysis 实测 35 tokens/秒,是主要旗舰里最慢的一个(对比口径下其他旗舰普遍在 50-80)。
同时它的输出很"啰嗦"——评测期间生成了 1.3 亿 token,平均值是 6300 万,是别人的两倍多。
这意味着什么:如果你做的是交互式场景(用户等着看结果),35 tok/s 的体感是明显卡顿的。但如果是批处理场景(夜里跑,早上收结果),速度根本不重要。
坑 2:reasoning 始终开启,默认 max
K3 一直在推理,推理强度通过顶层 reasoning_effort 字段设置(low / high / max,默认)。
默认是 max,意味着你不主动调,每一分钱都在按最高强度烧思考。
这一条和 GPT-6 Astra 是同一个毛病(Astra 的 reasoning 干脆没有 none 档)。关不掉思考 = 简单任务也在付复杂任务的钱。
好消息是 K3 至少给了 low 档,你可以手动降下来:
{
"model": "kimi-k3",
"reasoning_effort": "low", // 简单任务务必调低,默认是 max
"messages": [...]
}
它的强项在哪
Code Arena WebDev 榜第 1,1679 分——这个成绩是压着 Claude Fable 5(1631)和 GPT-5.6 Sol(1618)拿的。
而且单任务成本 1.04,远低于 Claude Fable 5 的 $2.75——注意这还是在它输出量是别人两倍的情况下算出来的。
所以 K3 的定位很清楚:前端 / Web 开发、长程编程、超大代码库理解。做这些它是真强,别拿它去跑简单分类提取,那是用牛刀杀鸡还按牛刀付费。
四、GLM-5.3:跑分最高,但有两条硬限制
硬指标
- Artificial Analysis 智能指数 60 分:与 Claude Fable 5、GPT-5.6 Sol 处于同一区间,与 K3 并列开源模型第一
- 1M 上下文,最大输出 131,072(思维链最长也是 131,072)
- 支持 Function Calling、结构化输出、前缀续写、上下文缓存
- 官方口径:以更小参数规模和更低调用成本达到前沿水平,同等智能水平下,单任务成本为前沿旗舰中最低
价格(国内口径):
| 计费项 | 国内 | 国际(新加坡) |
|---|---|---|
| 输入 | ¥8 | $1.40 |
| 输出 | ¥28 | $4.40 |
| 缓存命中 | ¥2 | $0.26 |
| 缓存写入 | 限时免费 | 免费 |
另有 GLM-5.3-Flash,5 折限时:输出 ¥1.4、输入 ¥0.4(原价 ¥2.8 / ¥0.8),支持图片、视频、文件多模态输入——注意这个比 GLM-5.3 本体(纯文本)模态还全。
两条会卡住你的硬限制
这是我在文档里挖出来、但很少有人提的两条:
限制 1:不支持批量推理(Batch)
云厂商控制台的能力清单里,"批量推理"这一项明确标着不支持。
这条对谁致命:做批量数据生成、批量文档处理、夜间跑大批量任务的团队。Batch 在海外厂商那边普遍是半价,GLM-5.3 没有这条腿——你只能在实时价上跑批处理。
限制 2:不支持模型调优(Fine-tuning)、不支持联网搜索
同样在能力清单里是明确标记。想要私有数据微调、或者需要模型自带联网能力的场景,这条路走不通。
另外注意限流:主流云平台的 GLM-5.3 配额大致是 RPM 200 / TPM 3,000,000。RPM 200 对高并发场景是个实打实的天花板,真要上量得提前跟厂商谈配额。
它适合谁
成本敏感 + 任务中等复杂 + 不需要批量和微调——比如智能客服、文档摘要、结构化提取、中等难度的代码补全。
不适合:需要 Batch 半价跑批的、需要私有微调的、需要模型原生联网的。
五、Hy4 preview:盲测第一,License 最宽松
硬指标
- 770B 总参 / 49B 激活(HuggingFace 文件页显示 780B,是因为算上了内置的 MTP 投机解码层 10B/0.7B;官方口径 770B 指 backbone)
- 78 层:第 1 层 dense FFN,其余 77 层 MoE;每层 256 路由专家 + 1 共享专家,每 token 激活 top-8 + 1
- Gated DSA + IndexCache:跨层稀疏索引复用
- 4 条残差流(iHC),hidden size 6144,词表 120832
- 1M 上下文
- License:Apache 2.0
上一代 Hy3 是 295B/21B、256K 上下文。一代之内参数翻 2.6 倍、上下文翻 4 倍,迭代节奏是平均两个月一个大版本(腾讯首席 AI 科学家姚顺雨主导)。
三个值得单独说的点
① Apache 2.0 是三者里最宽松的 License
这一条被严重低估。三个模型里:
| 模型 | License | 商用含义 |
|---|---|---|
| Hy4 | Apache 2.0 | 标准宽松开源协议,商用、修改、分发基本无附加限制 |
| K3 | Kimi K3 License | 自定义协议,有附加条款,商用前需细读 |
| GLM-5.3 | 开源(8/29 放权重) | 协议细节需自行确认 |
大白话:Apache 2.0 就像"这东西送你了,随便用,别告我就行";自定义 License 像"送你,但有几条附加条款你得看清楚"。要把模型塞进自己的产品里对外卖钱的,License 这一栏比跑分重要十倍。
② 盲测第一,但官方自己说这是"早期版本"
腾讯内部组织了 163 名内部专家、203 个工程任务盲测:
| 模型 | 盲测均分 |
|---|---|
| Hy4 preview | 2.99 / 4.00 |
| Kimi K3 | 2.94 / 4.00 |
| GLM-5.3 | 2.92 / 4.00 |
注意这个排序和智能指数榜是反的——GLM-5.3 智能指数 60 分最高,盲测却排第三。
这不是谁在说谎,是"考试"和"干活"本来就是两件事。榜单测的是"能不能答对题",盲测测的是"能不能交付一个能用的东西"。
官方同时明说了:这是早期版本,"预训练和后训练均仍有较大的提升空间",Hy4 下一版近期陆续上线。
③ 定位是"生产力",不是"聊天"
腾讯的说法是"为生产力而生",数据共建来自软件工程、游戏、金融、安全四个方向的专家。场景实测也确实是这个路子:
- 软件工程:长程开发任务的理解、规划、调试、验证;前端视觉审美和交互质量
- 办公分析:数据分析、跨文件协作,从信息处理到文档/表格/演示文稿的完整交付
- 游戏开发:一句话需求生成可玩原型,能操作游戏引擎
- 科学研究:分子动力学模拟、凝聚态物理、基础数学
如果你的场景是"让 AI 交付一个完整成果"而不是"跟 AI 对话",Hy4 的这个定位是对味的。
接入方式:腾讯云 Tokenhub、OpenRouter,以及腾讯自家产品(WorkBuddy / CodeBuddy / 元宝 / ima)。发布后有两周限时免费体验。
六、三个反直觉的结论
把上面的信息串起来,有三条结论跟主流认知是反的:
结论 1:跑分最高的那个,干活不一定最好
GLM-5.3 智能指数 60 分(三者最高),盲测 2.92 分(三者最低)。Hy4 智能指数没进榜前列,盲测 2.99(第一)。
原因:智能指数测的是"单次答题正确率",盲测测的是"203 个真实工程任务能不能交付"。后者包含大量榜单不考的东西——长程一致性、指令遵循、能不能一次做对、风格审美。
对你的意义:别只看榜单选型。如果可能,拿你自己最常做的那 20 个任务去跑一遍,比任何榜单都准。
结论 2:License 的差距,比能力的差距更致命
三个模型的能力差距,说实话在 5% 以内,普通人日常用根本感受不出来。
但 License 的差距是能不能商用的区别。Apache 2.0 意味着你可以直接拿去改、去卖、不用谈;自定义 License 意味着法务得介入、可能要签协议、规模大了可能被卡。
这一条直接决定你的产品能不能上线,比那 5% 的能力差距重要一百倍。
结论 3:1M 上下文已经是"标配",但真正能用满的没几个
三个模型全都 1M,听起来很爽。但:
- K3 在 1M 上下文下 35 tok/s(最慢),长上下文 + 慢速度 = 体感灾难
- 上下文越长,每轮的输入成本越高——1M 上下文跑一轮,光输入就是 $3(K3 未命中)或 ¥8(GLM-5.3)
- 缓存命中率决定你付 0.30——差 10 倍
所以 1M 上下文的正确用法不是"什么都往里塞",而是"塞进去之后让它命中缓存反复用"。
七、选型决策:你的场景该选谁
| 你的场景 | 选谁 | 理由 |
|---|---|---|
| 前端 / Web 开发、超大代码库 | Kimi K3 | Code Arena WebDev 榜第一,1679 分 |
| 要塞进产品对外商用、要改权重 | Hy4 preview | Apache 2.0,商用最干净 |
| 成本敏感、中等复杂、不需要批量和微调 | GLM-5.3 | 同等智能单任务成本最低,¥8/¥28 且缓存 ¥2 |
| 批量跑批、需要 Batch 半价 | 别选 GLM-5.3 | 明确不支持批量推理 |
| 需要私有数据微调 | 别选 GLM-5.3 | 明确不支持模型调优 |
| 需要模型原生联网 | 别选 GLM-5.3 | 明确不支持联网搜索 |
| 需要图片/视频/文件多模态输入 | GLM-5.3-Flash | 本体是纯文本,Flash 版模态更全 |
| 交互式场景(用户等着看结果) | 别选 K3 跑 max | 35 tok/s 最慢,且默认最高推理强度 |
| 高 RPM 并发 | 提前谈配额 | GLM-5.3 常见配额 RPM 200 |
一句话总结:做前端选 K3,要商用选 Hy4,省钱跑量选 GLM-5.3——但先确认你踩不踩它那三条限制。
八、我们的落地:一个入口,三个都接上
前面说了这么多,落到工程上是同一件事:这三个模型你大概率不会只用一个。
前端任务想用 K3 的 WebDev 能力,商用产品想用 Hy4 的 Apache 2.0,日常跑量想用 GLM-5.3 的价格——这是三个不同的模型,三家不同的厂商。
一家家去接,问题很实在:
- 鉴权、计费口径、错误码、限流策略全不一样。K3 按缓存命中不命中计价,GLM-5.3 按国内/国际双口径,Hy4 还在限时免费期——监控维度完全不同,账单根本对不齐
- 限流档位是隐藏雷。GLM-5.3 常见配额 RPM 200,跑到一半被限流,你的任务队列就卡住了
- 能力差异要写代码适配。GLM-5.3 不支持 Batch 和微调,K3 的 reasoning 默认 max——这些都得在调用层做判断和兜底,不是换个模型名就完事
我们做的事是:一个统一调用入口,把 Kimi K3、GLM-5.3、Hy4 全系,以及 Claude 全系、GPT 全系都接进来。业务代码只认一套接口,一套 key、一张账单、一个监控面板。底层多上游容灾,某条通道抖动自动切走。
具体能帮你省掉三件自己接很麻烦的事:
- 按任务类型自动分级:简单提取走便宜档、前端任务走 K3、商用交付走 Hy4,不用你手写路由逻辑
- 缓存命中率优化:K3 缓存命中 3.00,差 10 倍——这一项的弹性远大于"换个便宜模型"
- 限流与多通道自动选路:RPM 到顶自动切通道,不用半夜爬起来改配置
如果你正在选型国产模型,或者团队的 AI 账单涨得莫名其妙——把你的场景(前端/跑批/商用交付/日常对话)+ 大致月调用量 + 是否需要商用授权发我,我按"模型选型 + 缓存策略 + 分级路由"三招帮你粗算一版,看看到底该用哪个、能省多少。不收费,就当交个朋友。
九、写在最后
2026 年国产旗舰这一轮,最大的变化不是某个模型又刷了多少分,而是三家几乎同时把 1M 上下文和开源权重打成了标配。
这意味着**"靠规格差异化"的时代结束了**。接下来拼的是三件更无聊、但更决定生死的事:
- License 干不干净——决定了你能不能把它变成产品
- 批处理和微调这类"工程腿"全不全——决定了你能不能上量
- 跑分和干活是不是一回事——决定了你上线之后会不会翻车
国产模型在这一轮里拿到的位置,不是"便宜的平替",是"能进生产线的主力"。但前提是你别只看榜单——GLM-5.3 那三条"不支持",K3 那默认的 max 推理强度,Hy4 那"早期版本"的自我定性,都是榜单上看不见、但会实实在在卡住你的东西。
对你来说,记住三句话就够了:
- 做前端选 K3,要商用选 Hy4,省钱跑量选 GLM-5.3——但先确认踩不踩那三条限制
- License 比跑分重要——Apache 2.0 和自定义协议,是"能卖"和"得先谈"的区别
- 缓存命中率决定账单——0.30 之间差 10 倍,这一项比选哪个模型影响更大
觉得有用点个赞收藏,评论区聊聊你们现在主力用哪个、踩过什么坑。