智谱 GLM-5.3 技术解读:同基座、纯后训练,如何把"史诗级 Plus"落地
发布日期:2026 年 8 月 14 日 参考来源:智谱官方(zhipuai.cn、z.ai 官方公告)+ 公开媒体与评测平台交叉核实(Unite.AI、BigGo、BankB.it、快科技/新浪科技、Seeking Alpha 等) 说明:本文为独立技术信息整理,非厂商宣传内容;文中所有基准分数均为智谱官方公告口径(vendor-reported),独立复现请以权重开源后的第三方评测为准。
附:最近在用的两个工具
这两个月我的 AI 办公工具基本固定成了下面两样,顺带分享给有需要的朋友。
TraeWork(trae.cn):一站式 AI 办公平台,把任务协作和智能助手整合在了一起, 日常写方案、整理资料都在里面完成。用这个链接注册并登录桌面端,一次性到账 5000 积分:
Qoder(qoder.com.cn):一周年活动到 9 月 3 日截止,新注册可以领 300 积分, 外加 800 次 Qwen3.8-Max 的调用额度:
说明一下:上面两个都是我的邀请链接,通过它们注册,你我都能拿到积分。
一、TL;DR
2026 年 8 月 14 日,智谱(Z.ai)正式发布新一代旗舰模型 GLM-5.3。这版升级有一个非常“反直觉”的技术前提:它与 GLM-5.2 共用同一个基础模型(base model),所有能力增益全部来自后训练(post-training)阶段的规模化——更长的训练时长、数十倍于前代的长程任务环境、更丰富的环境类型。智谱创始人唐杰此前在社交媒体上预告这是一次“史诗级 Plus”级别的升级。
官方公布的核心成绩:
- 编码能力:内部 Z.ai Code Bench 较 GLM-5.2 提升 50%;在 Terminal-Bench 3.0、Agents' Last Exam(CLI)等公开基准上取得开源模型 SOTA;
- 长程 Agent 能力:Terminal-Bench 3.0 从 4.6 → 28.3,DeepSWE v1.1 从 46.2 → 66.9;
- 涌现式网络安全能力:CyberGym 漏洞发现 84.5%(SOTA),ExploitBench 较前代翻倍以上(54.4% vs 24.4%);
- 开源承诺:权重将在发布约两周后(预计 2026 年 8 月底)完成安全评估与加固后开放。
二、发布背景:一条“明牌式”泄露的旗舰升级
GLM-5.3 的发布并非毫无预兆,恰恰相反,它是国产大模型竞争中最具戏剧性的一次“意外曝光”:
- 泄露经过:8 月 3 日前后,智谱旗下编程工具 ZCode 官网短暂上线了 “GLM-5.3 Official Harness” 页面,官方说明文档也一度对外开放约一小时,随后被撤下;微软 Bing 的搜索结果缓存了这些页面,进一步扩大了泄露范围。与此同时,智谱官方 Java SDK(z-ai-sdk-java)仓库中出现新增 “glm-5.3” 模型并支持 JSON Schema 的提交记录。
- 创始人确认:智谱创始人唐杰在 X 上回应网友,确认 GLM-5.3 “很快就会发布”,并沿用“史诗级 Plus”的说法为升级幅度定调。
- 命名回归:此前社区一度传闻新版本会跳号命名 GLM-5.5 甚至 GLM-6,最终智谱选择沿 GLM-5.2 顺延,保持约两个月一更的发布节奏——GLM-5(2 月 12 日)→ GLM-5.1(4 月 7 日)→ GLM-5.2(6 月 16 日)→ GLM-5.3(8 月 14 日)。
- 市场节点:8 月 3 日阿里发布 2.4 万亿参数的 Qwen 3.8-Max,上月月之暗面发布 2.8 万亿参数的 Kimi K3,加上 DeepSeek V4 Flash-0731,国产头部旗舰短期集中亮相,GLM-5.3 正处于头部旗舰模型集中发布的时间窗口。
值得一提的是,泄露期间流传的“GLM-5.3 参数量将从 744B 提升到万亿以上”的说法并未成真——官方公告明确 GLM-5.3 复用 GLM-5.2 基座,这从侧面说明这版升级的看点不在“堆参数”,而在“后训练的天花板”。
三、技术要点:同基座 + 后训练规模化,能力“涌现”而非“堆料”
GLM-5.3 的技术路线可以概括为一句话:架构与基座不变,把后训练(RL/长程任务训练)推到极致。
官方公告披露的训练与数据要点:
| 维度 | GLM-5.2(基座基线) | GLM-5.3 的变化 |
|---|---|---|
| 基座模型 | 744B 总参 / 40B 激活(MoE),28.5T tokens 预训练,1M 上下文 | 同一基座,未重训 |
| 后训练规模 | — | 长程任务环境数量数十倍于前代 |
| 环境类型 | — | 更丰富的环境类型(终端、代码库、Agent 工具链等) |
| 训练时长 | — | 后训练时长显著延长 |
| 能力来源 | — | 官方称训练中“出现超出预期的能力涌现” |
这条路线在行业里并非孤例——2026 年的旗舰模型竞争中,“基座定架构、后训练定上限”几乎成为共识。GLM-5.3 的特殊之处在于两点:
- 增益集中在“最长地平线”的评测上:越是考验长时间多步骤执行(long-horizon)的基准,GLM-5.3 相对 GLM-5.2 的跳升幅度越大,与“数十倍长程任务环境”的训练设定高度自洽;
- 出现了“训练预期之外”的涌现能力:网络安全(漏洞发现与利用链)能力的增速远超智谱自己的预期——这是后训练规模化最直接的“副产品”证据,也是本次发布最具话题性的一点。
四、基准成绩拆解:官方口径与交叉验证
以下数据全部来自智谱官方公告(z.ai 博客 / 智谱官方发布),多家媒体(Unite.AI、BigGo、BankB.it、快科技等)引述一致,未见出入。
4.1 编码与长程 Agent 任务(对比 GLM-5.2)
| 基准 | 评测内容 | GLM-5.2 | GLM-5.3 | 提升 |
|---|---|---|---|---|
| Z.ai Code Bench(内部) | 智谱自建编码评测(官方称可降低公开测试集污染风险) | 基线 | +50% | 官方口径 |
| Terminal-Bench 3.0 | 真实终端环境中的复杂任务完成 | 4.6 | 28.3 | 约 6 倍 |
| DeepSWE v1.1 | 长地平线软件工程、持续代码修改 | 46.2 | 66.9 | +20.7 |
| Agents' Last Exam(CLI) | 真实职业场景、跨工具协作与长程任务 | 23.8 | 28.5 | +4.7 |
| GDPval-AA v2 | 覆盖 44 种职业的高价值知识工作 | — | 1,769 分 | 能力外溢信号 |
4.2 与闭源旗舰的直接对比(官方口径)
- 对 Claude Opus 4.8:官方称在“相近推理努力(effort)”设定下,GLM-5.3 在 Z.ai Code Bench 上得分超过 Opus 4.8,且输出 token 消耗更低(约 31.4% @ 约 5 万输出 token,对比 Opus 4.8 约 29.5% @ 约 12 万输出 token);
- 对 Claude Fable 5:Fable 5 在最高 effort 下仍领先(约 39.5%),GLM-5.3 与其差距集中在极长推理链上;
- 对 GPT-5.6 Sol:在 Terminal-Bench 3.0、DeepSWE 等较难的公开编码基准上,GLM-5.3 仍落后于 GPT-5.6 Sol 与 Fable 5;
- 智谱的总体定位是:“当前开源权重模型中最强的编码模型”,编码与 Agent 能力接近 Claude Fable 5,编码体验超越其它国产模型。
4.3 网络安全能力(官方重点披露项)
| 基准 | 评测内容 | GLM-5.2 | GLM-5.3 | 备注 |
|---|---|---|---|---|
| CyberGym | 从白盒源码中识别并验证漏洞 | 77.2% | 84.5% | 对比集中所有模型最高 |
| ExploitBench | 真实漏洞的深层次推理与利用链构造 | 24.4% | 54.4% | 翻倍以上 |
| ExploitGym | 限时预算内完成漏洞利用任务(按吞吐归一化) | 29 个 / 39 个 | 105 个(2h)/ 130 个(6h) | 闭源 Mythos 5 为 181 / 247 |
智谱官方对这条规律总结得很直白:越往“利用链”上游走,GLM-5.3 相对 GLM-5.2 的增益越大,同时与闭源前沿模型的差距也越宽。此外,官方披露已通过协调披露(coordinated disclosure)流程提交 1,097 个高危/严重漏洞发现——既证明能力真实,也说明智谱在给这项“双刃剑”能力补安全护栏。
4.4 数据口径提醒
以上数字均为厂商自报,且 Z.ai Code Bench 与网络安全评测均跑在智谱自己的测试框架(harness)下。独立第三方能否复现(尤其是内部 Code Bench 与 Cyber 分数),要等 8 月底权重开源后才能见分晓——这也是 Unite.AI 等海外媒体对本次发布最关注的问题。
五、开源与生态
- 开源计划:GLM-5.3 权重将在发布约两周后(预计 8 月底)开放,官方表示需先完成安全评估与加固。GLM-5.2 采用 MIT 协议在 Hugging Face zai-org 发布,社区普遍预期 5.3 延续开源权重路线。
- 落地场景:GLM-5.3 与智谱编程工具 ZCode 深度绑定(此前泄露的正是 ZCode 的 “Official Harness” 页面),编码 Agent 是本次发布的主要应用场景。
- 计费方式:GLM-5.3 采用积分制计费,输入、缓存输入、输出 token 分别计分;工作日 14:00–18:00(UTC+8)为高峰时段,其余时间按五折计费。
六、怎么看这次发布:三个清醒的视角
- 后训练叙事被验证了一半。“同一基座、纯后训练带来 6 倍于前代的 Terminal-Bench 跳升”本身极有说服力,说明智谱的后训练(尤其长程 RL 环境构造)已是核心壁垒;但它同时意味着架构红利已尽,后续升级必须靠更重的训练投入,边际成本会越来越高。
- 内部基准的“裁判员”问题。Z.ai Code Bench 是自家评测,“开源 SOTA”的含金量取决于公开基准的透明度与第三方复现。相比之下 Terminal-Bench 3.0、DeepSWE 等公开基准更有公信力,但 5.3 在这些基准上仍落后 GPT-5.6 Sol / Claude Fable 5,说明“开源第一”与“绝对第一”之间仍有距离。
- 网络安全能力是双刃剑。漏洞发现能力(1,097 个高危漏洞已协调披露)证明模型真实可用,但也要求更强的安全护栏与负责任的披露机制;权重开放后,这项能力如何被第三方使用,将是整个开源社区要共同面对的问题。
七、总结与展望
GLM-5.3 的核心特征是不换基座、纯靠后训练规模化:编码与长程 Agent 能力在官方口径下达到开源模型领先水平,网络安全能力也出现明显提升。它显示在算力与数据之外,后训练工程对模型能力上限的影响越来越大。需要说明的是,上述结论均基于厂商自报数据,实际水平有待权重开源后的独立评测验证。
接下来的看点集中在三件事上:① 8 月底权重开源后的第三方复现结果;② 与 DeepSeek V4 Pro 正式版、Kimi K3、Qwen 3.8-Max 的正面交锋;③ 社区呼声最高的“原生视觉入主线”(GLM-5V-Turbo 的能力是否并入 5.4/5.5)。无论哪一条,都意味着 GLM-5 这条产品线正在从“能写代码”走向“能构建系统、能执行长程任务、甚至能发现系统漏洞”的 Agent 基座时代。
参考来源
- 智谱官方:www.zhipuai.cn/zh (GLM 模型与 MaaS 产品线)
- Z.ai 官方公告《GLM-5.3: Frontier Coding with Emergent Cyber Capabilities》:z.ai/blog/glm-5.…
- Unite.AI《Z.ai Launches GLM-5.3 With Frontier Coding and a Cyber Capability That Outgrew Its Training》:www.unite.ai/z-ai-launch…
- BigGo Finance《Zhipu AI Releases GLM-5.3: Coding Capability Jumps 50%》:finance.biggo.com/news/0b571a…
- BankB.it(ChainCatcher 消息)《智谱 GLM-5.3 发布》:bankb.it/
- 快科技 / 新浪科技《国产大模型继续狙击GPT/Opus 智谱GLM-5.3即将发布》:finance.sina.com.cn/tech/roll/2…
- TechWeb / 富途牛牛《智谱AI新一代大模型GLM-5.3意外曝光》:news.futunn.com/post/770536…
- TechTimes《GLM-5.3 Must Include Vision: Z.ai's Developer Poll》:www.techtimes.com/articles/31…
- EvoLink / APIMart / aireiter 等社区与 API 平台对 GLM-5.3 发布节奏与规格的分析
免责声明:本文为技术资讯整理,基准分数均标注来源与口径;GLM-5.3 的评测数据为厂商自报,最终以权重开源后的独立评测为准。