缓存输入低至 0.1 元 / 1M tokens,Qwen、GLM、DeepSeek 三款 Flash 模型正面对比,看清便宜模型能不能真接活。
缓存输入低至 0.1 元起,常规输入 0.8 元起,Flash 大模型已经便宜到“随手试错”都不心疼。真正该问的是:便宜跑得快之外,它能不能接住终端、代码仓、工具链和长任务?
我把近期三款 Flash 级模型的官方口径放在一起:Qwen3.8-Flash-Next、GLM-5.3-Flash、DeepSeek-V4-Flash-0731;另把 DeepSeek-V4-Flash-Vision-Exp 单列出来,因为它补上了 Flash 文本版的视觉短板,更接近 Qwen 和 GLM 的多模态产品形态。参考线选 Claude Opus 4.8 和 Claude Fable 5。一句话先说结论:Qwen 常规输出价最低且新架构激进,GLM 综合稳但 5 折是限时变量,DeepSeek 缓存 0.1 元最狠、常规输出却最贵。
先看底牌
| 模型 | 官方规模 / 关键特性 | 适合先关注 |
|---|---|---|
| Qwen3.8-Flash-Next | 125B 总参数、6B 激活,另含 51B n-gram embedding 与 4B MTP;原生 262K 上下文,可扩展到 1M;带视觉编码器 | 新架构试验、长上下文 Agent、多模态输入 |
| GLM-5.3-Flash | 320B 总参数、18B 激活;1M 上下文;原生多模态;官方称 Artificial Analysis Intelligence Index v4.1.1 得 57 | 低成本综合 Agent、视觉编码、长上下文 |
| DeepSeek-V4-Flash-0731 | 284B 总参数、13B 激活;官方模型卡称较 Preview 大幅增强 Agent 能力;MIT 许可 | 文本代码 Agent、自建工作流、开源二开 |
| DeepSeek-V4-Flash-Vision-Exp | 官方称纯文本能力与 Flash 正式版持平;视觉 Agent 大幅跃升并接近 Opus-4.8;实验性 API | 看图、看界面、做图文混合 Agent 实验 |
⚠️ 注意:Qwen3.8-Flash-Next 是实验性预览架构;生产用的 Qwen3.8-Flash 基于它,并额外提供 1M 上下文等官方能力。DeepSeek-V4-Flash-Vision-Exp 是 8 月 21 日上线的实验性视觉模型,下面我会单列成绩,不和文本版混在一起排名。
评测项到底测什么
| 评测项 | 人话版解释 |
|---|---|
| Terminal Bench 2.1 | 在 Linux 沙箱里连续执行命令、排查环境,像真实运维 |
| DeepSWE / v1.1 | 在大型代码库里修 Bug、做重构,看软件工程硬实力 |
| NL2Repo | 把需求变成/改成一个仓库级项目,不只写单文件 |
| Toolathlon Verified | 多步 API 和工具调用工作流,看会不会编排工具 |
| Agents' Last Exam | 长周期真实任务,考验持续规划、执行和纠错 |
| SWE-bench Pro / Multilingual | 更难或多语言的软件工程修复任务 |
| IFBench | 指令遵循,看是否按约束输出 |
| GPQA Diamond | 高难科学推理,接近专家级问答 |
| LiveCodeBench v6 | 竞争性编程和代码推理 |
| HLE | 多学科专家级推理;有工具版本则看工具增强后的增益 |
| CyberGym | 开源项目漏洞发现与验证,偏安全攻防 |
| AutomationBench | 跨应用业务流自动化,如表单、系统、工具协作 |
| DSBench FullStack / Hard | 数据科学全流程和困难数据分析任务 |
核心结论前置
- GLM-5.3-Flash 是综合口径最稳的选手。 官方常规输入 0.8 元、输出 2.8 元 / 1M tokens,另有 5 折限时两周;官方表中 Toolathlon Verified 78.4、Terminal Bench 2.1 84.3、DeepSWE v1.1 63.4、Agents' Last Exam 26.3,AA 指数 57。
- DeepSeek-V4-Flash-0731 的文本 Agent 升级很明显。 官方模型卡显示 Terminal Bench 2.1 82.7、NL2Repo 54.2、DeepSWE 54.4、Toolathlon Verified 70.3、Agents' Last Exam 25.2,CyberGym 76.7,且权重采用 MIT。
- Qwen3.8-Flash-Next 的价值在“用更少激活参数换更多能力”。 官方表中 SWE-bench Pro 62.5、SWE-bench Multilingual 81.0、IFBench 81.3、GPQA Diamond 91.7、LiveCodeBench v6 91.9;只有 6B 激活参数。
先看价格牌:统一人民币
三家的价格终于都能用人民币直接比了。
| 官方 API 模型 | 缓存输入 | 常规输入 | 输出 | 省钱开关 |
|---|---|---|---|---|
| GLM-5.3-Flash | 0.23 元 / 1M | 0.8 元 / 1M | 2.8 元 / 1M | 5折限时两周 |
| Qwen3.8-Flash | 0.4 元 / 1M* | 0.8 元 / 1M | 2.7 元 / 1M | Batch调用半价 |
| DeepSeek-V4-Flash | 0.1 元 / 1M | 3.0 元 / 1M | 9.0 元 / 1M | 空闲时段半价 |
* 缓存命中价格计算较复杂,暂按半价计算
👀 省钱看点:
- 常规输入价:GLM / Qwen 都是 0.8 元,DeepSeek 是 3 元;常规输出则是 Qwen 2.7 元最低,GLM 2.8 元次之,DeepSeek 9 元最贵。
- DeepSeek 缓存命中价最狠:0.1 元 / 1M,固定 system prompt、重复文档和长多轮对话优先看它。
- GLM 的 5 折是限时变量,预算要同时按常规价和折后价各测一遍。
- Qwen Batch 半价适合批量修复、摘要和评测;0.4 元缓存输入为估算口径。
⚠️ Qwen 的价格对象是 Qwen3.8-Flash 生产 API,也就是基于 Flash-Next 的官方 API 版,不等同于开源实验权重单独标价。
同类指标相邻:核心 Agent 表
下面把终端、软件工程、仓库级代码、工具调用、长任务放在一起。分数来自各模型官方页或你指定的参考资料;不同来源的评测 harness、版本和上下文不完全一致,看趋势比抠单分更稳。
| 指标 | Qwen3.8-Flash-Next | GLM-5.3-Flash | DeepSeek-V4-Flash-0731 | Opus 4.8 | Fable 5 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | — | 84.3 | 82.7 | 85.0 | 88.0 |
| DeepSWE / v1.1 | 58.7 | 63.4 | 54.4 | 58.0 | 70.0 |
| NL2Repo | 48.1 | 56.3 | 54.2 | 69.7 | — |
| Toolathlon Verified | 73.5 | 78.4 | 70.3 | 76.2 | 77.9 |
| Agents' Last Exam | 24.3 | 26.3 | 25.2 | 25.7 | 25.7 |
👀 怎么读这张表:
- 终端与仓库级工程:Opus 4.8 仍是很硬的参考线;GLM Flash 在三款 Flash 里更均衡。
- 工具编排:GLM Flash 78.4 很亮眼,接近 Opus 4.8 的 76.2 与 Fable 5 的 77.9。
- 长任务:三款 Flash 都在 24–27 分区间,没有断代式差距。
专项能力补充
Qwen 官方语言表还给出几项很适合看“基础能力密度”的分数:
| 指标 | Qwen3.8-Flash-Next | DeepSeek-V4-Flash-0731 |
|---|---|---|
| SWE-bench Pro | 62.5 | 56.0 |
| SWE-bench Multilingual | 81.0 | — |
| IFBench | 81.3 | 79.2 |
| GPQA Diamond | 91.7 | 90.8 |
| LiveCodeBench v6 | 91.9 | 90.6 |
DeepSeek 官方模型卡则单独强调了两项内部/困难任务:DSBench-FullStack 68.7,DSBench-Hard 59.6;CyberGym 为 76.7,Opus 4.8 是 83.1。它们说明 DeepSeek-0731 的提升重点,不只在传统代码生成,还在真实 Agent 和安全任务。
GLM 官方博客的独立亮点是成本效率:AA Intelligence Index v4.1.1 得 57;官方还称这曾需要约 10 倍成本才能达到。自动化专项 AutomationBench v1.0.6 上,GLM Flash 为 48.8。但这项数据不能与 DeepSeek 官方表中的 AutomationBench Public 25.1 直接混成一个排名,因为版本口径不同。
Vision-Exp:DeepSeek 的多模态补丁
DeepSeek 官方公告给了三张很有信息量的多模态 Agent 分数:
| 指标 | V4-Flash-Vision-Exp | V4-Flash-0731 | Opus 4.8 |
|---|---|---|---|
| Agents' Last Exam | 27.3 | 25.2** | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
** 表示官方图中 V4-Flash 文本版在 Agents' Last Exam 中会忽略其中的多模态元素,所以这一列不能和 Vision-Exp 简单当作同一能力。
官方还说明:文本模型的纯文本能力与 Vision-Exp 持平;在需要视觉理解的 Agent Benchmark 上,Vision-Exp 接近 Opus-4.8。API 里图片会转成 token 计费,一张图最多占 384 tokens,价格与 V4-Flash 一致。这意味着它不是“只会看图”,而是想把视觉塞进 Agent 工作流。
选型建议
| 你的场景 | 更值得优先试 |
|---|---|
| 想低成本跑综合 Agent、工具调用、视觉编码 | GLM-5.3-Flash |
| 想要 MIT 权重、自建文本 Agent、二次开发 | DeepSeek-V4-Flash-0731 |
| 想低成本做图像理解、图文 Agent 实验 | DeepSeek-V4-Flash-Vision-Exp |
| 想验证 6B 激活参数、稀疏注意力和多模态长上下文 | Qwen3.8-Flash-Next |
| 只想要当前能力天花板参考 | 先对照 Opus 4.8 / Fable 5,再用业务集复测 |
⚠️ 最后提醒:这些都不是我们独立复测成绩。Flash 模型的实际表现会受上下文长度、推理档位、Agent harness、工具权限和业务数据影响。先用 20–50 个真实任务做小样本验证,再决定迁移成本。
价格怎么改变账单
标准单价只是起点,Flash 模型的真实成本藏在输出长度、工具轮次和缓存命中率里。
- 固定 system prompt、重复文档、长多轮对话:优先看缓存命中价,DeepSeek 0.1 元 / 1M 最激进。
- 批量代码修复、批量摘要、批量评测:Qwen Batch 半价值得单独测算。
- GLM 限时 5 折:要同时按常规 0.8 元输入、2.8 元输出和折后口径测算,别把促销价当成永久预算。
价格来源:Qwen3.8-Flash、智谱价格页、DeepSeek 价格页。
如果这篇帮你省掉了半小时翻表时间,点个「赞」,再转发给正在选模型的朋友。也欢迎留言说说:你现在最看重 Flash 模型的价格、上下文,还是 Agent 成功率?