低至 0.1 元起!Flash 大模型杀疯了:Qwen、GLM、DeepSeek 谁最能干活?

0 阅读7分钟

缓存输入低至 0.1 元 / 1M tokens,Qwen、GLM、DeepSeek 三款 Flash 模型正面对比,看清便宜模型能不能真接活。

cover.jpg

缓存输入低至 0.1 元起,常规输入 0.8 元起,Flash 大模型已经便宜到“随手试错”都不心疼。真正该问的是:便宜跑得快之外,它能不能接住终端、代码仓、工具链和长任务?

我把近期三款 Flash 级模型的官方口径放在一起:Qwen3.8-Flash-Next、GLM-5.3-Flash、DeepSeek-V4-Flash-0731;另把 DeepSeek-V4-Flash-Vision-Exp 单列出来,因为它补上了 Flash 文本版的视觉短板,更接近 Qwen 和 GLM 的多模态产品形态。参考线选 Claude Opus 4.8 和 Claude Fable 5。一句话先说结论:Qwen 常规输出价最低且新架构激进,GLM 综合稳但 5 折是限时变量,DeepSeek 缓存 0.1 元最狠、常规输出却最贵。

先看底牌

模型官方规模 / 关键特性适合先关注
Qwen3.8-Flash-Next125B 总参数、6B 激活,另含 51B n-gram embedding 与 4B MTP;原生 262K 上下文,可扩展到 1M;带视觉编码器新架构试验、长上下文 Agent、多模态输入
GLM-5.3-Flash320B 总参数、18B 激活;1M 上下文;原生多模态;官方称 Artificial Analysis Intelligence Index v4.1.1 得 57低成本综合 Agent、视觉编码、长上下文
DeepSeek-V4-Flash-0731284B 总参数、13B 激活;官方模型卡称较 Preview 大幅增强 Agent 能力;MIT 许可文本代码 Agent、自建工作流、开源二开
DeepSeek-V4-Flash-Vision-Exp官方称纯文本能力与 Flash 正式版持平;视觉 Agent 大幅跃升并接近 Opus-4.8;实验性 API看图、看界面、做图文混合 Agent 实验

⚠️ 注意:Qwen3.8-Flash-Next 是实验性预览架构;生产用的 Qwen3.8-Flash 基于它,并额外提供 1M 上下文等官方能力。DeepSeek-V4-Flash-Vision-Exp 是 8 月 21 日上线的实验性视觉模型,下面我会单列成绩,不和文本版混在一起排名。

评测项到底测什么

评测项人话版解释
Terminal Bench 2.1在 Linux 沙箱里连续执行命令、排查环境,像真实运维
DeepSWE / v1.1在大型代码库里修 Bug、做重构,看软件工程硬实力
NL2Repo把需求变成/改成一个仓库级项目,不只写单文件
Toolathlon Verified多步 API 和工具调用工作流,看会不会编排工具
Agents' Last Exam长周期真实任务,考验持续规划、执行和纠错
SWE-bench Pro / Multilingual更难或多语言的软件工程修复任务
IFBench指令遵循,看是否按约束输出
GPQA Diamond高难科学推理,接近专家级问答
LiveCodeBench v6竞争性编程和代码推理
HLE多学科专家级推理;有工具版本则看工具增强后的增益
CyberGym开源项目漏洞发现与验证,偏安全攻防
AutomationBench跨应用业务流自动化,如表单、系统、工具协作
DSBench FullStack / Hard数据科学全流程和困难数据分析任务

核心结论前置

  • GLM-5.3-Flash 是综合口径最稳的选手。 官方常规输入 0.8 元、输出 2.8 元 / 1M tokens,另有 5 折限时两周;官方表中 Toolathlon Verified 78.4、Terminal Bench 2.1 84.3、DeepSWE v1.1 63.4、Agents' Last Exam 26.3,AA 指数 57。
  • DeepSeek-V4-Flash-0731 的文本 Agent 升级很明显。 官方模型卡显示 Terminal Bench 2.1 82.7、NL2Repo 54.2、DeepSWE 54.4、Toolathlon Verified 70.3、Agents' Last Exam 25.2,CyberGym 76.7,且权重采用 MIT。
  • Qwen3.8-Flash-Next 的价值在“用更少激活参数换更多能力”。 官方表中 SWE-bench Pro 62.5、SWE-bench Multilingual 81.0、IFBench 81.3、GPQA Diamond 91.7、LiveCodeBench v6 91.9;只有 6B 激活参数。

先看价格牌:统一人民币

三家的价格终于都能用人民币直接比了。

官方 API 模型缓存输入常规输入输出省钱开关
GLM-5.3-Flash0.23 元 / 1M0.8 元 / 1M2.8 元 / 1M5折限时两周
Qwen3.8-Flash0.4 元 / 1M*0.8 元 / 1M2.7 元 / 1MBatch调用半价
DeepSeek-V4-Flash0.1 元 / 1M3.0 元 / 1M9.0 元 / 1M空闲时段半价

* 缓存命中价格计算较复杂,暂按半价计算

👀 省钱看点:

  • 常规输入价:GLM / Qwen 都是 0.8 元,DeepSeek 是 3 元;常规输出则是 Qwen 2.7 元最低,GLM 2.8 元次之,DeepSeek 9 元最贵。
  • DeepSeek 缓存命中价最狠:0.1 元 / 1M,固定 system prompt、重复文档和长多轮对话优先看它。
  • GLM 的 5 折是限时变量,预算要同时按常规价和折后价各测一遍。
  • Qwen Batch 半价适合批量修复、摘要和评测;0.4 元缓存输入为估算口径。

⚠️ Qwen 的价格对象是 Qwen3.8-Flash 生产 API,也就是基于 Flash-Next 的官方 API 版,不等同于开源实验权重单独标价。

同类指标相邻:核心 Agent 表

下面把终端、软件工程、仓库级代码、工具调用、长任务放在一起。分数来自各模型官方页或你指定的参考资料;不同来源的评测 harness、版本和上下文不完全一致,看趋势比抠单分更稳

指标Qwen3.8-Flash-NextGLM-5.3-FlashDeepSeek-V4-Flash-0731Opus 4.8Fable 5
Terminal Bench 2.184.382.785.088.0
DeepSWE / v1.158.763.454.458.070.0
NL2Repo48.156.354.269.7
Toolathlon Verified73.578.470.376.277.9
Agents' Last Exam24.326.325.225.725.7

👀 怎么读这张表:

  • 终端与仓库级工程:Opus 4.8 仍是很硬的参考线;GLM Flash 在三款 Flash 里更均衡。
  • 工具编排:GLM Flash 78.4 很亮眼,接近 Opus 4.8 的 76.2 与 Fable 5 的 77.9。
  • 长任务:三款 Flash 都在 24–27 分区间,没有断代式差距。

专项能力补充

Qwen 官方语言表还给出几项很适合看“基础能力密度”的分数:

指标Qwen3.8-Flash-NextDeepSeek-V4-Flash-0731
SWE-bench Pro62.556.0
SWE-bench Multilingual81.0
IFBench81.379.2
GPQA Diamond91.790.8
LiveCodeBench v691.990.6

DeepSeek 官方模型卡则单独强调了两项内部/困难任务:DSBench-FullStack 68.7,DSBench-Hard 59.6;CyberGym 为 76.7,Opus 4.8 是 83.1。它们说明 DeepSeek-0731 的提升重点,不只在传统代码生成,还在真实 Agent 和安全任务。

GLM 官方博客的独立亮点是成本效率:AA Intelligence Index v4.1.1 得 57;官方还称这曾需要约 10 倍成本才能达到。自动化专项 AutomationBench v1.0.6 上,GLM Flash 为 48.8。但这项数据不能与 DeepSeek 官方表中的 AutomationBench Public 25.1 直接混成一个排名,因为版本口径不同。

Vision-Exp:DeepSeek 的多模态补丁

DeepSeek 官方公告给了三张很有信息量的多模态 Agent 分数:

指标V4-Flash-Vision-ExpV4-Flash-0731Opus 4.8
Agents' Last Exam27.325.2**25.7
Chartography64.365.0
ZeroBench (Pass@5)35.034.0

** 表示官方图中 V4-Flash 文本版在 Agents' Last Exam 中会忽略其中的多模态元素,所以这一列不能和 Vision-Exp 简单当作同一能力。

官方还说明:文本模型的纯文本能力与 Vision-Exp 持平;在需要视觉理解的 Agent Benchmark 上,Vision-Exp 接近 Opus-4.8。API 里图片会转成 token 计费,一张图最多占 384 tokens,价格与 V4-Flash 一致。这意味着它不是“只会看图”,而是想把视觉塞进 Agent 工作流。

选型建议

你的场景更值得优先试
想低成本跑综合 Agent、工具调用、视觉编码GLM-5.3-Flash
想要 MIT 权重、自建文本 Agent、二次开发DeepSeek-V4-Flash-0731
想低成本做图像理解、图文 Agent 实验DeepSeek-V4-Flash-Vision-Exp
想验证 6B 激活参数、稀疏注意力和多模态长上下文Qwen3.8-Flash-Next
只想要当前能力天花板参考先对照 Opus 4.8 / Fable 5,再用业务集复测

⚠️ 最后提醒:这些都不是我们独立复测成绩。Flash 模型的实际表现会受上下文长度、推理档位、Agent harness、工具权限和业务数据影响。先用 20–50 个真实任务做小样本验证,再决定迁移成本。

价格怎么改变账单

标准单价只是起点,Flash 模型的真实成本藏在输出长度、工具轮次和缓存命中率里。

  • 固定 system prompt、重复文档、长多轮对话:优先看缓存命中价,DeepSeek 0.1 元 / 1M 最激进。
  • 批量代码修复、批量摘要、批量评测:Qwen Batch 半价值得单独测算。
  • GLM 限时 5 折:要同时按常规 0.8 元输入、2.8 元输出和折后口径测算,别把促销价当成永久预算。

价格来源:Qwen3.8-Flash智谱价格页DeepSeek 价格页

如果这篇帮你省掉了半小时翻表时间,点个「赞」,再转发给正在选模型的朋友。也欢迎留言说说:你现在最看重 Flash 模型的价格、上下文,还是 Agent 成功率?