Gemini 3.7 Flash 拆解:API 价格砍半,跑分超 Sonnet 5——但先别急着吹

3 阅读4分钟

刚看到价格,输入 0.75/百万 token,输出 3.75/百万 token。到年底前的促销价,元旦后恢复原价翻倍。 $0.75 低于目前所有主流中国模型的 API 价格。HN 上有人说"建一个网站成本不到一杯茶"——夸张了,但量级是对的。

我算了一笔账。一个编码 Agent 任务,读上下文 + 调工具 + 生成 + 校验,大概 30K 输入 + 5K 输出。用 3.7 Flash 单次成本约 0.04,Sonnet 5 是 0.17,GPT-5.6 Terra(OpenAI 目前的旗舰编码模型)是 $0.30。 单次差距不大。但我之前给团队做过一个文档批处理 Agent,高峰期一天跑 800 多个任务。按月算,3.7 Flash 大概 ¥7,000(按汇率 7.2 估算),Sonnet 5 要 ¥30,000 出头。差了两万多。 **如果你现在用 Sonnet 5 跑 Agent 后台,该认真考虑换 Flash 了。**不是因为它"更好",而是因为你大概率不需要为一个 Agent 后台任务付 4 倍的价格。

跑分:有干货,也有水分

Google 给了不少 benchmark。我挑跟日常开发相关的几个,加一点自己的判断。

FrontierCode 1.1 Main(Cognition 出的生产代码质量测试):3.7 Flash 43.6%,Sonnet 5 42.7%,Terra 41.3%。 差 0.9 个点,统计上不一定显著。Google 把这个数字放 model card 最顶上,心思很明显——Flash 定价只有 Sonnet 的 1/4,打平就算赢。中文媒体已经开始写"Flash 击败旗舰"了,建议别被带节奏。

WebDev Code Arena(网页开发 Elo):3.7 Flash 1588,Sonnet 5 是 1541。 47 分 Elo 差距在网页开发领域是实在的。Google 在这块进步确实快——3.5 Flash 那会儿生成的前端页面布局经常崩,到 3.7 已经能出像样的东西了。经常让 AI 生成前端页面的朋友应该能感知到。

AutomationBench(Zapier 做的企业自动化测试):3.7 Flash 30.4%,Sonnet 5 只有 10.7%。 这是 3.7 Flash 最有说服力的数字。Zapier 每天处理几百万次自动化任务,选模型最看重首次成功率——失败了重试的成本比单价重要得多。30.4% vs 10.7%,近 3 倍差距。

DeepSWE v1.1(真实软件工程):3.7 Flash 65.3%,Terra 69.6%。 到了复杂工程场景,旗舰还是旗舰。4 个多点的差距在这里是有意义的。 有个反对声音:外部评测机构 LuminaBench 说 3.7 Flash"令人失望",多项测试仍落后于 Terra,整体缺乏亮点。这个声音中文圈基本没报道。

另外顺带说一下 Google 的策略:三周一更新,Flash 从 3.5 到 3.7,迭代频率比很多 SaaS 产品还高。与此同时旗舰 Gemini 3.5 Pro 反复延期。Flash 高频迭代 + 低价 + 全产品线铺开(Workspace、Android、Spark 个人 Agent),就是在用中端抢用户生态。策略不丢人,模型暂时不够强就先走量和生态。

可调节思考配置——这个功能值得单独说

之前 Flash 系列的推理深度是固定的。简单问题它也"想"那么多 token,复杂问题也只想那么多。 3.7 Flash 加了 thinking budget 配置,可以根据任务类型动态调整:

from google import genai

client = genai.Client()

# 简单格式转换,轻量思考就够
response = client.models.generate_content(
    model="gemini-3.7-flash",
    contents="把这个 JSON 转成 CSV 格式",
    config={"thinking_budget": 1024}
)

复杂任务把 budget 调高就行,比如架构分析给到 8192。关键是你可以在同一个 Agent 流程里按步骤动态调整——格式转换、字段映射用 1024 快速过,代码生成和决策用 8192 深入想。之前用 Sonnet 5,每个步骤都在按旗舰价付"思考费",现在成本结构完全不一样了。 具体省多少看你工作流构成。我自己跑的 Agent 流程里大概六成步骤是简单操作,光这个功能就能把总成本砍掉 30-40%。 模型基础规格:100 万 token 上下文,64K 输出上限,支持文本/图片/音频/视频多模态。知识截止 2026 年 3 月,距今 5 个月了,涉及最新 API 变更的场景得自己补上下文。

什么场景直接用,什么场景别用

直接上 3.7 Flash 的

  • Agent 后台高频调用。年底前半价窗口,不用白不用
  • 前端页面生成。Elo 1588 在这个价位能打
  • 文档批量处理。100 万上下文 + 低价,天然匹配

别用 Flash 的场景

  • 大型代码库重构、复杂 Debug。Flash 在 DeepSWE 上比 Terra 差 4 个点,这种场景别省那几块钱
  • 多模态桌面操作 Agent。Sonnet 5 在 Agent's Last Exam 上 33.3%,Flash 只有 26.3%
  • 2027 年恢复原价后还值不值——这个 Google 没给承诺,到时候再说