按常理,一个模型家族里最热闹的应该是旗舰线,Google 这半年偏偏反着来。打开 2026 年 9 月 17 日的 Gemini API 模型列表,Pro 线的最新版本还是今年 2 月发布的 Gemini 3.1 Pro,状态一栏挂着 Preview;Flash 线从 5 月的 3.5 开始,7 月 3.6,8 月 3.7,9 月 3.8,四个月连发四代,清一色 Stable。
一边是七个月没出正式版的旗舰,一边是接近月更的轻量线,而且新 Flash 的能力还在一路逼近 Pro。这就把一个老问题变难了,写代码的人现在到底该选哪个。
先把两条线的家底摊开。
今年 Flash 更了四代,Pro 只更了一代
| 系列 | 模型 | 发布 | 状态 | 官方定位 |
|---|---|---|---|---|
| Pro | Gemini 2.5 Pro | 2025-06 | Stable | 深度推理、Coding、数学 STEM、长上下文 |
| Pro | Gemini 3 Pro Preview | 2025-11 | 已下线 | Gemini 3 第一代旗舰 |
| Pro | Gemini 3.1 Pro Preview | 2026-02 | Preview | 更强推理、Coding、Agent、可靠工具调用 |
| Flash | Gemini 2.5 Flash | 上代 | Stable | 低延迟、高吞吐、性价比 |
| Flash | Gemini 3 Flash Preview | 2025-12 | 已弃用 | Gemini 3 第一代 Flash |
| Flash | Gemini 3.5 Flash | 2026-05 | Stable | Coding、Agent、长时间任务 |
| Flash | Gemini 3.6 Flash | 2026-07 | Stable | Coding、Agent、空间推理 |
| Flash | Gemini 3.7 Flash | 2026-08 | Stable | 原生多模态推理 |
| Flash | Gemini 3.8 Flash | 2026-09 | Stable / GA | 长程软件工程、自主 Agent、企业工作流 |
几个状态值得单独拎出来。3 Pro Preview 已经在 2026 年 3 月 9 日关闭,现在还调 gemini-3-pro-preview 的话,实际会被指到 3.1 Pro 上去。Flash 这边的 3 Flash Preview 也进了弃用名单,官方给的替代是 3.6 Flash。说真的,不管你手上是哪个老版本,往前走都只剩两条路,3.1 Pro Preview,或者 3.5 之后的某代 Flash。
Pro 线更新慢,但每一刀都砍在要害上
Pro 的演化路径很短,2.5 Pro,3 Pro,3.1 Pro,三步走完。
2.5 Pro 是 2025 年 6 月转正的上一代旗舰,定位就是复杂代码、数学 STEM、长文档和大代码库推理,1,048,576 token 输入,65,536 token 输出,Thinking、Function Calling、Code Execution、Search Grounding 一应俱全。放到今天它还稳稳挂在 Stable 名单里,很多生产系统跑的就是它。
3 Pro Preview 是 Gemini 3 架构的第一版旗舰,2025 年 11 月发布,生命周期短得有点尴尬,今年 3 月就下线了。
真正值得看的是 3.1 Pro Preview。Google 官方对它的改进描述是一条链,thinking,token 效率,事实一致性,软件工程,Agent 工具调用,多步执行,一层层叠上去。更有意思的是它单独拆了个变体出来,gemini-3.1-pro-preview-customtools,专门服务 bash、view_file、search_code 加自定义工具这种 Coding Agent 场景。一个通用旗舰专门为 Agent 工作流开小灶,这个信号比任何跑分都直白。
但有个现实绕不过去。
3.1 Pro 到今天仍然是 Preview。而且 Google 当前没有 3.5 Pro、3.6 Pro、3.7 Pro、3.8 Pro 任何一款公开的 Gemini API 模型。旗舰线的策略不难读,不跟 Flash 拼发布节奏,把能力上限慢慢做扎实。
Flash 的转折点在 3.5,从快模型变成 Agent 模型
2.5 Flash 是上一代的生产主力,卖点就三个字,性价比。聊天、摘要、RAG、信息抽取、普通编码,大批量的 API 请求都归它管。它跟 Pro 的差别不在于能不能干,在于最难题目上的推理天花板。3 Flash Preview 是 Flash 跨进 Gemini 3 架构的第一版,新项目已经没有选它的理由,弃用页给的替代方向就是 3.6 Flash。
真正的转折发生在 3.5 Flash。2026 年 5 月转正之后,Google 对它的官方描述重心从 fast multimodal model 换成了 agentic execution、coding、long-horizon tasks。翻译一下,模型不再只负责快速回答问题,而是要跑完一整个循环,规划,调工具,看结果,再推理,再调工具,直到任务完成。官方还特别点名它适合 sub-agent 部署、多步工作流和复杂编码循环。
快不再是 Flash 的全部卖点。这是这条产品线的身份转折。
3.6 Flash 在 7 月跟上,关键词变成 code generation、agentic execution、spatial reasoning、rapid agentic loops。你拿一个修 bug 的任务想想就明白了,Agent 要搜 repo,读十几个文件,定位代码,改,跑测试,测试挂了读日志,再改,再跑,直到绿。这种多轮迭代的长链路任务,跟一问一答的 chatbot 已经是两个物种。3.6 明显是照着 Coding Agent 的执行模型在调的。
3.7 和 3.8,Flash 开始干 Pro 的活
8 月 13 日发布的 3.7 Flash,官方描述很克制,就说这是 Gemini 3 系列原生多模态推理模型的下一次迭代。但能力清单一点不克制,Low、Medium、High 三档 Thinking,1M 上下文,64K 输出,Computer Use、Code Execution、File Search、Function Calling、Google Search grounding、Maps grounding、Structured Output、URL Context 全部在列。这个规格放在两年前就是旗舰,如今挂在 Flash 名下。
然后是 9 月 2 日的 3.8 Flash,目前已经 GA。
Google 给它的定位一句话说完,long-horizon software engineering,autonomous agents,complex enterprise workflows,并且直接称它为 “our most intelligent Flash model”。
它跟 3.7 最大的差别不在单项能力,在长时间自主执行的可靠性。以前模型跑长任务的死法你都见过,规划完一路调工具,中间跑偏,死循环,或者开始编造结果。3.8 强调的是每一步更细的推理,工具调用之间回头检查结果,不对就调整计划,干完一段先自我验证再继续。官方的说法是,它会在困难的长程任务里采用更细的 reasoning steps、迭代式工具调用,并验证自己的工作,来减少 Agent loop 的失败。
一句话总结这四代,3.5 Agent 化,3.6 强化 Coding Agent,3.7 补多模态推理,3.8 把长程执行的可靠性焊死。Flash 这半年是一条完整的叙事线。
规格拉平之后,剩下的差异是定位差异
以前的认知模型很好建,Pro 最聪明也最慢最贵,Flash 稍弱但快且便宜。现在这堵墙漏得厉害。
看规格,3.1 Pro 是 1,048,576 上下文加 65,536 输出,3.8 Flash 一模一样。Thinking、Code Execution、Function Calling、Search Grounding、Structured Output,两边都有。真正拉开差距的不是功能清单,是推理天花板和单 token 成本。
把最近几代放一起看(星级是我的定性概括,只表达产品定位差异,不是官方 benchmark)。
| 模型 | 推理 | Coding | Agent | 长任务 | 速度成本 | 当前角色 |
|---|---|---|---|---|---|---|
| 2.5 Pro | ★★★★★ | ★★★★★ | ★★★★ | ★★★★★ | 较高 | 上代 Stable 旗舰 |
| 3.1 Pro | 最高档 | 最高档 | 最高档 | 最高档 | 较高 | 当前 Pro,Preview |
| 2.5 Flash | ★★★ | ★★★ | ★★★ | ★★★ | 优秀 | 上代性价比款 |
| 3.5 Flash | ★★★★ | ★★★★ | ★★★★ | ★★★★ | 优秀 | 3 代 Agent 基础 |
| 3.6 Flash | ★★★★ | ★★★★+ | ★★★★ | ★★★★ | 优秀 | 强化 Coding |
| 3.7 Flash | ★★★★+ | ★★★★+ | ★★★★+ | ★★★★+ | 优秀 | 综合升级 |
| 3.8 Flash | ★★★★+ | ★★★★★ | ★★★★★ | ★★★★★ | 优秀 | 当前 Flash 主力 |
所以现在的问题已经不是 Flash 能不能干这个活。
问题变成,这个任务值不值得花 Pro 级别的推理成本。Pro 守住的是极难推理和极难 Coding 那一小块高地,Flash 把其他所有场景的速度和成本卷到了地板上。
选型建议,写代码的直接抄
日常 IDE 编码、生成代码、Code Review、搜 repo、跑测试、修 bug、Agent 多轮执行,优先测 gemini-3.8-flash。特别难的架构设计、复杂算法、那些需要大量前置推理才敢动手的 bug,再上 gemini-3.1-pro-preview。如果是海量的简单任务,分类、抽取、文档解析、简单 sub-agent,往下沉,Flash-Lite 更划算,Google 当前同时供着 3.5 Flash-Lite 和 3.1 Flash-Lite 两条。
还有一个工程上容易被忽略的点。3.8 Flash 是 Stable 正式版,3.1 Pro 是 Preview,对生产系统来说这不是小字注脚,直接影响版本锁定和迁移策略,Preview 模型的行为变更和下线节奏都不由你。
最后说两句。
Google 这半年的产品策略其实很好读,Pro 是能力上限的宣言,发布可以慢,Flash 是交付的主战场,节奏必须快。对应到选型,先问任务需要多少推理,再问预算扛不扛得住,最后才问哪个模型最强。顺序反了,账就算不平。
真要横评的话,下一步更值得看的是 Gemini 3.8 Flash 和 3.1 Pro 对上 Claude、GPT 的同档位,盯 SWE-bench、工具调用成功率和每百万 token 成本,那才是 Coding Agent 换模型的决策依据。