Benchmark 与 GPT 5.6:跑分之外,AI 正在改变的是"分工方式"
GPT 5.6 发布了,跑分又涨了一截。但真正值得关注的不是"最强模型"又换人了,而是 OpenAI 不再把 AI 当作一个单一的聊天模型来卖——它被拆成了按任务难度、速度和成本分级的工作系统。这篇文章从 Benchmark 的本质聊起,说说为什么跑分是门槛,但不是答案。
一、Benchmark:大模型的"高考"
每次新模型发布,厂商的宣传页都绕不开一串数字:MMLU、GPQA、HumanEval、AIME……这些就是 Benchmark——用标准题目给大模型打分的体系。
为什么需要 Benchmark?大模型太多了——GPT、Claude、Gemini、DeepSeek、Qwen——每家都说自己强,需要一个客观标准来比较。Benchmark 就是这个标准。
LLM 的能力是多维的,标准题也不同:
| Benchmark | 考什么 | 怎么考 |
|---|---|---|
| MMLU | 综合知识广度 | 57 个学科选择题,从初中历史到大学医学,相当于文理综合卷 |
| GPQA Diamond | 顶级推理 | 研究生级物理、化学、生物难题,网上搜不到答案,考的是真推理不是背答案 |
| HumanEval / SWE-bench | 代码能力 | HumanEval 164 道编程题,要写出能跑通的代码;SWE-bench 直接修真实 GitHub 项目的 bug |
| MATH / AIME | 数学推理 | 竞赛级数学题,考模型能不能一步步推导出正确答案,而不是凑结果 |
| C-Eval | 中文能力 | 52 个学科、4 种难度,专门针对中文语境 |
厂商怎么用 Benchmark?
每次模型发布,厂商都会挑表现最好的那几项重点放大。"XX 模型在 XX 测试上排名第一"——这不代表整体最强,可能只是在某一项考试里拿了最高分。
Benchmark 的本质是门槛,不是排名。 一个模型连 Benchmark 都差,大概率能力也不行。但分数高,不等于好用。要多维度地看,更要结合实际业务和真实体验来判断。
二、GPT 5.6:不再是"一个模型",而是一套分工系统
GPT 5.6 发布后,讨论集中在几个问题上:跑分涨了多少?代码能力有没有超过 Claude?谁又成了"最强模型"?
这些问题很重要,但更值得关注的是另一件事:OpenAI 不再把 AI 当作一个单一的聊天模型了,而是把它做成了一套能够按任务难度、响应速度和成本来分派的工作系统。
GPT 5.6 被拆成了三个层级,每个层级有相对固定的能力档位:
Sol → 最难的任务(多份材料交叉分析、反复调用工具和检查结果)
Terra → 日常工作(写文档初稿、普通代码、整理数据)
Luna → 高频调用(分类、提取固定字段,更快更便宜)
这改变了用户的选择方式
过去用 AI,我们往往只问一句:"哪个模型最强?" 然后不管什么任务都往最强模型里扔。
但实际上:
- 把一万条用户反馈做分类、从合同里提取固定字段——Luna / Terra 就够了,根本不需要最强推理
- 写一份常规文档初稿、普通代码、整理数据——均衡模型就够用
- 只有碰到多份材料交叉分析、问题本身还不清楚、需要反复调用工具和检查结果的任务——才值得用 Sol
以后团队之间拉开差距的,不是谁一直在用最贵最强的模型,而是谁知道该把什么任务分给什么模型。
三、工具协作:AI 从"顾问"变成"执行者"
GPT 5.6 还有一个更大的变化——工具的协作能力明显增强了。
以前的模式是"可编程工具调用":模型调用一个工具,拿到结果,再等用户决定下一步。AI 更像一个顾问,你问一步,它答一步。
GPT 5.6 的方向变了:模型可以在中间写一些轻量程序,过滤无关数据、整理中间结果,再接着推进任务。它不是只回答问题了,而是参与流程。
拿行业研究举例——最费时间的通常不是写结论(回答),而是前面的过程:找资料、判断来源靠谱与否、整理表格、发现信息矛盾再去补查,最后才是搭结构和写初稿。
AIGC → AGI 的过渡,关键不只是"更聪明",而是能不能像一个能拆任务、会调用工具、会检查过程的执行者(ReAct 模式)。
四、真正的成本不是 Token 账单
能自己调用工具,和能放心让它自己运行,是两回事。
看成本,不能只看 API Token 账单。AI 的实际成本应该是:
AI 实际成本 = LLM API Token 账单
+ 多轮会话的反复提示词
+ 工具失败后的返工
+ 人工检查的时间
+ 一条工作流稳定跑完的时间
GPT 5.6 关注的不只是"更聪明",而是试图把复杂任务的交付成本降下来。它在代码、浏览、计算机操作、文档、表格、演示这些具体场景里发力,让 AI 参与到工作流程中——更自动化、开销更少。
Benchmark 跑分涨了几个点,用户其实感知不到。但当一条工作流从"需要人工盯 5 次"变成"自动跑完全程",这才是真实的生产力变化。
五、总结
| 维度 | 过去的思路 | 现在的变化 |
|---|---|---|
| 选模型 | 哪个最强用哪个 | 按任务难度分派给不同层级的模型 |
| 看跑分 | 把 Benchmark 当排名榜 | Benchmark 是门槛,过线后看实际效果 |
| 用 AI | 一问一答,AI 是顾问 | 拆任务、调工具、查过程,AI 是执行者 |
| 算成本 | 看 Token 单价 | 看整条工作流的交付总成本 |
| 比能力 | 比谁更聪明 | 比谁能把结果控制住、成本好核算 |
大家比的不再只是"模型有多聪明",而是谁能够把它用进具体任务里,并且把输出质量控制住、把成本核算清楚。
不同层级的模型,将会以虚拟员工的方式协作——你不再只是用户,你是在带一个团队。