按以往的历史,每次 OpenAI 发布新模型,我都是失望的!每次都是被 O 哥(Claude 家的)吊打!
但是这个直接从 5.6 -> 6,确实有点不一样了!
我们先不管“AGI”和“电脑操作”这些东西,重点是来对比一下我们之前测试过的例子!
结论:确实挺强!
正常情况下,我会先做一个专门的卖家秀段落,介绍模型的基准表现和网络评论等。但是这个 GPT-6 的基础信息已经非常多了,我想大家肯定也看过不少了。
我也分别让 Opus 5,Grok 4.6 以及 Gemini 3.8 给大家总结过了,我就不发太多了,简单地贴几张图作为背景信息吧!
第一张:核心基准数据!
官方能摆在这里的,自然是最亮眼的数据。
GPT-6 是全面大幅度领先,全部都是 SOTA,用华为的话来说是“遥遥领先”!
次新的 Sol 和最新的 Fable 5.1 都被吊打了,更不用说其它国产模型了。
只能说大家都跑太快了,最可怕的是 OpenAI 和 Anthropic 最新的模型都有意隐藏思维链,做了专门的防蒸馏措施,以后怕是不好弄了。
这里面最离谱的一个基准是 AGI3,99%比 7.8%!真的是“遥遥领先”!
而且这个模型还很全面的:
| 基准 | 主要领域 | 主要看什么 |
|---|---|---|
| Terminal-Bench Science 0.1 | 科学研究 | 在终端环境里完成真实科学工作流,例如数据处理、实验分析、科研工具使用 |
| AutomationBench | 商业自动化 | 处理企业/办公工作流,偏 Agent 自动执行真实业务任务 |
| FrontierMath Tier 4 v2 | 高阶数学 | 研究级数学推理,属于非常硬核的数学能力测试 |
| Terminal-Bench 4.0 | 编程 / 计算机操作 | 在真实终端里写代码、调试、配置环境、操作系统工具,偏 Coding Agent |
| HealthBench Professional | 医疗 | 专业临床场景下的医学推理、判断和回答质量 |
| BenchCAD | 3D / CAD | 理解并完成 CAD、3D 建模相关任务,属于空间与工程设计能力 |
| ARC-AGI-3 | 通用推理 / 智力 | 面对从未见过的新型交互谜题,测试抽象推理、规则发现和快速学习能力 |
从科研、商业自动化、数学、编程、医疗、3D 建模,再到通用抽象推理,GPT-6 几乎每个维度都拿出了很强的成绩。它这次最大的特点可能不是某一个单项特别夸张,而是能力版图明显更完整了。 合理怀疑,这次的模型参数很大,所以能力是多维度提升的。
第二张图:
这张图主要表达的是 AutomationBench 上的“效果 vs API 成本”,重点不是只看谁分高,而是看花多少钱能做到多高的自动化任务准确率。
横轴 API Cost:完成这类任务的 API 成本,越靠左越便宜。
纵轴 Accuracy:准确率,越高越好。
所以理想位置就是:左上角,又便宜又强。
OpenAI通过这张图就是想告诉我们:GPT-6 又强,又便宜,相比对手 Claude 家的模型!
第三张图:
这张图主要是想表达:它宁愿承认任务搞不定,或者继续尝试正确目标,也不会为了“完成 KPI”去攻击旁边没有授权的系统。这一点确实值得思考,很多模型还没有走到这一步! 这个基准可以让你更放心地使用这个模型!
大概就是这些吧!
AI 模型发展到这个阶段,已经不再是单纯的比能力了,而是比性价比,比安全性。
但是,话又说回来,没有能力作为基础,其它都是扯淡!
接下来就赶紧来测试一下实力了。
为了方便对比,今天主要是跑一些我们之前跑过的例子。
1、赛博朋克版清明上河图
这个是我的必考题!
因为这个题目,还远远没有到达上限,而且永远不会达到上限。 基础能力和基础基准会有明显的边界。但是这个题目测试的概念融合、空间感、创意这些东西是没有绝对的顶部的。
一般小一点模型,脑子不够用,想象力不够,基本上做不好这个题目。
就像 GLM5.3,虽然后训练已经很厉害了,前端效果也很不错了。但是它在这个例子上表现依旧很普通。所有 Flash 都不行,当然即便是 K3,Qwen 3.8 Max 这种参数很大的,也不一定能做好。因为有了脑子还不够,还要有其它东西。
下面打开 Codex 直接开测试:
这个例子,总共用了 11 分钟左右。
结果如下:
这个空间感、细腻程度、审美,都非常不错! 真的有一幅画的感觉了。 它里面建筑、人物、船、飞行器轮廓和细节都是做得比较到位的!
它最大的缺点可能就是:赛博味儿不够!
其他方面的话,就是整个卷轴有点短,而且房子的辨识度不是太高,没有那种错落有致的感觉。
整体来说,优点远大于缺点,属于数一数二的存在了!
为了让大家有更好的对比,我放一个 GPT-5.5 的效果:
这么一比是不是云泥之别了!
下面是国产模型中前端最厉害的 K3 的效果:
设计好像还行,但是空间感很差,很扁平,内容很少。
这是 Opus 5 的效果:
它的内容也是非常丰富的,烧烤摊都清晰可见,空间跨度也很大啊。不同建筑都是有明显差异的。GPT-6 更偏古风,它更偏赛博风格!
这个细节,单看图片感受还不强烈。大家可以去网页上查看!
2、甲维斯的车库
这个例子是让 AI 帮我创建一个在线版的 3D 车库。可以切换载具和视角!主要考察网页复刻能力、3D 建模能力、世界知识。
测试题目是这样的:
我在网上看到一个很有意思的例子,就是有人做了一个在线车库,可以快速切换车库中的各种车辆,以及显示这个载具的数据,中间显示具体的内容,可以通过鼠标拖动查看不同角度,然后可以切换涂漆,可以切换视角,可以自动旋转展示!网页配色,布局,内容我希望你尽可能还原参考图 2.png,不同之处在于车库里的车子,以及骑车的人,以及车库的名字。
车子我希望你做一辆自行车,一辆电瓶车,一辆机车,一辆三蹦子,一辆五菱宏光,一辆特斯拉,一辆小米,一辆保时捷,一套钢铁侠的经典战甲。具体型号你自己定,要主流的型号。
骑车开车的人物根据参考图 1.jpg 的头部形象进行设计,做一个 3D Q 版卡通想象。车库的主人是 Jarvis。
我的需求就是这样,细节你来完成,我只负责验收。使用单个 HTML 和前端技术完成,只输出最终结果页面。
两张参考图是这样的:
它的结果是这样的:
整体来说布局和颜色还原度很高,建模效果非常好! 就是有两个地方自作主张了,第一个是左下角的颜色多了两种,另外一个是中间顶部加了一些东西。 顶部加的这个东西,是很屌的。我后面再说。
先给大家看一下 GPT-5.6 Sol 的效果:
这么一对比,建模能力是不是质的飞跃了。
这是 Fable 5 的效果:
Fable 5 这一块做得也挺好的。
然后我们重点来说说 3D 建模!
这个 3D 建模应该是历史最佳了!(Fable 5.1 我没测)
无论是人物建模还是汽车建模,都很不错。 之前有些模型的人物建模真的非常抽象,这次好了很多,这方面比 Fable 5 的效果要好。
然后来说说它加的部分:
它添加了几个功能按钮。
可以把汽车外壳去掉,露出底盘,还可以把整个汽车拆解开来。
然后提供了深色和浅色两个主题,还能下载图片。 拆解效果一般,但是有那么点意思了!
只能说,非常全面,非常完善!已经超预期了。
天文机械表
然后我们再来跑一波天文机械表这个例子。
提示词:
用单个 HTML 文件实现一只机械腕表风格的天文时钟,纯原生实现,不许使用任何库、框架或 CDN。要求:
1. 主表盘读取本地系统时间,秒针平滑扫秒,使用 requestAnimationFrame 驱动,且长时间运行不得累积漂移;切到其他标签页再切回来时,指针必须立即校准到正确时间。
2. 包含一个月相小表盘,根据当前日期计算并显示月相连续变化,公式需要自行实现,精度要求误差控制在 1 天内。
3. 包含一个可用的计时码表,通过子表盘指针显示,支持开始、暂停、继续、归零与计圈(lap),按钮在任意顺序点击都不能出现状态错误。
4. 日期窗显示当前日期,正确处理大小月与闰年。
5. 包含昼夜 / 日出日落指示,用户可在三到四个预设城市之间切换,并根据经纬度现场计算当地日出日落时刻。
6. 页面需要响应式,并尊重 prefers-reduced-motion:开启时秒针改为跳秒并关闭装饰动画;同时为各表盘补充 ARIA 标注。
7. 整体视觉要像一只真实的高级腕表,而不是普通练习作业。
只输出最终代码,不要解释。
结果:
这个例子考点众多!
GPT-6 这一轮下来近乎完美! UI 设计到位,布局没有混乱,各种功能点正常,样式也挺好看的。
唯一美中不足的是,它的秒针的身体缺了,头和尾巴都正常。就是红色箭头这一部分没了。
它告诉我:
码表已通过 20,000 次混合操作检查,四座城市的闰日与夏令时场景也已通过!
这个例子总共消耗了 20 分钟,看了下,大部分时间都用在检查了。
我这个例子, GPT-5.5 也跑过,效果如下:
GPT5.5的结果,错误也并不多。但是这个布局是有点紊乱的,设计也不是很好。相比而言 GPT-6 这个好太多了!
然后补充下,这个例子 Opus 4.8 就已经可以接近满分了,所以我就没跑 Opus 5 和 Fable 5。
总得来说。这三个例子都比之前的版本好很多。
因为我本身对它的前端设计是没有任何期待的。所以这次突然给我一个中上水平,我就已经觉得它“惊为天人”了!
虽然我还没有专门测试网页设计,但是从前面几个例子来看,目测它的前端设计能力应该是有了一些改进了。
本来我是准备再多测几个例子的,奈何 Plus 说话没底气啊。我就跑了下面这个例子,一下子就把五小时给干完了。
这个图片是 GPT-6 的发布页的首屏效果。
这是一个动态流转的星云效果。刚开始是分散的,然后会聚集成一个 6 字星云。滚动条往下滚又会分散开来,然后又会汇聚成一个箭头和 GPT 的 logo。这个效果非常炫。
我就希望 GPT-6 也帮我抄一个。
没想到的是,网页还没搞好,五小时配额干完了!
东西是牛逼,但是真的用不起啊。
虽然它的数据中显示这个模型的单任务成本要比 Fable5.1 低很多,但是 API 价格摆在那里,便宜不到哪里去,就是花钱如流水的感觉。
便宜没好货,好货不便宜啊,这是真理啊! 这个底层规律,永远有效。
GPT6确实不错,我已经看了太多3D建模和3D游戏的效果了,看的流口水,等我魔法恢复了,我也要搞几个。