GPT-6 Astra 发布,标题一个比一个猛:"欢迎来到 AGI 时代"、"吊打 Claude"。
我把两边跑分对了一遍账,结论先放这:
牛不牛,取决于看谁出题。官方口径领先是真的,但第三方统考还没超 Claude。
官方出题:领先集中在三个赛道
OpenAI 自己测的,数学和科研是真量级差:
- FrontierMath T4:97.6% vs Claude Fable 5.1 的 87.8%
- Terminal-Bench Science 0.1:64.6% vs 52.6%
- 网络安全:达到自家 Critical 阈值,ExploitBench 满分
注意:ARC-AGI-3 的 98.6% 带脚注——改了两个 harness 设置;ExploitBench 带"可能污染"警告
第三方统考:打平偏下风
Artificial Analysis 的数据是另一回事:
| 指标 | Astra | Fable 5.1 | Opus 5 |
|---|---|---|---|
| 智能指数 | 61.2 | 65.7 | 63.1 |
| 编程 Agent 指数 | 67.0 | 67.2 | 68.1 |
| HLE 带工具 | 57.2% | 65.0% | — |
官方对比图里,这几项基本没出现。领先最大的进主图,打平落后的放附录——这招各家通用
比跑分更实在的信号:价格涨了 150%
- Astra:输入 50(每百万 token),Fast 模式翻倍
- GPT-5.6 Sol:促销价 20,延续到 11/21
- Claude Fable 5.1:50,跟 Astra 同价
三方价格一摆就明白了:OpenAI 一面喊 AGI,一面不敢放弃价格战。旗舰涨价,促销款继续承接流量。第三方按实际 token 算,Astra 单任务成本比 Sol 高约 75%。
给你的三个实操建议
- 别转官方对比图当结论,等独立复测
- 数学/科研/安全:Astra 是真香,冲
- 通用 Agent/知识工作:两边差距不大,看价格和缓存策略下单
一句话:跑分决定它值不值得关注,任务匹配和真实成本才决定你该不该掏钱。 等第三方复测出来,我再用实际任务跑一遍对比。