GPT-6 Astra 全网都在说吊打 Claude——我把两边跑分对了一遍账

0 阅读1分钟

GPT-6 Astra 发布,标题一个比一个猛:"欢迎来到 AGI 时代"、"吊打 Claude"。

我把两边跑分对了一遍账,结论先放这:

牛不牛,取决于看谁出题。官方口径领先是真的,但第三方统考还没超 Claude。

官方出题:领先集中在三个赛道

OpenAI 自己测的,数学和科研是真量级差:

  • FrontierMath T4:97.6% vs Claude Fable 5.1 的 87.8%
  • Terminal-Bench Science 0.1:64.6% vs 52.6%
  • 网络安全:达到自家 Critical 阈值,ExploitBench 满分

注意:ARC-AGI-3 的 98.6% 带脚注——改了两个 harness 设置;ExploitBench 带"可能污染"警告

第三方统考:打平偏下风

Artificial Analysis 的数据是另一回事:

指标AstraFable 5.1Opus 5
智能指数61.265.763.1
编程 Agent 指数67.067.268.1
HLE 带工具57.2%65.0%

官方对比图里,这几项基本没出现。领先最大的进主图,打平落后的放附录——这招各家通用

比跑分更实在的信号:价格涨了 150%

  • Astra:输入 10/输出10** / 输出 **50(每百万 token),Fast 模式翻倍
  • GPT-5.6 Sol:促销价 4/4/20,延续到 11/21
  • Claude Fable 5.1:10/10/50,跟 Astra 同价

三方价格一摆就明白了:OpenAI 一面喊 AGI,一面不敢放弃价格战。旗舰涨价,促销款继续承接流量。第三方按实际 token 算,Astra 单任务成本比 Sol 高约 75%。

给你的三个实操建议

  1. 别转官方对比图当结论,等独立复测
  2. 数学/科研/安全:Astra 是真香,冲
  3. 通用 Agent/知识工作:两边差距不大,看价格和缓存策略下单

一句话:跑分决定它值不值得关注,任务匹配和真实成本才决定你该不该掏钱。 等第三方复测出来,我再用实际任务跑一遍对比。