Claude Opus5 “便宜”稳定的最强“AGI”!

0 阅读6分钟

Kimi K3 这么强,对 K3 用户和 Claude 用户都是好事情。Opus 5 这不就来了嘛!

我一直说 K3 虽强,但是 Claude 更全面,更稳定,自主性更强。

今天 Claude Opus 5 ,它的第一句话就是这样的:

它是一个深思熟虑且主动的模型,以一半的价格接近了 Fable 5 的前沿智能。

看介绍,只要重点看第一句就可以了!

深思熟虑、主动、价格便宜(相对),这才是我的主力模型!

不出错,不犯傻,稳定,才是综合性价比最高。

1、基准数据

重点看完了,就可以看一下细节了:

Opus 5 在大多数 Agent 类任务中领先,尤其是“自主执行任务”和“复杂推理”方向。

多个维度比 Fable 5 还强,这是有些让人意外的!

Fable 5 曾被宣传成不敢发布的怪物,没想到现在 Opus 5 轻轻松松就超过它。

这个表格其实强弱很好看,它都给你标了。

我可以给大家稍微解读一下:

1、终端智能编程(Agentic terminal coding)

这是最重要的一项。

  • Opus 5:43.3%
  • Fable 5:33.7%
  • Opus 4.8:21.1%
  • GPT-5.6 Sol:34.4%

说明:

Opus 5 在类似 Claude Code 这种场景里提升巨大,能更好地:

  • 理解大型代码库
  • 修改多个文件
  • 调试
  • 自主完成开发任务

这也是 Anthropic 主推的能力。

2、知识工作能力

GDVal-AA v2:

  • Opus 5:1861
  • Fable 5:1747
  • GPT-5.6 Sol:1736
  • Opus 4.8:1593

代表:

写报告、分析资料、处理复杂办公任务的能力提升

3、新问题解决能力

ARC-AGI-3:

  • Opus 5:30.2%
  • Opus 4.8:1.5%
  • GPT-5.6 Sol:7.8%

这一项比较特殊,测试模型面对陌生规则、没有训练经验的问题。

Opus 5 提升非常明显。

4、Agent 搜索能力

BrowseComp:

  • Opus 5:90.8%
  • GPT-5.6 Sol:90.4%
  • Fable 5:87.4%

说明:

联网搜索、信息整理能力已经接近顶级水平。

5、电脑操作(Computer Use)

OSWorld 2.0:

  • Opus 5:70.6%
  • Fable 5:66.1%
  • GPT-5.6 Sol:62.6%
  • Opus 4.8:55.7%

表示:

操作真实电脑环境,比如:

  • 点击界面
  • 使用软件
  • 完成流程

Opus 5 有明显优势。

2、每个任务成本

还有一个很有意思的点:Claude 也和你谈性价比了!

它们推特的第三楼是这么说的:

Opus 5 也具有很高的效率。它在类似或更低的每任务成本下,优于其他模型:

他们给了四种使用场景下的任务消耗情况图:

你们敢信吗?Anthropic 居然用了四张图来显示Opus 5.0 的性价比(竞争太美妙了)。

根据这四个图来看,Opus 5.0 做到了同样价格下性能更高,同样性能下价格更低

上面四个图里面分别讲的是。

1、电脑操作任务

测试 AI 能不能像人一样操作电脑完成事情。

例如:

  • 打开软件
  • 点击按钮
  • 填表
  • 修改文档
  • 使用网页应用
  • 完成一套办公流程

2、企业业务流程任务

测试 AI 能不能完成真实工作流程。

例如:

  • 处理客户请求
  • 分析业务资料
  • 整理数据
  • 执行审批流程
  • 跨多个系统完成任务

3、多学科综合推理任务

测试 AI 的复杂知识和推理能力。

例如:

  • 数学问题
  • 科学问题
  • 医学问题
  • 法律问题
  • 工程问题
  • 跨领域综合分析

4、智能编程任务

测试 AI 能不能自主完成软件开发。

例如:

  • 阅读代码库
  • 找 Bug
  • 修改代码
  • 编写功能
  • 运行测试
  • 完成开发任务

3、通用人工智能

当“梁圣”在朝着 AGI 这个目标前进的时候,Anthropic 已经给了阶段性的结果。

上面有提到一个叫 AGI3 的基准!

这是一个很少被提及的新基准,它很少被提及,就是因为对当前的模型来说太难了,基本上得不了一分!

这个基准是今年上半年刚提出的。它最大的特点是没有告诉你规则

相当于给你一个陌生的环境,也不告诉你这游戏怎么玩、目标是什么、哪些操作有效、哪些东西重要。这些全部需要 AI 自己去探索。

这个基准刚开始的时候,几乎所有模型都是徘徊在个位数的百分比。

Sol 的 7.8% 已经算是非常高了!

没想到 Opus 5 直接把它干到了 30%,我好怕 Anthropic 一下子把它刷到 80%,大家又没得玩了。

虽然现在大家都知道 AGI 还没有实现,但是在这个 AGI3 基准上它已经是最强的存在了。

4、不对齐行为

除了表明基准领先、性价比高之外,Claude 还强调了另外一点:不对齐行为(越低越好)。

这个图主要表明:Opus 5 是 Claude 家族里最不容易出现危险、欺骗、鲁莽行为的模型。

这种数据不太适合放在第一个展示,但其实这才是最重要的点。

5、安全防御

另外还强调了一个网络安全方面的:

这个图其实展示了两方面的能力啊。左图是发现漏洞的能力。右图是漏洞的利用能力。

也就是说,Opus 5.0 的盾牌已经和 Mythos 5 差不多了。只是在攻击力上要比 Mythos 5 差很多!

就是给了你一个最强的盾,矛还在少数人手里。

这也不是坏事情啊,至少人家打过来的时候,你还能扛一下

作为五代模型啊,现在推出什么功能都不会太新鲜了!

现在的模型其实比拼的都是生态能力和实战能力!

其实我之前也表达过类似的观点,别看 Opus 系列相对而言比较贵,但是它真正完成任务的成本其实比较低的。现在官方也用数据来告诉你单任务成本!

另外一点,Opus 总是能以一个非常专业的视角,帮你做最好的规划。开头也讲了,说它是一个深思熟虑的主动型模型。

“主动”这两个词你们可能没有体会,我是很有体会的。每次我跟它沟通的时候,它总是能想得比我多,想得比我全,做得比我好。它绝对不是那种单纯执行任务的模型,它是会按最优路径来完成任务的模型。

就是那种你一个眼神,他心领神会,然后做得很好!

这也就是为什么我测了那么多模型,我实际使用的只有 Opus,从 4.64.74.8,再到 5.0!

这次 Opus 5.0 的发布时机也蛮有意思的,居然是在星期五,多少还是有点危机感,好事情!

国产模型加油吧!你们变强了,对所有人都有好处。