Claude Opus 5 上手:接近 Fable 5,半价

9 阅读5分钟

你可能已经看到了——Anthropic 在 7 月 24 日发布了 Claude Opus 5。

但这条新闻真正值得你关注的,不是「又有新模型了」,而是一个信号:日常可用的最强模型,定价终于到了不必心疼的程度。

Opus 5 接近 Fable 5 的智能水平,定价只有它的一半。API 价格和 Opus 4.8 完全一样——5/5/25 每百万 token,Fast mode 加价到 10/10/50 但速度快 2.5 倍。

过去你选模型是个两难:Fable 5 太贵,Sonnet 5 又不够强。Opus 5 恰好卡在中间——日常任务用它,性能上去了,账单没涨。

一、不是纸面升级,是数据说了算

Anthropic 这次公开的基准数据比以往都详细。不是「有提升」,是每条赛道都有硬数字:

// Claude Opus 5 基准测试数据(来源:Anthropic 官方公告)
{
  "Frontier-Bench_v0.1": "超越所有模型,Opus 4.8 的 2 倍以上",
  "CursorBench_3.2_max_effort": "距 Fable 5 仅差 0.5%,成本减半",
  "ARC-AGI_3": "3 倍于次优模型",
  "OSWorld_2.0": "超越 Fable 5,约为其 1/3 成本",
  "Zapier_AutomationBench": "1.5 倍于次优通过率",
  "有机化学(vs Opus 4.8)": "+10.2 个百分点",
  "蛋白质任务(vs Opus 4.8)": "+7.7 个百分点"
}

最有意思的是 ARC-AGI 3——这个测试要求模型解决从没见过的难题。Opus 5 考了 3 倍于第二名的分数,说明它不是背题型升级,是推理能力确实上了台阶。

在 OSWorld 2.0(计算机使用基准)上,Opus 5 甚至超过了 Fable 5 的最佳成绩,成本只有 Fable 5 的约三分之一。

不过也要说一句:在网络安全这个维度上,Opus 5 还落后 Mythos 5 一截。Anthropic 自己也没避讳。但对你日常用 API 编程来说,Opus 5 的安全限制其实比 Fable 5 更宽松——拦截率低了大约 85%。

二、实测故事比数字更有说服力

官方公告里放了九家早期客户的评价。我挑了几个最能说明变化的:

评价方角色核心评价
Scott WuDevin CEO「接近 Fable 级别性能,半价。调试和根因分析特别强」
Sualeh AsifCursor 联合创始人「CursorBench 距 Fable 5 就差临门一脚」
Wade FosterZapier CEO「Opus 5 跑完了全套流失预防流程。前代模型没通过」
匿名工程师 #1架构重构场景「Opus 5 推翻我的设计,不退让,给了折中方案」
Zimu Li技术成员「交 PR 不急于提交——先验证分支、检查模板、推演测试影响」

Zapier 的例子最具体:Opus 5 拿一个原始的客户健康工作簿,跑完了完整的流失预防流程——标记风险账号、通知负责人、汇总给保留运营。前代模型全都过不了。

最让我印象深刻的是一个 Frontier-Bench 任务:给一张机器零件的图纸,但故意不提供直接查看图片的途径。Opus 5 自己写了一套计算机视觉管线从像素里提取几何信息,重建了完整的 3D FreeCAD 模型。同类模型尝试了五次全部失败。

三、安全方面的取舍

Opus 5 的安全设计值得单独聊一下。

// Opus 5 安全策略对比(来源:Anthropic 官方公告)
{
  "classifier_干预率": "比 Fable 5 低约 85%",
  "源码漏洞发现": "✅ 允许",
  "二进制漏洞扫描": "❌ 阻止",
  "漏洞利用生成": "❌ 阻止",
  "被拦截请求": "自动降级到 Opus 4.8"
}

Anthropic 没有给 Opus 5 上 Fable 5 级别的限制——Classifier 拦截频率比 Fable 5 低大约 85%。这意味着你日常编程任务里被误拦截的概率很低。

具体策略,你可以参考下表:

还有一个很实用的设计:拦截的请求自动降级到 Opus 4.8,不阻塞工作流。在 Claude Code 里被拦截了也不会卡住。

不过,Opus 5 在漏洞利用能力上还远落后于 Mythos 5。做安全相关高风险工作还得上 Mythos。

四、给工程师的选型建议

看了这么多数据和实测,落实到实际选择上,我的建议是:

# 按场景的选型建议
recommendations = {
    "日常编码_调试_代码审查": "Opus 5 (Fast mode)",
    "复杂架构设计_全栈重构": "Opus 5",
    "高难度安全审计_前沿研究": "Fable 5 / Mythos 5",
    "批量任务_低延迟场景": "Sonnet 5"
}

日常编码、调试、代码审查:Opus 5 Fast mode。同价替代 Opus 4.8,性能翻倍。Fast mode 2.5 倍速度,10/10/50 的价格仍远低于 Fable 5。

复杂架构设计、全栈重构:Opus 5 即可。你从那些真实案例可以看到,Opus 5 的判断力和细致度胜任设计级任务。

高难度安全审计、前沿研究:Fable 5 或 Mythos 5。你需要天花板能力时再上旗舰。

批量任务、低延迟场景:Sonnet 5 仍是性价比之选。Opus 5 虽强,但不是所有你手里的场景都需要它的 power。

五、总结

Anthropic 在 Opus 4.8 的位置上,放了一个接近 Fable 5 的模型,价格没变。对于日常用 AI 编程的你来说,这是 2026 年最实在的一次升级。

如果你正在帮团队评估下一阶段的默认模型,不妨对比一下你现在的 API 账单和 Opus 5 的定价——同样预算下能拿到接近 Fable 5 的能力,这笔账怎么算都划算。

不是越贵越好,是花对地方才值。


原文:www.anthropic.com/news/claude…