Meta Muse Code 实测:编码 Agent 崩溃后能原样续跑,跑分落后 Claude Code 仍值得一试

56 阅读5分钟

Meta Muse Code 实测:编码 Agent 崩溃后能原样续跑,跑分落后 Claude Code 仍值得一试

Meta Muse Code 实测:编码 Agent 崩溃后能原样续跑,跑分落后 Claude Code 仍值得一试封面

Meta 上周把 Muse Code 甩进 beta,跑分比 Claude Code 低几分的它,却做了一件两家都没做的事:崩了能原样续跑。

每次新编码 Agent 发布,标题都在比跑分。Meta 在 8 月 5 日把 Muse Code 丢进 beta,Terminal-Bench 2.1 只拿到 82.9%,比 Claude Code 的 86.7% 低了快 4 分。但这次值得看的不是那几分差距,而是它把一次崩溃后的续跑做成了一等公民。这篇把 Muse Code、Claude Code、OpenAI Codex 三款摆在一起,看跑分之外的真正变量。

一、先看数据:3 个真实落地案例

案例落地场景核心技术形态公开披露的关键指标
Claude Code 仍是默认答案日常编码 + 长任务并行Opus 5 + Auto Mode 风险分类 + 并行子代理 + MCPTerminal-Bench 2.1 86.7%;DeepSWE 1.1 65.0%;默认权限 Auto Mode;10 至数百并行子代理
Meta Muse Code 跑分落后 但崩了能原样续跑长任务 / 多小时编码会话Muse Spark 1.2 + 只追加事件日志(replay-exact)+ /plan /grill /goalTerminal-Bench 2.1 82.9%(1.1 为 76.2%);DeepSWE 1.1 59.3%(1.1 为 53.0%);无 Windows 版本;闭源二进制
OpenAI Codex 走云端并行云端并行编码任务GPT-5.6 Terra + 云端并行子任务Terminal-Bench 2.1 81.8%;DeepSWE 1.1 64.8%;GPT-5.6 GA 2026-07-09 三档
数据来源:案例方公开披露(企业自报口径,建议交叉验证)。

1、Claude Code 仍是默认答案

Anthropic 的 Claude Code 现在默认跑 Opus 5,Terminal-Bench 2.1 拿到 86.7%,DeepSWE 1.1 是 65.0%,两项都在这轮对比里排第一。数据来自 Decrypt 评测,经七牛云转载,2026-08。 它从 2026 年 8 月起把 Auto Mode 设成默认权限模式,由内置 AI 分类器判断操作风险,减少开发者被打断的次数。官方表述支持 10 到数百个并行子代理,通过 MCP 服务器扩展能力边界。 来源:Decrypt 评测经 news.qiniu.com 转载,2026-08;Anthropic 官方文档。

2、Meta Muse Code 跑分落后 但崩了能原样续跑

Muse Code 在 8 月 5 日进 beta,底座是同一天发布的 Muse Spark 1.2。Meta 自测 Terminal-Bench 2.1 是 82.9%,从 1.1 的 76.2% 涨上来,DeepSWE 1.1 是 59.3%,两项都比 Claude Code 低 3 到 6 分。 但它把一个别人没量化的能力做成了核心:本地只追加的事件日志。每一次模型调用、工具执行、审批、编辑都写进日志,Meta 称之为 replay-exact、restart-safe。崩了之后从停下的那一行原样续跑,多小时任务不丢进度。 它还内置三个技能:/plan 把任务变成需审批的计划,/grill 把计划压力测试到扛得住,/goal 朝给定目标推进。安装只要一行命令,支持 macOS 和 Linux,但发布时没有 Windows 版本,分发的是闭源原生二进制 muse。 来源:DataNorth 对 Meta 发布的报道,2026-08-06;Meta 官方 launch 说明。

3、OpenAI Codex 走云端并行

OpenAI 的 Codex 走云端并行路线,这轮对比里默认 GPT-5.6 Terra,Terminal-Bench 2.1 是 81.8%,DeepSWE 1.1 是 64.8%,和 Muse Code 只差 1 分。 GPT-5.6 在 7 月 9 日 GA,分 Sol、Terra、Luna 三档,Codex 默认用 sol 做日常编码主力。它和 Claude Code、Muse Code 一样把多智能体编排当成卖点,区别在跑在云端、任务并行执行。 来源:Decrypt 评测经 news.qiniu.com 转载,2026-08;OpenAI GPT-5.6 发布说明。

二、一个反直觉信号

别把 Muse Code 那几分的落后读成 Meta 写不好代码。跑分测的是端到端完成任务,测不出崩溃后能不能续跑、长会话会不会丢上下文,而这些恰恰是真实开发里最磨人的部分。 反过来也别神话崩溃续跑。它解决的是可靠性,不是智能上限。一个能从崩溃里爬起来继续干的 agent,如果本来就不会修那个 bug,爬起来也只是换个姿势卡住。 来源:DataNorth 对 Meta 发布的报道,2026-08-06;作者基于长任务实测经验的判断。

三、给开发者的 3 条落地判断

  1. 2026 下半年的编码 Agent,模型分已经挤到一条线,差的那几分大多是测量噪声。挑 agent 的优先级,该从模型分数挪到编排层和可靠性。
  2. Muse Code 最该被记住的不是 82.9%,而是把崩溃续跑做成一等公民。对跑过多小时任务丢过上下文的人,这比几分更值钱。
  3. 但它没有 Windows 版本、还是 beta、闭源二进制。国内大量 Windows 开发者现在根本装不上,这条限制比跑分更影响你今天能不能用。
  4. 真要试,先在 Linux 或 macOS 上跑一行安装命令,用 /plan 把任务变成可审批的计划再放手,比直接让它自由发挥稳。

结语

三款产品把 2026 年的编码 Agent 拉到了同一条分数线上,接下来比的是谁更不容易在长任务里翻车。Muse Code 用崩溃续跑开了个头,但 beta 加无 Windows 版本,意味着大多数人现在只是旁观。你团队的长任务现在靠什么兜底?欢迎在评论区说说你踩过的坑。

如果这篇帮你把选型思路从跑分挪到可靠性,点个赞或收藏。你最在意编码 Agent 的哪个能力,评论区聊聊。